クローリングハック あらゆるWebサイトをクロールするための実践テクニック

  • 19人登録
  • 1レビュー
amano225さん 新品を購入   読み終わった 

主に、Javaを使ったクローリングとスクレイピングについての本。クローリングに関するテクニック等がまとまっていたように思う。
クローリングする側ではなく、Webサイト制作者向きにかかれてそうな記述もあったけど、それはそれで勉強になった。SEOとか考えてサイト制作している人にもいいかもしれない。
サイトの文字コードについて判断するには、Content-TypeヘッダとHTML内のmetaタグの二種類があるそうだけど、どちらも記載があったらContent-Typeのほうを優先するらしい。仕組み考えたらそりゃそうかと思うけど、どっちかというと書かれてる文字コードが違う場合は、metaタグのほうが正しいことのほうが多いような気がする。特に静的なHTMLページの場合。
後、Javaのライブラリだけど、Normalizerという文字をうまい具合に正規化してくれるAPIがあるのがいいなと思った。他の言語にもあるんだろうか。Javaで標準になってるぐらいだからありそうだけど。ちょっと探してみようと思う。
それと、MySQLは文字コードの対応がいろいろ必要になってくるんだなと思った。Charsetが4バイト文字の場合、区別しなくなるらしい。それを、「寿司ビール問題」と呼ぶのだとか。こういう問題があるというのはどこか頭の片隅にでもおいておきたい。
後、Google検索で表示されるファクトチェックという機能をはじめて知った。コンテンツの情報が正しいかどうかチェックした結果を表示してくれるらしい。何をもって正しいと判断してるかは気になるけど、日本でも普及してもらえないだろうか(人力だろうから大変だろうけど)。
後、Chromeにヘッドレスモードが追加されてるというのも初めて知った。それを受けて、WebDriverで使われていたヘッドレスブラウザのPhantomJSがメンテナンスを終了したらしい。それなら、Chromeの利用例を書いてくれよと思った(利用例はPhantomJSで書かれている)。
クローリングについては前からいろいろ興味はあって調べたりすることはあるけど、活用したことはないので、何か作ってみたいと思う。もちろん、迷惑がかからない程度に。

レビュー投稿日
2017年10月1日
読了日
2017年10月1日
本棚登録日
2017年10月1日
ツイートする
このエントリーをはてなブックマークに追加

『クローリングハック あらゆるWebサイト...』のレビューをもっとみる

『クローリングハック あらゆるWebサイトをクロールするための実践テクニック』のレビューへのコメント

まだコメントはありません。

コメントをする場合は、ログインしてください。

『クローリングハック あらゆるWebサイトをクロールするための実践テクニック』にamano225さんがつけたタグ

いいね!してくれた人

ツイートする