PhantomJS(Python3.5、Selenium)でリダイレクトのトラッキング-Browsermob-proxyのインストール編-

tracking

Browsermob-proxyのインストール編

PhantomJSは、Webkitベースのヘッドレスブラウザです。
JavaScriptの解析エンジンが搭載されていて、
JavaScriptのレンダリングが必要なWebサイトのスクレイピングができます!
なので、meta要素やJavaScriptによるクライアントサイドでの
リダイレクトにも対応できるという優れものです!

それで、これからの内容ですが、
PhantomJSでリダイレクトがかかるWebサイトをスクレイピングするのですが、
その際に、リダイレクトのログを追いたい、ネットワークをトラッキングしたい
ということです。

このトラッキング、
PhantomJS単体でもやろうと思えばやれるのですが、PhantomJS単体だと
・データベースへの接続をどうしよう
・HTMLの解析をどうしよう

などなど、どうしてもその他の問題が出てきます。

なので、やはり、
以下の組み合わせで実装します!
・Python3.5
・Selenium
・PhantomJS

※インストール方法は、こちらから

今回は、ネットワークログ、リダイレクトのトラッキング
を観測するプロキシサーバの
Browsermob-proxyのインストール方法をご紹介します!

概要

SeleniumでPhantomJSを操作するのですが、
そのコードをPythonで記述します。
そして、プロキシサーバのBrowsermob-proxyで
ネットワークログ、リダイレクトのトラッキングを観測します。

Browsermob-proxyのインストール方法

※CentOS7.1環境下で行ってます

・本体のインストール

・Javaのインストール

http://www.oracle.com/technetwork/java/javase/downloads/jdk8-downloads-2133151.htmlより

・シェルファイルの設定

ログインし直せば、設定は反映されます!

確認した結果

最後に

スクレイピングでネットワークログであったり、
トラッキングを観測したいというのは、
だいぶコアな悩みだと思います。

だから、ほんとに情報見つけるの大変でした。。。。

今回は、Browsermob-proxyのインストール方法でしたが、
次回は、使い方をご紹介します!

関連記事

コメントは利用できません。

ピックアップ記事

  1. img108

    2016-10-4

    おもしろ可愛い♥ハロウィン限定メニュー2016!EGGS ’N THINGS、Q-pot CAFE、とらやカフェなどなど・・・

    ハロウィン限定メニュー&スイーツ特集もうすぐハロウィン!ということで、今回は都内のカフェを中心にハロ…

ピックアップ記事

  1. img108

    2016-10-4

    おもしろ可愛い♥ハロウィン限定メニュー2016!EGGS ’N THINGS、Q-pot CAFE、とらやカフェなどなど・・・

    ハロウィン限定メニュー&スイーツ特集もうすぐハロウィン!ということで、今回は都内のカフェを中心にハロ…

ピックアップ記事

  1. フリー素材

    2016-5-11

    自分が思いついたサービスは他の誰かも考えている

    こんばんにちは。日時過ごしていると、こんなサービスあればいいのに。なんてことをよく考えることがある。…
ページ上部へ戻る
Top