環境設定
python3/リクエストライブラリ/解析ライブラリ/データベース/ストレージライブラリ/Webライブラリ/アプリスクレイピングライブラリ/スクレイピングフレームワーク
-
python3
- Windows 11ではストアから直接ダウンロードできます(
- Linuxでは
apt-get install python3
-
リクエストライブラリ
-
requests
pip3 install requests -
selenium
pip install selenium -
chromeDriver
- Chromeの「概要」でバージョンを確認する
- chromeDriverから対応するバージョンをダウンロードする
- chromeDriverを環境変数に設定する
-
phantomJS新しいバージョンのseleniumではphantomJSがサポートされなくなったため、chromedriverを直接使用できます
動作確認:
from selenium import webdriverfrom selenium.webdriver.chrome.options import Optionschrome_options = Options()chrome_options.add_argument('--headless')chrome_options.add_argument('--disable-gpu')driver = webdriver.Chrome(options=chrome_options)driver.get("<https://dreaife.icu/>")print(driver.current_url) -
aiohttp
pip install aiodns
-
-
解析ライブラリ
-
lxml
pip install lxml -
beautifulsoup4
pip install beautifulsoup4 -
pyquery
pip install pyquery -
tesserocr
-
tesseractをインストールする
-
tesserocrをインストールする
Windowsでは
pip install <name>.whlを使用してインストールします -
動作確認
import tesserocrfrom PIL import Imageimage = Image.open('G:/codeS/backOnGithub/Jupyter/spider/image.png')print(tesserocr.image_to_text(image))注意:File “tesserocr.pyx”, line 2580, in tesserocr._tesserocr.image_to_textRuntimeError: Failed to init API, possibly an invalid tessdata pathエラーが発生した場合は、まずtesseractのtest_dataをエラー対象のフォルダーに配置する必要があります
-
-
-
データベース
- MySQL
- MongoDB
- Redis
-
ストレージライブラリ
-
PyMySQL
pip install pymysql -
PyMongo
pip install pymongo -
redis-py
pip install redis -
RedisDump
Rubyをインストールする
gem install redis-dump
-
-
Webライブラリ
-
Flask
pip install flask -
Tornado
pip install tornado
-
-
アプリスクレイピングライブラリ
-
charles
-
mitmproxy
pip install mitmproxy -
appium
-
-
スクレイピングフレームワーク
-
pyspider
pip install pyspiderWindows 11で実行できない場合は、私のこちらの記事をご覧ください
-
scrapy
-
scrapy-splash
-
scrapy-redis
-
この記事が役に立ったときは、ぜひ他の人に共有してください!
一部の情報は古い可能性があります





