ラズベリーパイ4でcrawl4aiをインストール
このブログでは、ラズベリーパイ4にWebスクレイピングライブラリである crawl4ai をインストールし、簡単な動作確認を行う手順を紹介します。
前提条件
- ラズベリーパイ4が起動しており、インターネットに接続されていること
- Python 3 がインストールされていること
- ターミナル(コマンドラインインターフェース)が利用できること
インストール手順
1. 作業ディレクトリの作成と移動
まず、作業用のディレクトリを作成し、そこに移動します。
cd /srv/
mkdir crawl4ai
cd crawl4ai/
2. 仮想環境の作成
Pythonの依存関係を管理するために、仮想環境を作成します。
python3 -m venv venv
3. 仮想環境のアクティベート
作成した仮想環境をアクティベートします。
source venv/bin/activate
アクティベートされると、ターミナルのプロンプトの先頭に (venv) と表示されます。
4. crawl4ai と関連ライブラリのインストール
pip を使用して、crawl4ai、transformers、torch、nltk をインストールします。
pip install "crawl4ai @ git+https://github.com/unclecode/crawl4ai.git" transformers torch nltk
インストールにはしばらく時間がかかる場合があります。
5. crawl4ai のセットアップ
crawl4ai の初期セットアップを実行します。
crawl4ai-setup
6. Playwright とその依存関係のインストール
crawl4ai が内部で使用する Playwright と Chromium をインストールします。
python -m playwright install --with-deps chromium
これにより、Webブラウザの操作に必要なコンポーネントがインストールされます。
動作確認
1. テストプログラムの作成
nano エディタを使用して、簡単なテストプログラム (testc4a.py) を作成します。
nano -w testc4a.py
以下のコードを testc4a.py に記述します。
import asyncio
from crawl4ai import *
async def main():
async with AsyncWebCrawler() as crawler:
result = await crawler.arun(
url="https://news.yahoo.co.jp/topics/business",
)
print(result.markdown)
if __name__ == "__main__":
asyncio.run(main())
記述が終わったら、Ctrl + X を押して保存し、Enter で確定します。
2. テストプログラムの実行
作成したテストプログラムを実行します。
python3 testc4a.py
プログラムが正常に動作すれば、Yahoo!ニュースのビジネストピックスの内容がMarkdown形式でターミナルに表示されます。
まとめ
上記の手順で、ラズベリーパイ4に crawl4ai をインストールし、基本的なWebスクレイピングの動作を確認することができました。このライブラリを活用して、様々なWebサイトから必要な情報を効率的に抽出することができます。

0 件のコメント:
コメントを投稿