2025年4月19日土曜日

ラズベリーパイ4でcrawl4aiをインストール

ラズベリーパイ4でcrawl4aiをインストール

このブログでは、ラズベリーパイ4にWebスクレイピングライブラリである crawl4ai をインストールし、簡単な動作確認を行う手順を紹介します。

前提条件

  • ラズベリーパイ4が起動しており、インターネットに接続されていること
  • Python 3 がインストールされていること
  • ターミナル(コマンドラインインターフェース)が利用できること

インストール手順

1. 作業ディレクトリの作成と移動

まず、作業用のディレクトリを作成し、そこに移動します。

cd /srv/
mkdir crawl4ai
cd crawl4ai/
  

2. 仮想環境の作成

Pythonの依存関係を管理するために、仮想環境を作成します。

python3 -m venv venv
  

3. 仮想環境のアクティベート

作成した仮想環境をアクティベートします。

source venv/bin/activate
  

アクティベートされると、ターミナルのプロンプトの先頭に (venv) と表示されます。

4. crawl4ai と関連ライブラリのインストール

pip を使用して、crawl4aitransformerstorchnltk をインストールします。

pip install "crawl4ai @ git+https://github.com/unclecode/crawl4ai.git" transformers torch nltk
  

インストールにはしばらく時間がかかる場合があります。

5. crawl4ai のセットアップ

crawl4ai の初期セットアップを実行します。

crawl4ai-setup
  

6. Playwright とその依存関係のインストール

crawl4ai が内部で使用する Playwright と Chromium をインストールします。

python -m playwright install --with-deps chromium
  

これにより、Webブラウザの操作に必要なコンポーネントがインストールされます。

動作確認

1. テストプログラムの作成

nano エディタを使用して、簡単なテストプログラム (testc4a.py) を作成します。

nano -w testc4a.py
  

以下のコードを testc4a.py に記述します。

import asyncio
from crawl4ai import *

async def main():
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url="https://news.yahoo.co.jp/topics/business",
        )
        print(result.markdown)

if __name__ == "__main__":
    asyncio.run(main())

記述が終わったら、Ctrl + X を押して保存し、Enter で確定します。

2. テストプログラムの実行

作成したテストプログラムを実行します。

python3 testc4a.py
  

プログラムが正常に動作すれば、Yahoo!ニュースのビジネストピックスの内容がMarkdown形式でターミナルに表示されます。

まとめ

上記の手順で、ラズベリーパイ4に crawl4ai をインストールし、基本的なWebスクレイピングの動作を確認することができました。このライブラリを活用して、様々なWebサイトから必要な情報を効率的に抽出することができます。

0 件のコメント:

コメントを投稿

Claude Codeをwindows11に導入してVSCとつなげてみた

  Claude Codeをwindows11に導入してVSCとつなげてみた WSLインストール VSCとClaude Code連携できるとの話を聞いて拡張機能を見てみたがどうも違うらしい。とりあえず、windowsにインストールしてみる。 npm install -g @ant...