Webサイトを LLM 対応のMarkdownに変換し、RAG やAIエージェント用にデータを抽出するオープンソースのWeb クローラーです。
中辛 の解説
Crawl4AI は、JavaScriptを実行するブラウザーでページを訪問し、きれいな Markdown やJSON スキーマ形式でデータを取り出します。メニュー・フッター・ボイラープレートを除外するフィルター、ページ内のリンク参照、見出し・表・コードブロックの構造を保持します。ローカルで pip install crawl4ai で実行するか Docker サーバーで立てるか、クラウド API を 1つのキーで使用できます。複数 URL の一括処理・キャッシング・ステートレス保存で長期クローリングに対応し、LLM 呼び出し(OpenAI ほか)を組み込んで質問ベースの抽出も実行可能です。
こんなリポジトリです
こんなときに便利です
- RAG パイプライン用に複数のドキュメントサイトから Markdown を一括取得し、ベクトルデータベースに保存する
- 価格情報ページから LLM で商品・金額・説明をJSON スキーマで抽出し、Eコマース在庫システムに送る
- Webからの質問への回答を得るため、AdaptiveCrawler で自動的に関連ページを探索し、必要な情報のみを学習させる
主な機能
ほかとの違い
Apache 2.0 ライセンス下でソースコード全体がオープンで、API キーなしで自分のサーバーやマシンで永続的に無料で実行でき、クラウド版でも Web 検索・MCP エージェント統合を同一 API で提供します。
このリポジトリの作り方
はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。
準備するもの
- Python 3.7以上(ローカル実行時)
- Playwright がサポートする Chromium・Firefox・WebKit のいずれか(セットアップスクリプトで自動インストール)
- Docker(セルフホスト時)
- LLM API キー(LLM 抽出戦略使用時のみ)
すぐに始める
- パッケージをインストールします。
pip install -U crawl4ai
- ブラウザーをセットアップします。
crawl4ai-setup
- Python スクリプトを実行します。
import asyncio
from crawl4ai import AsyncWebCrawler
async def main():
async with AsyncWebCrawler() as crawler:
result = await crawler.arun(url="https://news.ycombinator.com")
print(result.markdown)
asyncio.run(main())
別の方法: Docker サーバーで実行する場合
- トークンを生成して Docker コンテナを起動します。
export CRAWL4AI_API_TOKEN="$(openssl rand -hex 32)"
docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g \
-e CRAWL4AI_API_TOKEN="$CRAWL4AI_API_TOKEN" \
unclecode/crawl4ai:latest
- REST APIで ページを取得します。
curl -s http://localhost:11235/md \
-H "Authorization: Bearer $CRAWL4AI_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{"url": "https://news.ycombinator.com"}' | jq -r .markdown
ギット飯トライで味見
入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。
ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。
npx gitbap-try unclecode/crawl4ai
Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →
スター推移 · 7日
確認日時
使いやすさ · まねしやすいか
- ゆるいライセンス
- テストあり
- サンプル集
- 最近の更新
- AGENTS.md
- llms.txt
- テンプレート
最近の更新あり · 2024 年に作成
「AI エージェント」 こういうリポジトリを毎週受け取りませんか?
毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。
自分のリポジトリですか? README にギット飯バッジを貼る
[](https://www.gitbap.com/r/unclecode/crawl4ai)Claude からそのまま使う — ギット飯のつなぎ方
ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。
Claude の設定 → コネクタにこのアドレスを貼り付け。
https://www.gitbap.com/api/mcpプラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。
/plugin marketplace add jakeparkcolde/gitbap-cowork/plugin install gitbap-cowork@gitbapAI が README をもとに要約しました · 原文を見る