unclecode/crawl4ai

Webサイトを LLM 対応のMarkdownに変換し、RAG やAIエージェント用にデータを抽出するオープンソースのWeb クローラーです。

開発の材料自由に使える · Apache-2.0AI エージェントPython難易度
85,115+439今週👀 740 保存
8,828フォーク47Issue
デモ・公式サイトをひらくcrawl4ai.com

中辛 の解説

Crawl4AI は、JavaScriptを実行するブラウザーでページを訪問し、きれいな Markdown やJSON スキーマ形式でデータを取り出します。メニュー・フッター・ボイラープレートを除外するフィルター、ページ内のリンク参照、見出し・表・コードブロックの構造を保持します。ローカルで pip install crawl4ai で実行するか Docker サーバーで立てるか、クラウド API を 1つのキーで使用できます。複数 URL の一括処理・キャッシング・ステートレス保存で長期クローリングに対応し、LLM 呼び出し(OpenAI ほか)を組み込んで質問ベースの抽出も実行可能です。

こんなリポジトリです

こんなときに便利です

  • RAG パイプライン用に複数のドキュメントサイトから Markdown を一括取得し、ベクトルデータベースに保存する
  • 価格情報ページから LLM で商品・金額・説明をJSON スキーマで抽出し、Eコマース在庫システムに送る
  • Webからの質問への回答を得るため、AdaptiveCrawler で自動的に関連ページを探索し、必要な情報のみを学習させる

主な機能

LLM 対応の Clean Markdown 生成とメニュー・ボイラープレート除外フィルターCSS・XPath・正規表現・LLMを使った構造化データ抽出と JSON スキーマ対応深い Web クローリング(BFS・DFS・ベストファースト)、セッション・プロキシ・ステルスモード制御、複数 URL 並行処理

ほかとの違い

Apache 2.0 ライセンス下でソースコード全体がオープンで、API キーなしで自分のサーバーやマシンで永続的に無料で実行でき、クラウド版でも Web 検索・MCP エージェント統合を同一 API で提供します。

このリポジトリの作り方

はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。

準備するもの

  • Python 3.7以上(ローカル実行時)
  • Playwright がサポートする Chromium・Firefox・WebKit のいずれか(セットアップスクリプトで自動インストール)
  • Docker(セルフホスト時)
  • LLM API キー(LLM 抽出戦略使用時のみ)

すぐに始める

  1. パッケージをインストールします。
pip install -U crawl4ai
  1. ブラウザーをセットアップします。
crawl4ai-setup
  1. Python スクリプトを実行します。
import asyncio
from crawl4ai import AsyncWebCrawler

async def main():
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(url="https://news.ycombinator.com")
        print(result.markdown)

asyncio.run(main())

別の方法: Docker サーバーで実行する場合

  1. トークンを生成して Docker コンテナを起動します。
export CRAWL4AI_API_TOKEN="$(openssl rand -hex 32)"
docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g \
  -e CRAWL4AI_API_TOKEN="$CRAWL4AI_API_TOKEN" \
  unclecode/crawl4ai:latest
  1. REST APIで ページを取得します。
curl -s http://localhost:11235/md \
  -H "Authorization: Bearer $CRAWL4AI_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://news.ycombinator.com"}' | jq -r .markdown

ギット飯トライで味見

入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。

ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。

npx gitbap-try unclecode/crawl4ai

Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →

スター推移 · 7日

85,115+439 / 7日

確認日時

使いやすさ · まねしやすいか

まねしやすいサンプル評点 52/100
  • ゆるいライセンス
  • テストあり
  • サンプル集
  • 最近の更新
  • AGENTS.md
  • llms.txt
  • テンプレート

最近の更新あり · 2024 年に作成

「AI エージェント」 こういうリポジトリを毎週受け取りませんか?

毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。

自分のリポジトリですか? README にギット飯バッジを貼る
[![깃밥](https://www.gitbap.com/badge/unclecode/crawl4ai.svg)](https://www.gitbap.com/r/unclecode/crawl4ai)
Claude からそのまま使う — ギット飯のつなぎ方

ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。

方法 ① コネクタ URL

Claude の設定 → コネクタにこのアドレスを貼り付け。

https://www.gitbap.com/api/mcp
方法 ② プラグイン(試用まで)

プラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
つなぎ方をくわしく →

AI が README をもとに要約しました · 原文を見る