ScrapeGraphAI/Scrapegraph-ai

大規模言語モデルとグラフロジックを使ってWebサイトやローカルドキュメントからデータを抽出するPythonライブラリです。

開発の材料自由に使える · MITデータ・クローリングPython難易度
29,857+199今週👀 450
2,959フォーク5Issue
デモ・公式サイトをひらくscrapegraphai.com

中辛 の解説

SmartScraperGraph、SearchGraph、SpeechGraph など複数のパイプラインを提供します。OpenAI・Groq・Azure・Gemini・Ollama など様々なLLMに対応し、Playwright を使ったブラウザ操作も含みます。デモコードはに記載されており、5行程度で単一ページから構造化データを抽出できます。難易度は中程度で、Pythonの基本知識があれば即座に使用可能です。

이런 레포예요

이럴 때 쓰면 좋아요

  • プロンプトだけで複数ページから構造化データを抽出したいとき
  • LLMに自然言語指示で Webスクレイパーを自動生成させたいとき
  • ローカルモデル(Ollama)を使ってオンプレミス環境で Webデータ抽出を行いたいとき

핵심 기능

LLMを使った自然言語ベースのスクレイピング指示SmartScraperGraph・SearchGraph・SpeechGraph など複数のパイプラインOpenAI・Groq・Azure・Gemini・Ollama など複数のLLM対応

대안 대비 차별점

従来の正規表現やCSSセレクタベースではなく、LLMが自然言語指示を理解して自動的にデータ抽出ロジックを構築する点が特徴です。

食べた人たち

実際に使ってみた人の記録です — 一言も完走の記録も、確認のうえで公開しています。

試食評 · 使った人のひとこと

まだ試食評がありません。使ってみたら、最初のひとことをどうぞ。

ほかのリポジトリの試食評を見る →

이 레포로 만든 것들

🖋 완주 인증하기

아직 이 레포로 만든 완주 인증이 없어요. 첫 밥도장을 찍어보세요!

このリポジトリの作り方

はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。

준비물

  • Python 3.8以上
  • Playwright がインストール可能な環境
  • OpenAI・Groq・Ollama など任意のLLMのAPIキーまたはローカルインスタンス

すぐ動かしてみるPython (uv)

ギット飯がリポジトリの構成を確認して組み立てた実行コマンドです。ターミナルに貼り付ければ、取得から実行までまとめて進みます。

git clone --depth 1 https://github.com/ScrapeGraphAI/Scrapegraph-ai.git &&
cd Scrapegraph-ai &&
uv sync

uv가 없다면: brew install uv · 실행 명령은 README를 확인하세요.

コードは自分の環境で動きます — はじめて見るリポジトリなら、中身にひととおり目を通してから実行するのがおすすめです。

README가 안내하는 자세한 단계 보기
  1. pipを使ってライブラリをインストールします。
pip install scrapegraphai
  1. Playwrightをインストールして、ブラウザドライバを準備します。
playwright install
  1. Python スクリプトでSmartScraperGraphを初期化します。LLMとして Ollama の llama3.2 を使う場合。
from scrapegraphai.graphs import SmartScraperGraph

graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}
  1. スクレイパーインスタンスを作成し、プロンプトと対象URLを指定します。
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)
  1. パイプラインを実行して結果を取得します。
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))

ギット飯トライで味見

入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。

ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。

npx gitbap-try ScrapeGraphAI/Scrapegraph-ai

Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →

スター推移 · 7日

29,857+199 / 7일

使いやすさ · まねしやすいか

ベストサンプルサンプル評点 68/100
  • ゆるいライセンス
  • テストあり
  • サンプル集
  • 最近の更新
  • AGENTS.md
  • llms.txt
  • テンプレート

最近の更新あり · 2024 年に作成

「데이터·크롤링」 こういうリポジトリを毎週受け取りませんか?

毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。

自分のリポジトリですか? README にギット飯バッジを貼る
[![깃밥](https://www.gitbap.com/badge/ScrapeGraphAI/Scrapegraph-ai.svg)](https://www.gitbap.com/r/ScrapeGraphAI/Scrapegraph-ai)
Claude からそのまま使う — ギット飯のつなぎ方

ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。

方法 ① コネクタ URL

Claude の設定 → コネクタにこのアドレスを貼り付け。

https://www.gitbap.com/api/mcp
方法 ② プラグイン(試用まで)

プラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
つなぎ方をくわしく →

AI が README をもとに要約しました · 原文を見る