🥊 맛대결 · 같은 일을 하는 레포 견주기

웹 크롤링 도구 4파전: firecrawl vs colly vs camoufox vs 큐레이션 리스트

같은 '데이터·크롤링' 카테고리에 묶였지만 실제 역할은 서로 다릅니다. firecrawl은 LLM용 API 서비스, colly는 Go 크롤링 프레임워크, camoufox는 안티디텍트 브라우저, awesome-web-scraping은 도구 자체가 아닌 큐레이션 리스트입니다.

데이터·크롤링참가 4곳 · 착한밥상 1

왜 이들을 묶었나크롤링이라는 단어 하나로 묶이지만 실제로 쓰는 순간 완전히 다른 물건을 고르게 됩니다. 이 비교는 '무엇이 더 좋은가'가 아니라 '내가 지금 필요한 게 API인지, 라이브러리인지, 브라우저인지, 아니면 조사 자료인지'를 먼저 가르는 데 목적이 있습니다.

🏆 간판 메뉴 · 이 카테고리의 첫 선택

gocolly/colly

Go로 쓴 초고속 웹 스크래핑 프레임워크

왜 이걸 골랐나착한밥상 등급으로 신뢰도가 검증된 유일한 레포이며, 설치가 가볍고(go get 한 줄) Go 동시성 덕분에 성능도 좋습니다. robots.txt, 캐싱, 큐 관리 같은 크롤링 필수 기능을 이미 내장하고 있어 첫 크롤러 프로젝트로 삼기에 부담이 적습니다.

🍚 착한밥상신뢰도 1.00Go · Apache-2.0
착한밥상 심층 해설 보기🧪 한 줄로 맛보기
CORE · 차원별 비교

여섯 가지 차원으로 견줬습니다

차원firecrawl/firecrawl후보lorien/awesome-web-scraping후보daijro/camoufox후보gocolly/colly🍚 착한밥상
install🛠️중간셀프호스팅 시 Redis 등 인프라 구성 필요, 클라우드 API도 별도 제공설치 불필요도구가 아니라 목록이라 설치 자체가 없음다소 번거로움패치된 Firefox 바이너리 다운로드와 자동화 스택 구성이 필요쉬움go get 한 줄로 라이브러리 추가, 별도 인프라 불필요
scale🚀확장성 높음큐·워커 구조로 대규모 크롤링 API 서비스를 지향해당없음실행되는 도구가 아니라 성능 지표 자체가 없음단일 브라우저 중심대량 병렬성보다 탐지 회피와 은닉성에 초점매우 빠름Go 동시성 기반으로 정적 페이지 대량 수집에 강함
maintenance🔧활발함스타트업 주도로 기능 추가가 빠르게 이어지는 편느슨함커뮤니티 PR 위주로 간헐적으로 갱신되는 목록성장중신생 프로젝트로 업데이트가 이어지지만 규모는 아직 작음검증된 안정착한밥상 등급으로 신뢰도가 확인된 상태
learning📈매우 쉬움API 호출 몇 줄로 마크다운 결과를 바로 받아볼 수 있음읽기만 하면 됨도구 학습이 아니라 목록을 훑어보는 것뿐다소 어려움브라우저 자동화와 핑거프린트 개념 이해가 필요중간Go 언어와 콜백 기반 API 구조를 익히는 시간이 필요
라이선스상업적 사용 AGPL-3.0 NOASSERTION MPL-2.0 Apache-2.0
용도 적합어디에 맞나LLM 파이프라인에 넣을 웹 데이터를 마크다운으로 빠르게 확보해야 하는 경우어떤 스크래핑 도구를 써야 할지 아직 감이 없어 조사 단계에 있는 경우탐지 회피가 중요한 사이트를 브라우저 자동화로 다뤄야 하는 경우정적·반정적 페이지를 대량으로 빠르게 수집하는 Go 기반 크롤러가 필요한 경우
firecrawl/firecrawl후보
install중간셀프호스팅 시 Redis 등 인프라 구성 필요, 클라우드 API도 별도 제공
scale확장성 높음큐·워커 구조로 대규모 크롤링 API 서비스를 지향
maintenance활발함스타트업 주도로 기능 추가가 빠르게 이어지는 편
learning매우 쉬움API 호출 몇 줄로 마크다운 결과를 바로 받아볼 수 있음
라이선스 AGPL-3.0
용도 적합LLM 파이프라인에 넣을 웹 데이터를 마크다운으로 빠르게 확보해야 하는 경우
lorien/awesome-web-scraping후보
install설치 불필요도구가 아니라 목록이라 설치 자체가 없음
scale해당없음실행되는 도구가 아니라 성능 지표 자체가 없음
maintenance느슨함커뮤니티 PR 위주로 간헐적으로 갱신되는 목록
learning읽기만 하면 됨도구 학습이 아니라 목록을 훑어보는 것뿐
라이선스 NOASSERTION
용도 적합어떤 스크래핑 도구를 써야 할지 아직 감이 없어 조사 단계에 있는 경우
daijro/camoufox후보
install다소 번거로움패치된 Firefox 바이너리 다운로드와 자동화 스택 구성이 필요
scale단일 브라우저 중심대량 병렬성보다 탐지 회피와 은닉성에 초점
maintenance성장중신생 프로젝트로 업데이트가 이어지지만 규모는 아직 작음
learning다소 어려움브라우저 자동화와 핑거프린트 개념 이해가 필요
라이선스 MPL-2.0
용도 적합탐지 회피가 중요한 사이트를 브라우저 자동화로 다뤄야 하는 경우
gocolly/colly✅ 간판 메뉴
install쉬움go get 한 줄로 라이브러리 추가, 별도 인프라 불필요
scale매우 빠름Go 동시성 기반으로 정적 페이지 대량 수집에 강함
maintenance검증된 안정착한밥상 등급으로 신뢰도가 확인된 상태
learning중간Go 언어와 콜백 기반 API 구조를 익히는 시간이 필요
라이선스 Apache-2.0
용도 적합정적·반정적 페이지를 대량으로 빠르게 수집하는 Go 기반 크롤러가 필요한 경우
참가 레포 · 4

각자 무엇을 잘하고, 무엇을 포기했나

레포명을 누르면 착한밥상 심층 해설로
firecrawl/firecrawl관찰 중

웹 페이지를 크롤링·스크래핑해 LLM이 바로 쓸 수 있는 마크다운·구조화 데이터로 변환해주는 오픈소스 웹 데이터 API

👍 장점

  • LLM용 마크다운·구조화 데이터 변환을 API 하나로 처리
  • 크롤링+파싱+정제까지 원스톱으로 제공
  • 구조화 데이터 추출 스키마 지원
  • 개발 속도가 빠른 편

👎 단점

  • AGPL-3.0 라이선스로 상용 서비스에 소스 공개 부담이 있을 수 있음
  • 자체 호스팅 시 Redis 등 인프라 구성 필요
  • TypeScript 스택에 종속됨
TypeScriptAGPL-3.0신뢰도 1.00심층 해설 →
lorien/awesome-web-scraping관찰 중

웹 스크래핑 도구, 라이브러리, 매뉴얼을 모아 놓은 큐레이션 리스트

👍 장점

  • 스크래핑 생태계 전반을 한눈에 파악 가능
  • 도구·라이브러리·매뉴얼을 언어별로 폭넓게 정리
  • 조사 단계에서 시간을 크게 절약해줌

👎 단점

  • 실제 크롤링 기능은 전혀 없음(도구가 아니라 목록)
  • 항목의 최신성·품질 검증은 사용자 몫
  • 커뮤니티 PR에 의존해 갱신 속도가 일정하지 않음
MakefileNOASSERTION신뢰도 1.00심층 해설 →
daijro/camoufox관찰 중

Firefox 기반 오픈소스 안티디텍트 브라우저로, 웹 스크래핑과 AI 에이전트를 위해 설계되었습니다.

👍 장점

  • Firefox 기반으로 봇 탐지 우회에 특화
  • AI 에이전트용 브라우저 자동화에 적합
  • 핑거프린트 위장 기능이 내장돼 있음

👎 단점

  • 패치된 Firefox 바이너리 설치 과정이 다소 무거움
  • 브라우저 하나만 다루므로 대량 병렬 크롤링엔 부적합
  • 상대적으로 커뮤니티 규모가 작음
C++MPL-2.0신뢰도 1.00심층 해설 →
gocolly/colly🍚 착한밥상

Go로 쓴 초고속 웹 스크래핑 프레임워크

👍 장점

  • Go 특유의 동시성으로 매우 빠른 처리 속도
  • 콜백 기반의 직관적인 API
  • robots.txt·캐싱·큐 등 크롤링 필수 기능 내장
  • Apache-2.0으로 상용 사용 부담이 적음

👎 단점

  • JS 렌더링이 필요한 동적 사이트는 별도 처리가 필요
  • Go 언어에 대한 기본 이해가 선행돼야 함
  • LLM용 데이터 정제 기능은 직접 구현해야 함
GoApache-2.0신뢰도 1.00심층 해설 →
이럴 땐 이거

용도별 추천

LLM에 넣을 웹 데이터를 마크다운으로 바로 뽑고 싶다면?
firecrawl/firecrawl

API 호출 한 번으로 크롤링부터 마크다운 변환까지 한 번에 처리합니다.

정적 페이지를 대량으로 빠르게 수집해야 한다면?
gocolly/colly

Go의 동시성과 큐 관리 기능으로 대규모 병렬 크롤링에 적합합니다.

탐지 우회가 중요한 사이트를 브라우저로 다뤄야 한다면?
daijro/camoufox

Firefox 기반 핑거프린트 위장으로 안티봇 시스템을 우회합니다.

아직 어떤 도구를 써야 할지 모르겠다면?
lorien/awesome-web-scraping

언어별 스크래핑 도구와 자료를 폭넓게 훑어보며 선택 기준을 잡을 수 있습니다.

어떤 기준으로 견줬나

맛대결은 순위표가 아닙니다. 아래 여섯 차원은 “설치해서 실제로 쓸 때 결과가 갈리는 지점”만 골랐고, 등급은 검증단이 각 레포를 실제 설치·실행해 남긴 기록과 공개 저장소 데이터에 근거합니다.

설치 난이도문서만 보고 첫 응답까지 도달하는 데 걸린 시간과 실패 지점 수
성능 · 규모동시 요청 처리 구조(배칭·캐시)와 저사양 대응 범위
유지보수 활력최근 커밋 빈도, 릴리스 주기, 이슈 응답 시간
라이선스상업적 사용·사내 배포 시 제약 여부
학습곡선사전 지식 요구량, 예제·문서의 언어별 완결성
용도 적합개인·팀·엣지 중 어디에 설계 의도가 맞춰져 있는가

등급은 절대 점수가 아니라 이 대결 안에서의 상대 비교입니다 · 착한밥상 배지는 4개 관문(안전·실속·살아있음·숙성)을 통과한 레포에만 붙습니다 · 관찰 중 표기는 숙성 기간이 아직 차지 않은 경우입니다.

지난 맛대결

아직 지난 회차가 없어요 — 지금 보고 있는 이 회차가 이 카테고리의 첫 회차입니다. 다음 회차가 차려지면 이 회차가 여기에 쌓이고, 지난 회차는 깃밥 PRO에서 열립니다.

착한식당 서재 →