웹 크롤링 도구 4파전: firecrawl vs colly vs camoufox vs 큐레이션 리스트
같은 '데이터·크롤링' 카테고리에 묶였지만 실제 역할은 서로 다릅니다. firecrawl은 LLM용 API 서비스, colly는 Go 크롤링 프레임워크, camoufox는 안티디텍트 브라우저, awesome-web-scraping은 도구 자체가 아닌 큐레이션 리스트입니다.
왜 이들을 묶었나 — 크롤링이라는 단어 하나로 묶이지만 실제로 쓰는 순간 완전히 다른 물건을 고르게 됩니다. 이 비교는 '무엇이 더 좋은가'가 아니라 '내가 지금 필요한 게 API인지, 라이브러리인지, 브라우저인지, 아니면 조사 자료인지'를 먼저 가르는 데 목적이 있습니다.
gocolly/colly
Go로 쓴 초고속 웹 스크래핑 프레임워크
왜 이걸 골랐나 — 착한밥상 등급으로 신뢰도가 검증된 유일한 레포이며, 설치가 가볍고(go get 한 줄) Go 동시성 덕분에 성능도 좋습니다. robots.txt, 캐싱, 큐 관리 같은 크롤링 필수 기능을 이미 내장하고 있어 첫 크롤러 프로젝트로 삼기에 부담이 적습니다.
여섯 가지 차원으로 견줬습니다
| 차원 | firecrawl/firecrawl후보 | lorien/awesome-web-scraping후보 | daijro/camoufox후보 | gocolly/colly🍚 착한밥상 |
|---|---|---|---|---|
| install🛠️ | 중간셀프호스팅 시 Redis 등 인프라 구성 필요, 클라우드 API도 별도 제공 | 설치 불필요도구가 아니라 목록이라 설치 자체가 없음 | 다소 번거로움패치된 Firefox 바이너리 다운로드와 자동화 스택 구성이 필요 | 쉬움go get 한 줄로 라이브러리 추가, 별도 인프라 불필요 |
| scale🚀 | 확장성 높음큐·워커 구조로 대규모 크롤링 API 서비스를 지향 | 해당없음실행되는 도구가 아니라 성능 지표 자체가 없음 | 단일 브라우저 중심대량 병렬성보다 탐지 회피와 은닉성에 초점 | 매우 빠름Go 동시성 기반으로 정적 페이지 대량 수집에 강함 |
| maintenance🔧 | 활발함스타트업 주도로 기능 추가가 빠르게 이어지는 편 | 느슨함커뮤니티 PR 위주로 간헐적으로 갱신되는 목록 | 성장중신생 프로젝트로 업데이트가 이어지지만 규모는 아직 작음 | 검증된 안정착한밥상 등급으로 신뢰도가 확인된 상태 |
| learning📈 | 매우 쉬움API 호출 몇 줄로 마크다운 결과를 바로 받아볼 수 있음 | 읽기만 하면 됨도구 학습이 아니라 목록을 훑어보는 것뿐 | 다소 어려움브라우저 자동화와 핑거프린트 개념 이해가 필요 | 중간Go 언어와 콜백 기반 API 구조를 익히는 시간이 필요 |
| 라이선스상업적 사용 | ➖ AGPL-3.0 | ➖ NOASSERTION | ✅ MPL-2.0 | ✅ Apache-2.0 |
| 용도 적합어디에 맞나 | LLM 파이프라인에 넣을 웹 데이터를 마크다운으로 빠르게 확보해야 하는 경우 | 어떤 스크래핑 도구를 써야 할지 아직 감이 없어 조사 단계에 있는 경우 | 탐지 회피가 중요한 사이트를 브라우저 자동화로 다뤄야 하는 경우 | 정적·반정적 페이지를 대량으로 빠르게 수집하는 Go 기반 크롤러가 필요한 경우 |
각자 무엇을 잘하고, 무엇을 포기했나
웹 페이지를 크롤링·스크래핑해 LLM이 바로 쓸 수 있는 마크다운·구조화 데이터로 변환해주는 오픈소스 웹 데이터 API
👍 장점
- LLM용 마크다운·구조화 데이터 변환을 API 하나로 처리
- 크롤링+파싱+정제까지 원스톱으로 제공
- 구조화 데이터 추출 스키마 지원
- 개발 속도가 빠른 편
👎 단점
- AGPL-3.0 라이선스로 상용 서비스에 소스 공개 부담이 있을 수 있음
- 자체 호스팅 시 Redis 등 인프라 구성 필요
- TypeScript 스택에 종속됨
웹 스크래핑 도구, 라이브러리, 매뉴얼을 모아 놓은 큐레이션 리스트
👍 장점
- 스크래핑 생태계 전반을 한눈에 파악 가능
- 도구·라이브러리·매뉴얼을 언어별로 폭넓게 정리
- 조사 단계에서 시간을 크게 절약해줌
👎 단점
- 실제 크롤링 기능은 전혀 없음(도구가 아니라 목록)
- 항목의 최신성·품질 검증은 사용자 몫
- 커뮤니티 PR에 의존해 갱신 속도가 일정하지 않음
Firefox 기반 오픈소스 안티디텍트 브라우저로, 웹 스크래핑과 AI 에이전트를 위해 설계되었습니다.
👍 장점
- Firefox 기반으로 봇 탐지 우회에 특화
- AI 에이전트용 브라우저 자동화에 적합
- 핑거프린트 위장 기능이 내장돼 있음
👎 단점
- 패치된 Firefox 바이너리 설치 과정이 다소 무거움
- 브라우저 하나만 다루므로 대량 병렬 크롤링엔 부적합
- 상대적으로 커뮤니티 규모가 작음
Go로 쓴 초고속 웹 스크래핑 프레임워크
👍 장점
- Go 특유의 동시성으로 매우 빠른 처리 속도
- 콜백 기반의 직관적인 API
- robots.txt·캐싱·큐 등 크롤링 필수 기능 내장
- Apache-2.0으로 상용 사용 부담이 적음
👎 단점
- JS 렌더링이 필요한 동적 사이트는 별도 처리가 필요
- Go 언어에 대한 기본 이해가 선행돼야 함
- LLM용 데이터 정제 기능은 직접 구현해야 함
용도별 추천
API 호출 한 번으로 크롤링부터 마크다운 변환까지 한 번에 처리합니다.
Go의 동시성과 큐 관리 기능으로 대규모 병렬 크롤링에 적합합니다.
Firefox 기반 핑거프린트 위장으로 안티봇 시스템을 우회합니다.
언어별 스크래핑 도구와 자료를 폭넓게 훑어보며 선택 기준을 잡을 수 있습니다.
어떤 기준으로 견줬나
맛대결은 순위표가 아닙니다. 아래 여섯 차원은 “설치해서 실제로 쓸 때 결과가 갈리는 지점”만 골랐고, 등급은 검증단이 각 레포를 실제 설치·실행해 남긴 기록과 공개 저장소 데이터에 근거합니다.
등급은 절대 점수가 아니라 이 대결 안에서의 상대 비교입니다 · 착한밥상 배지는 4개 관문(안전·실속·살아있음·숙성)을 통과한 레포에만 붙습니다 · 관찰 중 표기는 숙성 기간이 아직 차지 않은 경우입니다.
지난 맛대결
아직 지난 회차가 없어요 — 지금 보고 있는 이 회차가 이 카테고리의 첫 회차입니다. 다음 회차가 차려지면 이 회차가 여기에 쌓이고, 지난 회차는 깃밥 PRO에서 열립니다.