데이터·크롤링,
첫 술 떠드립니다
웹에 흩어진 데이터, 오늘 직접 모아볼 수 있어요.
🔒 이 페이지는 순한맛 고정이게 뭔가요 — 1분 설명
크롤링은 웹페이지에 있는 정보를 프로그램으로 자동 수집하는 일이에요. 여러 시장을 돌며 필요한 식재료만 골라 담아오는 거죠. 아래만 있으면 오늘 첫 데이터를 긁어와 표로 정리해볼 수 있어요.
준비물
- GitHub 계정 만들기 (무료)
- Python 설치 — 주방 차리기
- 수집하고 싶은 사이트·데이터 하나 정하기
처음이라면 꼭 알아둘 레포
쉬운 것부터 차례로. 따라 만들기 좋고 검증된 레포만 골랐어요.
1ScrapeGraphAI/Scrapegraph-ai
難易度2LLM 기반 웹 스크래핑 라이브러리로 자연어 프롬프트만으로 웹사이트와 로컬 문서에서 데이터를 추출합니다.
apify/crawlee-python
難易度3웹 크롤링과 브라우저 자동화를 위한 안정적이고 빠른 Python 라이브러리
soxoj/maigret
難易度4사용자명만으로 3,000개 이상의 사이트에서 계정을 찾아 한 사람의 정보를 수집하는 오픈소스 OSINT 도구
firecrawl/firecrawl
難易度5웹 페이지를 크롤링·스크래핑해 LLM이 바로 쓸 수 있는 마크다운·구조화 데이터로 변환해주는 오픈소스 웹 데이터 API
apify/crawlee
難易度6웹 스크래핑과 브라우저 자동화를 위한 엔드투엔드 Node.js 라이브러리
gocolly/colly
難易度Go로 쓴 초고속 웹 스크래핑 프레임워크
매주 새 데이터 레시피 받기
월요일 아침마다, 따라 만들기 좋은 데이터·크롤링 레포만 골라서