AI 서비스에 웹 데이터 붙이기 · Bright Data 현직자 특강
2026년 9월 9일(수) 19:30-21:00 · 온라인 Google Meet · 당근 번개 특강
모임 개요
| 일시 | 2026년 9월 9일(수) 오후 7:30 ~ 9:00 |
|---|---|
| 진행 방식 | 온라인 Google Meet |
| 분류 | 당근 번개 (갑자기 잡힌 번개 특강) |
| 참가비 | 무료 |
| 초청 강사 | 이종혁 님 · Bright Data 한국 영업 담당 |
| 참여 대상 | 모두의 창업 AI바이브 멤버 (개발자가 아니어도 환영) |
한 줄 요약
Bright Data의 웹 데이터 수집 플랫폼 전반을 현직 한국 영업 담당자에게 직접 들은 번개 특강입니다. 프록시 인프라와 언락킹 API로 차단을 우회하는 원리부터, AI가 URL만 넣으면 맞춤형 스크래퍼 코드를 자동 생성하는 '스크래퍼 스튜디오' 실시간 시연, 그리고 Claude 등 LLM에 MCP로 연결해 챗GPT·퍼플렉시티에 최신 웹 데이터를 붙이는 방법까지 다뤘습니다.
이번 특강의 배경
“웹의 데이터를 AI에 연결하면 무엇까지 만들 수 있을까?”
AI 서비스나 바이브코딩을 하다 보면 결국 "데이터를 어디서, 어떻게 가져올 것인가?"라는 질문에 부닥치게 됩니다. 크롤링이 막히거나 차단되면 어떻게 할지, 상품·가격·리뷰·기업정보를 대량으로 수집할 수 있을지, ChatGPT나 Gemini 같은 AI에 실시간 웹 데이터를 어떻게 붙일지 등을 Bright Data 현업 담당자에게 직접 듣고 질문할 수 있는 자리로 기획되었습니다.
주요 내용
Bright Data 기업 소개
웹 데이터 플랫폼 산업에서 글로벌 최대 규모의 사업자입니다. 포브스가 선정한 엔터프라이즈 티어 상위 업체로, 포춘 500 포함 2만 개 이상의 고객사와 500명 이상의 직원을 보유하고 있으며, 작년 매출은 한국 원화 기준 약 5,000억~6,000억 원 규모입니다. 상위 20개 LLM 랩 중 14곳, 상위 AI 퍼스트 기업 중 7곳이 Bright Data 인프라를 사용하고 있습니다. 메타·X·구글과의 소송에서도 로그인 이전 퍼블릭 데이터 수집은 법적으로 문제가 없다는 미국 법원 판결로 모두 승소했습니다.
프록시 인프라와 언락킹 API
- 데이터센터 프록시 — 속도가 가장 빠르지만 알려진 IP라 차단이 잘 됨
- ISP 프록시 — SK브로드밴드·KT·LG유플러스 등 통신사 IP로 보완
- 레지던셜 프록시 — 실제 유저 IP를 사용해 차단율이 가장 낮음 (모바일 프록시는 신규 고객에게 중단)
- 언락킹 API — 캡차·브라우저 핑거프린트·챌린지를 무력화해 차단된 데이터에 접근
- 서프(SERP) API — 구글·빙·네이버 등 검색엔진 결과 수집
- 브라우저 API — 퍼페티어/플레이라이트에 언락킹과 IP 로테이션을 자동 추가
- AI 서치 엔진 API — ChatGPT·Perplexity 등과 연동된 데이터셋 수집 지원
데이터 수집 방식의 변화
과거에는 엔지니어가 직접 스크래핑 코드를 작성해야 했지만, 이제는 AI 기반 스크래핑 도구와 API를 활용하는 하이브리드 방식으로 전환되고 있습니다. 인기 도메인(아마존·유튜브 등)은 미리 만들어진 '스크래퍼 라이브러리'로 바로 호출할 수 있고, 원하는 데이터 포인트가 없으면 'Request a new one'으로 엔지니어링팀에 추가를 요청할 수 있습니다. 수집 결과는 JSON 또는 CSV로 다운로드하며, 데이터 사전에서 항목별 설명을 확인할 수 있습니다.
스크래퍼 스튜디오(Scraper Studio) 실시간 시연
URL과 추가 지시사항만 입력하면 AI가 페이지 구조를 분석해 인터랙션 코드(수집용)와 파서 코드(구조화용)를 자동 생성합니다. 올리브영 페이지로 실연했으며, 주요 기능은 다음과 같습니다.
- 셀프 힐링(Self-healing) — 코드가 의도대로 작동하지 않을 때 버튼 한 번으로 문제 해결·로직 수정 (예: 다음 페이지까지 순회하도록 AI에게 수정 지시)
- 자동화 스케줄링 — 일/시간/분 단위 주기적 수집, 결과를 Snowflake·Google Storage·이메일·웹훅으로 자동 전송
- 무료 기능 — 코드 생성·미리보기·결과물 다운로드 모두 무료
- 수집 결과 파일은 약 2~4주간만 보관되므로 장기 저장 시 전송 설정 권장
요금 체계
매달 5,000 크레딧까지 무료입니다. Pay-as-you-go 모델은 페이지당 약 1.5달러이며 약정 없이 필요할 때 충전해 사용하고 잔액 환불이 가능합니다. 대용량 사용자를 위해 월 500·1,000·2,000 페이지 플랜을 제공하며, 대규모 이용 시 페이지당 약 1.1달러로 단가가 낮아집니다.
Bright Data MCP 통합
Claude 등 LLM에 Bright Data의 MCP(Model Context Protocol)를 연결하는 시연을 진행했습니다. 차단된 사이트(예: Glassdoor)의 데이터에 접근해 요약하는 과정을 보여주었으며, 매달 5,000 크레딧을 무료로 제공합니다. 홈페이지 컨트롤 패널에서 인프라·언락킹·API를 관리할 수 있고, 내장 AI 챗봇으로 에러 코드나 기술 문의(한국어 지원)를 해결할 수 있습니다.
실사용 사례 — 쇼미룩(ShowMeLook)
손대균 님이 쇼미룩 서비스 구축 과정에서 스크래퍼 스튜디오를 활용한 경험을 공유했습니다. 웹사이트 URL과 필요한 데이터(이미지·가격·재고·사이즈 등)만 입력해 AI와 대화하며 API를 생성했고, 주간 단위로 스케줄링해 필요한 시점에만 데이터를 수집했습니다. 수집된 데이터는 웹훅으로 자신의 서비스에 자동 전달·분류·정리되어 데이터 통합이 매우 효율적이었습니다.
이번 특강의 목표
- Bright Data가 어떤 서비스인지, 실제로 어떻게 활용할 수 있는지 직접 듣고 이해하기
- 웹 데이터 수집과 크롤링의 차이, 안정적으로 데이터를 가져오는 방법 배우기
- AI 서비스·AI Agent·자동화 서비스에 웹 데이터를 어떻게 연결할지 실전 Q&A
- 검색만으로는 알기 어려운 현업 담당자의 실사용 노하우 얻기
마무리
Bright Data를 검색해 기능만 보는 것보다, 한국 영업 담당자에게 직접 설명을 듣고 내가 만들고 있는 서비스에 어떻게 적용할 수 있는지 질문할 수 있는 값진 시간이었습니다. 앞으로 AI 서비스·바이브코딩·AI Agent·자동화를 만들 계획이라면 결국 "데이터를 어디서, 어떻게 가져올 것인가?"를 고민하게 되는데, 이번 특강이 그 출발점이 되었습니다.