소프트웨어 엔지니어가 AI로 400년 기록 뒤져 찾아낸 것들
소프트웨어 엔지니어 제시 웨이츠가 자신의 홈랩에서 AI 파이프라인을 돌려 네덜란드 동인도회사(VOC) 문서 435만 쪽을 12시간 만에 분석했습니다. 그 결과 17세기 운석 낙하 기록, 자바 섬에서 사라진 코뿔소 세 마리, 공식 기록에 없는 화산 폭발 정황이 나왔습니다.
이 작업의 출발은 역사학자 벤저민 브린의 글입니다. 브린은 10월 1일 앤트로픽의 오퍼스 5.5를 써서 1615년 선원 일지에서 "도도 새를 많이 잡았다"는 새로운 목격담을 찾아냈습니다. 웨이츠는 이 방식을 확장해 여러 미스터리를 병렬로 추적하고, 검증 가능한 원문 링크까지 자동으로 연결하는 파이프라인을 만들었습니다.
파이프라인: 사람 대신 '싼 판단 모델'이 1차 걸러내기
핵심은 두 단계 필터입니다. 먼저 그래픽카드로 570만 구절을 벡터 임베딩(의미를 수치로 변환)해 의미 기반 검색을 가능하게 했습니다. 키워드 검색이면 17세기 네덜란드어 철자 차이('코뿔소'만 15가지 표기) 때문에 놓쳤을 내용입니다.
검색 결과 수만 건 중 사람이 읽을 만한 분량만 남기기 위해 웨이츠는 **제브(Jev)**라는 초소형 '시스템 원' 모델을 투입했습니다. "이 구절이 실제 야생 동물을 언급하는가? 위치는 어디인가?" 같은 좁은 질문만 판단하게 하고, 통과한 수십 건만 클로드 하이쿠가 정밀 읽기를 했습니다. 코끼리 언급 5만 9천 건을 제브가 걸러내는 데 든 비용은 3달러였습니다.
웨이츠는 "이 필터 아이디어는 내 제안이었고, 클로드 코드의 페이블 모델은 처음엔 시스템 원 개념을 몰랐다"고 밝혔습니다. 병목이던 '사람이 후보 문단 일일이 읽기'를 1센트 단위 모델이 대체한 셈입니다.
발견된 것들: 운석, 코뿔소, 화산
자료에서 확인된 발견은 세 가지입니다. 1648년 바타비아(현 자카르타) 인근 운석 낙하 보고, 1680~1690년대 자바 서부에서 목격된 코뿔소 세 마리(기존 학계는 18세기 초 멸종으로 봄), 1808년 미확인 거대 화산 폭발 후보로 거론되는 수마트라 지역 화산 활동 정황입니다. 모두 원문 스캔과 아카이브 레퍼런스가 붙어 있어 누구든 원본을 대조할 수 있습니다.
커뮤니티 반응: "연구는 좋은데 사이트 효과가 과하다"
해커뉴스 댓글 7개 중 다수는 내용보다 웨이츠 블로그의 회전하는 코뿔소 애니메이션, 운석 임팩트 효과, 흐름도 애니메이션을 비판했습니다. "뉴욕타임스도 본문 가리는 효과는 안 쓴다", "90년대 '공사 중' 배너 GIF 같다"는 지적이 나왔습니다. 연구 방법론 자체에 대한 이견은 거의 없었습니다.
쉽게 풀어보면
제시 웨이츠는 소프트웨어 엔지니어입니다. 그는 역사학자가 아닙니다. 하지만 네덜란드 동인도회사가 1602년부터 1799년까지 아시아 전역에서 남긴 문서 435만 쪽이 디지털화돼 있다는 걸 알았습니다. 사람이 읽으려면 70년 걸립니다.
그는 AI에게 "이 산더미에서 풀 수 있는 역사 미스터리 후보를 뽑아줘"라고 물었습니다. AI가 13개 후보를 줬습니다. 그중 운석, 코뿔소, 화산, 지진, 사라진 배 등이 있었습니다.
그다음 웨이츠는 클로드 코드(개발자용 AI 도구)와 함께 파이프라인을 짰습니다.
- 의미 검색 준비: 문서 전체를 '의미 지문(벡터 임베딩)'으로 바꿨습니다. 단어가 달라도 뜻이 같으면 찾아냅니다. '코뿔소' 철자가 15가지 달라도 상관없습니다.
- 1차 필터(제브): 수만 건 검색 결과 중 '진짜 야생 동물 목격담인가? 위치가 있는가?'만 1초 만에 판단하는 아주 작은 모델을 썼습니다. 비용은 몇 달러.
- 2차 정밀 읽기(클로드 하이쿠): 1차 통과한 수십 건만 큰 모델이 사람처럼 꼼꼼히 읽고 원문 위치를 붙여줬습니다.
이렇게 하룻밤 만에 70년 치 읽기를 끝냈습니다. 그리고 원문 스캔 링크가 달린 새로운 기록 세 건을 얻었습니다.
이 이야기의 핵심은 AI가 혼자 다 한 게 아니다라는 점입니다. 웨이츠가 '싼 모델로 1차 걸러내기'라는 아이디어를 냈고, 검증은 반드시 원문으로 되돌려서 했습니다. AI는 도구였고, 설계자와 검증자는 사람이었습니다.
나에게 미치는 영향
당신도 오늘 바로 비슷한 방식으로 내가 가진 대량 문서에서 원하는 정보만 뽑아보기를 시험할 수 있습니다.
- **구글 노트북LM(무료)**에 PDF나 텍스트 파일을 여러 개 올립니다.
- 왼쪽 패널에서 "가이드 추가"를 누르고 이렇게 적습니다.
"이 문서들에서 **[관심 주제, 예: '고객 불만 중 배송 지연 관련만']**만 골라 원문 문장과 페이지 번호까지 줘. 확실하지 않으면 '모름'이라고 해."
- 답변이 나오면 인용된 원문 링크(문서 내 위치)를 클릭해 직접 확인하세요.
이게 웨이츠가 한 일의 축소판입니다. '비싼 모델이 다 읽게 하기' 대신 '작은 규칙으로 1차 걸러내기' 원리를 무료 도구로 써먹는 겁니다.
흔히 막히는 지점: 노트북LM이 문서를 너무 많이 올리면 느려지거나 요약만 하고 인용을 안 줍니다. 문서를 주제별로 10~20개씩 나눠 여러 노트북으로 올리면 해결됩니다. 또, "원문 위치 줘"를 프롬프트에 반드시 넣어야 페이지 번호가 나옵니다.
남은 쟁점: 검증 비용과 도메인 지식
웨이츠 파이프라인의 전제는 **'원문 스캔이 온라인에 공개돼 있고, 기계 판독(OCR) 품질이 쓸 만하다'**는 것입니다. 한국 고문서나 비공개 기업 아카이브에는 그대로 쓰기 어렵습니다. 또 제브 같은 필터 모델을 직접 돌리려면 GPU 서버와 파이프라인 구축 능력이 필요합니다. 노트북LM 같은 관리형 서비스로는 '1차 필터 모델 교체'가 안 됩니다.
본지가 32일 전 다룬 AI에게 글쓰기를 맡기면 내 생각이 사라질까 논쟁과 닿아 있습니다. 웨이츠는 설계·판단·검증은 사람이 하고, 읽기·분류·요약만 AI에 위임했습니다. '생각의 주체성'을 넘기지 않은 사례입니다.
웨이츠는 코드와 프롬프트를 공개하지 않았습니다. 재현하려면 임베딩 파이프라인, 제브 같은 소형 모델 서빙, 클로드 API 연동을 직접 짜야 합니다. "누구나 쓸 수 있는 도구"가 아니라 "능력 있는 엔지니어가 자기 연구용으로 만든 파이프라인"에 가깝습니다.
이 기사의 출처
- Hacker NewsI Pointed AI at 400 Years of Archives. It Found a Forgotten Meteorites and More
- r/ClaudeAII Pointed Claude at 400 Years of Historical Archives. It Found a Forgotten Meteorite, Lost Rhinos, and Unrecorded Volcanic Eruptions.
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.