AI 고문서 검색, 발견보다 중요한 원본까지의 경로
AI는 기록을 새로 만드는 것이 아니라 사람이 확인할 후보를 줄일 때 강력하다. 검색 실패를 역사적 부재로 해석하지 않고 원본과 목록까지 이어지는 근거를 남겨야 한다.
AI 뉴스를 놓치지 마세요
매주 핵심 AI 소식을 이메일로 받아보세요.
소프트웨어 엔지니어 Jesse Waites가 10월 8일 공개한 조사 기록은 AI의 연구 활용을 구체적인 작업 흐름으로 보여준다. 네덜란드 동인도회사 기록과 옛 신문 등에서 운석 낙하, 코뿔소 운송, 화산 분출과 관련한 후보 자료를 찾아낸 사례다. 제목의 '발견'을 곧바로 학계가 확정한 새로운 사실로 읽어서는 안 된다. 저자도 전문가 확인이 남아 있음을 설명한다.
핵심은 대형 모델 하나에 모든 기록을 읽힌 것이 아니다. 검색 가능한 자료를 준비하고, 저렴한 판단 모델로 후보를 줄이고, 더 큰 모델로 해석한 다음 원본 이미지와 전문 목록으로 돌아가는 다단계 설계다. AI가 아는 내용을 믿는 대신 사람이 재검토할 경로를 만드는 데 가치가 있다.
435만 쪽을 읽었다는 말의 실제 의미
저자는 GLOBALISE 프로젝트의 전사 자료 435만 쪽에서 약 570만 개 구절을 임베딩으로 바꾸는 작업을 집의 GPU로 하룻밤, 약 12시간에 처리했다고 설명한다. 이는 모든 쪽의 역사적 의미를 검증했다는 뜻이 아니라 검색용 표현을 만든 처리 시간이다. 자료의 전사와 디지털화는 그보다 앞서 수행된 별도의 인프라 작업이다.
당시 네덜란드어의 철자 변화와 문자 인식 오류 때문에 단일 키워드 검색은 관련 기록을 놓칠 수 있다. 의미 기반 검색은 이 문제를 완화하지만 비슷하게 보이는 다른 장소나 사건도 가져온다. 따라서 검색 결과는 증거 후보이지 곧바로 답이 아니다. 장서 규모와 처리 속도를 소개할 때 이 구분이 빠지면 AI의 독해 능력이 과장된다.
작은 판단 모델과 큰 모델의 역할을 나누다
저자는 Jev로 동물 언급 등을 먼저 선별하고, Claude Haiku로 유망한 구절을 읽고 번역하며 날짜와 장소를 추출했다고 설명한다. 이어 코딩 에이전트로 원본 스캔을 열어 전사와 비교하고, 기존 목록과 대조했다. 코끼리 언급 약 5만9천 건의 1차 선별에 약 3달러가 들었다는 수치는 저자의 해당 단계 보고이며, 전체 프로젝트의 총비용이나 누구나 재현할 가격표가 아니다.
| 단계 | 줄이려는 문제 | 남아 있는 검증 |
|---|---|---|
| 전사·임베딩 검색 | 방대한 기록과 철자 변이 | 누락·OCR 오류 확인 |
| 좁은 질문으로 선별 | 관련 없는 대량 후보 | 탈락 자료의 표본 재검토 |
| 번역·정보 추출 | 사람이 읽을 분량 | 지명·연대·문맥 해석 |
| 원본·목록 대조 | 전사 오류와 중복 발견 | 분야 전문가의 신규성 판단 |
관련 작업 환경은 Antiquity 저장소에도 공개돼 있다. 다만 공개 도구가 있다는 사실이 조사 결과의 독립 재현을 뜻하지는 않는다. 이 기사 역시 파이프라인 전체나 원본 필사본의 판독을 재실행한 검증 보고서가 아니다.
흥미로운 후보와 확정된 발견 사이
저자는 1812년 신문에 재수록된 운석 낙하 서신, 스리랑카 왕에게 보내려다 죽은 코뿔소 세 마리의 기록, 기존 목록에 없다고 판단한 화산 분출 후보 세 건을 제시했다. 운석 사례에는 네덜란드 도서관의 해당 신문 참조가 연결돼 있고, 화산 사례는 Smithsonian Global Volcanism Program과의 비교를 설명한다.
이런 링크는 검증 가능한 주장을 만드는 데 중요하다. 하지만 특정 목록에 없다는 확인과 해당 분야의 모든 연구에서 알려지지 않았다는 결론은 다르다. 저자는 코뿔소 사례의 전문 문헌상 신규성을 더 확인해야 한다고 썼고, 원본을 대조하지 않은 기이한 하늘 현상은 조사 결과가 아닌 이야기로 취급하라고 구분했다. 보도에서도 이 수준 차이를 유지해야 한다.
또한 AI가 화산 위치를 크게 잘못 짚은 사례가 있었다고 밝힌다. 문서에 나온 지형과 이동 경로로 위치를 다시 맞추는 작업은 언어 모델의 매끄러운 번역만으로 대체되지 않는다. 연구용 에이전트의 품질은 후보 수보다 잘못된 후보를 버린 근거에서 드러난다.
알려진 사건을 먼저 찾는 검사가 필요한 이유
저자는 새로운 사건에 앞서 이미 알려진 도도새 기록과 라키·탐보라 분출 등 통제 사례를 검색했다고 설명한다. 검색기가 존재하는 자료를 찾아낼 수 있는지 확인하는 최소한의 절차다. 반면 1808~1809년의 미확인 대분출을 특정하려는 시도는 성과가 없었다.
그 실패는 '사건이 없었다'는 증거가 아니다. 아직 전사되지 않은 항해일지, 검색 대상 밖 언어, 자료 소실이나 오분류 때문에 놓쳤을 수도 있다. 통제 사례를 통과해도 모든 유형의 기록에 대한 재현율이 입증되는 것은 아니다. 이런 한계를 공개해야 후속 연구자가 검색 범위와 결론의 강도를 구분할 수 있다.
한국 기록 기관에 주는 시사점
국내 고문서·신문·공공 기록에 적용할 때도 모델부터 고르기보다 원본 식별자, 전사 버전, 페이지 좌표를 보존하는 설계가 먼저다. 같은 인물과 지명의 이체자, 옛 행정구역, 한문과 근대 한국어의 혼용을 평가 자료에 넣어야 한다. 1차 필터가 버린 자료를 무작위로 다시 읽는 검사도 검색 누락을 추정하는 데 도움이 된다.
Biohub의 데이터 기반 연구 투자와 마찬가지로 성과의 상당 부분은 공개 자료를 정리해 온 기관에 의존한다. OpenAI 수학 결과의 공개·검증 문제는 결과물과 검증 부담이 다름을 보여주며, StarCraft 평가의 출처 논쟁은 산출물의 경로를 남겨야 하는 이유와 연결된다. 기록 기관의 경쟁력은 그럴듯한 요약보다 누구나 원본으로 돌아갈 수 있는 서비스에 있을 것이다.
자주 묻는 질문
운석과 화산 발견은 확정됐나?
저자가 후보 기록을 제시한 단계다. 전문 목록의 갱신이나 학술적 신규성이 모두 확정됐다는 자료로 소개하지 않는다.
12시간이면 435만 쪽을 완벽히 이해할 수 있나?
아니다. 저자가 밝힌 수치는 임베딩을 통한 검색 준비에 관한 것으로, 모든 문서의 의미 검증 시간이 아니다.
작은 모델을 쓰면 정확도가 보장되나?
그렇지 않다. 저렴한 선별은 비용을 줄일 수 있지만 중요한 자료를 탈락시킬 수 있어 재현율 검사와 표본 검토가 필요하다.
검색 결과가 없으면 사건도 없었나?
아니다. 자료 범위, 전사 상태, 검색 표현과 모델의 누락 가능성을 함께 고려해야 한다.
한국 기관이 가장 먼저 준비할 것은 무엇인가?
원본과 전사본을 안정적으로 연결하는 식별자, 알려진 사건의 평가 집합, 사람이 후보를 승인하거나 기각한 기록이다.
관련 토픽 더 보기
📰 원본 출처
jessewaites.com이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.