본문 바로가기
반응형

AI정독2

PDF 텍스트가 안 나올 때 — 스캔본인 줄 알았는데 앞 4쪽만 읽고 있었습니다 한눈에26~97쪽짜리 인뎁스 리포트 1,129개·6.3GB를 같은 도구로 처리했습니다. 앞 편 엔진을 복사하지 않고 «어디서 가져오나»만 갈아끼웠습니다 — 그래서 한쪽을 고치면 양쪽이 같이 좋아집니다.「스캔한 PDF라 글자를 못 읽는다」고 몇 달을 믿었는데 틀렸습니다. 제 코드가 앞 네 쪽만 읽고 있었고, 두꺼운 리포트는 앞 네 쪽이 표지·목차입니다.86쪽 문서에서 4,361자만 읽고 있었습니다 — 전문 120,000자의 3.6%입니다. 「전 페이지를 읽어라」 한 줄로 고쳤고, 스캔으로 분류했던 155건 중 절반이 정상 문서로 돌아왔습니다.PDF가 1,000개를 넘으면 눈으로 못 찾습니다. 파일 이름의 낱말로 갈래를 나눠 폴더로 옮기고, 기준을 고치면 이미 쌓인 것도 다시 분류합니다 — 옮기기 전에 «무.. 2026. 8. 22.
AI 요약이 숫자를 틀리는 세 가지 자리 — 증권사 리포트 1,837건을 정독시키며 찾은 것 한눈에매일 나오는 증권사 리서치를 자동으로 모아 AI가 정독하고, 한 장짜리 대시보드로 텔레그램에 받습니다. 지금까지 PDF 1,837개·1.9GB가 쌓였습니다.텔레그램은 메시지가 4,096자에서 잘립니다. 그래서 긴 내용은 채팅창에 쏟지 않고 HTML 파일로 첨부합니다 — 폰에서도 표와 색이 그대로 열립니다.AI가 숫자를 틀리는 자리는 정해져 있었습니다. 단위 바꿔 적기(10배 오류) · 회계 괄호를 양수로 읽기 · 원문에 없는 값을 역산해 지어내기. 하지 말 것을 하나씩 적어주니 재시험에서 지어낸 값이 0개가 됐습니다.원문이 길수록 요약이 부실해집니다 — 5,000자 이하 41% · 12,000~25,000자 8% · 25,000자 이상 1.5%. 20만자짜리가 575자로 나온 적이 있고, 긴 것만 .. 2026. 8. 22.
반응형