LLM2 [260713] AI가 자신 있게 틀렸던 순간을 목격했다 리포트를 검토해준 AI가 실제 실적을 "있을 수 없는 수치"라며 오염이라 판정했는데, 확인해보니 진짜였다오늘은 마침 느슨한 재택 교육이 있는 날이라, 평소 평일보다 여유 있게 작업 시간을 낼 수 있었습니다. 그래서 그런지 유독 건질 게 많은 하루였습니다.AI가 자신 있게 틀렸던 순간을 목격했다리포트 검토를 도와주던 AI가, 어떤 종목의 재무 수치가 특정 지표 기준으로 지나치게 높게 나온 걸 보고 "이 정도 수치는 이 업종/이 회사 규모에서 역대 어느 시점에도 나온 적이 없다"며 아주 자신 있게 "데이터가 오염된 것"이라고 판정했습니다.그런데 실제로 확인해보니 아니었습니다. 그 정도로 실적이 진짜 좋았던 겁니다 — 최근 관련 업종에 큰 호황이 와서, 예전 기준으로는 "있을 수 없는" 수치가 지금은 현실이 .. 2026. 7. 13. 260706 작업일지 - 로컬 LLM 3종 비교에서 찾아낸 숨은 실패 패턴들 등급 분포만 봐서는 안 보였던 두 가지 실패 유형, 그리고 프레임워크 마이그레이션으로 잡은 구조화 출력 문제프로젝트 초반이라 하루 단위로 바뀌는 게 많습니다. 매일 올리진 못하겠지만, 굵직한 변화가 있었던 날은 이렇게 짧게 남겨보려고 합니다. 오늘은 세 가지 축으로 작업했습니다.1. 로컬 LLM 3종 정식 비교멀티에이전트 LLM 리서치 파이프라인에 쓸 로컬 모델을 하나 골라야 해서, 후보 3개를 같은 조건(같은 종목 목록, 같은 날짜)으로 순차 실행해서 비교했습니다.비교는 두 단계로 했습니다.자동 확인: 실패율, 최종 등급이 한쪽으로 쏠리는지, 다른 종목명이 섞여 들어오는지, 소요 시간수동 스팟체크: 실제 생성된 글의 완성도, 등급과 근거가 실제로 맞는지 하나씩 열어서 확인여기서 흥미로운 걸 발견했는데,.. 2026. 7. 6. 이전 1 다음