'환각 0'이 실제로 보장하는 것 — groundedness와 그 대가
검증 노드가 재는 것은 사실성이 아니라 문서와의 일치이며, 문서가 틀리면 통과한다. 다섯 가지 한계와 코드에서 센 LLM 호출 횟수, 그리고 실습 코드에 남아 있는 함정 여덟 개를 정리한다.
태그
8편
검증 노드가 재는 것은 사실성이 아니라 문서와의 일치이며, 문서가 틀리면 통과한다. 다섯 가지 한계와 코드에서 센 LLM 호출 횟수, 그리고 실습 코드에 남아 있는 함정 여덟 개를 정리한다.
정답이 하나가 아닌 출력을 어떻게 채점하는지, 실행 경로가 긴 시스템에서 어느 지점을 재야 하는지, 그리고 지표를 개발팀 밖으로 내보내는 3계층 구조와 7단계 도입 절차를 정리한다.
에이전트 루프가 무너지는 열 가지 방식을 증상·원인·해결로 정리하고, 모델을 바꾸기 전에 좁혀야 할 6단계 진단과 도입 자체를 루프로 다루는 조직 절차, 근거 강도 구분법까지 다룬다.
검증 루프를 실제로 돌렸을 때 무엇이 관측되는지, 압축기에서 생성 권한을 제거하는 설계, 그리고 RAG 품질을 계층별 지표로 관리하는 체계를 정리한다.
검증 노드가 실제로 보장하는 범위, 비용이 늘어나는 세 경로와 종료 조건 4겹, 실행 권한을 줄 때의 최소 요건, 그리고 에이전트가 개발조직에 요구하는 것을 정리한다.
루프의 관리 단위를 런타임 계약으로 정의하고 목표·상태·정책·도구·관찰·검증기·종료·격리 여덟 표면으로 분해한 뒤, 언제 루프가 과설계가 되는지를 검증 가능성 기준으로 가른다.
Focus별 ToolNode를 조립해 결정론적 분기를 완성한 뒤, 각주가 붙지 않는 진짜 원인이 프롬프트가 아니라 State 설계에 있음을 밝히고 스트리밍 UX가 그래프에 거는 제약까지 따라간다.
환각 판정과 답변 적합성 판정을 중첩해 세 갈래 경로를 만드는 구조를 코드로 따라가고, 모든 Grader가 공유하는 구조화 출력 3요소 패턴과 binary yes/no가 갖는 세 가지 한계를 정리한다.