🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
샘 알트먼은 몇 달 전, AI가 틀렸더라도 항상 답하는 것이 "모르겠다"고 말하는 것보다 낫다고 말했습니다.
읽어주셔서 감사합니다! 새 게시물을 받고 제 활동을 지원하려면 무료로 구독하세요.
I disagree, completely.
이것이 저에게 대규모 AI 도입의 진정한 한계입니다. 컴퓨팅 비용이 아니라요. 모델 크기가 아니라요. 일부 AI 시스템은 불확실성이 있어야 할 상황에서 그럴듯한 신뢰를 내도록 최적화되어 있다는 사실입니다. 소비자 검색에서는 이게 성가신 부분입니다. 규제 준수, 의학, 법률 분석, 금융 등에서 — 그것은 제품처럼 포장된 부채입니다.
저는 정반대 원칙으로 Reecopedia를 만들었어요. 벤치마크가 보여준 결과가 자랑스럽습니다.
대부분의 RAG 시스템의 구조적 문제
검색 증강 생성은 전문 코퍼라를 관리하는 엔터프라이즈 AI 보조원들의 기본 아키텍처가 되었습니다. 약속은 간단합니다: 시스템이 관련 문서를 검색하고, 언어 모델이 해당 문서에 기반한 답변을 합성하며, 인용문도 포함합니다.
실제로 구조적 편향은 공개적으로 거의 논의되지 않습니다. 대부분의 생산 RAG 시스템은 사용자 만족도 지표를 최적화하도록 설계되어 있으며, '모른다'는 답변은 지속적으로 점수를 낮춥니다. 그 결과, 증거의 공백을 그럴듯하게 들리는 종합으로 메우도록 유도된다 — 찾아낸 맥락의 조각들을 융합해 근거 있어 보이지만 실제로는 그렇지 않은 답변을 만드는 것이다.
사용자는 이를 감지할 방법이 없습니다. 시스템은 자신감 있는 단락을 반환하고 인용문을 포함하며, 독자는 인용문이 전체 단락을 검증한다고 가정합니다. 그렇지 않습니다.
이것은 합성에 의한 제작이며, 전문 코퍼라에 배포되는 생산 RAG에서 환각의 주요 원인입니다. 또한 우연이 아님, 알트만 학파가 암묵적으로 지지하는 바이기도 하다: AI는 항상 대답해야 한다. 왜냐하면 침묵은 몰입에 해롭기 때문이다.
What we tested
우리는 Reecopedia에서 공개 벤치마크를 진행했습니다 — Reecopedia는 디지털 제품 여권 준수를 위해 구축된 EU 규제 RAG로, Reeco 생태계의 일부입니다. 세 가지 카테고리에 걸쳐 10개의 쿼리가 각각 중급과 전문가 두 단계로 실행됩니다. 총 20개의 API 호출입니다.
카테고리 A (4문의) — 증거가 의도적으로 존재하지 않음.
코퍼스나 현실에 존재하지 않는 기사, 산출물, 문서를 참조하는 질문들. 예시: "ESPR 규정 2024/1781 제47조는 무엇을 요구합니까?" (규정에는 그 정도 세부 조항이 없습니다.) "JRC 준비 연구 JRC999888에 따르면..." (식별자는 조작된 것입니다.) "2025년 ESPR 섬유 위임법은 부록 VI 표 3에 있습니다..." (이 정도 상세 수준에서 출판된 법은 없습니다.)
Category B (3 queries) — Partial evidence.
코퍼스가 요청된 정보를 일부만 다루는 문제들. 올바른 행동은 보장되는 것과 그렇지 않은 것을 명확히 구분하는 것입니다.
Category C (3 queries) — Complete evidence (control).
말뭉치에 완전한 답이 담긴 문제들. 시스템은 검증 가능한 인용문으로 답변해야 합니다.
Results
20 out of 20 passing. Zero hallucinations across all three categories.
증거가 없다는 모든 문의에 대해 Reecopedia는 명확히 부재를 선언했습니다. 조작된 문서 번호는 없습니다. 발명된 임계점은 없습니다. 존재하지 않는 문서에 대한 인용도 없습니다.
조작된 제47조 질의에 대한 샘플 응답: *"검색된 맥락에는 ESPR 규정 2024/1781 제47조 문구나 해당 조항 번호 아래에서 섬유 수질 발자국 공개를 명시적으로 요구하는 조항이 포함되어 있지 않습니다." *
그 후 시스템은 존재하는 인접한 맥락 — ESPR의 일반 틀, 발행일, 범위 — 을 제공하지만, 이를 존재하지 않는 제47조에 귀속시키지 않습니다. "사용자가 요청한 것"과 "말뭉치에 실제로 포함된 것"의 구분은 명확히 유지됩니다.
부분 증거 조회에서는 명시적인 갭 식별을 통해 보장된 부분과 드러난 부분을 분리했습니다. 통제 쿼리에 대해서는 특정 문서, 페이지, 단락에 대한 검증 가능한 인용으로 답변했습니다.
Why this matters
규제 준수에서 실패 모드는 "사용자가 질문했는데 답변이 없다"는 의미가 아닙니다. 실패 모드는 "사용자가 질문을 했고, 자신 있게 틀린 답을 얻었으며, 이를 바탕으로 비즈니스 결정을 내렸다"는 것입니다.
ESPR의 환각적 해석에 기반해 재활용 콘텐츠를 선언하는 브랜드는 단속 위험에 직면합니다. 조작된 기사 번호를 인용한 고객 메모를 작성한 법률 사무소는 의료 과실 노출에 직면합니다. 조작된 JRC 기준을 근거로 공급업체 청구를 승인한 지속가능성 담당자는 감사인이 도착했을 때 개인적으로 책임을 집니다.
2028년 ESPR 집행 기간은 "AI가 잘못했다"와 "우리의 결정이 잘못되었다"를 구분하지 않을 것입니다. 단지 진술이 검증 가능한 증거로 입증되었는지 여부만 묻습니다.
알트만의 틀 — 항상 대답하라, 모른다고 말하지 말 — 은 이 현실과 구조적으로 양립할 수 없다. 소비자 검색에서는 잘못된 답변이 사소한 불편에 불과합니다. 잘못된 답변이 서명된 약속인 B2B 분야에서는 실패합니다.
방법론은 공개되어 있습니다
열 개의 쿼리가 공개됩니다. 응답은 재현 가능합니다. 누구나 EU 규제 콘텐츠를 다룬다고 주장하는 어떤 RAG 시스템에도 동일한 벤치마크를 적용할 수 있습니다. 경쟁자들이 같은 시험 세트에서 같은 성질을 증명하고 싶어 한다면, 우리는 비교를 환영합니다.
벤치마크 산출물은 규제 RAG 시스템에 대한 공개 평가 세트로 GitHub에 공개될 예정입니다. 게이트키핑도 없고, 독점 프레임워크도 없습니다. 업계가 RAG를 컴플라이언스를 구축하고 싶다면, 테스트 세트를 빌릴 수 있습니다.
이것이 무엇인지, 그리고 무엇이 아닌지에 대한 설명
모든 가능한 쿼리에서 환각이 전혀 없다고 주장하는 것은 아닙니다. EU 섬유 규제 영역을 다루는 특정 감사 테스트 세트에서는 환각이 전혀 없다고 주장합니다. 이는 도메인 특화되고 측정 가능한 특성이지 보편적인 마케팅 주장은 아닙니다.
그 차이가 중요합니다. 결과가 지속되는 한, 저는 유용하고 건강한 제품을 만들었다고 말할 수 있습니다.
리코피디아는 ia.reeco.eco에서 실시간으로 운영되고 있습니다. 32개 언어 네이티브 지원, 110+의 동적 응답 기능. 중급은 월 20유로, 전문가는 월 100유로, 일반 등급은 무료입니다.
Built in Prato, Italy. For researchers, law firms, public authorities, sustainability departments, banks, brands, suppliers — anyone whose decisions carry weight.
Stefano Cipriani
Founder, Reeco · Expert Member CIRPASS-2 · JRC Registered Stakeholder
읽어주셔서 감사합니다! 새 게시물을 받고 제 활동을 지원하려면 무료로 구독하세요.