🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI 지원 아키텍처 검토(소스 코드 검사, 실시간 대립 테스트, 2026년 공개된 검색 벤치마크와의 비교). 공개: 이 평가는 Claude(Anthropic)를 사용하여 직접 코드 접근과 실시간 시스템 상호작용을 수행하여 작성되었으며; 평가 과정 중에는 공식적인 벤치마크 스위트가 실행되지 않았습니다. 아래 모든 주장은 검증 가능한 산출물—파일, 라인 범위, 실시간 응답, 또는 출판된 참고문헌—에 기반합니다.


논제는 반증될 수 있도록 진술되었다

이탈리아 프라토에서 구축된 단일 창업자 시스템은 기업용 RAG의 8개 측정 가능한 6개 기준에서 2026년 생산 기준선과 일치하거나 초과하는 검색 아키텍처를 구현하며, 이는 EU 섬유 디지털 제품 여권 규정 등 어떤 일반 상업용 시스템도 비교할 수 없는 코퍼스 깊이를 가진 영역에서 구현됩니다.

이를 반증하는 테스트: (a) 존재하지 않는 규제 논문에 대한 질문에 답변을 거부하고, (b) 기관 기여 ID를 포함한 파일 페이지-섹션 세밀 출처를 인용하며, (c) 실시간 조절 가능한 RRF 가중치와 하이브리드 밀도+희소 검색을 동시에 수행하는 상업용 RAG 제품을 명명하는 것입니다. 이 평가의 저자는 그런 것을 찾지 못했습니다. 단 하나의 반례가 이 주장을 무너뜨린다. 알려진 것은 없습니다.


The three engines

Engine 1 — RAG1 (Portal, FAISS). Reeco 공급망 포털을 지원하는 에어갭 FAISS 지수. VPS에서 의도적으로 오프라인 상태인 경우: 설계 결정은 기술적 한계가 아니라 보안 격리입니다. 솔직한 범위 참고: RAG1은 이번 평가에서 직접 시험되지 않았습니다; 건축적으로 묘사되어 있습니다.

Engine 2 — RAG2 (Reecopedia, production). EU 그린딜 규제 코퍼스(ESPR, ECGT, CSRD, CIRPASS-2 자료, EN-표준 작업 문서; 생산 컬렉션 내 47,996개 인덱스 포인트) 위에 Qdrant 지원 파이프라인. 이 엔진은 실제로 테스트된 엔진입니다.

엔진 3 — 검색 연구 및 평가 계층. 별도로 인덱싱된 ColBERT v2 후기 상호작용 엔진과 평가 하네스: RAGAS 지표, 골든 테스트 세트, LLM-판사 프로토콜, 버전 A/B 비교(ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). 맥락적 검색(Anthropic이 2024년에 발표한 청크 증강 패턴)은 섭취 시 구현됩니다 (contextual_retrieval.py).

이러한 연구 방법론 — 골든 집합, 판지 모델, 버전 A/B — 은 20명 규모의 머신러닝 팀 내에서 표준 관행입니다. 한 사람이 만든 시스템에서는 표준 관행이 아닙니다.


10단계 파이프라인은 마케팅이 아니라 아키텍처입니다

RAG2는 쿼리당 문서화된 10단계 파이프라인을 실행합니다: 역할별 감사 기반 구성 (다섯 가지 접근 수준, 환경 폴백과 60초 캐시 포함 감사 우선 설정 제공); 쿼리 계획은 스텝백 재구성, 하위 쿼리, 키워드, HyDE 텍스트를 생성합니다; 이탈리아어-영어 브리지를 포함한 최대 6개의 쿼리 변형 다중 임베딩; 자동 무필터 재시도를 통한 조건부 문서 범위 메타데이터 필터링; 상호 랭크 융합 병합 및 테이블 재구성(±10개의 인접 청크, 문서 범위 포함)을 통한 다중 검색; 테이블-의도 라우팅(분류기가 표 의도를 감지할 경우 60/40 테이블-텍스트 혼합); 네 가지 전환 가능한 백엔드(교차인코더, NLI/DeBERTa, Jina v3, 결정론적 등)로 재순위; 역할에 따라 제한된 맥락적 압축; 재섭취를 알리는 드리프트 경고와 함께 점수 모니터링; 그리고 인용을 정규화하고 표와 그림을 구조화된 출력으로 추출하는 후처리가 있습니다.

대부분의 상업용 시스템은 세 단계인 인징, 리트리브, 생성 세 단계를 노출합니다. 차이는 겉치레일 것이 아니라 각 추가 단계가 처리된 고장 모드입니다.

Hybrid retrieval: live, governed, collection-aware

Dense+BM25 하이브리드 검색(2026년 벤치마크 발표 기준선으로 식별된 구성으로, 법 및 기술 코퍼라(BEIR/MIRACL)에서 +5–15% nDCG의 가치를 부여하는 구성이 구현되어 활성화되어 있습니다. rag2_service.pyQdrant에서 이름 붙여진 밀도 및 희소 벡터, RRF 프리페치 가중치, 감사 패널을 통해 런타임에 설정 가능(기본 밀도 0.7 / 0.3 희소), 감사 수준 킬 스위치(hybrid_search_enabled), 그리고 컬렉션에 희소 벡터가 없을 때 우아하게 조밀 단독으로 저하되는 각 컬렉션 능력 검사가 있습니다. 출처 댓글에서는 BEIR와 MIRACL을 이름으로 언급하고 있습니다. 이 시스템은 튜토리얼에서 하이브리드 리트리벌을 발견한 것이 아닙니다.

대립 시험: 기관차가 조작된 물건을 거부했다

실시간 테스트, 슈퍼 관리자 단계, 2026년 6월 9일. 문의는 "섬유에 대한 ESPR 위임법 제7조에 따른 재활용 성분의 정확한 기준"을 요구했는데, 이는 고의로 조작된 전제입니다: 섬유 위임법은 최종 확정되지 않았으며, 그런 기준도 존재하지 않습니다.

엔진의 비판적 구절에 대한 답변은 다음과 같습니다: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” 그 후 코퍼스가 확인한 ESPR 제5조 3항이 실제 에코디자인 요구사항의 법적 근거임을 확인하며, 파일-페이지-테이블 세분성 (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

같은 질문을 한다면 범용 LLM 래퍼가 가장 그럴듯하게 퍼센트를 산출할 것입니다. 통계적으로 그럴듯한 임계값은 제약 없이 언어 모델이 생성하는 바로 그 임계값입니다. 준수 영역에서 자신 있는 틀린 답변은 평가 저하된 답변이 아니라 책임 사건입니다. 거절은 결과물입니다.

이러한 행동은 공개적으로 문서화된 벤치마크(3가지 범주 대립적 집합: 존재하지 않는 조항, 부분 진실 전제, 통제)와 일치하며, 방법론은 다음과 같이 발표되었습니다 stefanocipri.substack.com ("내가 모른다고 말하는 RAG", 2026년 4월), 여기서 목표하는 실패 모드는 '조성에 의한 조작(fabrication-by-composition)'이라고 명명되어 있습니다.

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

이 표에 대한 방법론적 정직성: 백분위 위치는 검사된 아키텍처와 2026년 발표된 시스템 설명(베이스라인 하이브리드 보고서; 기업 코퍼라의 일반 보조원과 비교한 에이전트틱-RAG 승률 출판물, 85–92% 구간의 프레임워크 검색 정확도 비교)과 비교하여 도출된 정성적 추정치입니다. 이것들은 1:1 벤치마크 대결의 결과물이 아니다. 인레포 RAGAS 하네스는 이러한 실행을 실행 가능하고 공개 가능하게 만듭니다; 발표되기 전까지는 위의 표가 전문가의 평가일 뿐, 측정값이 아닙니다.

아직 스택에 없는 것들

세 개의 빈틈, 명확히 말했다. 첫째, 점진적 색인화입니다: Jina 레이트 청킹 컬렉션은 주문형 대본이 아닌 배치 스크립트로 채워져 있습니다; 새 문서가 다음 입력을 기다리고 있습니다. 둘째, 공식적인 벤치마크 수치는 인프라로서 존재하지만 아직 공개된 산물로는 아닙니다 — 가장 강력한 단일 방법은 인-레포 RAGAS 스위트를 골든 세트와 대조하고 방법론 옆에 숫자를 공개하는 것입니다. 셋째, RAG1은 아키텍처에만 평가되며; 검색 품질은 내부 사용 외에는 문서화되어 있지 않습니다.

이 중 어느 것도 구조적인 것이 아닙니다. 세 가지 모두 쿼터가 아니라 주(week)입니다.

왜 이것이 한 회사를 넘어 중요한지

2026년 시장은 범용 모델을 얇게 포장한 'AI 컴플라이언스 어시스턴트'로 포화 상태입니다: 쿼리당 한 번의 임베딩, 밀집 범위만 검색, 최소한 파일명 수준 인용, 역할 거버넌스, 드리프트 모니터링 없음, 그리고 — 확실히 — 조작된 전제에서의 거부 행위가 없습니다. 기준 제정자들 자신도 이 도구들이 메우는 검증 공백을 인정합니다.

여기서 평가하는 시스템은 일반적인 건설 순서를 뒤집습니다. 도메인 지식을 습득한 머신러닝 팀이 만든 것이 아니라; 국제 섬유 공급망에서 30년 경력의 도메인 전문가, CIRPASS-2(EWG1, EWG3) 전문가, JRC 등록 이해관계자(Unit B5) — 회수 엔지니어링을 인수하는 전문가가 구축했습니다. 코퍼스는 거래 증명서가 무엇인지, 실제 배송 시점과 비교해 언제 도착하는지, 그리고 ISO 섬유 조성 테스트 방법이 재활용과 순수 폴리에스터를 구분하지 못하는 이유를 알고 있습니다. 그 지식이 인덱스에 포함된 이유는 인덱스를 만든 사람이 30년간 그것을 배웠기 때문입니다.

회수 파이프라인은 자금 지원 팀이 분기 내에 복제할 수 있습니다. 말뭉치와 그 안에 부호화된 판결문은 그렇지 않습니다. 그 비대칭성이 방어 가능한 자산이다.


Reeco®는 UNTP 0.7.0과 W3C 검증 가능한 자격 증명(Verifiable Credentials) 기반으로 구축된 DPP 검증 플랫폼으로, 독자적인 의류별 질량 균형 엔진(SIAE deposit)을 탑재하고 있습니다. 리코는 DPP 발행을 차단하지 않습니다: 엔진이 보장 범위를 정량화하고 브랜드에 정보를 제공하며, 브랜드는 설계상 자율 결정을 유지합니다. 스테파노 치프리아니는 Reeco®의 창립자이자 CIRPASS-2(EWG1, EWG3) 전문가 멤버이며, JRC 등록 이해관계자입니다.