17장이 평가의 ‘왜’ 였다면 18장은 ‘무엇을 재는가’ 입니다.
RAG 시스템은 정보 검색과 생성이라는 두 단계를 거치며, 각 단계에서 발생하는 오류가 누적되어 최종 결과에 영향을 미칩니다. AI 에이전트는 여기에 의사결정과 도구 사용이라는 복잡성이 더해집니다. 그래서 계층마다 다른 지표가 필요합니다.
| 계층 | 무엇을 평가하나 |
|---|---|
| 검색 계층 | 관련 문서나 정보를 얼마나 정확하게 찾아내는지 |
| 생성 계층 | 검색된 정보를 바탕으로 얼마나 정확하고 유용한 응답을 만들어내는지 |
| 전체 시스템 | 사용자의 의도를 얼마나 잘 파악하고 만족시키는지 |
단순한 정확도나 정밀도 같은 이진 분류 지표만으로는 부족한 이유를 책은 이렇게 보여 줍니다.
질문: 종합부동산세는 얼마인가요?
시스템 A: 약 500만 원입니다.
시스템 B: 500만 원이며, 이는 과세표준 8억 원에 기본세율 1.2%를 적용한 결과입니다.
두 답변은 단순한 정확성 측면에서는 동일하지만, 사용자 경험 측면에서는 큰 차이가 있습니다.
또한 LLM 기반 시스템은 모델 업데이트, 데이터 변화, 사용자 패턴 변화에 따라 시간이 지나면서 성능이 달라질 수 있습니다. 따라서 일회성 평가가 아닌 지속적인 모니터링 체계가 필요합니다.
18.1 검색 정확도 관련 지표
검색 품질이 곧 최종 응답의 품질을 결정한다고 해도 과언이 아닙니다. 아무리 뛰어난 LLM이라도 잘못된 정보나 관련 없는 정보를 기반으로는 정확한 응답을 생성할 수 없기 때문입니다.
검색 정밀도
검색 정밀도 = 관련 있는 검색된 문서 수 / 검색된 문서 총수
종합부동산세에 관한 질문에 소득세법 문서가 검색되었다면 정밀도를 낮추는 요인입니다. 정밀도가 낮으면 LLM은 관련 없는 정보에 기반해 응답을 생성할 가능성이 높아지며, 이는 환각이나 부정확한 응답으로 이어집니다. 개선 방법은 임베딩 모델의 품질 향상, 검색 알고리즘 최적화, 유사도 임곗값 조정입니다.
검색 재현율
재현율 = 검색된 관련 문서 수 / 전체 관련 문서 수
종합부동산세처럼 복잡한 주제는 과세표준 계산, 공제 항목, 세율 적용 등 여러 조항이 연관됩니다. 재현율이 낮아 일부 관련 정보만 검색된다면 LLM은 완전한 답변을 생성하지 못합니다.
여기에 이 장의 첫 번째 트레이드오프가 있습니다. 정밀도를 높이려고 검색 결과를 제한하면 재현율이 낮아지고, 재현율을 높이려고 검색 범위를 넓히면 정밀도가 낮아집니다.
청크 정밀도
청크 정밀도 = 관련 있는 검색된 청크 수 / 검색된 청크 총수
RAG는 문서 전체가 아니라 작은 청크 단위로 저장·검색하므로 문서 수준과 청크 수준의 평가가 모두 필요합니다. 300쪽의 세법 문서에서 특정 세율에 관한 내용만 필요한 상황이라면 관련 청크만 정확하게 검색하는 것이 효율적입니다.
이 지표는 청킹 전략의 효과를 직접적으로 평가합니다. 6장에서 chunk_size=1500, chunk_overlap=200을 정했던 그 선택을 숫자로 검증하는 방법입니다.
청크가 너무 크면 관련 없는 정보가 포함되어 정밀도가 낮아질 수 있고, 청크가 너무 작으면 문맥이 손실되어 의미 파악이 어려워질 수 있습니다.
MRR
1 |Q| 1
MRR = ───────── · Σ ──────
|Q| i=1 rank_i
|Q|는 쿼리 수, rank_i는 i번째 쿼리에 대한 첫 번째 관련 항목의 순위입니다. 대부분의 RAG 시스템은 상위 k개의 검색 결과만 LLM에 제공하므로 관련 정보의 순위가 중요한 평가 요소가 됩니다.
가장 관련성 높은 문서가 검색 결과의 첫 번째가 아닌 세 번째에 있다면 MRR값은 3분의 1이 됩니다. 높은 MRR값을 달성하려면 정교한 랭킹 메커니즘이 필요하며, 단순히 벡터 유사도에만 의존하는 것은 한계가 있고 BM25 같은 키워드 기반 검색과의 하이브리드 접근법이나 리랭킹 단계를 추가하는 것이 더 효과적입니다.
2장의 하이브리드 검색이 왜 필요한지가 여기서 지표로 뒷받침됩니다.
18.2 응답 품질 관련 지표
검색 단계에서 아무리 관련성 높은 문서를 완벽하게 찾아냈더라도 최종 응답의 품질이 떨어지면 전체 시스템의 가치는 크게 감소합니다. 이는 마치 훌륭한 재료를 구했지만 요리를 잘못해서 맛없는 음식을 만드는 것과 같습니다.
| 지표 | 척도 | 무엇을 보나 |
|---|---|---|
| 응답 관련성 | 1~5 | 응답이 질문과 얼마나 관련 있는가. ‘종합부동산세 계산 방법’을 물었는데 ‘부동산 매매 절차’를 설명하면 낮다 |
| 사실적 정확성 | 이진 또는 1~5 | 검색된 문서의 정보 및 실제 사실과 일치하는가. 종합부동산세율이 1.2%인데 1.5%로 언급하면 낮다. LLM의 환각 문제를 직접 평가한다 |
| 응답 완전성 | 1~5 | 질문의 모든 측면을 빠짐없이 다뤘는가. ‘계산 방법’을 물었다면 과세 대상·과세표준·세율·공제 항목·계산 예시가 모두 있어야 완전하다 |
| 인용 정확성 | 정확한 인용 수 / 전체 인용 수 | ‘종합부동산세법 제13조에 따르면…’이라고 했는데 실제로는 제15조에 있다면 인용 오류다 |
| 근거성(groundedness) | 검색된 문서에 근거한 응답 부분 / 전체 응답 | LLM이 자체 지식이 아닌 검색된 정보에 기반하는 정도. 검색된 문서에는 없는 세금 감면 정책을 언급한다면 근거성이 낮다 |
완전성은 검색 단계의 재현율과 밀접하게 연관됩니다. 관련 정보가 모두 검색되지 않으면 완전한 응답을 생성할 수 없기 때문입니다.
근거성 평가는 자동화하기 어렵지만 최근에는 이런 접근을 씁니다.
- 평가용 LLM을 활용해 응답의 각 문장이 검색된 문서에 기반하는지 평가
- 응답과 검색된 문서 간의 임베딩 유사도 계산
- 원문의 일부를 직접 인용한 비율 측정
근거성을 높이려면 LLM에게 검색된 정보를 벗어나지 말고 응답을 생성하도록 명확히 지시하고, 불확실한 내용은 임의로 추측하지 않도록 안내하는 것이 중요합니다.
18.3 사용자 경험 관련 지표
검색 정확도와 응답 품질이 시스템의 ‘기능적 우수성’ 을 측정한다면, 사용자 경험 지표는 ‘실용적 가치’ 를 평가합니다. 그리고 중요한 지적이 따릅니다.
흥미롭게도 기술적 성능과 사용자 만족도는 항상 일치하지 않습니다. 매우 정확하고 상세한 법률 정보를 제공하는 시스템이라도 응답이 지나치게 복잡하거나 이해하기 어렵다면 사용자는 만족하지 못할 수 있습니다. 반대로 기술적으로는 약간 부족하더라도 사용자가 쉽게 이해하고 바로 활용할 수 있는 응답을 제공한다면 더 높은 만족도를 얻을 수 있습니다.
응답 시간
평균 응답 시간 = Σ(응답 시간) / 쿼리 수
RAG에서는 이를 네 구성 요소로 나눠 측정하는 것이 유용합니다.
| 구간 | 내용 |
|---|---|
| 검색 시간 | 관련 문서를 찾는 데 걸리는 시간 |
| 문맥 구성 시간 | 검색된 정보를 프롬프트에 통합하는 데 걸리는 시간 |
| LLM 생성 시간 | LLM이 실제로 응답을 생성하는 데 걸리는 시간 |
| 후처리 시간 | 생성된 응답을 정리하고 포매팅하는 데 걸리는 시간 |
이렇게 세부 측정하면 병목을 파악할 수 있습니다. 검색 시간이 길면 벡터 저장소 인덱싱을 개선하고, LLM 생성 시간이 길면 더 작은 모델이나 양자화 기법을 고려할 수 있습니다. 5장에서 양자화로 생성 시간이 최대 3배 갈렸던 그 선택입니다.
개선 전략은 캐싱(자주 묻는 질문의 응답을 캐시), 병렬처리(독립적인 작업을 병렬 실행), 점진적 응답(전체 생성 전에 일부 결과를 먼저 표시)입니다.
수치 하나가 기준점을 줍니다.
연구에 따르면 웹 서비스에서 응답 시간이 3초를 초과하면 사용자의 약 40%가 이탈한다고 합니다. 사용자는 AI 에이전트에도 빠른 응답을 기대하며, 특히 업무용 도구에는 더욱 엄격한 기준이 적용됩니다.
유용성과 명확성
유용성(1~5) 은 응답이 사용자의 실제 필요를 얼마나 충족하는지 봅니다. 종합부동산세 계산 방법을 묻는 질문에 법률 조항만 나열하는 것보다, 단계별 계산 예시와 함께 사용자가 직접 적용할 수 있는 형태로 제공하는 것이 더 유용합니다. 주요 요소는 실용성, 적시성, 실행 가능성, 맞춤화입니다.
명확성(1~5) 은 응답의 구조·언어·논리적 흐름이 얼마나 이해하기 쉬운지 봅니다. 주요 요소는 논리적 구조, 언어 명확성, 시각적 구조(문단·목록·표), 예시 제공입니다.
18.4 종합 평가 지표
개별 지표만으로는 전체 품질을 판단하기 어렵습니다. 검색 정밀도는 높지만 응답 완전성이 낮은 시스템과, 검색 정밀도는 보통이지만 응답이 매우 명확하고 유용한 시스템 중 어느 것이 더 우수한지 판단하기 쉽지 않습니다.
실무에서는 복잡한 여러 지표보다 하나의 명확한 지표가 의사결정에 더 유용할 때가 많습니다. 개발팀이 시스템 개선 우선순위를 정하거나, 경영진이 투자 결정을 내리거나, 고객에게 서비스 품질을 설명할 때 종합 지표는 효과적인 소통 도구가 됩니다.
RAGAS
RAGAS(retrieval augmented generation assessment score) 는 RAG 시스템을 위한 종합 평가 프레임워크로, 다섯 요소를 결합합니다.
RAGAS 점수 = w1 × 정답률 + w2 × 관련성 + w3 × 근거성
+ w4 × 문맥 정밀도 + w5 × 문맥 재현율
평가 과정은 네 단계입니다.
- 표준 질문-답변 쌍으로 구성된 테스트 데이터셋 준비
- 각 질문을 RAG 시스템으로 관련 문서 검색 및 응답 생성
- 검색된 문서와 생성된 응답의 요소별 점수 계산
- 가중치를 적용해 최종 RAGAS 도출
오픈소스로 제공되며 자체 평가 데이터셋으로 다른 RAG 시스템과 객관적인 성능 비교(벤치마킹)가 가능합니다. 가중치는 사용 사례에 맞게 조정합니다. 의료 분야는 정확성에, 일반 정보 검색은 관련성에 더 높은 가중치를 줄 수 있습니다.
인간 평가 점수
인간 평가 점수 = (관련성 점수 + 정확성 점수 + 완전성 점수 + 유용성 점수) / 4
자동화된 지표로는 포착하기 어려운 품질, 특히 유용성·명확성·맥락 이해 같은 주관적 측면에서 중요합니다. 프로세스는 이렇게 구성합니다.
- 명확한 평가 기준과 루브릭 개발
- 도메인 전문가 및 일반 사용자를 포함한 다양한 평가자 선정
- 블라인드 테스트를 적용해 객관적 평가 진행
- 평가자 간 일치도(inter-rater reliability) 측정 및 검증
인간 평가는 시간과 비용이 많이 들지만 실제 사용자 경험을 가장 잘 반영합니다. 특히 시스템의 초기 개발 단계나 중요한 업데이트 전후에 수행하는 것이 효과적입니다. 효율을 높이려면 기본 검증은 자동화된 지표로, 정기적으로 인간 평가를 활용해 더 깊이 있는 분석을 하는 하이브리드 방식을 씁니다.
18.5 RAG 시스템의 핵심 평가 영역 다섯 가지
| 영역 | 집중할 지표 | 핵심 질문 |
|---|---|---|
| ① 올바른 문서 검색 | 검색 정밀도·재현율 | 검색된 문서가 질문 주제와 직접 연관되는가? 최신 정보인가? 신뢰할 수 있는 출처인가? |
| ② 올바른 청크 검색 | 청크 정밀도·MRR | 청크가 질문의 특정 측면을 직접 다루는가? 청크들이 서로 중복되지 않고 고유한 정보를 제공하는가? 충분한 맥락을 포함하는가? |
| ③ 응답의 사실적 정확성 | 사실적 정확성 | 수치(세율·금액·날짜), 인용된 법률 조항, 계산 과정, 명시된 조건과 예외가 정확한가? |
| ④ 검색된 문서에 기반한 응답 | 근거성·인용 정확성 | 각 문장이 검색된 문서에서 직접 뒷받침되는가? 인용된 출처가 정확히 명시되었는가? 원문의 맥락이 왜곡되지 않았는가? |
| ⑤ 사용자 질문과의 관련성 | 응답 관련성 | 질문의 모든 측면을 다루는가? 실제 의도를 파악했는가? 맥락(기업용 vs. 개인용)을 고려했는가? 불필요한 정보로 채워져 있지 않은가? |
문서 검색이 첫 관문인 이유가 명확합니다. 문서 검색 단계에서 오류가 발생하면 이후 모든 과정에 영향을 미치므로, RAG 시스템의 가장 기본적인 평가 요소입니다.
18.6 지표 간의 균형과 북극성 지표
지표들은 서로 트레이드오프 관계에 있습니다.
| 트레이드오프 | 내용 |
|---|---|
| 검색 정밀도 ↔ 재현율 | 정밀도를 높이려고 검색 결과를 제한하면 재현율이 감소한다 |
| 응답 완전성 ↔ 명확성 | 더 완전한 응답을 제공하려고 많은 정보를 포함하면 명확성이 떨어진다 |
| 응답 시간 ↔ 정확성 | 더 정확한 결과를 얻으려고 추가 처리를 하면 응답 시간이 늘어난다 |
그래서 사용 사례에 맞게 지표의 우선순위를 설정해야 합니다. 의료나 법률 도메인은 정확성과 근거성에 높은 가중치를, 일반 정보 검색은 관련성과 응답 시간에 더 높은 가중치를 줄 수 있습니다.
마지막 제안이 실무적입니다.
또한 다양한 평가 지표를 종합적으로 고려하되, 시스템의 목적에 가장 중요한 북극성 지표(north star metric, NSM) 를 설정하는 것이 유용합니다. 이 핵심 지표는 시스템 개선의 주요 방향을 제시하고, 여러 지표 간의 트레이드오프를 조정하는 기준점이 될 수 있습니다.
정리
- 계층마다 지표가 다르다. 검색 / 생성 / 전체 시스템을 나눠서 잰다.
- 검색은 정밀도·재현율·청크 정밀도·MRR로 본다. MRR은 “정답이 몇 번째로 나왔나”라서 리랭킹의 값어치를 드러낸다.
- 응답은 관련성·사실적 정확성·완전성·인용 정확성·근거성으로 본다. 근거성이 낮으면 환각 신호다.
- 기술적 성능과 사용자 만족도는 일치하지 않는다. 정확해도 이해하기 어려우면 만족도가 낮다.
- 응답 시간은 네 구간으로 쪼개서 잰다. 3초를 넘기면 40%가 떠난다.
- 종합은 RAGAS(자동)와 인간 평가 점수(주관)로, 그리고 둘을 섞은 하이브리드로 한다.
- 지표는 서로 상충한다. 도메인에 맞게 가중치를 주고, 북극성 지표 하나를 기준점으로 삼는다.