我要投稿

《构建和评估高级RAG》: RAG评估要素和方法

发布日期：2024-06-16 07:48:15 浏览次数： 2442 作者：数翼

本文带你了解如下知识：

• 评估RAG程序的三要素、
• RAG评估的详细流程、
• LLM评估的方式有哪些、
• 反馈函数的构成和使用

RAG评估要素

RAG 的评估围绕 RAG 的三要素展开：输入、上下文、输出。

形成了三个主要的指标：

• 问题相关性、
• 上下文相关性、
• 事实度（植地性怪怪的，我翻译成事实度，表示结果是否终于上下文和提问）。

详细信息参考「数翼」其他文章，这里不做深入。

评估流程

上一篇文章，我们提到了 TruLens 的评估流程，今天详细看看。

1. 构建 LLM 程序

第一步当然是构建 LLM 应用程序，也是我们要评估的主体。

应用程序可以你问答程序、AI助手等等，你也可以用你任何喜欢的 API。

2. TruLens 连接 LLM 程序

第二步就是将您的 LLM 应用程序连接到 TruLens，同时记录LLM的输入和响应。

前面已经演示过，这个步骤非常简单。

3. 使用反馈函数评估和记录结果

第三步就是通过针对应用程序的提示和响应运行反馈函数并记录结果并评估质量。

为什么需要反馈函数

衡量 LLM 应用的性能是从开发到生产过程中的关键一步。如果没有先在代表性测试集上衡量其准确性，就不会将传统 ML 系统投入生产。

然而与传统机器学习不同的是，基本事实是稀疏的，而且通常完全不可用。

由于没有基本事实来计算我们的 LLM 应用程序的指标，因此可以使用反馈函数来计算 LLM 应用程序的指标。

什么是反馈函数

反馈函数提供了一种在应用程序运行时生成评估的编程方法，可以衡量应用程序在数据上的表现，以及用户的表现。

评估方式

评估可以有多种方式，传统NLP、人工、大模型等等，我们这里使用 LLM。

反馈函数的结构

下图展示了反馈函数的结构。

反馈提供者

反馈提供者是运行给定反馈功能的后端。每个提供程序都提供多个底层模型，例如 GPT-4 或 Llama-2。在许多情况下（但并非所有情况下），反馈实现是跨提供程序共享的（例如基于 LLM 的评估）。

4. 创建反馈函数

from trulens_eval import OpenAI as fOpenAI

provider = fOpenAI()

问题相关性反馈函数

from trulens_eval import Feedback

f_qa_relevance = Feedback(
    provider.relevance_with_cot_reasons,
    name="Answer Relevance"
).on_input_output()

上下文相关性反馈函数

使用 TruLlama 获取上下文，

from trulens_eval import TruLlama

context_selection = TruLlama.select_source_nodes().node.text

创建上下文相关性评估函数：

import numpy as np

f_qs_relevance = (
    Feedback(provider.qs_relevance,
             name="Context Relevance")
    .on_input()
    .on(context_selection)
    .aggregate(np.mean)
)

事实度反馈函数

from trulens_eval.feedback import Groundedness

grounded = Groundedness(groundedness_provider=provider)

f_groundedness = (
    Feedback(grounded.groundedness_measure_with_cot_reasons,
             name="Groundedness"
            )
    .on(context_selection)
    .on_output()
    .aggregate(grounded.grounded_statements_aggregator)
)

5. 评估应用程序

使用 TruLlama 创建记录器来连接应用程序，传入前面我们创建的三个反馈函数：

• f_qa_relevance,
• f_qs_relevance,
• f_groundedness

from trulens_eval import TruLlama
from trulens_eval import FeedbackMode

tru_recorder = TruLlama(
    sentence_window_engine,
    app_id="App_1",
    feedbacks=[
        f_qa_relevance,
        f_qs_relevance,
        f_groundedness
    ]
)

从文件获取和手动添加要评估的问题，

eval_questions = []
with open('eval_questions.txt', 'r') as file:
    for line in file:
        # Remove newline character and convert to integer
        item = line.strip()
        eval_questions.append(item)
eval_questions.append("How can I be successful in AI?")

使用查询引擎进行提问，同时使用 TruLens 进行记录，

for question in eval_questions:
    with tru_recorder as recording:
        sentence_window_engine.query(question)

获取评估结果：

records, feedback = tru.get_records_and_feedback(app_ids=[])
records.head()

结果的可读性并不好，

使用 Pandas 显示一下，

import pandas as pd

pd.set_option("display.max_colwidth", None)
records[["input", "output"] + feedback]

查看第一条记录，

tru.get_leaderboard(app_ids=[])

或者运行 Dashboard 查看，

tru.run_dashboard()

从下图可以看到，问题相关性挺高，但是其他两个指标不太好。

查看 11 条记录的评估数据：

点击任意一条记录查看详细结果，可以根据上下文、输入、输出来进行诊断。

--- END ---

《构建和评估高级RAG》001: 实现高级RAG管道

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-19

基于Embedding分块 - 文本分块（Text Splitting），RAG不可缺失的重要环节

2025-04-19

RAG升级-基于知识图谱+deepseek打造强大的个人知识库问答机器人

2025-04-19

RAG vs. CAG vs. Fine-Tuning：如何为你的大语言模型选择最合适的“脑力升级”？

2025-04-19

低代码 RAG 只是信息搬运工，Graph RAG 让 AI 具备垂直深度推理能力！

2025-04-18

微软PIKE-RAG全面解析：解锁工业级应用领域知识理解与推理

2025-04-18

AI 记忆不等于 RAG：对话式 AI 为何需要超越检索增强

2025-04-18

Firecrawl：颠覆传统爬虫的AI黑科技，如何为LLM时代赋能

2025-04-18

什么是RAG与为什么要RAG？

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

全网最全国内Agent平台深度测评：扣子、Dify、FastGPT，谁是你的Agent开发首选？

2024-10-27

一文彻底搞懂大模型 - RAG（检索、增强、生成）

2024-09-04

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

2024-07-18

RAGFlow：基于OCR和文档解析的下一代 RAG 引擎

2024-05-05

RAG框架，都在这了!

2024-06-20

RAG 高效应用指南：Embedding 模型的选择和微调

2024-06-13

深入解析 Graph RAG：提升语言模型问答能力的创新策略

2024-07-09

微软开源的GraphRAG解读

2024-07-09

基于Llama 3 构建RAG语音助手：将本地 RAG 与 Qdrant、Whisper 和 LangChain 集成

2024-05-19

Prompt工程师必备：复旦重磅 | 最佳RAG实践长什么样的？

2024-07-07

大家都在问

RAG vs. CAG vs. Fine-Tuning：如何为你的大语言模型选择最合适的“脑力升级”？

2025-04-19

什么是RAG与为什么要RAG？

2025-04-18

真实场景下落地RAG的十条建议及RAG中如何提升个性化？

2025-04-16

RAG系统中的“幕后英雄”：重排器如何提升信息检索的精准度？

2025-04-14

Dify 基础篇| 深度解读 RAG：为什么需要混合检索？

2025-04-13

OlmOCR如何成为搭建RAG 知识库的"智能中枢"？

2025-04-11

构建Agentic RAG 系统的方法有哪些？

2025-04-09

【AI知识点】什么是Agentic RAG？

2025-04-07

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB