AI产品库
Ragas Logo

品牌档案

Ragas

给 RAG 与智能体应用做系统化评测的开源框架

官方定义为「帮你从凭感觉检查走向系统化评测循环的库」:用 LLM 驱动的指标替代人工打分,并内置实验管理、数据集管理与结果追踪,可与主流开发框架集成。

深度介绍

Ragas详细介绍

🧭

定位:把「凭感觉」换成系统化评测循环

文档的第一句话就是它的定位:「Ragas 是一个帮你从『凭感觉检查』走向系统化评测循环的库」,用来为基于大模型的应用提供评测工具,让评测这件事变得可重复、可比较。它同时给出了两个痛点:传统指标抓不住大模型应用真正重要的东西,而人工评测又无法规模化。解法的核心是把 LLM 驱动的指标与系统化实验结合起来,形成持续改进的闭环。项目以 Apache-2.0 许可开源,由 VibrantLabs 维护,核验时仓库约有 1.58 万 star。

🧪

实验优先:改动、评测、观察、再迭代

官方把「实验优先」列为第一项关键特性:每次改动都应当作为一次实验来跑,用同一套指标与同一份数据得到可比较的结果,再据此决定保留还是回退。配套的是数据集管理、结果追踪与实验记录——这些在人工评测时代通常靠表格与截图维护,规模化之后几乎无法回溯。对工程团队来说,这条要求的实际价值在于把「换提示词、换模型、换切块策略」变成有据可依的决策,而不是靠几个典型案例的直观印象。

📐

RAG 指标:从检索到回答逐段检查

指标库中面向检索增强生成的包括:忠实度(回答是否有上下文依据)、回答相关性(是否切题)、上下文精确率与上下文召回率(检索到的片段是否相关且齐全)、上下文实体召回率(关键实体是否被检索到)与噪声敏感度(无关内容是否干扰回答)。这组指标的价值在于把「答得不好」拆解成检索问题还是生成问题——上下文召回低说明该找的资料没找来,忠实度低则说明模型在编。定位问题后再改,比反复调提示词有效得多。

🤖

智能体与工具调用也纳入评测

除 RAG 外,指标库还覆盖智能体场景:主题遵循(是否超出允许范围)、工具调用准确率、工具调用 F1 与智能体目标达成率。工具调用 F1 这类指标尤其适合排查「该调工具却没调」与「不该调却调了」两类错误,而目标达成率用来回答「多步之后任务是否真的完成」这一最终问题。文档中另有针对智能体测试集生成的章节,可以为多步流程自动造出带工具期望的用例。

📚

指标不止一套:比较、传统 NLP 与 SQL

指标库按用途分组:自然语言比较类包含事实正确性与语义相似度;传统非模型类指标包括 BLEU、CHRF、ROUGE、字符串相似度与精确匹配,适合与模型指标交叉验证;SQL 类包含基于执行的比对、查询等价性与数据比对;通用类提供基于评分细则的评审与方面评审等打分方式;此外还收录了 NVIDIA 的一组指标。指标繁多容易让人纠结,实践中通常先选两三个与业务目标直接相关的指标固定下来,再逐步补充。

🏭

测试集生成:从自有文档造出评测数据

没有标注数据是评测落地最常见的阻碍,Ragas 的测试集生成模块正是针对这一点:它可以读取自有文档,借助知识图谱式构建与场景生成产出评测问题,支持单跳与多跳查询、人格设定、预切块数据以及面向智能体的用例;文档还专门讨论非英文场景与自定义查询分布。官方给出的路线是先跑通快速开始,再用生成的数据集建立基线,之后每次改动都在这套数据集上回归,避免「换一批问题看效果」带来的不可比性。

🔌

集成与可定制:适配模型、改提示词、控成本

集成方面官方提供了与主流开发框架的对接,以及多种模型适配器,可替换成自建或本地模型;定制方面支持修改指标提示词、把指标适配到其他语言、对指标进行训练与对齐,并用优化器做提示词的自动改进。工程侧还提到缓存、取消任务、运行配置与成本分析——用模型做评测本身是要花钱的,成本分析这一项能帮助团队判断评测频率与规模是否可持续。这些指南都在「How-to」板块中按场景分列。

🕰

项目状态:开源库版本停在 v0.4.3,团队转向产品

需要如实说明维护节奏:仓库最新发布为 v0.4.3(2026 年 1 月 13 日),PyPI 上同版本同日发布,主仓库最后一次提交为 2026 年 2 月 24 日。文档中团队表示,过去两年用评测帮助改进过许多大模型应用,正在把这些经验「压缩成一个产品」,并提供了预约沟通与联系邮箱。也就是说,开源库依然可用且带 Apache-2.0 许可,但功能演进明显放缓,选型时应关注后续维护计划,必要时固定版本并自行兜底。

产品特点

核心功能与独有价值

01

以指标库替代人工打分

提供忠实度、回答相关性、上下文精确率与召回率、上下文实体召回率、噪声敏感度等 RAG 指标,以及主题遵循、工具调用准确率与 F1、目标达成率等智能体指标,可用装饰器扩展自定义指标。

02

从自有文档自动生成测试集

支持基于知识图谱式构建与场景生成产出评测问题,覆盖单跳与多跳查询、人格设定、预切块数据与智能体用例,并讨论非英文场景,缓解缺少标注数据的落地障碍。

03

实验与数据集管理内置

官方主张「实验优先」:同一份数据、同一套指标比较改动前后的效果,配套数据集管理与结果追踪,使提示词、模型与检索策略的调整可回溯、可复现。

04

多套指标并存可交叉验证

除模型驱动指标外,还提供 BLEU、CHRF、ROUGE、字符串相似度与精确匹配等传统指标,以及基于执行的 SQL 比对与基于评分细则的通用打分,便于交叉验证模型指标的可靠性。

最近动态

重要更新

最新发布 v0.4.3(2026-01-13)

仓库发布记录与 PyPI 均显示最新版本为 v0.4.3,发布于 2026 年 1 月 13 日。此后未见新的正式发布,使用时应固定版本号,并留意上游的变更说明。

主仓库最后提交为 2026-02-24(核验时点)

核验时主仓库最后一次提交时间停在 2026 年 2 月 24 日,与 2026 年 1 月的版本发布相隔不久。文档中团队表示正在把评测经验做成产品,并开放办公时间与联系渠道,说明精力重心可能已从开源库转向产品。

文档与指标覆盖(核验时点)

文档分为入门、核心概念(实验、数据集、指标)、使用指南(模型定制、缓存、取消任务、多语言适配、指标训练与对齐、优化器、成本分析、多轮对话评测)与参考四部分,指标覆盖 RAG、智能体与工具调用、自然语言比较、传统 NLP、SQL 与通用打分等分组。

仓库归属组织为 vibrantlabsai(核验时点)

仓库当前位于 vibrantlabsai 组织下,文档与安装说明也以该仓库为准;早期该项目位于 explodinggradients 组织。查找资料或提交问题时应使用当前仓库地址,避免引用已迁移的旧链接。

产品总结

Ragas 是一个面向大模型应用的评测框架。文档的开篇定位是「帮你从凭感觉检查走向系统化评测循环的库」,它要解决两个问题:传统指标衡量不了大模型应用真正重要的部分,人工评测又无法规模化;做法是用大模型驱动的指标配合系统化实验,形成可重复、可比较的改进闭环。项目以 Apache-2.0 许可开源,由 VibrantLabs 维护,核验时仓库约有 1.58 万 star。 指标是它的主体。RAG 方向提供忠实度、回答相关性、上下文精确率与召回率、上下文实体召回率与噪声敏感度,可以把「答得不好」拆成检索问题还是生成问题;智能体方向提供主题遵循、工具调用准确率、工具调用 F1 与目标达成率;此外还有自然语言比较(事实正确性、语义相似度)、传统指标(BLEU、CHRF、ROUGE、字符串相似度与精确匹配)、基于执行的 SQL 比对与基于评分细则的通用打分,并收录了 NVIDIA 的一组指标。指标可用装饰器扩展,也支持修改提示词、适配其他语言与训练对齐。 除了打分,它还解决评测数据从哪来的问题:测试集生成模块可以读取自有文档,通过知识图谱式构建与场景生成产出评测问题,支持单跳与多跳查询、人格设定、预切块数据与智能体用例,并讨论非英文场景。工程侧提供数据集管理、结果追踪、与主流开发框架的集成、多种模型适配器、缓存与成本分析,官方主张「实验优先」——每次改动都在同一份数据与同一套指标上比较,而不是换一批样例凭印象判断。 使用前需要了解维护状态:开源库最新发布为 v0.4.3(2026 年 1 月 13 日),主仓库最后一次提交为 2026 年 2 月 24 日,文档中团队表示正把过去两年的评测经验做成产品,并开放办公时间与联系渠道。也就是说库本身仍可用、许可宽松,但功能演进已明显放缓,生产使用建议固定版本并评估自行维护的成本;同时评测过程需要调用大模型,费用取决于模型选择与调用量,规模较大时应先用成本分析估算再铺开。

产品类型
LLM 应用评测框架
支持平台
Python 库(pip 安装) / 自定义指标装饰器 / LangChain、LlamaIndex 等框架 / 多种模型适配器(含本地与云端模型) / 结果追踪与数据集管理 / 测试集自动生成
资费模式
开源库以 Apache-2.0 许可免费使用;评测过程需要调用大模型,实际费用取决于所选模型与调用量。

核验信息

参考文章与数据来源

本页事实来自 Ragas 官方渠道:文档首页(「从凭感觉检查走向系统化评测循环」的定位、两项痛点与三项关键特性)、入门与快速开始、可用指标页(RAG、智能体与工具调用、自然语言比较、传统 NLP、SQL 与通用指标分组)、RAG 测试集生成与智能体测试集生成、集成与自定义指南(模型适配、多语言适配、指标训练与对齐、优化器、成本分析、多轮评测)、官方产品站,以及仓库的组织归属、许可与发布记录。版本与维护节奏核验于 2026 年 9 月 22 日,请以官方当期说明为准。

  1. 官方文档官方文档
  2. 官方文档官方文档 · 快速开始
  3. 官方文档官方文档 · 可用指标
  4. 官方文档官方文档 · RAG 测试集生成
  5. 官方文档官方文档 · 集成指南
  6. 官网官方产品站
  7. 其他官方仓库(Apache-2.0)
  8. 其他官方版本发布页

用户体验调查

Ragas介绍页面对您是否有帮助?