可用指标列表
Ragas 提供一组评测指标,用于衡量你的 LLM 应用性能。这些指标旨在帮助你客观衡量应用表现。指标覆盖不同应用与任务,例如 RAG 和 Agentic workflows(智能体工作流)。
每个指标本质上都是一套范式,用于评测应用的某一特定方面。基于 LLM 的指标可能通过一次或多次 LLM 调用得到分数或结果。你也可以用 ragas 修改或编写自己的指标。
Retrieval Augmented Generation(检索增强生成)
- Context Precision(上下文精确度)
- Context Recall(上下文召回)
- Context Entities Recall(上下文实体召回)
- Noise Sensitivity(噪声敏感度)
- Response Relevancy(回复相关性)
- Faithfulness(忠实度)
- Multimodal Faithfulness(多模态忠实度)
- Multimodal Relevance(多模态相关性)
Nvidia Metrics(Nvidia 指标)
Agents or Tool use cases(Agent 或工具使用场景)
- Topic adherence(主题遵循度)
- Tool call Accuracy(工具调用准确度)
- Tool Call F1(工具调用 F1)
- Agent Goal Accuracy(智能体目标准确度)
Natural Language Comparison(自然语言比较)
- Factual Correctness(事实正确性)
- Semantic Similarity(语义相似度)
- Non LLM String Similarity(非 LLM 字符串相似度)
- BLEU Score
- CHRF Score
- ROUGE Score
- String Presence(字符串存在)
- Exact Match(精确匹配)
SQL
General purpose(通用)
- Aspect critic(方面评判)
- Simple Criteria Scoring(简单标准打分)
- Rubrics based scoring(基于评分量表的打分)
- Instance specific rubrics scoring(实例特定评分量表打分)