Ragas CLI
Ragas 命令行接口(CLI)提供了从终端快速搭建评测项目并运行实验的工具。
安装
CLI 随 ragas 包一起提供:
pip install ragas
也可以使用 uvx 无需安装直接运行:
uvx ragas --help
可用命令
ragas quickstart
从模板创建完整的评测项目。这是开始使用 Ragas 最快的方式。
ragas quickstart [TEMPLATE] [OPTIONS]
参数:
TEMPLATE:模板名称(可选)。留空可查看可用模板。
选项:
-o, --output-dir:创建项目的目录(默认:当前目录)
示例:
# List available templates
ragas quickstart
# Create a RAG evaluation project
ragas quickstart rag_eval
# Create project in a specific directory
ragas quickstart rag_eval --output-dir ./my-project
ragas evals
使用评测文件对数据集运行评测。
ragas evals EVAL_FILE [OPTIONS]
参数:
EVAL_FILE:评测文件路径(必填)
选项:
--dataset:项目中的数据集名称(必填)--metrics:要评测的指标字段名,逗号分隔列表(必填)--baseline:用于对比的基线实验名称(可选)--name:实验运行名称(可选)
示例:
ragas evals evals.py --dataset test_data --metrics accuracy,relevance
ragas hello_world
创建一个简单的 hello world 示例,用于验证安装。
ragas hello_world [DIRECTORY]
参数:
DIRECTORY:创建示例的目录(默认:当前目录)
Quickstart 模板
RAG 与检索
- RAG 评测(
rag_eval) - 用自定义指标评测 RAG 系统 - 改进 RAG(
improve_rag) - 对比 naive 与 agentic RAG 方法
Agent 评测
- Agent 评测(
agent_evals) - 评测求解数学问题的 AI agent - LlamaIndex Agent 评测(
llamaIndex_agent_evals) - 用 tool call 指标评测 LlamaIndex agent
专项用例
- Text-to-SQL 评测(
text2sql) - 用执行准确率评测 text-to-SQL 系统 - 工作流评测(
workflow_eval) - 评测复杂 LLM 工作流 - Prompt 评测(
prompt_evals) - 比较不同 prompt 变体
LLM 测试
- Judge Alignment(
judge_alignment) - 衡量 LLM-as-judge 与人工标准的对齐程度 - LLM 基准测试(
benchmark_llm) - 对多种 LLM 模型做基准测试与比较
快速开始
60 秒内跑起来:
# Create project
uvx ragas quickstart rag_eval
cd rag_eval
# Install dependencies
uv sync
# Set API key
export OPENAI_API_KEY="your-key"
# Run evaluation
uv run python evals.py