Langsmith
数据集与追踪可视化
Langsmith 是 langchain 团队推出的、用于构建生产级 LLM 应用的平台。它帮助你追踪、调试和评测 LLM 应用。
langsmith + ragas 集提供 2 项能力
- 查看 ragas
evaluator的 traces - 在 langchain evaluation 中使用 ragas 指标 -(即将推出)
追踪 ragas 指标
由于 ragas 底层使用 langchain,你只需设置好 langsmith,traces 就会被记录。
要设置 langsmith,请确保设置以下环境变量(更多内容见 langsmith 文档
export LANGCHAIN_TRACING_V2=true
export LANGCHAIN_ENDPOINT=https://api.smith.langchain.com
export LANGCHAIN_API_KEY=<your-api-key>
export LANGCHAIN_PROJECT=<your-project> # if not specified, defaults to "default"
一旦 langsmith 设置完成,像平常一样运行评测即可
from datasets import load_dataset
from ragas import evaluate
from ragas.metrics import answer_relevancy, context_precision, faithfulness
fiqa_eval = load_dataset("vibrantlabsai/fiqa", "ragas_eval")
result = evaluate(
fiqa_eval["baseline"].select(range(3)),
metrics=[context_precision, faithfulness, answer_relevancy],
)
result
Found cached dataset fiqa (/home/jjmachan/.cache/huggingface/datasets/vibrantlabs___fiqa/ragas_eval/1.0.0/3dc7b639f5b4b16509a3299a2ceb78bf5fe98ee6b5fee25e7d5e4d290c88efb8)
0%| | 0/1 [00:00<?, ?it/s]
evaluating with [context_precision]
100%|█████████████████████████████████████████████████████████████| 1/1 [00:23<00:00, 23.21s/it]
evaluating with [faithfulness]
100%|█████████████████████████████████████████████████████████████| 1/1 [00:36<00:00, 36.94s/it]
evaluating with [answer_relevancy]
100%|█████████████████████████████████████████████████████████████| 1/1 [00:10<00:00, 10.58s/it]
{'context_precision': 0.5976, 'faithfulness': 0.8889, 'answer_relevancy': 0.9300}
搞定!现在可以前往你的项目查看 traces