Ragas Ragas
stable · 中文译文
中文译文 · 原文:https://docs.ragas.io/en/stable/howtos/integrations/_langsmith/ · 许可证 Apache-2.0

Langsmith

数据集与追踪可视化

Langsmith 是 langchain 团队推出的、用于构建生产级 LLM 应用的平台。它帮助你追踪、调试和评测 LLM 应用。

langsmith + ragas 集提供 2 项能力

  1. 查看 ragas evaluator 的 traces
  2. 在 langchain evaluation 中使用 ragas 指标 -(即将推出)

追踪 ragas 指标

由于 ragas 底层使用 langchain,你只需设置好 langsmith,traces 就会被记录。

要设置 langsmith,请确保设置以下环境变量(更多内容见 langsmith 文档

export LANGCHAIN_TRACING_V2=true
export LANGCHAIN_ENDPOINT=https://api.smith.langchain.com
export LANGCHAIN_API_KEY=<your-api-key>
export LANGCHAIN_PROJECT=<your-project>  # if not specified, defaults to "default"

一旦 langsmith 设置完成,像平常一样运行评测即可

from datasets import load_dataset

from ragas import evaluate
from ragas.metrics import answer_relevancy, context_precision, faithfulness

fiqa_eval = load_dataset("vibrantlabsai/fiqa", "ragas_eval")

result = evaluate(
    fiqa_eval["baseline"].select(range(3)),
    metrics=[context_precision, faithfulness, answer_relevancy],
)

result
Found cached dataset fiqa (/home/jjmachan/.cache/huggingface/datasets/vibrantlabs___fiqa/ragas_eval/1.0.0/3dc7b639f5b4b16509a3299a2ceb78bf5fe98ee6b5fee25e7d5e4d290c88efb8)



  0%|          | 0/1 [00:00<?, ?it/s]


evaluating with [context_precision]


100%|█████████████████████████████████████████████████████████████| 1/1 [00:23<00:00, 23.21s/it]


evaluating with [faithfulness]


100%|█████████████████████████████████████████████████████████████| 1/1 [00:36<00:00, 36.94s/it]


evaluating with [answer_relevancy]


100%|█████████████████████████████████████████████████████████████| 1/1 [00:10<00:00, 10.58s/it]




{'context_precision': 0.5976, 'faithfulness': 0.8889, 'answer_relevancy': 0.9300}

搞定!现在可以前往你的项目查看 traces