Ragas Ragas
stable · 中文译文
中文译文 · 原文:https://docs.ragas.io/en/stable/howtos/integrations/_athina/ · 许可证 Apache-2.0

Athina AI

在生产日志上使用 Ragas 指标

Athina 是一个生产监控与评测平台。可在此试用 sandbox。

你可以使用 Athina 与 Ragas 指标,在生产日志上运行评测,并在生产数据上获得细粒度的模型表现指标。

例如,你可以直观地获得如下洞察:

  • 对于客户 id 为 nike-usa、与 refunds 相关的查询,我的 AnswerRelevancy 分数是多少
  • 对于使用 prompt catalog_answerer/v3、模型 gpt-3.5-turbo 的 product catalog 查询,我的 Faithfulness 分数是多少

▷ 以编程方式运行 Athina

当你用 Athina 以编程方式运行 Ragas 评测时,可以在 Athina 的 UI 上像下面这样查看结果 👇

  1. 安装 Athina 的 Python SDK:
pip install athina
  1. 在 app.athina.ai 创建账号。注册后你会收到一个 API key。

可参考这份示例 notebook:https://github.com/athina-ai/athina-evals/blob/main/examples/ragas.ipynb

  1. 运行代码
import os
from athina.evals import (
    RagasAnswerCorrectness,
    RagasAnswerRelevancy,
    RagasContextRelevancy,
    RagasFaithfulness,
)
from athina.loaders import RagasLoader
from athina.keys import AthinaApiKey, OpenAiApiKey
from athina.runner.run import EvalRunner
import pandas as pd

# Set your API keys
OpenAiApiKey.set_key(os.getenv("OPENAI_API_KEY"))
AthinaApiKey.set_key(os.getenv("ATHINA_API_KEY"))

# Load your dataset from a dictionary, json, or csv: https://docs.athina.ai/evals/loading_data
dataset = RagasLoader().load_json("raw_data.json")

# Configure the eval suite
eval_model = "gpt-3.5-turbo"
eval_suite = [
    RagasAnswerCorrectness(),
    RagasFaithfulness(),
    RagasContextRelevancy(),
    RagasAnswerRelevancy(),
]

# Run the evaluation suite
batch_eval_result = EvalRunner.run_suite(
    evals=eval_suite,
    data=dataset,
    max_parallel_evals=1,  # If you increase this, you may run into rate limits
)

pd.DataFrame(batch_eval_result)

▷ 配置 Ragas 在生产日志上自动运行

如果你正在 把生产推理日志记录到 Athina,可以配置 Ragas 指标对生产日志自动运行。

  1. 打开 Athina Dashboard
  2. 打开 Evals 页面(左侧闪电图标)
  3. 点击右上角的 "New Eval" 按钮
  4. 选择 Ragas 标签页
  5. 选择你想配置的评测

了解更多关于 Athina