Athina AI
在生产日志上使用 Ragas 指标
Athina 是一个生产监控与评测平台。可在此试用 sandbox。
你可以使用 Athina 与 Ragas 指标,在生产日志上运行评测,并在生产数据上获得细粒度的模型表现指标。
例如,你可以直观地获得如下洞察:
- 对于客户 id 为
nike-usa、与refunds相关的查询,我的AnswerRelevancy分数是多少 - 对于使用 prompt
catalog_answerer/v3、模型gpt-3.5-turbo的product catalog查询,我的Faithfulness分数是多少
▷ 以编程方式运行 Athina
当你用 Athina 以编程方式运行 Ragas 评测时,可以在 Athina 的 UI 上像下面这样查看结果 👇
- 安装 Athina 的 Python SDK:
pip install athina
- 在 app.athina.ai 创建账号。注册后你会收到一个 API key。
可参考这份示例 notebook:https://github.com/athina-ai/athina-evals/blob/main/examples/ragas.ipynb
- 运行代码
import os
from athina.evals import (
RagasAnswerCorrectness,
RagasAnswerRelevancy,
RagasContextRelevancy,
RagasFaithfulness,
)
from athina.loaders import RagasLoader
from athina.keys import AthinaApiKey, OpenAiApiKey
from athina.runner.run import EvalRunner
import pandas as pd
# Set your API keys
OpenAiApiKey.set_key(os.getenv("OPENAI_API_KEY"))
AthinaApiKey.set_key(os.getenv("ATHINA_API_KEY"))
# Load your dataset from a dictionary, json, or csv: https://docs.athina.ai/evals/loading_data
dataset = RagasLoader().load_json("raw_data.json")
# Configure the eval suite
eval_model = "gpt-3.5-turbo"
eval_suite = [
RagasAnswerCorrectness(),
RagasFaithfulness(),
RagasContextRelevancy(),
RagasAnswerRelevancy(),
]
# Run the evaluation suite
batch_eval_result = EvalRunner.run_suite(
evals=eval_suite,
data=dataset,
max_parallel_evals=1, # If you increase this, you may run into rate limits
)
pd.DataFrame(batch_eval_result)
▷ 配置 Ragas 在生产日志上自动运行
如果你正在 把生产推理日志记录到 Athina,可以配置 Ragas 指标对生产日志自动运行。
- 打开 Athina Dashboard
- 打开 Evals 页面(左侧闪电图标)
- 点击右上角的 "New Eval" 按钮
- 选择 Ragas 标签页
- 选择你想配置的评测
了解更多关于 Athina
- Website: https://athina.ai
- Docs: https://docs.athina.ai
- GitHub Library: https://github.com/athina-ai/athina-evals
- Sandbox: https://demo.athina.ai