跳转到内容

AI、AGENT 与上下文 · DEFINED TERM

Evaluation Dataset 评测集

用一组有期望结果和评分规则的代表性任务持续衡量 AI 质量。

你可能会这样说“把常见问题、边界案例和历史失败都放进回归评测。”

VISUAL EXAMPLE

先看懂它怎么工作

界面状态示例

等待操作

MECHANISM

运行机制

  1. 收集任务
  2. 标注期望与评分
  3. 运行模型
  4. 比较并分析退化

USE WHEN

适合这样用

模型升级、Prompt 调整和 RAG 质量验证

NOT FOR

不要这样理解

只挑容易成功的示例会制造虚假高分

TELL YOUR AGENT

可直接发给 Agent

请按“Evaluation Dataset 评测集”的概念处理这个需求:把常见问题、边界案例和历史失败都放进回归评测。。先说明实现边界,再给出可检查的结果。

ACCEPTANCE

怎么确认它真的做好了

覆盖真实分布和高风险边界,评分可复现,版本变化有对照报告

OFFICIAL SOURCES

官方来源