工作台三条独立评测链路
Longbean quality garden

让每一次运行,都有证据可循。

先独立构建测试集,再选择 AI 自动评测或人工逐条评测;两条评分链路只在结果中心汇合。

已发布测试集4共 134 个 Turn Case
AI 自动评测32 运行中 · 1 已完成
人工标注进度18/72盲评任务进行中
Query 草稿244 条待人工检查

最近评测任务

AI 与人工是两个独立任务,使用同一冻结测试集时才可比较。

任务评测方式测试集进度当前结果状态
五维全链路自动评测ai_eval_01J8F6Q4AI 自动Query Matrix v2.372/72通过率 78.6%完成
Query Matrix 人工基线human_eval_01J8G21A人工标注Query Matrix v2.318/72均分 4.2/5进行中
前端交付自动专项ai_eval_01J8EZY1AI 自动Delivery v0.916/24通过率 68.0%运行中
工具失败人工专项human_eval_01J8C91N人工标注Tool Failure v0.60/6未开始

Query 批量生产

克隆线上真实生产链路,按生产规则组装带标签、可追溯的单轮或多轮测试任务。

  1. 01
    接入来源导入或线上同步
  2. 02
    匹配规则继承生产标签
  3. 03
    组装上下文保留完整 QA 对
  4. 04
    写入测试集质检后入库

导入初始 Query

每行一条。系统会保留原始表达,并按规则扩展为测试任务。

1 条待处理
支持粘贴、文件导入;自动忽略空行和重复项。
互动影游生产规则 v3.2

导入后自动识别任务意图、信息状态和目标对象,规则标签随 Query 一起入库。

来源·人工导入环节·项目创建上下文·首轮规则·prod-v3.2
Fixture 与标准答案不会写入用户 Query

构建规则

本批次将构建 20 条测试任务

标签必填
高级生成约束

测试任务

批次 query_batch_0730_01 · 20 条草稿

20 当前任务16 通过门禁4 待人工检查首轮 生产环节
Query 任务链路上下文生产规则标签质检

选择一条任务查看完整上下文

Query ID、生产快照和 QA 对将在这里展示。

上下文对话组
已选择 3 / 4 条测试任务;入库后仍为草稿。

测试集

集中管理已生成或导入的 Query、Scenario、Fixture、Expectation 与发布版本。

Scenario13连续项目场景
Turn Case72可执行用户轮次
Expectation98同轮共享一次 Run
信息状态覆盖4/4足够 / 缺失 / 模糊 / 冲突

测试集版本

选择一个版本后,再进入 Scenario、Turn Case 与 Expectations。

数据集版本QueriesScenarios覆盖范围最近使用
任务×意图×信息状态dataset_qm_100v2.37213全链路今天 14:32
Query Matrixdataset_qm_100_draftv2.4 草稿00待补充尚未使用
黄金 Case 回归集dataset_golden_20v1.22010核心路径昨天 19:46
黄金 Case 回归集dataset_golden_20_draftv1.3 草稿2010核心路径尚未追加
前端交付专项dataset_delivery_24v0.9 草稿246Canvas / UI今天 11:08
工具失败与恢复dataset_tool_failurev0.6 草稿188Skills / Tools7月28日

评测规则

以版本化 RuleSet 文件归档;下载、AI 任务和人工任务始终引用同一份冻结文件。

RuleSet 文件

草稿与已发布版本分开保存。

4 个文件

互动影游五维标准

RuleSet v2.0 · 每维 0/1 · 6 类严重错误 · 最早错误归因

试运行
归档路径/rules/interactive-film/interactive-film-5d/v2.0.yaml
文件 IDruleset_ifg_5d_v2_0
最近更新2026-07-29 18:42
D1目标与边界理解5 个必检项0 / 1
D2信息判断与追问5 个必检项0 / 1
D3执行编排与状态控制7 个必检项0 / 1
D4结果正确性与专业质量指令门槛 → 对象 Rubric0 / 1
D5交付完整性与可用性通用项 + Delivery Profile0 / 1
发布前缺口来自 V2 标准与工程 Prompt 的交叉检查
  • D4 对象内容 Rubric未完整冻结
  • D5 六类 Delivery Profile未完整冻结
  • 5 分与 4 分的合格阈值待产品确认
  • slot + 展示 JSON 协议§12.1 覆盖生效
AI 任务与人工任务均可引用;每个任务保存文件 ID、版本和内容哈希。

AI 自动评测

选择测试集、评测规则与 Judge 模型,批量运行并自动生成 D1–D5 分值。

独立链路 · 不依赖人工评分

新建 AI 评测任务

测试集:Query Matrix · 72 Queries · 评测规则:互动影游五维标准 v2.0 · Judge:judge-prod-v3 · 高精度

预计 72 个 Agent Run + 72 次 Judge
当前任务仅记录所选规则文件的名称与版本。
占位配置:暂未接入真实 Judge 模型调用,当前判分来自预置评测数据,接入后仅需替换取数层。

本批次评测统计

五维通过率、按对象类型 / 信息状态的合格率、按主任务类型合格率。

五维通过率

每个维度独立统计,高分不能抵消任何单一维度的失败。

按对象类型合格率

定位薄弱的产出对象类型,而非单纯归因到某一维度。

按信息状态合格率

信息缺失 / 模糊 / 冲突时,Agent 表现是否明显下降。

按主任务类型合格率

Query Runs

共 72 条,可下钻查看每条的证据与五维判分依据。

Query项目主任务类型 / 对象信息状态D1–D5最早失败结论

人工评测任务

选择分配给当前标注员的任务,再进入独立盲评工作台。

待进行任务2当前标注员可进入
待评分 Query60按任务分别保存
草稿记录0点击评分即自动写入
工作模式盲评不展示 AI Judge 分数

我的标注任务

每个任务绑定一个冻结测试集和规则版本;进入后按题号逐条作答。

评测员 03 · 自动保存开启

结果中心

分别查看 AI 自动评测和人工评测结果;仅在使用同一冻结测试集时生成对比。

AI 五维全通过率78.6%ai_eval_01J8F6Q4
人工任务完成度25.0%18 / 72 Queries
示例可比一致率83.3%演示数据 · 双方均完成的 18 条
平台无效运行率3.4%只影响 AI 自动评测分母
D1 目标边界94%
D2 信息判断82%
D3 执行状态88%
D4 结果质量79%
D5 交付可用84%

AI 自动评测趋势

同一测试集下的 Build 五维全通过率

0729 +6.4%
100%80%60%40%072107230724072607280729

AI 最早失败节点

来自自动评测工程证据,同因只计一次

状态落盘 / CAS31%
路由与信息判断24%
前端交付 / UI19%
业务 Skills16%
输入与项目状态10%

Prompt / Build 变更影响

0729 原始版 → 业务效果补全版 · 相同冻结 Case

4 项语义变更
任务分类Q-4 / Q-11 / Q-13

从“新建/修改内容”调整为真实执行操作,回归通过率 +8.1%。

系统接入门禁interactive-film-game + manifest

新增显式加载、CAS、投影与写后读回证据。

媒体模型运行时配置成为权威

旧 Prompt 与工程 Prompt 模型名不同,必须以 Build 快照核验。

最终输出协议slot + 分隔标记 + JSON

以工程 Prompt §12.1 定点覆盖为本次候选协议。

同测试集结果对比

当前展示代表性演示记录;AI 与人工原始任务 ID 分别保留,不在标注阶段相互覆盖。

QueryAI 任务分人工任务分是否一致独立任务
这场戏用长镜头还是快速切镜更好?turn_p02_05 · Q-104 / 5 ai_eval_01J8F6Q44 / 5 human_eval_01J8G21A一致AI + 人工
只读评审第 2 集分镜和视频 PromptP03 锦宅春秋 · Q-143 / 5 ai_eval_01J8F6Q44 / 5 human_eval_01J8G21A不一致AI + 人工
检查并修复第 3 集剧情和分镜turn_p12_03 · Q-45运行中 ai_eval_01J8EZY1仅 AI
封面正脸要求与锁定品牌规范冲突P04 星火温室 · Q-185 / 5 human_eval_01J8G21A仅人工

AI Run 证据工作台

ai_eval_01J8F6Q4 · run_01J8F6R3 · turn_p02_05 · judge-prod-v3

运行有效性有效
AI 评测结论不合格
最早失败D2 · 信息判断
严重错误未命中
D1 1D2 0D3 1D4 1D5 1
D2 · 信息判断与追问agent.intent_resolved · 2026-07-29 14:38:12.441
最早失败
证据优先级:项目状态 > 工具返回 > 调用记录 > 最终回复
{
  "evidence_id": "ev_intent_03",
  "information_state_expected": "缺失-必须用户补充",
  "information_state_observed": "缺失",
  "expected_first_action": "只询问一个最阻塞项",
  "observed_question_count": 4,
  "observation": "一次要求用户补充剧情目标、人物动作、场景空间和期望节奏",
  "rule_id": "D2-R04",
  "ai_score": 0,
  "confidence": 0.94
}
Prompt、Skill、Judge 模型、代码 Commit 与规则版本均来自本次 AI 任务快照。

Run 详情

① 用户 Query 原文

② Agent 实际运行输出(Judge 评审的对象)
③ 按五维标准评审上面这次 Agent 输出

操作

Longbean workspace