工作台三条独立评测链路
Longbean quality garden

让每一次运行,都有证据可循。

先独立构建测试集,再选择 AI 自动评测或人工逐条评测;两条评分链路只在结果中心汇合。

已发布测试集4共 134 个 Turn Case
AI 自动评测32 运行中 · 1 已完成
人工标注进度18/72盲评任务进行中
Query 草稿244 条待人工检查

最近评测任务

AI 与人工是两个独立任务,使用同一冻结测试集时才可比较。

任务评测方式测试集进度当前结果状态
五维全链路自动评测ai_eval_01J8F6Q4AI 自动Query Matrix v2.372/72通过率 78.6%完成
Query Matrix 人工基线human_eval_01J8G21A人工标注Query Matrix v2.318/72均分 4.2/5进行中
前端交付自动专项ai_eval_01J8EZY1AI 自动Delivery v0.916/24通过率 68.0%运行中
工具失败人工专项human_eval_01J8C91N人工标注Tool Failure v0.60/6未开始

Query 批量生产

克隆线上真实生产链路,按生产规则组装带标签、可追溯的单轮或多轮测试任务。

  1. 01
    接入来源导入或线上同步
  2. 02
    匹配规则继承生产标签
  3. 03
    组装上下文保留完整 QA 对
  4. 04
    写入测试集质检后入库

导入初始 Query

每行一条。系统会保留原始表达,并按规则扩展为测试任务。

1 条待处理
支持粘贴、文件导入;自动忽略空行和重复项。
互动影游生产规则 v3.2

导入后自动识别任务意图、信息状态和目标对象,规则标签随 Query 一起入库。

来源·人工导入环节·项目创建上下文·首轮规则·prod-v3.2
Fixture 与标准答案不会写入用户 Query

构建规则

本批次将构建 20 条测试任务

标签必填
高级生成约束

测试任务

批次 query_batch_0730_01 · 20 条草稿

20 当前任务16 通过门禁4 待人工检查首轮 生产环节
Query 任务链路上下文生产规则标签质检

选择一条任务查看完整上下文

Query ID、生产快照和 QA 对将在这里展示。

上下文对话组
已选择 3 / 4 条测试任务;入库后仍为草稿。

测试集

集中管理已生成或导入的 Query、Scenario、Fixture、Expectation 与发布版本。

Scenario13连续项目场景
Turn Case72可执行用户轮次
Expectation98同轮共享一次 Run
信息状态覆盖4/4足够 / 缺失 / 模糊 / 冲突

测试集版本

选择一个版本后,再进入 Scenario、Turn Case 与 Expectations。

数据集版本QueriesScenarios覆盖范围最近使用
任务×意图×信息状态dataset_qm_100v2.37213全链路今天 14:32
Query Matrixdataset_qm_100_draftv2.4 草稿00待补充尚未使用
黄金 Case 回归集dataset_golden_20v1.22010核心路径昨天 19:46
黄金 Case 回归集dataset_golden_20_draftv1.3 草稿2010核心路径尚未追加
前端交付专项dataset_delivery_24v0.9 草稿246Canvas / UI今天 11:08
工具失败与恢复dataset_tool_failurev0.6 草稿188Skills / Tools7月28日

评测规则

以版本化 RuleSet 文件归档;下载、AI 任务和人工任务始终引用同一份冻结文件。

RuleSet 文件

草稿与已发布版本分开保存。

4 个文件

互动影游五维标准

RuleSet v2.0 · 每维 0/1 · 6 类严重错误 · 最早错误归因

试运行
归档路径/rules/interactive-film/interactive-film-5d/v2.0.yaml
文件 IDruleset_ifg_5d_v2_0
最近更新2026-07-29 18:42
D1目标与边界理解5 个必检项0 / 1
D2信息判断与追问5 个必检项0 / 1
D3执行编排与状态控制7 个必检项0 / 1
D4结果正确性与专业质量指令门槛 → 对象 Rubric0 / 1
D5交付完整性与可用性通用项 + Delivery Profile0 / 1
发布前缺口来自 V2 标准与工程 Prompt 的交叉检查
  • D4 对象内容 Rubric未完整冻结
  • D5 六类 Delivery Profile未完整冻结
  • 5 分与 4 分的合格阈值待产品确认
  • slot + 展示 JSON 协议§12.1 覆盖生效
AI 任务与人工任务均可引用;每个任务保存文件 ID、版本和内容哈希。

AI 自动评测

选择测试集、被测 Agent Build 与 Judge 模型,批量运行并自动生成 D1–D5 分值。

独立链路 · 不依赖人工评分

新建 AI 评测任务

每条 Query 先运行被测 Agent,再由所选 Judge 模型按冻结规则评分。

预计 72 个 Agent Run + 72 次 Judge
任务保存 RuleSet 文件 ID、版本和内容哈希。
模型版本、温度与结构化输出会写入任务快照。
高级运行设置

AI 评测任务

每个任务独立记录被测模型与 Judge 模型。

AI 评测任务测试集被测 BuildJudge 模型进度五维全通过率状态
ai_eval_01J8F6Q4五维全链路自动评测Query Matrix v2.30729-bizjudge-prod-v372 / 7278.6%完成
ai_eval_01J8EZY1前端交付自动专项Delivery v0.90729-bizjudge-prod-v316 / 2468.0%运行中
ai_eval_01J8DPH7System Prompt A/BGolden v1.20729 vs 0724judge-fast-v20 / 40排队中

当前任务的 Query Runs

ai_eval_01J8F6Q4 · 共 72 条,可下钻工程证据。

RunQueryBuild / Prompt最早失败维度D1–D5有效性 / 结论耗时
run_01J8F6R3turn_p02_05 · Q-22/Q-39这场戏用长镜头还是快速切镜更好?0729-bizsp_9fd2a7cD2 信息判断1 / 0 / 1 / 1 / 1运行有效 不合格8m 14s
run_01J8F72Aturn_p09_05 · Q-8/Q-9/Q-10修改开放式结局与陆川设定,其他内容不变0729-bizsp_9fd2a7c无失败1 / 1 / 1 / 1 / 1运行有效 · 合格6m 42s
run_01J8F75Pturn_p07_05 · Q-15/Q-18只读检查大纲、资产和前三集剧情0729-bizsp_9fd2a7cD4 内容质量1 / 1 / 1 / ? / 1运行有效 规则无法判定7m 08s
run_01J8F79Cturn_p12_03 · Q-45检查并修复第 3 集剧情和分镜0729-bizsp_9fd2a7c运行中1m 19s
run_01J8F81Dturn_p03_04 · Q-33/Q-35只重试失败的角色图和第 6 镜视频0729-bizsp_9fd2a7c平台无效 · Trace 缺失

人工评测任务

选择分配给当前标注员的任务,再进入独立盲评工作台。

待进行任务2当前标注员可进入
待评分 Query60按任务分别保存
草稿记录0点击评分即自动写入
工作模式盲评不展示 AI Judge 分数

我的标注任务

每个任务绑定一个冻结测试集和规则版本;进入后按题号逐条作答。

评测员 03 · 自动保存开启

结果中心

分别查看 AI 自动评测和人工评测结果;仅在使用同一冻结测试集时生成对比。

AI 五维全通过率78.6%ai_eval_01J8F6Q4
人工任务完成度25.0%18 / 72 Queries
示例可比一致率83.3%演示数据 · 双方均完成的 18 条
平台无效运行率3.4%只影响 AI 自动评测分母
D1 目标边界94%
D2 信息判断82%
D3 执行状态88%
D4 结果质量79%
D5 交付可用84%

AI 自动评测趋势

同一测试集下的 Build 五维全通过率

0729 +6.4%
100%80%60%40%072107230724072607280729

AI 最早失败节点

来自自动评测工程证据,同因只计一次

状态落盘 / CAS31%
路由与信息判断24%
前端交付 / UI19%
业务 Skills16%
输入与项目状态10%

Prompt / Build 变更影响

0729 原始版 → 业务效果补全版 · 相同冻结 Case

4 项语义变更
任务分类Q-4 / Q-11 / Q-13

从“新建/修改内容”调整为真实执行操作,回归通过率 +8.1%。

系统接入门禁interactive-film-game + manifest

新增显式加载、CAS、投影与写后读回证据。

媒体模型运行时配置成为权威

旧 Prompt 与工程 Prompt 模型名不同,必须以 Build 快照核验。

最终输出协议slot + 分隔标记 + JSON

以工程 Prompt §12.1 定点覆盖为本次候选协议。

同测试集结果对比

当前展示代表性演示记录;AI 与人工原始任务 ID 分别保留,不在标注阶段相互覆盖。

QueryAI 任务分人工任务分是否一致独立任务
这场戏用长镜头还是快速切镜更好?turn_p02_05 · Q-104 / 5 ai_eval_01J8F6Q44 / 5 human_eval_01J8G21A一致AI + 人工
只读评审第 2 集分镜和视频 PromptP03 锦宅春秋 · Q-143 / 5 ai_eval_01J8F6Q44 / 5 human_eval_01J8G21A不一致AI + 人工
检查并修复第 3 集剧情和分镜turn_p12_03 · Q-45运行中 ai_eval_01J8EZY1仅 AI
封面正脸要求与锁定品牌规范冲突P04 星火温室 · Q-185 / 5 human_eval_01J8G21A仅人工

AI Run 证据工作台

ai_eval_01J8F6Q4 · run_01J8F6R3 · turn_p02_05 · judge-prod-v3

运行有效性有效
AI 评测结论不合格
最早失败D2 · 信息判断
严重错误未命中
D1 1D2 0D3 1D4 1D5 1
D2 · 信息判断与追问agent.intent_resolved · 2026-07-29 14:38:12.441
最早失败
证据优先级:项目状态 > 工具返回 > 调用记录 > 最终回复
{
  "evidence_id": "ev_intent_03",
  "information_state_expected": "缺失-必须用户补充",
  "information_state_observed": "缺失",
  "expected_first_action": "只询问一个最阻塞项",
  "observed_question_count": 4,
  "observation": "一次要求用户补充剧情目标、人物动作、场景空间和期望节奏",
  "rule_id": "D2-R04",
  "ai_score": 0,
  "confidence": 0.94
}
Prompt、Skill、Judge 模型、代码 Commit 与规则版本均来自本次 AI 任务快照。

操作

Longbean workspace