Longbean quality garden
让每一次运行,都有证据可循。
先独立构建测试集,再选择 AI 自动评测或人工逐条评测;两条评分链路只在结果中心汇合。
已发布测试集4共 134 个 Turn Case
AI 自动评测32 运行中 · 1 已完成
人工标注进度18/72盲评任务进行中
Query 草稿244 条待人工检查
最近评测任务
AI 与人工是两个独立任务,使用同一冻结测试集时才可比较。
| 任务 | 评测方式 | 测试集 | 进度 | 当前结果 | 状态 | |
| 五维全链路自动评测ai_eval_01J8F6Q4 | AI 自动 | Query Matrix v2.3 | 72/72 | 通过率 78.6% | 完成 | |
| Query Matrix 人工基线human_eval_01J8G21A | 人工标注 | Query Matrix v2.3 | 18/72 | 均分 4.2/5 | 进行中 | |
| 前端交付自动专项ai_eval_01J8EZY1 | AI 自动 | Delivery v0.9 | 16/24 | 通过率 68.0% | 运行中 | |
| 工具失败人工专项human_eval_01J8C91N | 人工标注 | Tool Failure v0.6 | 0/6 | — | 未开始 | |
Query 批量生产
克隆线上真实生产链路,按生产规则组装带标签、可追溯的单轮或多轮测试任务。
- 01
接入来源导入或线上同步
- 02
匹配规则继承生产标签
- 03
组装上下文保留完整 QA 对
- 04
写入测试集质检后入库
自动打标互动影游生产规则 v3.2
导入后自动识别任务意图、信息状态和目标对象,规则标签随 Query 一起入库。
来源·人工导入环节·项目创建上下文·首轮规则·prod-v3.2
Fixture 与标准答案不会写入用户 Query
生产接口同步线上链路快照
只读取任务、历史对话和生产状态,不修改线上项目。
已连接
查看同步到的上下文载荷
规则映射选择要克隆的生产动作
每个任务保留上游 QA 对、快照 ID、生产环节和规则标签。
5 类已选
7 生产环节2–4 QA 对 / 任务100% 规则标签覆盖
高级生成约束
测试任务
批次 query_batch_0730_01 · 20 条草稿
20 当前任务16 通过门禁4 待人工检查首轮 生产环节
已选择 3 / 4 条测试任务;入库后仍为草稿。
测试集
集中管理已生成或导入的 Query、Scenario、Fixture、Expectation 与发布版本。
Scenario13连续项目场景
Turn Case72可执行用户轮次
Expectation98同轮共享一次 Run
信息状态覆盖4/4足够 / 缺失 / 模糊 / 冲突
第 1 层测试集版本
选择一个版本后,再进入 Scenario、Turn Case 与 Expectations。
| 数据集 | 版本 | Queries | Scenarios | 覆盖范围 | 最近使用 | |
| 任务×意图×信息状态dataset_qm_100 | v2.3 | 72 | 13 | 全链路 | 今天 14:32 | |
| Query Matrixdataset_qm_100_draft | v2.4 草稿 | 0 | 0 | 待补充 | 尚未使用 | |
| 黄金 Case 回归集dataset_golden_20 | v1.2 | 20 | 10 | 核心路径 | 昨天 19:46 | |
| 黄金 Case 回归集dataset_golden_20_draft | v1.3 草稿 | 20 | 10 | 核心路径 | 尚未追加 | |
| 前端交付专项dataset_delivery_24 | v0.9 草稿 | 24 | 6 | Canvas / UI | 今天 11:08 | |
| 工具失败与恢复dataset_tool_failure | v0.6 草稿 | 18 | 8 | Skills / Tools | 7月28日 | |
任务×意图×信息状态 · v2.3
Dataset / Scenario / Turn Case
已冻结
Dataset Query Matrix v2.3›Scenario P01 宫阙浮生›Turn Case Q-01›Expectations 4 条
当前 Turn · 用户 Query足够
根据设定生成《宫阙浮生》正式互动大纲,并拆成 6 集互动剧情。
Query 只保留用户真实表达;测试事实与答案分别存放。
Fixture · 运行前上下文
- 项目
- P01 / 宫阙浮生
- 目标对象
- 跨模块 / 综合任务
- 信息状态
- 足够
- 上下文快照
- fixture_p01_q01.json
第 4 层 · Atomic Expectations
- 识别目标对象与操作范围
- 按信息状态决定执行或追问
- 遵守工程链路与写入门禁
- 产物满足对象级 Rubric
评测规则
以版本化 RuleSet 文件归档;下载、AI 任务和人工任务始终引用同一份冻结文件。
文件归档RuleSet 文件
草稿与已发布版本分开保存。
4 个文件
interactive-film-5d-v2.0.yaml互动影游五维标准
RuleSet v2.0 · 每维 0/1 · 6 类严重错误 · 最早错误归因
试运行
D1目标与边界理解5 个必检项0 / 1
D2信息判断与追问5 个必检项0 / 1
D3执行编排与状态控制7 个必检项0 / 1
D4结果正确性与专业质量指令门槛 → 对象 Rubric0 / 1
D5交付完整性与可用性通用项 + Delivery Profile0 / 1
发布前缺口来自 V2 标准与工程 Prompt 的交叉检查
- D4 对象内容 Rubric未完整冻结
- D5 六类 Delivery Profile未完整冻结
- 5 分与 4 分的合格阈值待产品确认
- slot + 展示 JSON 协议§12.1 覆盖生效
AI 任务与人工任务均可引用;每个任务保存文件 ID、版本和内容哈希。
AI 自动评测
选择测试集、被测 Agent Build 与 Judge 模型,批量运行并自动生成 D1–D5 分值。
独立链路 · 不依赖人工评分
新建 AI 评测任务
每条 Query 先运行被测 Agent,再由所选 Judge 模型按冻结规则评分。
预计 72 个 Agent Run + 72 次 Judge
任务保存 RuleSet 文件 ID、版本和内容哈希。
模型版本、温度与结构化输出会写入任务快照。
高级运行设置
AI 评测任务
每个任务独立记录被测模型与 Judge 模型。
| AI 评测任务 | 测试集 | 被测 Build | Judge 模型 | 进度 | 五维全通过率 | 状态 | |
| ai_eval_01J8F6Q4五维全链路自动评测 | Query Matrix v2.3 | 0729-biz | judge-prod-v3 | 72 / 72 | 78.6% | 完成 | |
| ai_eval_01J8EZY1前端交付自动专项 | Delivery v0.9 | 0729-biz | judge-prod-v3 | 16 / 24 | 68.0% | 运行中 | |
| ai_eval_01J8DPH7System Prompt A/B | Golden v1.2 | 0729 vs 0724 | judge-fast-v2 | 0 / 40 | — | 排队中 | |
没有匹配的 AI 任务调整测试集或任务状态筛选条件。 |
当前任务的 Query Runs
ai_eval_01J8F6Q4 · 共 72 条,可下钻工程证据。
| Run | Query | Build / Prompt | 最早失败维度 | D1–D5 | 有效性 / 结论 | 耗时 | |
| run_01J8F6R3turn_p02_05 · Q-22/Q-39 | 这场戏用长镜头还是快速切镜更好? | 0729-bizsp_9fd2a7c | D2 信息判断 | 1 / 0 / 1 / 1 / 1 | 运行有效 不合格 | 8m 14s | |
| run_01J8F72Aturn_p09_05 · Q-8/Q-9/Q-10 | 修改开放式结局与陆川设定,其他内容不变 | 0729-bizsp_9fd2a7c | 无失败 | 1 / 1 / 1 / 1 / 1 | 运行有效 · 合格 | 6m 42s | |
| run_01J8F75Pturn_p07_05 · Q-15/Q-18 | 只读检查大纲、资产和前三集剧情 | 0729-bizsp_9fd2a7c | D4 内容质量 | 1 / 1 / 1 / ? / 1 | 运行有效 规则无法判定 | 7m 08s | |
| run_01J8F79Cturn_p12_03 · Q-45 | 检查并修复第 3 集剧情和分镜 | 0729-bizsp_9fd2a7c | — | — | 运行中 | 1m 19s | |
| run_01J8F81Dturn_p03_04 · Q-33/Q-35 | 只重试失败的角色图和第 6 镜视频 | 0729-bizsp_9fd2a7c | — | — | 平台无效 · Trace 缺失 | — | |
| 没有匹配的 Run、Query、Build 或 Case ID。 |
人工评测任务
选择分配给当前标注员的任务,再进入独立盲评工作台。
待进行任务2当前标注员可进入
待评分 Query60按任务分别保存
草稿记录0点击评分即自动写入
工作模式盲评不展示 AI Judge 分数
我的标注任务
每个任务绑定一个冻结测试集和规则版本;进入后按题号逐条作答。
评测员 03 · 自动保存开启
当前考试任务Query Matrix 人工基线human_eval_01J8G21A
等待作答
human_eval_01J8G21A / annotations / q19
测试集Query Matrix v2.372 Queries · 版本已冻结
规则文件互动影游五维标准 v2.0D1–D5 每维 0/1
标注员Tide Lab / 评测员 03独立评分 · 盲评开启
Q-19 · P02 山河棋局 / turn_p02_05
“这场戏用长镜头还是快速切镜更好?”
Fixture:没有场景目标、人物动作或当前分镜。信息状态为“缺失-必须用户补充”。
第 19 / 72 题
盲评答卷
下面展示影游 Agent 的生产环节与原始证据;AI 自动评测分数在整套人工任务提交前不可见。
影游 Agent 生产答卷
生产环节证据
内容环节 · 分镜脚本工程节点 1 / 7
run_demo_q19 · input.context
输入与项目上下文
已读取
读取用户 Query、项目对象和冻结 Fixture,形成本轮生产上下文。
最终用户可见回复0729-biz · sp_9fd2a7c · run_demo_q19
“开始判断镜头方案前,请补充这场戏的剧情目标、人物动作、场景空间和期望节奏;收到后我会继续给出建议。”
结果中心
分别查看 AI 自动评测和人工评测结果;仅在使用同一冻结测试集时生成对比。
AI 五维全通过率78.6%ai_eval_01J8F6Q4
人工任务完成度25.0%18 / 72 Queries
示例可比一致率83.3%演示数据 · 双方均完成的 18 条
平台无效运行率3.4%只影响 AI 自动评测分母
D1 目标边界94%
D2 信息判断82%
D3 执行状态88%
D4 结果质量79%
D5 交付可用84%
AI 自动评测趋势
同一测试集下的 Build 五维全通过率
0729 +6.4%
AI 最早失败节点
来自自动评测工程证据,同因只计一次
Prompt / Build 变更影响
0729 原始版 → 业务效果补全版 · 相同冻结 Case
4 项语义变更
任务分类Q-4 / Q-11 / Q-13从“新建/修改内容”调整为真实执行操作,回归通过率 +8.1%。
系统接入门禁interactive-film-game + manifest新增显式加载、CAS、投影与写后读回证据。
媒体模型运行时配置成为权威旧 Prompt 与工程 Prompt 模型名不同,必须以 Build 快照核验。
最终输出协议slot + 分隔标记 + JSON以工程 Prompt §12.1 定点覆盖为本次候选协议。
同测试集结果对比
当前展示代表性演示记录;AI 与人工原始任务 ID 分别保留,不在标注阶段相互覆盖。
| Query | AI 任务分 | 人工任务分 | 是否一致 | 独立任务 | |
| 这场戏用长镜头还是快速切镜更好?turn_p02_05 · Q-10 | 4 / 5 ai_eval_01J8F6Q4 | 4 / 5 human_eval_01J8G21A | 一致 | AI + 人工 | |
| 只读评审第 2 集分镜和视频 PromptP03 锦宅春秋 · Q-14 | 3 / 5 ai_eval_01J8F6Q4 | 4 / 5 human_eval_01J8G21A | 不一致 | AI + 人工 | |
| 检查并修复第 3 集剧情和分镜turn_p12_03 · Q-45 | 运行中 ai_eval_01J8EZY1 | — | — | 仅 AI | |
| 封面正脸要求与锁定品牌规范冲突P04 星火温室 · Q-18 | — | 5 / 5 human_eval_01J8G21A | — | 仅人工 | |