QATC Lab

方法说明

本平台是《AI投研如何降本提效》报告的实验验证层——每个数字都对应报告的一个章节。

配置 ↔ 报告映射

平台元素报告出处
A · 无Skill基线 / B · 提示词+清单 / C · 流程型Skill / D · 证据型Skill+程序验证报告 §7.2 A/B/C/D 组
W · 错误示例:膨胀流程报告 §一 28万Token案例 + §4 四类泄漏
T1 · 政策与行业数据核验(verify 类)报告 §7.1 四类任务 · 核验
T1+ · 数据核验加大版(T1L,T1 的加长材料版)报告 §7.1 四类任务 · 核验(规模压力测试)
T2 · 研究报告审阅(review 类)报告 §7.1 四类任务 · 审阅
T3 · 估值模型构建(valuation 类,公式级金标准+防硬编码依赖检查)报告 §7.1 四类任务 · 估值
T4 · 深度报告生成缩小版(report 类,先导版 T4-P)报告 §7.1 四类任务 · 报告(先导缩小版 T4-P)
质量评分(T1 逐条核验 / T2 命中-误报 / T3 单元格+桥接依赖 / T4 四维计分)报告 §3.3 质量账
首次通过率与雪球倍数(多轮上下文放大)报告 §4 四类泄漏 + §7.3 稳健性
团队降本估算器报告 执行摘要 + 产业视角章

三本账计量口径

Token 账

采用平台原生 usage 字段(报告计量口径第一层),即模型 API 返回的 prompt_tokens / completion_tokens 原值,不做估算或折算。雪球曲线展示每轮输入 tokens 与累计输入 tokens。

耗时账

墙钟时间(wall time):从任务提交到最终输出完成的实际秒数,含排队与闸门返工。多轮配置逐调用记录 latency。

质量账

T1:6 条声明逐条判定对比金标准,verdict 匹配 + 关键对象匹配 + 关键词校验,单条满分 10;「部分准确」判定在对象不一致时记为签名错误(部分准确陷阱)。T2:命中预埋错误 +10/个,误报陷阱 -8/个,其他误报 -3/个,归一化到 0-100。T3:11 个公式级单元格各 8 分 + 桥接一致 6 分 + 依赖检查 6 分(TV 必须由模型自己的 FCF₅ 推出,防硬编码)。T4:事实覆盖 10×6 + 冲突处理 2×10 + 反方覆盖 2×5 + 交付要件(章节/证据矩阵/摘要)10 分。

实验纪律

  • 1.同一任务:对照组跑的是完全相同的任务定义。
  • 2.同一冻结材料:材料全文冻结,任何人可展开阅读核对。
  • 3.同一输出契约:结构化 JSON 输出格式固定,否则无法程序评分。
  • 4.同一模型:所有配置调用同一模型,排除模型差异。
  • 5.只变工作配置:变量唯一——基线 / 清单 / 膨胀流程 / 流程型 Skill / 证据型 Skill / 自定义。

诚实边界

单轮实验结果存在随机性,不代表稳定效应;本页 token 为平台原生 usage(报告口径第一层);演示任务规模小于真实任务,真实场景雪球效应更大。

不能得出的结论(报告 §8.6)

  • ·不能得出「某模型更便宜」——实验只变工作方法,不比模型。
  • ·不能得出稳定效应量——单轮实验存在随机性,报告效应量来自多轮重复。
  • ·不能外推到所有任务类型——演示任务针对投研核验/审阅场景设计。
  • ·不能把演示规模当真实规模——真实任务材料更长,雪球效应更大。