源码或界面中已有可审阅实现。
MoodLens AI · Evidence ledger
项目证据账本
把“做了什么、验证了什么、还不知道什么”分开呈现。数据更新时间以各项记录为准,不用自动化测试代替用户结果。
Shared vocabulary
统一成熟度口径
页面、报告和发布说明均使用以下五种状态。只有发生过并留下可复核材料的工作才进入已验证状态。
测试验证代码、状态或安全合同;不代表用户效果。
固定数据、Prompt 和规则版本下的模型运行结果。
小样本任务观察;不等于 PMF 或正式效果验证。
尚未发生,不计入已完成证据。
01
当前可复核事实
截至 2026-08-23 的项目状态;模型质量和用户帮助性仍遵守独立门槛。
实现端到端研究原型implemented
- 范围
- 对话、工作表、督察、六层画布、运行账本、可关闭关系环境旁路
- 公开体验
- 固定、脱敏、无 Key 的确定性回放
测试163 项自动化回归automated_verified
- 组成
- 141 项服务端/渲染契约测试 + 22 项 TypeScript 状态与 UI 测试
- 边界
- 不称为模型评测、用户研究或效果数据
模型接入门通过,双候选质量门未过model_evaluated_automatic_contracts
- HY3 接入
- 当前本机配置已通过连接、普通对话、工具、正式画布与主动收束四级检测
- 质量筛选
- 48 条双候选主筛选运行已记录;两个候选均未入选,帮助性盲评仍待完成。
知识83 张来源卡待专业审核runtime rules: 0
- 运行时
- 0 条专业规则启用;严格审核门没有被绕过
- 表述边界
- 72 个合成 draft 案例只用于参考,不称作真实模型或用户评测
02
24 例双模型自动合同
每个候选完成一次全量;8 个关键纠正/abstain 案例各重复三次。原始结果保留,以下不是用户帮助性分数。
模型hy3:hy3quality_gate_failed
- 工具协议
- 24/24
- 严格证据失败
- 11
- 关键案例完整通过
- 3/8
- 延迟
- 中位 2972 ms · P95 6010 ms
模型deepseek:deepseek-v4-flashquality_gate_failed
- 工具协议
- 4/24
- 严格证据失败
- 3
- 关键案例完整通过
- 0/8
- 延迟
- 中位 7648 ms · P95 8285 ms
03
失败与未完成项
这些项目会直接影响模型选择和投递可信度,因此不隐藏。
模型盲评未完成
12 组帮助性评分完成前,自动合同通过只代表进入人工评审。
架构收益与成本并存
Harness 证据失败 11→5,但调用 12→36、总延迟约 34→94 秒;未锁定架构。
用户0 / 5–8 人
用户协议已限定低敏场景与最小数据保存;尚未招募,不展示成功率。
业务没有 PMF 结论
当前只能证明产品判断与可复核工程交付,不能证明规模化留存或效果。
04
复核路径
建议按“用户价值 → 固定案例 → 架构取舍 → PRD → 评测原始数据”的顺序检查。
模型 Prompt、规则和案例版本会随原始 JSON 一起保存;估算成本在未锁定价格源时保持 null。
用户测试只保存参与者编号、任务结果、量表与脱敏观察。- 01
/demo三分钟固定回放与证据边界
- 02
/architecture五节点主链、权限、状态与失败
- 03
/prd默认只读的完整产品快照