MoodLens AI · Evidence ledger

项目证据账本

把“做了什么、验证了什么、还不知道什么”分开呈现。数据更新时间以各项记录为准,不用自动化测试代替用户结果。

Shared vocabulary

统一成熟度口径

页面、报告和发布说明均使用以下五种状态。只有发生过并留下可复核材料的工作才进入已验证状态。

implemented已实现

源码或界面中已有可审阅实现。

automated_verified自动化验证

测试验证代码、状态或安全合同;不代表用户效果。

model_evaluated模型评测

固定数据、Prompt 和规则版本下的模型运行结果。

user_observed早期用户观察

小样本任务观察;不等于 PMF 或正式效果验证。

planned规划中

尚未发生,不计入已完成证据。

01

当前可复核事实

截至 2026-08-23 的项目状态;模型质量和用户帮助性仍遵守独立门槛。

实现
端到端研究原型implemented
范围
对话、工作表、督察、六层画布、运行账本、可关闭关系环境旁路
公开体验
固定、脱敏、无 Key 的确定性回放
测试
163 项自动化回归automated_verified
组成
141 项服务端/渲染契约测试 + 22 项 TypeScript 状态与 UI 测试
边界
不称为模型评测、用户研究或效果数据
模型
接入门通过,双候选质量门未过model_evaluated_automatic_contracts
HY3 接入
当前本机配置已通过连接、普通对话、工具、正式画布与主动收束四级检测
质量筛选
48 条双候选主筛选运行已记录;两个候选均未入选,帮助性盲评仍待完成。
知识
83 张来源卡待专业审核runtime rules: 0
运行时
0 条专业规则启用;严格审核门没有被绕过
表述边界
72 个合成 draft 案例只用于参考,不称作真实模型或用户评测
02

24 例双模型自动合同

每个候选完成一次全量;8 个关键纠正/abstain 案例各重复三次。原始结果保留,以下不是用户帮助性分数。

模型
hy3:hy3quality_gate_failed
工具协议
24/24
严格证据失败
11
关键案例完整通过
3/8
延迟
中位 2972 ms · P95 6010 ms
模型
deepseek:deepseek-v4-flashquality_gate_failed
工具协议
4/24
严格证据失败
3
关键案例完整通过
0/8
延迟
中位 7648 ms · P95 8285 ms
03

失败与未完成项

这些项目会直接影响模型选择和投递可信度,因此不隐藏。

模型盲评未完成

12 组帮助性评分完成前,自动合同通过只代表进入人工评审。

架构收益与成本并存

Harness 证据失败 11→5,但调用 12→36、总延迟约 34→94 秒;未锁定架构。

用户0 / 5–8 人

用户协议已限定低敏场景与最小数据保存;尚未招募,不展示成功率。

业务没有 PMF 结论

当前只能证明产品判断与可复核工程交付,不能证明规模化留存或效果。

04

复核路径

建议按“用户价值 → 固定案例 → 架构取舍 → PRD → 评测原始数据”的顺序检查。

版本锚点moodlens-recruiter-eval-2026-08-22.v1

模型 Prompt、规则和案例版本会随原始 JSON 一起保存;估算成本在未锁定价格源时保持 null。

用户测试只保存参与者编号、任务结果、量表与脱敏观察。
  1. 01
    /demo

    三分钟固定回放与证据边界

  2. 02
    /architecture

    五节点主链、权限、状态与失败

  3. 03
    /prd

    默认只读的完整产品快照