开发者可定位失败发生在记录表、主 Agent、工具校验、督察还是状态写入,并用 requestId 和版本复现。
Runtime evidence ledger · architecture v2026-08-23
运行日志
把一次对话拆成可核验的 Agent、确定性装置、工具合同和状态写入。它既是开发修正的证据,也是后续评估与 Agent 绩效治理的数据基础。
它记录系统怎样行动,不记录模型怎样“想”
运行日志保存可观察的请求、工具、状态差异、耗时、错误和异步检查点;不会采集隐藏思维过程,也不会进入任何 Agent 的上下文。
同一事件合同可聚合成功率、延迟、降级、工具合规、纠正与过期检查点,为模型或版本对比提供原始证据。
指标只评价 Agent 与装置是否履行合同,不对用户情绪、人格或表达方式打分;综合绩效系统目前是演进方向。
记录仅在当前浏览器 IndexedDB 保存,最多 90 天 / 5,000 轮;当前没有后端日志数据库。
ARCHITECTURE CORRESPONDENCE
与 Agent 系统架构共用同一组装置标识
每条事件都带 architecture componentId。评委可以从这里看到“本轮发生了什么”,再到 Agent 系统架构检查该角色或装置的职责、边界与耦合。
打开 Agent 系统架构 →Agent / 装置执行位置本轮记录证据架构节点
A2 · 调查工作表 Agent同步主链模型、耗时、降级、revision、证据/候选数量
worksheet_agent · worksheet_tool · worksheet_storeA4 · 氛围观察 Agent异步旁路事件决策、工具次数、信号数、降级、视觉状态写入
atmosphere_agent · atmosphere_tools · atmosphere_storeK1/K2 · 安全门与材料路由模型调用前安全级别、说话人、材料路由
safety_gate · boundary_routerA1 · 咨询师 Agent同步主链模型、请求号、延迟、Token、回复、工具、校验告警
consultant_agent · response_guardT1/T2/K3 · 控制与画布链条件触发控制信号、四段工具、证据写入、画布版本
consultant_controls · canvas_toolchain · evidence_guard · canvas_storeO4/A3/T4/S4 · 督察链回复后异步调度原因、检查点、时效、采用/过期、下一轮约束
supervision_scheduler · supervisor_agent · supervision_tools · supervision_storeO1/S6 · 轮次与账本全程turnId、上下文版本、阶段、状态前后、错误、异步回写
turn_runtime · runtime_ledger边界说明:混元生图是用户主动触发的独立模型服务,不属于普通对话轮;知识审核与自动化测试属于离线治理流水线。二者不会被伪造为每轮都运行,后续应分别建立 image_generation 与 release_gate 事件。
从可观测事件到 Agent 评估
当前实现的是证据底座。只有在明确版本、样本与人工标注协议后,才能形成绩效看板和发布门槛。
调用成功率 · 降级率 · 错误阶段 · 重试后恢复
可以从 status、error、phase、requestId 统计;当前未生成虚假的综合分。端到端耗时 · Agent 延迟 · Token 用量 · 异步阻塞
可以比较不同模型与版本的质量—成本—延迟,不以模型名代替效果。工具合规 · 督察采用 · 迟到检查点 · 状态写入
用于发现 Agent 之间的断点、重复工作和跨轮污染,而不评价用户。纠正率 · 画布证据覆盖 · 用户撤下 · 任务完成
需要与匿名用户反馈和版本号结合;运行日志只是证据层,不等同于效果结论。当前结果0轮
本地用量—浏览器 IndexedDB
架构合同v321 个可观测节点标识
异常0当前筛选范围
正在读取本机运行日志…
选择一个轮次,查看真实装置行动链与证据。