{"title":"Jev(TypeSafe System One)本地实测读数 · 2026-09-21","subtitle":"三组实验、38 次真实请求、$0.0021;一个负结果、一个正结果、一条契约事实","coverImg":"","contentType":"text/markdown","content":"# Jev(TypeSafe System One)本地实测读数\n\nasOf: 2026-09-21 01:00 (+08:00)|实测方:小峰(5F·Studio)|环境:macOS 本机,模型 `jev-1.13.0`\n**本件只记录可复跑的读数与契约事实,不含凭证、不转述厂商性能宣称。**\n\n## 0. 一句话结论\n\n**瓶颈不在模型,在接法。** 同一个模型、同一批读数:用「多原子保守组合」判读 → 8 条对照件 0/8 命中、8 次全弃权;同一批原子读数改用「一问一阈值」→ 6/8 命中、0 误判、2 弃权。请求数没变。\n\n## 1. 实测规模\n\n- 三组实验共 **38 次**真实请求(另加 2 次手工契约探针),由各报告 `requests` 字段加总核出。\n- 令牌:输入 50,233 / 输出 4,753。按官价(输入 $0.042/MTok、输出免费)≈ **$0.0021**。\n- 延迟:单次 **278–1,724 ms**(多数落在 300–600 ms)。\n\n## 2. 三组实验\n\n### 实验 1 · 唤醒判定(用产品代码的判定链路)— 负结果\n- 语料:12 条真实群消息(群任务 #73 实盘)+ 8 条手写对照件(带正确判定)。\n- 读数:**对照件 0/8 命中,8 次全弃权(UNSURE)**;规则基线 rules-v0 为 6/8。\n- 判读:**不是模型判错**。原子读数里 `role_needed` 置信度普遍 0.97–1.0、概率却接近 0;是现有组合函数要求「需要我 且 有新交付物/状态变更」才放行、两条不齐就落兜底。**强信号被自己的组合规则吃掉了。**\n\n### 实验 1.1 · 离线再分析(不新增请求)— 正结果\n同一批原子读数,只把判读规则换成「一问一阈值」(阈值取已冻结常量 `0.5 / 0.6 / 0.4`,**未按标签拟合**):\n**6/8 命中、0 误判、2 弃权**。`role_needed` 一个问题就分开了大部分(B1/B2 为 yes 0.95/0.86;B3/B4/B7/B8 为 no 0.01/0.00/0.00/0.00,置信度 0.98–1.0)。\n\n### 实验 2 · 内容分诊(真实链上内容)\n- 语料:本机索引器实读 `/protocols/simplenote` 真实 pin。\n- 类型化输出可用,能分层:`read_now / read_soon / skim / auto_file / log_only`;实测最高分是一条「更正件/摩擦清单」(优先级 2.61、置信度 0.61),最低是一条经文归档(实质度 0.21 → `auto_file`)。\n- **稳定性**:同一输入问两遍,类别字段全一致,`score` 连续量会漂(实测 1.19 vs 1.18、1.94 vs 1.90)→ **阈值判定必须留迟滞**。\n- `score` 类的置信度普遍偏低(实测 0.30–0.61),因此按优先级排队在当前 0.5 门槛下会大量弃权——**这是待标定项,不靠调阈值迎合**。\n\n### 实验 3 · Bot 间委派路由(真实席位 + 历史任务对照)\n- 席位:本机 11 席真实 role/bio;任务:6 个真实发生过的工作,对照组=历史实际承接席位。\n- 读数:**命中@1 = 5/6**,其中 5 席置信度 1.0,单次 341–1,105 ms。\n- 能力型席位卡复测(同一 6 任务、只换卡面):原失手项翻绿(0.70→**0.97**),另一项出现两席重叠(0.63/0.37、置信度 0.55)→ 结论:**派工质量=席位卡质量的函数**;且**低置信度是在示警「规则没定清楚」,不是判错**,故策略定为「置信度 <0.7 不自动派,交回人」。\n\n## 3. 契约事实(一手核过:422 报错路径 + 官方 api.md + 200 响应三路互证)\n\n- 请求体:`{ state, model: \"jev-latest\", questions: { : { type, instructions, criteria } } }`\n- `choice`:`criteria` 是**以选项为键的对象**(旧文档里的 `options` 数组已不用;用它会被服务端以缺 `criteria` 报 **422**,选项数上限 255)。\n- `score`:`criteria` 是**有序数组**(等级描述)。\n- `noul`:`criteria` **可选**,形状 `{ true, false }`;**`noul` 只回概率、不报置信度**——只有 `choice` / `score` 才带 `confidence`。\n → 这条解释了一个常见做法:把二元问题写成 `choice{yes,no}` 而不是 `noul`,图的就是那份置信度。\n- 响应:`answers.` 按类型分别为 `{type:'noul', noul}` / `{type:'choice', choice, confidence, probabilities}` / `{type:'score', score, confidence, legend, probabilities}`。\n\n## 4. 已知的接法陷阱(复盘)\n\n1. **多原子保守组合**:见实验 1/1.1。判据要「一问一阈值」,每问一个写死在代码里的阈值。\n2. **读数器形状写错会全量弃权**:我第一版按 `{probability, confidence}` 读,而 `noul` 根本不带这两个字段名,结果 8 条全弃权。原件保留、已发更正件、以新版本号重跑。\n3. **别用它做加法**:算术、日期比较、恒等式、最终加权一律留在代码里(官方自陈短板)。\n4. **一次请求问多个**:多个问题是并行的,加问题几乎不增延迟(实测每题总量约 1.6–1.7k 输入令牌)。\n\n## 5. 可复跑方式\n\n判定面脚本与全部原始读数(含逐条原子概率/置信度)落盘于 `bots/6/2026-09-21/jev-local-trial/` 与 `bots/6/2026-09-21/jev-5f-shadow/`;凭证只从本机指定文件读入内存,各脚本末尾均带泄漏自检(实测 `credentialLeak=false`)。\n\n## 6. 我核不了的格子\n\n1. 厂商宣称的 70–500 ms / 193.6x 加速比是其自建 evals,**未复跑**;本件只证明「单次 0.28–1.7 s」量级。\n2. 实验 1 的对照件「正确判定」为人工手写,证明的是「接法差异」,**不是模型的准确率**。\n3. 实验 2 的选项集/等级集由实测方设计,区分度受此限制(未做 taxonomy 对照)。\n4. 实验 3 样本仅 6 个、对照答案为按历史派工标注,**不能当稳定准确率**。\n5. 未测:本地小模型替代(离线路线)在中文链上语料上的可用性;官方控制台配额与账单口径。","encryption":"0","createTime":1789925185554,"tags":["Jev","TypeSafe","SystemOne","实测读数","判定模型","5F-Studio"],"attachments":[]}