安装
npx -y @deepseek-ai/dsh plugin --profile web add github:Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report此安装命令根据 GitHub 仓库地址生成,是未经验证的安装起点。
README
维护者编写的文档快照。
DeepSeek V4 × J-Space:Benchmark 与工程观察记录
© 2026 Tiger3807861189. This work is licensed under the Creative Commons Attribution-NoDerivatives 4.0 International License (CC BY-ND 4.0).
© 2026 Tiger3807861189. 本记录采用 知识共享-署名-禁止演绎 4.0 国际许可协议(CC BY-ND 4.0)授权。
页面范围:本页记录外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。
J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址:https://github.com/Tiger3807861189/J-Space-Cognition-Suite-V3.6
1. 外部工程观察
1.1 Anchored Standard:首轮接口锚定
dsh-anchored-standard 关注 DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。
该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了“轨迹被锚定”和“任务能力已经稳定提升”:当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本页只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。
1.2 Routing Suite:任务感知的入口选择
dsh-routing-suite 使用首轮任务分类、persona 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。
该项目后来对早期“官方刻意设计双吸引子”“自路由绝对不可能”等强归因作出了公开勘误:实测数据、探针和工程实现继续保留,底层因果解释不再作为已证结论。本页据此只引用可观察现象。其资料中的 mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。
2. 思维链二极管
2.1 操作性定义
本页所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一:
- 短思维直觉:较快形成判断并进入行动,推理块较短;
- 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。
两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。
这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We need、Let me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。
2.2 形成原因:极简接口过拟合假说
J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。
这里的“过拟合”是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持“接口条件与轨迹变化相关”,但不足以从外部还原完整训练机制。
2.3 两侧的结构性弊端
| 会话形态 | 容易出现的结构性问题 |
|---|---|
| 短思维直觉 | 过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成 |
| 长思维推理 | 分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束 |
因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。
3. 三套方案的浅层关系
| 方案 | 主要作用位置 | 与二极管问题的关系 |
|---|---|---|
| Anchored Standard | 首次模型请求的接口条件 | 恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹 |
| Routing Suite | 新会话开始前的任务分类与模式选择 | 根据任务选择较适合的稳定行为带,并回避不稳定过渡区域 |
| J-Space | 会话进入轨迹后的完整任务生命周期 | 不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端 |
三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。
3.1 J-Space 对两侧弊端的浅层处理
当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。
当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。
对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。
4. Benchmark 记录
4.1 评测上下文
J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。
结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。
表格汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好;— 表示没有报告结果。
4.2 分数记录
| Benchmark | V4-Flash-0731 | V4-Flash-0731 + J-Space | V4-Pro-0813 | V4-Pro-0813 + J-Space | GLM-5.3 | Kimi-K3 | Opus-4.8 | Fable 5(w/ fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE(无工具) | 37.8 | 45.5 | 42.7 | 48.0 | — | 43.5 | 49.8 | 53.3 |
| HLE(有工具) | 51.5 | 60.6 | 60.0 | 67.7 | 62.5 | 56.0 | 57.9 | 63.0 |
| Terminal Bench 2.1 | 82.7 | 87.1 | 87.9 | 90.1 | 88.2 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 54.2 | 70.2 | 61.5 | 73.4 | 58.0 | 58.0 | 69.7 | — |
| CyberGym | 76.7 | 81.7 | 83.3 | 86.8 | 84.5 | 80.0 | 78.3 | 83.1 |
| DeepSWE | 54.4 | 67.4 | 62.7 | 72.0 | 66.9 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 70.3 | 77.7 | 74.1 | 79.5 | 73.0 | 76.5 | 76.2 | 77.9 |
| Agents' Last Exam | 25.2 | 30.1 | 25.7 | 30.3 | 28.5 | 27.6 | 25.7 | 23.8 |
| AutomationBench(Public) | 25.1 | 31.7 | 31.8 | 38.2 | 48.2 | 30.8 | 27.2 | 29.1 |
4.3 Benchmark 与二极管弊端的定性对应
| Benchmark 类型 | 可能暴露的会话级问题 | J-Space 的浅层对应 |
|---|---|---|
| HLE(无工具) | 短侧可能过早下结论;长侧可能在知识边界之外无效延伸 | 必要桥接、置信控制与独立复核 |
| HLE(有工具)、CyberGym | 短侧可能少用或少整合证据;长侧可能迟迟不进入工具取证 | Empirics、工具接缝与验证覆盖 |
| Terminal Bench | 短侧可能快速执行但遗漏核验;长侧可能分析过度、行动延迟 | 明确 Next、诊断重试与 checkpoint |
| NL2Repo、DeepSWE | 短侧可能丢失跨文件约束;长侧可能反复重建计划 | 共享广播、Loop 账本与持续验证 |
| Toolathlon-Verified | 短侧可能跳过编排检查;长侧可能困在工具选择和重新规划 | 共享状态、接缝审计与 coverage |
| Agents' Last Exam、AutomationBench | 异构任务或长间隔会放大固定路径与任务阶段的错配 | 选择性 pass、持久状态与恢复 |
上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。
4.4 数据来源
- DeepSeek V4-Flash-0731 模型卡
- 智谱 AI 的 GLM-5.3 发布评测记录
- Kimi-K3 模型卡
- Claude Fable 5 与 Claude Mythos 5 System Card
- J-Space Cognition Suite V3.6 README
5. 适用边界
- 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。
- 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。
- Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。
- 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。
- J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。
引用
工程使用请引用 J-Space Cognition Suite V3.6:https://doi.org/10.5281/zenodo.21977271。
相关学术分析请以未来发布的论文版本为准。
仓库信息
- 许可证
- NOASSERTION
- 最新发布
- v1.0
- 最后更新
- 2026年8月18日 15:50
谨慎安装
请检查源代码、权限、生命周期脚本、依赖与网络访问;不受信任的插件应先在隔离环境中测试。