Tiger3807861189 / DeepSeek-V4-J-Space-Capability-Realization-Report

已收录

DeepSeek V4 × J-Space capability realization report — benchmark evidence that J-Space reduces capability-realization loss on DeepSeek V4 (Flash/Pro).

main技能 查看源代码

安装

npx -y @deepseek-ai/dsh plugin --profile web add github:Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report

此安装命令根据 GitHub 仓库地址生成,是未经验证的安装起点。

README

维护者编写的文档快照。

在 GitHub 查看 ↗
提交版本 3d17ce1同步于 2026年8月18日

DeepSeek V4 × J-Space:Benchmark 与工程观察记录

© 2026 Tiger3807861189. This work is licensed under the Creative Commons Attribution-NoDerivatives 4.0 International License (CC BY-ND 4.0).

© 2026 Tiger3807861189. 本记录采用 知识共享-署名-禁止演绎 4.0 国际许可协议(CC BY-ND 4.0)授权。

页面范围:本页记录外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。

J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址:https://github.com/Tiger3807861189/J-Space-Cognition-Suite-V3.6

1. 外部工程观察

1.1 Anchored Standard:首轮接口锚定

dsh-anchored-standard 关注 DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。

该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了“轨迹被锚定”和“任务能力已经稳定提升”:当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本页只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。

1.2 Routing Suite:任务感知的入口选择

dsh-routing-suite 使用首轮任务分类、persona 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。

该项目后来对早期“官方刻意设计双吸引子”“自路由绝对不可能”等强归因作出了公开勘误:实测数据、探针和工程实现继续保留,底层因果解释不再作为已证结论。本页据此只引用可观察现象。其资料中的 mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。

2. 思维链二极管

2.1 操作性定义

本页所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一:

  • 短思维直觉:较快形成判断并进入行动,推理块较短;
  • 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。

两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。

这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We needLet me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。

2.2 形成原因:极简接口过拟合假说

J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。

这里的“过拟合”是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持“接口条件与轨迹变化相关”,但不足以从外部还原完整训练机制。

2.3 两侧的结构性弊端

会话形态容易出现的结构性问题
短思维直觉过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成
长思维推理分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束

因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。

3. 三套方案的浅层关系

方案主要作用位置与二极管问题的关系
Anchored Standard首次模型请求的接口条件恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹
Routing Suite新会话开始前的任务分类与模式选择根据任务选择较适合的稳定行为带,并回避不稳定过渡区域
J-Space会话进入轨迹后的完整任务生命周期不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端

三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。

3.1 J-Space 对两侧弊端的浅层处理

当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。

当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。

对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。

4. Benchmark 记录

4.1 评测上下文

J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。

结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。

表格汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好; 表示没有报告结果。

4.2 分数记录

BenchmarkV4-Flash-0731V4-Flash-0731 + J-SpaceV4-Pro-0813V4-Pro-0813 + J-SpaceGLM-5.3Kimi-K3Opus-4.8Fable 5(w/ fallback)
HLE(无工具)37.845.542.748.043.549.853.3
HLE(有工具)51.560.660.067.762.556.057.963.0
Terminal Bench 2.182.787.187.990.188.288.385.088.0
NL2Repo54.270.261.573.458.058.069.7
CyberGym76.781.783.386.884.580.078.383.1
DeepSWE54.467.462.772.066.967.558.070.0
Toolathlon-Verified70.377.774.179.573.076.576.277.9
Agents' Last Exam25.230.125.730.328.527.625.723.8
AutomationBench(Public)25.131.731.838.248.230.827.229.1

4.3 Benchmark 与二极管弊端的定性对应

Benchmark 类型可能暴露的会话级问题J-Space 的浅层对应
HLE(无工具)短侧可能过早下结论;长侧可能在知识边界之外无效延伸必要桥接、置信控制与独立复核
HLE(有工具)、CyberGym短侧可能少用或少整合证据;长侧可能迟迟不进入工具取证Empirics、工具接缝与验证覆盖
Terminal Bench短侧可能快速执行但遗漏核验;长侧可能分析过度、行动延迟明确 Next、诊断重试与 checkpoint
NL2Repo、DeepSWE短侧可能丢失跨文件约束;长侧可能反复重建计划共享广播、Loop 账本与持续验证
Toolathlon-Verified短侧可能跳过编排检查;长侧可能困在工具选择和重新规划共享状态、接缝审计与 coverage
Agents' Last Exam、AutomationBench异构任务或长间隔会放大固定路径与任务阶段的错配选择性 pass、持久状态与恢复

上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。

4.4 数据来源

5. 适用边界

  • 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。
  • 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。
  • Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。
  • 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。
  • J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。

引用

工程使用请引用 J-Space Cognition Suite V3.6:https://doi.org/10.5281/zenodo.21977271

相关学术分析请以未来发布的论文版本为准。

仓库信息

许可证
NOASSERTION
最新发布
v1.0
最后更新
2026年8月18日 15:50

谨慎安装

请检查源代码、权限、生命周期脚本、依赖与网络访问;不受信任的插件应先在隔离环境中测试。