Nº1 · harness
DSH v0.1.0-rc.8 发布:多模态输入 + Claude Code/Codex 子代理 Profile Bundle,纯文本模型靠 OCR 工具链"看图"
维度 D1 框架/harness
装备栈改变工作方式模型层实质影响可落地零件
事件:2026-08-20 DeepSeek Harness 公测后首次重要更新(14 项):模型适配器可启用原生图片请求,/goal、/plan 支持图文混合输入,@菜单新增文件/会话引用;Claude Code 与 Codex 可作为 Profile Bundle 按需装入子代理体系(Codex 支持非交互权限模式+多命名实例);Windows PTY 加入持久 PowerShell 会话;纯文本模型可通过 OCR+颜色统计+像素扫描工具链兜底"看图";另有 web_search 并发、子代理 reportDelivery 及时唤醒父任务、SQLite/大会话分叉性能提升。ithome 报道同时剧透 V4 视觉版。
PAAS 关联(D5 治理 + D1 执行)DSH 是 PAAS 宿主,rc.8 直接改变运行环境。潜在行动:DSH 升级评估(当前宿主版本 vs rc.8)——Windows 持久 PowerShell 解决"每次命令新进程无状态"痛点,多模态输入与子代理 reportDelivery 为 PAAS 直接收益项。
来源:36kr/智东西 · pandaily · ithome · GitHub release
Nº2 · 编排
Prime Intellect nanoGPT 速通实验:Kimi K3+Harness 逼近 Opus 5,"科研能力=试错吞吐量"实证
维度 D2 多 agent 编排 · D7 自主长任务 · D8 支撑模型
装备栈改变工作方式模型层实质影响可落地零件
事件:Prime Intellect 把 18 个前沿模型(Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、GLM 5.2、DeepSeek V4 Pro、Qwen 3.8 等)放入断网沙箱做全自主 nanoGPT 优化实验(153 次,单次最长超 8 天,8×H200):从 3290 步 baseline 压缩训练步数。Kimi K3 搭配 Prime Agent Harness 跑出 2930 步,超 GPT-5.6 Sol,距 Opus 5 仅 10 步;Fable 5 最佳 2726 步(人类纪录 2600,已完成 82% 优化空间)。核心发现:无任何实验产生全新方法,差距来自试错吞吐量(换 seed 重测/噪声判断/自造工具);关键机制是持久 IPython 内核让 K3 自建工作流。便宜开源模型(监控/实现)+强模型(判断)的 Multi-Agent Harness 路线动摇"闭源 RSI 赢家通吃"剧本。
PAAS 关联(D2 编排 + D8 模型)委派成本分层实证:token 计费敏感的 PAAS 可参照"便宜模型干监控、强模型干判断";GLM 5.2/V4 Pro/Qwen 3.8 同场 agentic 数据=模型选型输入。
来源:量子位
Nº3 · 协议
Anthropic 坚持 CLAUDE.md 拒支持 AGENTS.md 标准超一年:跨 harness 规则可移植性摩擦持续
维度 D5 技能与工具协议
装备栈改变工作方式
事件:Claude Code 拒绝支持社区 AGENTS.md 标准(相关 issue 累计数千 upvotes)已超一年,Anthropic 坚持自家 CLAUDE.md 格式,迫使用户双文件维护;同期 2026 年曝出的供应链/RCE 漏洞凸显其"控制优先"立场。与上期 Agent Plugins 1.0.0(六巨头标准、Anthropic 缺席)互为印证:Anthropic 在插件格式与规则文件两条战线均走封闭路线。
PAAS 关联(D5 治理)PAAS/DSH 以 AGENTS.md 为规则载体(DSH 原生支持=跨 harness 优势位);PAAS opencode→ZCode→DSH 迁移史实际经历过规则双维护成本。仅观察:若未来引入 Claude Code 子代理(见 Nº1 Profile Bundle),需评估规则双写策略。
来源:WebProNews
八维扫描状态
| 维度 | 本轮 | 备注 |
| D1 框架/harness | 收录 Nº1 | DSH rc.8;Claude Code v2.1.235-237(上期 v2.1.234 后续小版本,无架构变化不单独收录) |
| D2 编排 | 收录 Nº2 | Prime Intellect Multi-Agent Harness 成本分层实证 |
| D3 上下文工程 | 无(窗口内) | LangChain deepagents"自主上下文压缩"(模型自触发 compaction)为 2026-03 旧文,与 PR5 同题仅备注 |
| D4 Agent 记忆 | 低 | arXiv 2608.04746(Scrub Jay 情景记忆)/2608.19652(演化状态追踪)理论向,与上期 MemOS 线同维度 |
| D5 技能/协议 | 收录 Nº3 | Agentic AI Foundation +57 成员(上期 Plugins 1.0.0 同线增量);CSA"MCP 单一文化风险"注记(观察) |
| D6 评估/可观测 | 低 | DSH×Litefuse 为上期已覆盖线无新增;"故意搞坏 agent 测 AI 审查员"实战文(弱) |
| D7 自主长任务 | 归入 Nº2 | 153 次全自主实验单次最长 8 天;Grok Bot 后台执行(PAAS 无此线);Gemini Spark computer use 泄漏(待核实) |
| D8 支撑模型 | 收录 Nº2 | 18 模型同场 agentic 数据;GLM-5.3/V4 Pro 上线千问平台/千问办公(渠道动态,观察) |
毕业候选(待拍板)
- DSH rc.8 升级评估(DEC 候选):对照当前宿主版本评估升级路径——Windows 持久 PowerShell/子代理 codex-claude Profile Bundle/多模态输入三项对 PAAS 的直接收益与回归风险(junction 自愈、插件兼容性需实测)
- 委派成本分层实验(METHOD 候选):借 Prime Intellect 实证,在 PAAS 委派中试"便宜模型监控/实现 + 强模型判断"分层,对照现行委派成本纪律量化节省
- 工具层视觉兜底模式(观察级):rc.8 的 OCR+像素分析给纯文本模型拼视觉——若 PAAS 引入图片任务且宿主模型无视觉能力,此为 fallback 设计参照