PAAS Agent Radar

Agent 前沿雷达

第 7 期 · 2026-08-29 · 扫描窗口近 2-4 周 · 收录判据:PAAS 关联 ≥2
Nº1 · harness 范式

Harness Continual Learning:持续学习从模型参数走向 harness 层——"守卫演化"把关机制

维度 D1 框架/harness · D4 记忆 · D5 治理
装备栈可落地零件改变工作方式

事件:arXiv 2608.19013(机器之心 8-28 报道)。HCL 新范式:持续学习状态从模型参数转移到 harness(prompts/memories/tools/skills/routing rules),模型冻结而 harness 进化;首次定义 harness-level forgetting(harness 更新破坏早期行为,模型未变也发生)。四组件:Task Interface / Experience Memory / Capability Map / Adaptive Router;核心机制 guarded harness evolution——Optimizer 从执行后反馈生成候选,Evaluator 提交前三检查(当前改进/历史保留/有效性),更新生成与状态提交分离。文本推理/多模态感知/开放世界交互实验相对基线增益 >10%,stability-plasticity 权衡可显式调节。

PAAS 关联(D1 harness + D4 记忆 + D5 治理)PAAS 正是"模型冻结、harness 进化"的现实实例——宪法/gate/插件/KB/TSS/compaction-shadow 全在冻结模型外。guarded evolution 的"提议-评估-提交分离"与 oracle 双点审核/回滚机制同构,可提炼 METHOD;harness-level forgetting 为宪法④(不可逆操作先确认)提供理论名词;与第 6 期 Compaction Cliff 结论互证(harness 状态更新会破坏既有行为)。行动:候选 METHOD 卡 + harness-level forgetting 审计。

来源:arXiv 2608.19013 · 机器之心 8-28

Nº2 · 模型

GLM-5.3-Flash 上线:原生多模态+混合架构,AA 57 分持平 Opus 4.8,定价仅 GLM-5.3 的 1/10

维度 D8 支撑模型 · D1 装备栈
装备栈模型层实质影响改变工作方式

事件:智谱 8-27 发布(商汤大装置国产算力)GLM-5 系列首个原生多模态模型:320B 总参/18B 激活混合架构(稀疏+线性注意力,注意力计算 -3.01x、KV 缓存 -4.44x vs GLM-5.3);上下文 1M/输出 128K;AA 综合智能指数 57 分超 GLM-5.2、持平 Claude Opus 4.8,Z.ai Code Bench 编程接近 Opus 4.8;定价约 GLM-5.3 的 1/10(限时 1/20、Opus 4.8 的 1/40);视觉融入 Coding 循环;GLM Coding Plan 额度翻 3 倍、非高峰时段耗标准积分 50%。"牛来/Ox Alpha"已被智谱认领即此模型(infoq/pandaily 交叉证实)。

PAAS 关联(D8 模型 + D1 装备栈)PAAS ZCode 工具 agent 现行模型即 GLM-5.3-FLASH——Flash 档换代直接命中 settings 型号配置;AA 57 分 × 1/10~1/40 价格=Flash 档进入前沿区间,委派成本数量级变化;非高峰 50% 与 DeepSeek off-peak 半价同向,峰谷计费成国产 API 主流,无人值守调度可统一参照。行动:评估 Flash 档换装量化 + 1M 上下文对长会话/影子回载的影响。

来源:智谱官方模型文档 · 科技日报 · InfoQ 实测 · Pandaily

Nº3 · 长程自主

Qwen3.8-Max 2.4T 开源旗舰 + 16 天长程自主编程实证(空文件夹→自动进化代码工厂)

维度 D8 支撑模型 · D7 自主长任务
装备栈改变工作方式模型层实质影响

事件:阿里 8 月初发布 Qwen3.8-Max(2.4T MoE/A95B 激活,原生 256K 上下文,开源免费权重),定位复杂长程任务+自动编程旗舰;8 月下旬长程实证集中落地:apidog 实测 16 天自主运行(Claude Code 架构下空文件夹连续运行,自主搭出"可进化的代码工厂");品玩实测"从会写代码走向能交付任务";zhiding 12 个真实任务小考(8-19)。去重:Qwen3.8-Max 编码旗舰发布本身从未被收录(此前 Qwen 仅作为 nanoGPT 实验模型列举/计算机使用模型出现),本条收发布+长程实证增量。

PAAS 关联(D8 模型 + D7 自主长任务 · 观察+跟踪)开源 2.4T 权重=DSH settings 自托管/低成本候选线,委派预算敏感场景参照;16 天级长程自主从实验走向真实项目交付实证——对 goal 循环/无人值守长任务的时长预期与可靠性设计有参照;"空文件夹进化出代码工厂"=harness 级能力积累,与 Nº1 HCL 互证。PAAS 无自托管推理线,列为观察+长任务案例库。

来源:Qwen 官方博客 · apidog 16 天实测 · 品玩实测 · zhiding 小考

八维扫描状态

维度本轮备注
D1 框架/harness收录 Nº1HCL 论文(harness 层持续学习范式);@deepseek-ai/dsh 仍 0.1.1-rc.2(实测,裸包 dsh=2016 node-dsh 老包排除);deepseek-harness 保留包登记 dsh-tui 开发中(弱);Claude Code v2.1.246 小更新无机制增量
D2 编排无主线zenodo "Deterministic Orchestration of a Fleet of LLM Agents"(8-12)弱信号,被 Nº1 守卫演化思想覆盖
D3 上下文工程旧线增量Rate–Distortion 记忆压缩(2607.08032)+ Structured Context Eviction(2606.11213)在第 6 期 Compaction Cliff 线内,无独立新机制
D4 Agent 记忆归入 Nº1HCL Experience Memory 组件;Agent Memory Distillation(2608.07169,教师→小模型蒸馏记忆)同行弱信号无直接行动点
D5 技能/协议无新增MCP SDK v2 第 6 期已收;Agent Plugins 1.0(forkast 重发)=第 2 期旧闻重推跳过
D6 评估/可观测Arize AX "AI factory for self-improving agents"(8 月,商业产品判据<2 不收录,recorder 路线参照);Agent's Last Exam / Toolathlon 8 月榜单数据点
D7 自主长任务收录 Nº3Qwen3.8 16 天自主编程实证(真实项目交付级);LocalLSTC(2608.25777 GUI 长短期控制)弱信号
D8 支撑模型收录 Nº2 + Nº3GLM-5.3-Flash(8-27,Opus 4.8 同级 1/10 价);Qwen3.8-Max 2.4T 开源+长程实证;Tencent HY4 Preview vs Qwen3.8-Max 弱

毕业候选(待拍板)

  1. HCL 守卫演化原则(METHOD 候选):"变更生成与提交分离 + 提交前三检查"提炼为装备治理原则,对照 oracle 双点审核与宪法④;先做一次 harness-level forgetting 审计(历次配置/插件变更是否破坏过早前行为,素材=近失事记录)
  2. GLM-5.3-Flash 换装评估(DEC 候选):ZCode 工具 agent 档 GLM-5.2→5.3-Flash 量化——AA 57 分持平 Opus 4.8 × 1/10~1/20 价格 × 1M 上下文,对照现行模型栈与 DeepSeek 谷价线
  3. Qwen3.8-Max 开源线跟踪(观察级):开源 2.4T 纳入"开源 vs API"成本分叉参照;16 天长程实证纳入长任务可靠性设计案例库