PAAS Agent Radar

Agent 前沿雷达

第 14 期 · 2026-09-14 · 扫描窗口近 2-4 周 · 收录判据:PAAS 关联 ≥2
Nº1 · 框架/harness

OpenAI Agents API 公测(9-10/9-11):Codex 同款托管 harness 开放为云 API——orchestration/compaction/sub-agent/crash recovery 全套成为基础设施

维度 D1 harness · D2 编排 · D3 上下文工程
装备栈改变工作方式可落地零件(概念)

事件:OpenAI 宣布 Agents API 公测:把驱动 Codex 的同一套 harness/基础设施以托管 API 开放;四构件 = Agent(model/instructions/tools/MCP servers)+ 可选 Environment 沙箱(OpenAI 托管或 Vercel/DigitalOcean 等约 9 家合作方)+ 持久 Session + events/items 流;平台侧托管 session 编排、跨长任务 context compactionsub-agent 协调、lazy tool loading、crash recovery;计费无平台费,只按 model tokens + 工具用量 + 沙箱计算。同批 ChatGPT Work agent 基础设施对外开放(官方工程师称按需拉起 agent <1 分钟)。日期口径:三家独立二级源一致定 9-10(官方页未逐字核日期 ⚠️)。

PAAS 关联(D1 harness + D2 编排 + D3 上下文 · 对照观察,不切换)托管 agent harness 全套 = DSH 同类机制获得直接云端对照物:sub-agent 协调↔DSH subagent、compaction↔PR5/compaction-basic、crash recovery↔goal 续行/jobs、durable session↔会话持久化。"自建 harness vs 租用托管 agent 运行时"边界正式移动——PAAS 长任务链路的编排/压缩/恢复环节存在外包选项。行动:与 DSH subagent/workflow/goal/jobs 四机制逐项对照沉淀一页映射;评估"托管运行时"作为云端备份执行面的可行性(触发条件=跨机器委派或本机执行面单点风险上升)。

来源:OpenAI 官方发布页 · knowflowhub(9-10) · explainx(四构件+沙箱细节) · AI Agent Store 周报

Nº2 · 框架/harness × 评估

Claude Code 2.1.269/270(9-11/9-12):claude plugin eval 插件评测入列第一方 + Workflow 并发上限可调 256 + /goal 静默卡死修复

维度 D1 harness · D6 评估 · D7 自主长任务
装备栈改变工作方式

事件:2.1.269(9-11)大版本:新增 claude plugin eval(对插件跑 eval 套件,得分化可复现结果 + JSON/HTML 报告——插件生命周期首次内置第一方评测);CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1-256)(Workflow 工具 per-run 并发 agent 上限可调,面向 inference-bound fan-out);/output-style 切换、Bash 文件改动 diff 附随结果、OTEL 指标带 vcs.* 仓库标签。修复批暴露三条高相关失败模式(官方文档化):/goal 在 API 错误/断网/token 限额后静默卡死(现改为指数退避重试、或暂停并说明原因);auto-compaction 无完整早期交换可摘要时会话永久卡 "Prompt is too long"(Agent SDK 大 prompt 场景);云端 scheduled routine 用 subagent 时偶发误判提前完成(跳过真实失败的重试或重复拉起)。另有 compaction 后告知模型的 git status 改为当前状态。2.1.270(9-12)修 2.1.269 回归(长会话中只读 git 命令误要权限)。VSCode 侧新增 agent map 与 Hooks 管理对话框。

PAAS 关联(D1 harness + D6 评估 + D7 长任务 · 对照清单)同类 harness 三机制正面命中 PAAS 对照面:goal 续行健壮性=DSH goal 工具、workflow 并发上限=DSH workflow fan-out、plugin eval=插件验证方法论参照。"goal 静默卡死/routine 误判完成"被官方确认为真实失败模式——PAAS 定时无人值守链(radar/news/weekly/batch 启动器)同款风险清单。行动:①plugin eval 模式记为 PAAS 插件 gate 自测候选参照 ②DSH goal 机制对照"退避重试+暂停说明"行为面 ③检查 PAAS 定时会话是否存在"误判完成"风险面(如 runner 把 agent 非零退出当成功)。

来源:releasebot:Claude Code 2.1.269/270(9-11/9-12,转载官方 CHANGELOG) · GitHub anthropics/claude-code releases

八维扫描状态

维度本轮备注
D1 框架/harness收录 Nº1+Nº2Agents API 公测(9-10/9-11)归 Nº1;Claude Code 2.1.269/270(9-11/9-12)归 Nº2;Codex CLI 0.155.0-alpha.3.1-3.10(9-11,GitHub releases 全部为构建 bot 自动 alpha、无 release notes)= 0.154.0 后进入 0.155 alpha 迭代号,无实质机制增量
D2 编排备注Agents API sub-agent 协调跨维归 Nº1;Salesforce Multi-Agent Orchestration GA + AI Control Plane(9-11/12:agent 注册/身份/策略/生命周期/评估/成本统一管控面——企业产品线排除,"control plane"概念一句归安全链观察);Orkes/LangGraph 线无新
D3 上下文工程备注Agents API 内置跨长任务 compaction 跨维归 Nº1;Claude Code 2.1.269 两条 compaction 修复(Prompt too long 卡死、compaction 后 git status)跨维归 Nº2;louisbouchard 综述(8-18)维持已注
D4 Agent 记忆Mem0/Letta/Claude 记忆线窗口内无新
D5 技能/协议增量备注安全治理链第四波Anthropic 官方威胁情报报告《Detecting and countering misuse of AI》(9 月,2025-12~2026-08 七类危害案例)+ Google GTIG 威胁追踪"攻击者从单 prompt 转向 agentic 链"(9-09,周报转述)→ 毕业候选#1 增量;MCP/skills 规范无新(2026-07-28 spec 旧闻已注)
D6 评估/可观测备注Claude Code claude plugin eval 跨维归 Nº2;Okareo REPS 29 维 agent 评分框架(厂商稿、新闻页未见日期、单源)→ ⚠️待核实不收;Splunk/Harness 调查线上期已注无新
D7 自主长任务备注Salesforce Agentforce "long-horizon runtime"(9-11,Hunter agent 按周尺度追目标——企业产品线排除一句,"weeks-scale goal"口径与 research intern/2028 路线同链记录);Amodei "agent swarm 6-12 个月接管整个互联网"减速呼吁(9-13)归安全链备注;Claude Code /goal 健壮性修复跨维归 Nº2;research intern 线无新节点
D8 支撑模型备注DeepSeek 线:9-14(今日)04:00 UTC 起 V4-Pro 全端点重路由至 V4.1-Flash 按 Flash 价计费生效(上期#1 预告节点落地),V4.1-Pro 未发布;社区在 V4.1-Flash 开放权重中逆向出约 204GB 独立 "engram" 组件(r/LocalLLaMA,⚠️社区解读未核实——官方模型卡只载 CED 架构);GPT-6 Astra(9-03)= 第 10 期#1 已收,Wikipedia 词条/系统卡再命中无新节点;GLM/Qwen 线无新(GLM-5.3-Flash 促销价 9-09 截止已注)

毕业候选(待拍板)

  1. "多 agent 编排安全边界"议题(延续第 10-13 期,跟踪中·第四波增量):防线产品化 → 监管执法化 → SOC 集成+采用缺口量化 → 官方威胁情报化+头部分子表态(Anthropic 官方威胁情报报告七类案例 / GTIG "agentic 链"威胁追踪 / Amodei 减速呼吁"Nvidia 黄仁勋'每家公司将运行数十万至百万常驻 agent'对冲表态)。触发行动条件不变(引入第三方 skill 市场/暴露面扩大/多 agent 通信跨机器)时建 METHOD 卡"PAAS 多 agent 通信边界与审计可信清单"
  2. 插件自带 eval 套件模式(新增,候选级):Claude Code claude plugin eval 把"插件+评分化可复现评测"绑定为第一方能力。触发条件:PAAS 插件数量增长(paas-rhythm 之外)或引入外部插件/技能市场时,参照建立 plugin eval 式 gate 自测(与 P-S4 gate 单测回归同构)
  3. 托管 agent 运行时对照表(新增,观察级):OpenAI Agents API 四构件 ↔ DSH 四机制(agent↔subagent、Environment↔沙箱、durable Session↔会话持久化、events↔recorder 流、crash recovery↔goal 续行)。触发条件:需要云端备份执行面、跨机器委派、或 DSH 执行面单点风险上升时,先落对照一页再评估
  4. harness 审计证据跨 compaction 持久化(延续第 11-13 期,观察级):本轮 Claude Code 2.1.269 修复批再证同题工程信号(compaction 后 git status、Prompt too long 卡死修复),低优先维持
  5. research intern→researcher 路线图跟踪(延续,观察级):本轮无新节点;2028-03 全自主 AI 研究员为官方公开时间表坐标。不触发行动
  6. DeepSeek 模型线滚动发布跟踪(延续上期#2,观察级):9-14 重路由已生效(预告节点落地),V4.1-Pro 待发;百炼托管底模跟进情况❓待观察;"engram"逆向解读若获官方文档化再升级