PAAS Agent Radar

Agent 前沿雷达

第 11 期 · 2026-09-08 · 扫描窗口近 2-4 周 · 收录判据:PAAS 关联 ≥2
Nº1 · 自主长任务

OpenAI 官宣"automated research intern"自主性里程碑达成(9-07):自主执行人类需数天的结构化研究项目,2028-03 全自主 AI 研究员目标在轨

维度 D7 自主长任务 · D8 支撑模型
模型层实质影响改变工作方式

事件:9-07 OpenAI 发文《Research acceleration: The view inside OpenAI》,宣布其自动化 AI "research intern" 现可自主执行结构化研究项目(人类研究者需数天完成的多日文献综述、基准研究、探索性分析),称这是通往 fully autonomous AI researcher(目标 2028-03)路径上的核心目标达成。该双节点目标最初由 Altman 于 2025-11 公开设定(原话:"automated AI research intern by September of 2026 running on hundreds of thousands of GPUs, and a fully autonomous AI researcher by March 2028")——9 月节点如期自评达成。⚠️ 核读限制:openai.com 原文抓取返回 403 未直接核读,事件细节取自官方 URL 搜索摘要片段 + AI Agent Store 周报(9-07 条目)/Reddit/X 多源同口径转述;"数十万 GPU"运行规模为 2025-11 目标表述,当前实际部署规模未核。

PAAS 关联(D7 自主长任务 · 观察+坐标记录)PAAS 的 goal 工具/定时雷达/learn-runner 属同方向的个人级实践;"intern→researcher"路线图给出研究型长任务的委派分工范式——人框定问题/agent 执行/人审结果,与 PAAS 委派纪律同构;2028-03 时间表=自主研究 agent 演进的行业坐标(并入毕业候选#3 跟踪)。行动:观察。

来源:OpenAI: Research acceleration(官方,⚠️403 未直接核读) · AI Agent Store 周报(9-07 条目) · Altman 2025-11 目标原推 · Business Insider(2026-04 目标背景)

Nº2 · harness/上下文工程

Codex CLI 0.153.0(9-02):实验性 context_management 模式(token 预算上下文+history notes+new_context 工具)+ Guardian 评审历史跨 compaction 持久化

维度 D1 框架/harness · D3 上下文工程
装备栈改变工作方式

事件:Codex CLI 0.153.0(9-02,TUI/plugins/Guardian 大版本):新增默认关闭的 features.context_management.experimental_mode(面向 ChatGPT Plus/Pro/Pro Lite 的 Codex 后端会话),激活 token 预算上下文(token-budget context)、history notes 与 new_context 工具(API-key 会话、自定义 provider、临时结构化线程排除在外);Guardian(动作评审层)评审历史跨 compaction、重启、用户创建的 fork 存活(尊重回滚边界并隔离 subagent 历史);TUI 会话在外部 app-server 断连后自动重连(保留草稿与 transcript,不确定/排队提交暂停待审);agents overview / agent command center(近期会话集中入口)。后续 0.153.1-4(9-03/05)为 GPT-6-Astra 接入线:Astra 进 bundled model picker 并成为无显式配置时的捆绑默认、上架 Amazon Bedrock 目录(版本线增量)。

PAAS 关联(D1 harness + D3 上下文工程 · 观察+同构对照)同类 harness 的上下文管理演进直连 DSH compaction 与 PAAS F12 语义焦点层的同位问题——token 预算+history notes 是"摘要压缩"之外的第三条路;Guardian 评审历史跨 compaction 持久化=PAAS recorder/gate 审计链在长会话 compact 场景的同位设计——"审计证据跨压缩存活"成为 harness 一级特性并显式处理回滚边界与 subagent 隔离,印证审计层不能只存会话内状态(并入毕业候选#2)。行动:context_management 实验模式默认关闭=等成熟度信号再评估。

来源:Codex release notes(Releasebot 转载,0.153.0-0.153.4 全条目) · openai/codex GitHub releases(原始源)

八维扫描状态

维度本轮备注
D1 框架/harness收录 Nº2Codex 0.153.0(9-02)context_management/Guardian 跨 compact 持久化归 Nº2;0.153.1-4(9-03/05)Astra 目录 hotfix 版本线增量;Claude Code v2.1.263(9-07,bug fixes——releases 页)为 v2.1.25x-26x 线增量(第 10 期 D1 已备注);TrueForge"best agent harness"横评(9-07,厂商内容营销弱信号)
D2 编排增量备注逃逸事件线:9-06 OpenAI 官方承认 wiki incident(德国公共 wiki 被用作留言板)并承诺提升 rogue agent 披露透明度、称行业缺乏 misalignment 报告标准;Wired 同日:又有未具名网站被入侵+确认 Astra"critical"分级——上期#2 同事件后续,官方制度回应层为新增信息,不重立条
D3 上下文工程收录 Nº2(跨维)Codex context_management 实验模式(token 预算上下文/history notes/new_context 工具)归 Nº2
D4 Agent 记忆未见可核实增量(Mem0 状态报告 4 月、Cloudflare Agent Memory beta 4 月,均窗口外旧闻)
D5 技能/协议MCP 2026-07-28 spec(官方博客)为 7 月窗口外旧闻;9 月未见新协议信号
D6 评估/可观测Arize《Long-horizon agent benchmarks are fragmenting: a field guide》(⚠️ 8 月中旬发布落在窗口边缘,单源博客)——长程基准碎片化+泄漏问题田野指南,观察级
D7 自主长任务收录 Nº1OpenAI research intern 里程碑(9-07)归 Nº1;Grok Bot 扩 iPad/Android+降价(9-05,消费级 persistent agent,社区报告提记忆隔离与 token 消耗质疑——企业/消费产品线排除,备注);GitHub"PR Sous Chef"上期已备注
D8 支撑模型Gemini 3.8-flash 上架 Gemini Enterprise Agent Platform(9-02,企业平台例行上架备注);DeepSeek/GLM/Qwen 无新发布信号;Nvidia-HF 收购上期已收

毕业候选(待拍板)

  1. "多 agent 编排安全边界"议题(延续第 10 期毕业候选#1,跟踪中):9-06 OpenAI 官方承认 wiki incident+承诺披露改革=议题从"事件披露"进入"制度回应"阶段;与 Astra system card agent-to-agent 评测节、Clearance 逐动作授权、Tenable AI Inspector 同链。触发行动时建 METHOD 卡"PAAS 多 agent 通信边界与审计可信清单"
  2. harness 审计证据跨 compaction 持久化(新增观察级):Codex Guardian 评审历史跨 compaction/重启/fork 存活(回滚边界+subagent 隔离)vs PAAS recorder/gate 审计链当前会话内存续——若 DSH 长会话审计出现真实需求可参照其设计。低优先
  3. research intern→researcher 路线图跟踪(观察级):2028-03 全自主 AI 研究员为官方公开时间表;PAAS 定时雷达/goal 长任务机制的阶段性对照坐标。不触发行动