1. OpenAI 宣布达成「自动化研究实习生」里程碑,推进 2028 年 3 月造出自动化 AI 研究员
事件内容:OpenAI 9 月 6 日发布内部研究加速报告,称已达成去年秋天设定的目标——9 月拥有「自动化研究实习生」(可在人类指导下完成耗时数天的明确研究任务)。披露的内部数据显示:截至 8 月中旬,其研究组织每投入 1 个人工工作日,就使用 3.1 个 agent 工作日的运行时长(衡量运行时间而非等效生产力);并计划 2028 年 3 月前造出全自动化的 AI 研究员。
值得关注的原因:这是前沿实验室第一次用内部运营数据量化「agent 对知识工作的渗透程度」。对电商与数据分析从业者最直接的启示是:可明确拆解、有明确验收标准的研究型/分析型任务,正在快速被 agent 接管;未来团队的竞争力不在于「谁来跑分析」,而在于「谁来定义问题、验收结果、做最终判断」。递归自我改进(RSI)如果被验证可行,将重塑整个知识工作的人力结构。
2. GPT-6 Astra computer use 爆火:自主操控 Blender / Houdini / Unity 等专业软件
事件内容:GPT-6 Astra 上线后大量用户用它自主操控 Blender、Houdini、Unity、Aseprite 等专业软件,做出游戏 Demo、3D 复刻作品。数字生命卡兹克实测:Computer Use 花约 4 小时搭出天坛祈年殿(耗掉 200 美元 Pro 会员近半额度),MCP 方式更快可完成摩托车建模与组装动画;在「旧金山艺术宫」复刻案例中,Astra 自己搜索几百张参考图、翻到美国国会图书馆老扫描文件找柱子尺寸,多数工作在夜间自主完成。
值得关注的原因:这是 AI 从「对话/生成」走向「直接操作桌面软件」的关键拐点,意味着大量依赖专业工具的设计、建模、视频剪辑工作可以被自然语言驱动。对电商运营者而言,商品 3D 展示、短视频素材、详情页视觉的产出门槛将大幅下降;对数据分析者,未来「让 agent 自己打开 BI 工具、跑数、出图」会像今天让 agent 写代码一样自然。代价是成本与可控性——卡兹克提醒「执行能力贬值、判断力断层」才是真问题。
3. Anthropic 据报道签约高达 5170 亿美元算力协议,锁定至少 14.8 GW
事件内容:据 The Information 报道,Anthropic 在十一个月内外签署了价值高达 5170 亿美元的算力合同,自 2025 年 10 月以来锁定至少 14.8 GW 算力,并计划自建数据中心。此前 Anthropic CEO Dario Amodei 曾公开警告竞争对手在算力扩张上的「鲁莽风险」。
值得关注的原因:大模型竞争正进入「算力即护城河」的军备竞赛阶段。5170 亿美元量级的长期算力锁单,意味着头部实验室把未来数年的供给先占为己有,中小团队与开源项目的可用算力成本将被间接推高。对依赖云上大模型 API 做电商/数据分析的企业,需关注供给集中带来的成本与可用性风险,私有化/混合部署的预案会越来越重要。
4. OpenAI 发布《An Alien Mind》长文:坦诚 CoT 监控能力随模型提升而减弱
事件内容:OpenAI 9 月 6 日发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目(确认推理模型可扩展训练的起点),系统阐述「目标对齐」与「价值对齐」的区分。文章指出:链式思维(CoT)监控的效果正随着模型能力提升而逐步减弱;GPT-6 Astra 在对齐上显著优于 GPT-5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),并呼吁自愿放缓扩展、建立第三方安全门槛与加强国际协调。
值得关注的原因:这是头部实验室罕见地公开「我们能监控模型的手段正在失效」这一事实。对企业落地 AI Agent 的启示很务实:当模型越来越强、内部推理越来越不透明,「靠人工抽查输出」的治理方式会失效,必须把安全与合规前置到工作流设计(权限、审计、人工兜底节点),而非事后审查。
5. Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩大幅变化
事件内容:据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据——例如 Astra 的幻觉率曾从 4.2% 降至 2% 后又改回。报道指向模型发布时基准数据的透明度问题。
值得关注的原因:在「模型月月发、榜单天天变」的环境下,这条新闻是一记提醒:厂商公布的基准数字可能动态调整,不宜作为选型唯一依据。对用 AI 做电商运营、数据分析的团队,落地前务必用自己的真实业务数据做小样本验证,把「公开榜单」当参考、把「自家场景实测」当决策依据——这也是避免被营销节奏带偏的基本功。
今日核心洞察
- Agent 正从「写代码」走向「做研究 / 操软件」:OpenAI 自动化研究实习生(3.1 倍运行时)、GPT-6 Astra 操控专业软件,标志可明确验收的知识工作被系统性接管,人的价值上移到「定义问题 + 验收判断」。
- 算力成为新的核心壁垒:Anthropic 5170 亿美元、14.8GW 的长期锁单,提示大模型供给集中化,企业需为 API 成本与可用性做预案(私有化/混合部署)。
- 可解释性在退坡,治理要前置:CoT 监控随模型增强而减弱,说明「事后抽查输出」的安全方式会失效,合规必须嵌入工作流(权限/审计/人工兜底)。
- 别盲信厂商基准:GPT-6 Astra 幻觉率数据多次调整,选型决策一定要用自身业务数据实测,而非追榜单。
- 效率革命的代价是成本与判断:Computer Use 4 小时耗尽近半 Pro 额度,说明「AI 直接干活」已能跑通,但成本、可控性与「判断力断层」仍是落地必须直面的三件事。
