1. Google DeepMind 发布 Gemini 3.7 Flash:距上一代仅三周,价格直接腰斩
事件内容:8月13日,Google DeepMind 发布 Gemini 3.7 Flash,主打编程与智能体任务,距 3.6 Flash 发布仅隔三周。输入/输出价格分别为每百万 token 0.75 美元和 3.75 美元,为原 3.6 Flash 的一半。官方定位为"面向编程与智能体的最强工作模型"。
值得关注的原因:三周一次迭代、单价腰斩,这是 Flash 系列第二次在能力提升的同时降价。对个人和小团队最实际的影响是:批量数据处理类任务的模型成本已经低到可以随便用了——比如把几万条商品评论跑一遍情感分类、把散乱的运营日报批量结构化,过去要算 API 预算,现在基本可以忽略。做数据的同学应该趁这波价格重新算一遍自己的"AI 处理单条数据成本",很多之前判断"不划算"的自动化场景现在已经成立了。
2. OpenAI 发布 GPT-5.6 构建者指南:推理持久化让 ARC-AGI-3 得分从 13.3% 跳到 38.3%
事件内容:8月13日,OpenAI 发布 GPT-5.6 构建者指南。GPT-5.6 模型家族以更低成本实现前沿级智能体性能,新增推理持久化(保留推理)、原生多智能体编排、程序化工具调用三项 API 能力。具体数据:在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍;Luna 在 BrowseComp 上以 84.04% 追平 GPT-5.5 的 84.36%,但成本从 33.27 美元降至 1.33 美元(约 1/25)。
值得关注的原因:这条最值得细读。“同样分数,成本从 33 美元降到 1.33 美元"说明当前智能体的成本瓶颈不在模型定价,而在工程方式——同一个模型,会不会用"保留推理+压缩”,成本差 25 倍。这对做数据自动化的人是明确的信号:别急着换更贵的模型,先把上下文管理和推理复用做对。原生多智能体编排落到 API 层,也意味着"一个 Agent 拆表、一个 Agent 建模、一个 Agent 写结论"这种流水线不再需要自己写调度框架了。
3. Google Sheets 上线 Sheets canvas:一句话把表格数据变成交互式迷你应用
事件内容:8月13日,Google Sheets 发布 Sheets canvas 功能,基于 Gemini 构建。用户只需用自然语言提示词,即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用",无需编写公式或脚本。
值得关注的原因:这是本期对数据分析岗位最直接相关的一条。它把"数据→可交互产物"这一步的门槛降到了一句话,过去需要 BI 工具或前端支持才能做出的轻量看板,现在在表格里就能生成。往深一层看,这对数据分析师的价值结构有真实影响:把数据变成图表这件事正在快速贬值,而判断该看哪些指标、指标为什么这么动、下一步该干什么——这三件事的价值在同步升值。工具能替你做图,但替不了你定义问题。国内做类似产品的(金山、飞书多维表格、九数云)大概率会在几个月内跟进,值得提前熟悉这套交互范式。
4. DeepSeek Harness v0.1 开发者预览版以 MIT 协议开源:“一切皆插件”
事件内容:8月13日,DeepSeek 推出 Harness v0.1 开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为**“一切皆插件”**——模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
值得关注的原因:MIT 协议 + 全模块可插拔,是国产开源智能体框架里比较少见的组合。“沙箱、文件系统、循环"都做成插件这一点有实用价值:意味着可以把公司内部的数据库连接、权限体系、审计日志作为插件挂进去,而不用像用商业 Agent 平台那样把数据交出去。对有数据合规约束的企业(金融、零售会员数据),这是一条可行的内部智能体落地路径。
5. Claude 接管应用日常维护:数周内自动开出 388 个 PR,180 个通过审核合并
事件内容:8月13日,Boris Cherny(@bcherny)分享了让 Claude 接管其应用日常维护的实践:通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并(通过率约 46%)。Claude 通常一次就能改对,出错时可通过调整例程在次日改进。
值得关注的原因:388 开、180 合、46% 通过率——这是目前少见的带完整分母的 AI 自动化真实数据。46% 不算高,但关键在于"另外 54% 的失败几乎零成本”,且例程可以隔天迭代。这套模式完全可以平移到数据工作上:把"每天检查数据质量、找口径异常、清理废弃报表"这类重复劳动交给 Agent,通过 Slack/企微频道跑,人只做审核。真正的门槛不是模型能力,而是你能不能把日常任务写成可被重复执行的例程。
其他值得一提
- Cursor 推出 builds:后台持续准备就绪的开发环境副本,云智能体启动无需从零搭建,响应速度最高提升 3 倍(内部环境启动快 10 倍,首个 token 生成快 3 倍)。8 月 17 日起所有环境默认启用,不额外收费。
- MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
- 小红书开源 dots.tts:20 亿参数全连续端到端自回归语音合成模型,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度与平均说话人相似度。
今日核心洞察
成本曲线已经陡到需要重新做技术选型。Gemini 3.7 Flash 三周迭代且价格腰斩、GPT-5.6 同分数成本降 25 倍——任何三个月前做的"AI 成本不划算"结论,现在都需要重算。建议每季度重跑一次自己的单位处理成本表,很多被搁置的自动化场景已经过了盈亏平衡点。
工程方式比模型选择更决定成本。Luna 在 BrowseComp 上分数不变、成本从 33.27 美元降到 1.33 美元,差别全在"保留推理+压缩"。这条应该刻在墙上:先把上下文和推理复用做对,再考虑换模型。
“把数据变成图"正在快速贬值。Sheets canvas 一句话生成交互式看板,意味着报表制作能力的稀缺性在消失。数据人的护城河要往两头挪:上游是业务问题定义能力,下游是结论到行动的转化能力,中间的工具操作环节谁都能做了。
Agent 落地的真门槛是"例程化”,不是模型。Claude 388 PR / 46% 合并率给出了参照系:能自动化的前提是你能把重复劳动写成可被反复执行、可被审核、可被隔天迭代的例程。大部分团队做不了 AI 自动化,卡的不是模型,是自己的流程从来没写清楚过。
开源智能体框架给了合规场景一条路。DeepSeek Harness 的 MIT + 全插件化设计,意味着数据不出内网也能跑智能体。对有会员数据、交易数据合规约束的电商与零售企业,这比接商业 Agent 平台更现实,值得作为内部 POC 方向储备。
