一、昨日重要动态(5条)
1. Anthropic 发布 Claude Opus 5:智能接近旗舰 Fable 5,价格砍半
事件内容:7月24日,Anthropic 正式发布 Claude Opus 5。官方数据显示:其智能水平接近 Claude Fable 5,但价格减半;在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起面向 Claude Max 用户开放。同日 Anthropic 发布配套博客,披露为 Claude 5 代模型删除了 Claude Code 超过 80% 的系统提示词,编码评测无显著损失——新一代模型对上下文工程的依赖大幅下降。(来源:Anthropic Newsroom / Claude Blog)
值得关注的原因:一句话总结:更强、更便宜、更省提示词。对日常用 AI 干活的人,“价格减半"意味着重度 Agent 工作流的成本直接砍半;“系统提示词精简80%“则是个重要信号——精心堆砌提示词的时代在过去,模型本身的任务理解能力在快速吃掉提示工程的价值。写提示词模板的同学要留意方向调整了。
2. Black Forest Labs 发布 FLUX 3 多模态模型:单次生成20秒视频+原生音频,还能开进奥迪生产线
事件内容:7月24日,Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,统一架构联合学习图像、视频和音频(视频预测占训练算力95%以上),单次生成最长20秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联。同时与机器人公司 mimic 合作推出 FLUX-mimic 动作模型,已在奥迪生产线上测试部署。(来源:IT之家 / BFL官方博客)
值得关注的原因:两个看点:一是"20秒+原生音频"把视频生成从"素材片段"推向"可直接用的成片单元”,电商短视频素材制作成本还会再降一档;二是视频模型学会了"预测动作"就能驱动机器人——生成模型与具身智能的技术栈正在合流,这是比单纯生成质量提升更大的事。
3. 英伟达、微软、Meta 联合公开信:警告不要对开放权重模型过度监管
事件内容:7月24日,英伟达、微软和 Meta 联合签署公开信,警告对开放权重 AI 模型的过度监管将削弱美国在 AI 领域的竞争力,指出开放权重模型能促进创新、降低准入门槛、支持学术研究。值得注意的是,OpenAI 和 Anthropic 未签署该信函。微软 CEO 纳德拉同日发文阐述开源模型战略。(来源:CNBC / Hacker News)
值得关注的原因:三巨头联名+两家闭源头部缺席,把 AI 行业"开放派 vs 闭源派"的阵营分界画得清清楚楚。开放权重模型的监管走向直接影响国内团队能否继续获取 Llama 等开源模型的迭代红利,也影响 Qwen、DeepSeek 等国产开源模型的国际竞争环境,值得持续跟踪。
4. 蚂蚁百灵发布 Ling-3.0-flash:124B总参数只激活5.1B,长文本TTFT降低60%
事件内容:7月24日,蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-flash:总参数量124B、激活参数仅5.1B(1/64稀疏MoE+原生混合线性注意力),在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰 Ring-2.6-1T,长输入下首Token延迟(TTFT)降低60%,并扩展至10000+可交互训练环境。(来源:蚂蚁百灵公众号)
值得关注的原因:124B 参数只激活 5.1B,意味着旗舰级能力+小模型级推理成本。这类"高稀疏MoE"路线正在成为国产模型的主流选择,对需要私有化部署或大批量调用(比如电商客服、商品信息批处理)的场景,推理成本每降一档,可行的业务场景就多一批。
5. 百度"搭子"升级:电脑手机跨端接力执行任务,平均耗时降20%
事件内容:7月24日,百度在 AI Day 上发布"搭子"多项升级:支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作;桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作;手机端支持云端远程操控。智能路由自动匹配任务模式后,平均任务耗时降低20%,Token利用率提升25%。(来源:百度智能云公众号)
值得关注的原因:“跨端接力"解决的是 Agent 产品的一个真实痛点——任务在电脑上跑到一半,人已经出门了。国产 Agent 产品的竞争焦点正从"能不能干活"转向"干活的连续性和体验”。做个人效率工作流的同学可以关注:调研、下载、盯盘这类长任务,交给能跨端的 Agent 挂机跑,是实打实的效率提升。
二、今日核心洞察
模型价格战进入"旗舰半价"阶段:Opus 5 用一半价格给到接近旗舰的智能,叠加蚂蚁 Ling-3.0-flash 的高稀疏路线,推理成本的下降速度超过多数人预期。之前因为成本原因搁置的 AI 批处理场景(商品文案、图片审核、数据清洗),现在值得重新算一遍账。
提示工程的价值在被模型能力吞噬:Anthropic 砍掉80%系统提示词且效果不降,说明"堆提示词"的红利期接近尾声。往后拼的是任务拆解、工具编排和数据供给——也就是上下文工程里"给对信息"而非"说对话术"的部分。
视频生成迈过"可用成片"门槛:FLUX 3 的20秒+原生音频,加上此前各家的持续迭代,电商短视频、商品展示视频的生产成本曲线还在陡峭下行。内容团队的核心竞争力正在从"拍摄剪辑"转向"选题策划+AI工作流搭建”。
开放vs闭源的路线之争已上升到政策博弈层面:三巨头联名信划清阵营,开放权重模型的监管环境将直接影响全球(包括国产开源模型)的技术扩散速度。
Agent 产品竞争进入"体验细节"下半场:ChatGPT 桌面版语音控制多智能体、百度搭子跨端接力——头部玩家都在解决"人机协作的连续性"问题,单点能力的比拼让位于工作流闭环的比拼。
