<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>小米MiMo on 玩数据de强尼</title><link>https://awesomedata.pages.dev/tags/%E5%B0%8F%E7%B1%B3mimo/</link><description>Recent content in 小米MiMo on 玩数据de强尼</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Tue, 22 Sep 2026 14:05:00 +0800</lastBuildDate><atom:link href="https://awesomedata.pages.dev/tags/%E5%B0%8F%E7%B1%B3mimo/index.xml" rel="self" type="application/rss+xml"/><item><title>每日AI资讯 2026-09-22</title><link>https://awesomedata.pages.dev/p/daily-ai-news-2026-09-22/</link><pubDate>Tue, 22 Sep 2026 14:05:00 +0800</pubDate><guid>https://awesomedata.pages.dev/p/daily-ai-news-2026-09-22/</guid><description>&lt;img src="https://awesomedata.pages.dev/p/daily-ai-news-2026-09-22/cover.jpg" alt="Featured image of post 每日AI资讯 2026-09-22" /&gt;&lt;h2 id="1-小米开源-mimo-v26-系列全模态-pro--flash登顶开放权重智能指数"&gt;1. 小米开源 MiMo-V2.6 系列：全模态 Pro + Flash，登顶开放权重智能指数
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;事件内容&lt;/strong&gt;：9 月 21 日，小米 MiMo 正式发布并开源 MiMo-V2.6 系列，包含 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两个原生全模态模型，通过规模化强化学习训练，官方称这是探索 RSI（递归自我改进）路径的关键一步。MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得分 46，超越前代 MiMo-V2.5-Pro 的 26，为开放权重模型中最高；在多数 Agent 基准上与 Claude Opus 5、GPT-5.6 Sol 表现相当，能力覆盖编码、computer use、3D 推理与创作。在 Code Arena：WebDev 榜上，MiMo-V2.6-Pro 以 1628 分（AutoEval）位列约第 10 名、开源权重中约第 3，较上一代 1475 分上涨 153 分。权重以 MIT 许可开放。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;值得关注的原因&lt;/strong&gt;：单代智能指数从 26 跳到 46，是罕见的跨越式提升，且直接以 MIT 许可开放权重——意味着企业可以本地部署一个接近闭源旗舰水平、覆盖文本 / 图像 / 语音等多模态的全能模型，数据不出内网。对电商与数据团队的落地面很广：商品内容理解、多模态质检、长链路 Agent 自动化。同时也进一步说明，中国开源模型正在把&amp;quot;旗舰能力&amp;quot;变成&amp;quot;可自建的基础设施&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="2-xai-发布-grok-47主打编码与知识工作同价同速翻倍性能"&gt;2. xAI 发布 Grok 4.7：主打编码与知识工作，同价同速翻倍性能
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;事件内容&lt;/strong&gt;：9 月 21 日，xAI 发布 Grok 4.7，定位为其最强编码与知识工作模型，定价 $2 / 百万输入 token、$6 / 百万输出 token，与上一代 Grok 4.6 同价同速，另提供速度与价格成倍变化的快速变体。Artificial Analysis 评测显示，Grok 4.7 在 Intelligence Index 得 46 分，较 Grok 4.6 高 2 分；AA-Briefcase 得 1657 Elo（+111），仅次于 Claude Opus 5 与 Claude Fable 5.1；编码代理（coding agent）得分升至 56。马斯克引用该评测称，Grok 4.7 使 xAI 在智能体编码领域位列第三，仅次于 Anthropic 与 OpenAI。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;值得关注的原因&lt;/strong&gt;：这轮竞争的焦点已从&amp;quot;聊天能力&amp;quot;转向&amp;quot;智能体知识工作&amp;quot;——AA-Briefcase 这类基准测的是真实办公场景下的任务完成度，直接对应数据分析、文档产出、流程执行。值得注意的是&amp;quot;同价升级&amp;quot;策略：能力提升但价格不动，意味着同等预算能跑更多 Agent 任务，对高频使用 AI 做经营分析、报告生成的团队是实际的成本红利。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="3-腾讯混元发布-hy-image35-preview专业设计师盲测胜率提升-30"&gt;3. 腾讯混元发布 Hy Image3.5 preview：专业设计师盲测胜率提升 30%+
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;事件内容&lt;/strong&gt;：9 月 21 日，腾讯混元发布 Hy Image3.5 preview 图像生成模型，支持文生图与图生图、最多 5 张参考图、多轮编辑与最高 2K 分辨率输出。经上百名专业设计师 GSB 盲测，对上一代综合胜率提升 30% 以上，官方定位是&amp;quot;为专业创作提供高性价比模型&amp;quot;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;值得关注的原因&lt;/strong&gt;：这是对电商内容生产最直接可用的一条。5 张参考图 + 多轮编辑 + 2K 输出，正好覆盖电商主图、场景图、模特换装、系列风格统一这几类高频需求；GSB 盲测针对的是专业设计师审美而非模型榜单，参考价值更接近真实商用标准。对没有专业摄影与设计资源的中小商家而言，&amp;ldquo;高性价比 + 多参考图 + 可多轮改&amp;quot;的组合，能把素材生产的边际成本压得很低，也便于把出图环节接入批量化工作流。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="4-nvidia-nemotron-35-lightning30b-总参--3b-激活专攻-agent-高频执行"&gt;4. NVIDIA Nemotron 3.5 Lightning：30B 总参 / 3B 激活，专攻 Agent 高频执行
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;事件内容&lt;/strong&gt;：9 月 22 日，OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning——一款 30B 总参数、约 3B 激活参数的混合专家（MoE）开源权重模型，定位于工具调用、编码等高频且边界清晰的 Agent 执行步骤，与负责复杂推理的 Nemotron 3 Ultra（550B 总参数、55B 激活）形成明确分工。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;值得关注的原因&lt;/strong&gt;：这是 Agent 架构思路的一次清晰表达——把&amp;quot;每一步都要调大模型&amp;quot;改成&amp;quot;简单执行步交给小模型、复杂推理才交给大模型&amp;rdquo;。3B 激活意味着单次调用成本与延迟都极低，而 Agent 工作流里绝大多数步骤（查数据、调接口、格式化、条件判断）恰恰都是边界清晰的执行动作。对要搭建自动化运营 / 数据分析 Agent 的团队，这种&amp;quot;大小模型分工&amp;quot;是目前最现实的一条降本路径。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="5-linear-重构-ci-流程应对-ai-编码带来的验证瓶颈pr-等待从-6-分钟降至-5-分钟"&gt;5. Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈：PR 等待从 6 分钟降至 5 分钟
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;事件内容&lt;/strong&gt;：9 月 21 日，Linear 工程师分享了如何解决&amp;quot;AI Agent 加速写代码后，CI 反而成为瓶颈&amp;quot;的问题。重构后，PR 等待时间从 6 分钟以上降至 5 分钟出头，单元测试 runner 时间约减半。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;值得关注的原因&lt;/strong&gt;：这是一条被低估的落地观察——AI 提效不会均匀分布，写代码快了，瓶颈会立刻转移到验证、评审与发布环节。对数据团队同理：AI 让取数、写 SQL、出报告变快之后，真正的瓶颈会变成口径确认、结果校验与交付评审。所以真正的收益不在于把某个环节提速，而在于提前识别并重构&amp;quot;下一个瓶颈&amp;quot;，否则整体产出不会变。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="今日核心洞察"&gt;今日核心洞察
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;开源模型完成一次&amp;quot;能力跃级&amp;quot;&lt;/strong&gt;：小米 MiMo-V2.6-Pro 单代智能指数 26 → 46、MIT 许可、全模态，等于把接近闭源旗舰的能力变成可本地部署的基础设施。企业的选型逻辑应从&amp;quot;用哪家 API&amp;quot;扩展为&amp;quot;哪些能力该自建、数据不出内网&amp;quot;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型竞争的标尺已换成&amp;quot;智能体知识工作&amp;quot;&lt;/strong&gt;：Grok 4.7 的关键提升在 AA-Briefcase（+111 Elo）与编码代理得分，而非闲聊体验。这意味着模型价值要按&amp;quot;能否独立完成一项真实工作任务&amp;quot;衡量，选型时更该看办公 / 分析类基准和单任务成本。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent 架构走向大小模型分工&lt;/strong&gt;：Nemotron 3.5 Lightning（30B/3B 激活）专职高频执行、Ultra 负责复杂推理，指向一个可复用原则——把工作流拆成&amp;quot;边界清晰步&amp;quot;与&amp;quot;需要推理步&amp;quot;，前者用小模型批量跑，成本可降一个数量级。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像模型的商用门槛继续下探&lt;/strong&gt;：混元 Hy Image3.5 用&amp;quot;5 张参考图 + 多轮编辑 + 2K + 设计师盲测胜率&amp;quot;切入专业创作，电商素材生产是第一批受益场景。生成环节的成本已不是主要约束，如何把出图嵌进批量化的选品 / 上新流程才是关键。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AI 提效的真实瓶颈会位移&lt;/strong&gt;：Linear 的案例给出方法论——AI 让产出端变快后，瓶颈立刻转移到验证端。数据与电商团队引入 AI 后，应主动盯住&amp;quot;下一个堵点&amp;quot;（口径、校验、评审），它决定了最终产出是否真的提升。&lt;/li&gt;
&lt;/ol&gt;

 &lt;blockquote&gt;
 &lt;p&gt;补充线索（近 7 天窗口，非昨日事件）：阶跃星辰 Step 5 Preview 在 Artificial Analysis Intelligence Index 得 44 分，与 Kimi K3（max）持平，每任务成本约 $0.72、约为同级模型的 1/2.8；Nathan Lambert 向美国国会提交的开源模型综述指出，中国开源权重模型已在下载量、基准成绩与学术采用上领先。&lt;/p&gt;

 &lt;/blockquote&gt;</description></item></channel></rss>