成立半年、融资 4 亿美元的 NaiveAI 终于拿出了第一个模型。9 月 27 日,由清华大学副教授代季峰创办的这家公司发布 Naive-N0.5-Flash,一个总参数 309B、单 token 激活 15.5B 的 MoE 模型,权重与推理代码以 MIT 协议开放。比参数更值得看的,是它把全局注意力整层去掉的做法,以及官方直言“研发过程中 AI 承担了大部分执行工作”这一条。
Naive-N0.5-Flash 是什么
Naive-N0.5-Flash 基于小米 MiMo-V2.5 Base 改造:保留原有 MoE 结构,把注意力机制换掉后再续训 3.25 万亿 tokens。它原生支持 100 万 token 上下文,面向编码与 AI 研发两类任务。
模型总参数 309B,每 token 只激活 15.5B。按官方说法,定位是“Flash”档的速度优先型号,同时提供 API:输入每百万 tokens 0.6 元、输出 2.6 元、缓存读取 0.07 元。
架构上的取舍:整层拿掉全局注意力
这是本次发布里技术含量最高的一处改动。NaiveAI 把标准 Transformer 里的全局注意力层全部移除,改用两层机制配合:
- 滑动窗口注意力负责局部,计算量与上下文长度线性相关;
- DeepSeek 稀疏注意力按稀疏索引从历史中挑出一部分 token 参与计算,承担“全局检索”的职责。
两者按一定比例交替堆叠,模型因此不再有任何一层需要看全量上下文。官方给出的理由是:上下文拉到百万级时,全注意力的计算量与显存带宽会成为瓶颈,稀疏化后这两项压力都能压下来。需要注意的是,稀疏索引器本身仍要扫描历史,KV cache 也仍然完整保留——省的是注意力计算,不是缓存。
AI 参与研发,具体参与了什么
NaiveAI 的技术报告把“AI for AI”写得很具体:模型负责写代码、跑实验、监控结果并提出下一轮修改方案,人类研究员负责定目标、设约束、定验收标准并做关键决策。
一个可核验的例子是推理系统 NaiveRT:团队在 6 天内跑了 151 轮优化实验,其中 63 轮的方案被采纳。这仍然是“人类指挥、AI 执行”的模式,不是模型自主迭代自身,但把执行环节的工作量转移出去,已经是当下最激进的一档实践。
速度数字要看测试条件
官方公布的推理速度有两个口径,差距很大:
- 峰值 2122 tokens/s:8 张 GPU、关闭思考模式、不计输入处理时间、取 41 次请求中表现最好的一秒;
- 标准模式约 50 tokens/s/用户:这才是日常可用的参考值。
峰值数字是一个窄口径的解码速度结果,不代表任意负载下的端到端体验。拿它和其他模型的公开速度直接对比会失真。
怎么看这次发布
309B 的 MoE 放在今天的量级竞赛里不算突出,它的价值在两处:一是证明了“无全局注意力 + 稀疏检索”这条路在百万上下文上能跑通且可商用;二是把 AI 参与研发从一个说法落实成了有轮次、有采纳率的工程记录。
需要保留的是分寸:官方称其编码能力进入国产模型第一梯队,但全部基准成绩均为厂商自测,尚无第三方独立复现,1M 上下文下的实际效果与成本仍建议用自己的任务跑一遍再判断。






