暂无菜单项

10
发布于 更新于

代季峰的 NaiveAI 交出首款模型:309B MoE 开源,训练过程大量交给 AI

成立半年、融资 4 亿美元的 NaiveAI 终于拿出了第一个模型。9 月 27 日,由清华大学副教授代季峰创办的这家公司发布 Naive-N0.5-Flash,一个总参数 309B、单 token 激活 15.5B 的 MoE 模型,权重与推理代码以 MIT 协议开放。比参数更值得看的,是它把全局注意力整层去掉的做法,以及官方直言“研发过程中 AI 承担了大部分执行工作”这一条。

Naive-N0.5-Flash 是什么

Naive-N0.5-Flash 基于小米 MiMo-V2.5 Base 改造:保留原有 MoE 结构,把注意力机制换掉后再续训 3.25 万亿 tokens。它原生支持 100 万 token 上下文,面向编码与 AI 研发两类任务。

模型总参数 309B,每 token 只激活 15.5B。按官方说法,定位是“Flash”档的速度优先型号,同时提供 API:输入每百万 tokens 0.6 元、输出 2.6 元、缓存读取 0.07 元。

架构上的取舍:整层拿掉全局注意力

这是本次发布里技术含量最高的一处改动。NaiveAI 把标准 Transformer 里的全局注意力层全部移除,改用两层机制配合:

  • 滑动窗口注意力负责局部,计算量与上下文长度线性相关;
  • DeepSeek 稀疏注意力按稀疏索引从历史中挑出一部分 token 参与计算,承担“全局检索”的职责。

两者按一定比例交替堆叠,模型因此不再有任何一层需要看全量上下文。官方给出的理由是:上下文拉到百万级时,全注意力的计算量与显存带宽会成为瓶颈,稀疏化后这两项压力都能压下来。需要注意的是,稀疏索引器本身仍要扫描历史,KV cache 也仍然完整保留——省的是注意力计算,不是缓存。

AI 参与研发,具体参与了什么

NaiveAI 的技术报告把“AI for AI”写得很具体:模型负责写代码、跑实验、监控结果并提出下一轮修改方案,人类研究员负责定目标、设约束、定验收标准并做关键决策。

一个可核验的例子是推理系统 NaiveRT:团队在 6 天内跑了 151 轮优化实验,其中 63 轮的方案被采纳。这仍然是“人类指挥、AI 执行”的模式,不是模型自主迭代自身,但把执行环节的工作量转移出去,已经是当下最激进的一档实践。

速度数字要看测试条件

官方公布的推理速度有两个口径,差距很大:

  • 峰值 2122 tokens/s:8 张 GPU、关闭思考模式、不计输入处理时间、取 41 次请求中表现最好的一秒;
  • 标准模式约 50 tokens/s/用户:这才是日常可用的参考值。

峰值数字是一个窄口径的解码速度结果,不代表任意负载下的端到端体验。拿它和其他模型的公开速度直接对比会失真。

怎么看这次发布

309B 的 MoE 放在今天的量级竞赛里不算突出,它的价值在两处:一是证明了“无全局注意力 + 稀疏检索”这条路在百万上下文上能跑通且可商用;二是把 AI 参与研发从一个说法落实成了有轮次、有采纳率的工程记录。

需要保留的是分寸:官方称其编码能力进入国产模型第一梯队,但全部基准成绩均为厂商自测,尚无第三方独立复现,1M 上下文下的实际效果与成本仍建议用自己的任务跑一遍再判断。

常见问题(FAQ)

Naive-N0.5-Flash 可以免费商用吗?
可以。模型权重与推理代码均以 MIT 协议开放,允许商用,无需额外授权。若走官方 API,则按输入 0.6 元、输出 2.6 元、缓存读取 0.07 元每百万 tokens 计费。
2122 tokens/s 的推理速度在什么条件下测出来的?
这是峰值口径:8 张 GPU、关闭思考模式、不计输入处理时间,并取 41 次请求中表现最好的一秒。日常使用的标准模式约为每位用户 50 tokens/s,后者才是可参考的实际速度。
什么是“AI 参与研发”?模型在自己训练自己吗?
不是自主迭代。按官方技术报告,AI 负责写代码、跑实验、分析结果并提出修改方案,人类研究员负责设定目标、约束与验收标准并做关键决策。典型例子是推理系统 NaiveRT 在 6 天内完成 151 轮优化实验,其中 63 轮被采纳。
0 / 600
0 讨论
热门最新
总结
暂无总结