发生了什么
北京初创公司 NaiveAI 于 9 月 27 日发布并开源 Naive-N0.5-Flash。这是一个总参数 3090 亿、单 token 激活约 155 亿的混合专家(MoE)模型,原生支持 100 万 token 上下文,权重与推理代码以 MIT 协议在 Hugging Face 与 GitHub 开放,模型卡把目标负载直接写为「编码与 AI 研发」。
- 规模:总参数 3090 亿(309B),单 token 激活 155 亿(15.5B)
- 上下文:原生 100 万 token,全网络不含任何全注意力层
- 注意力构成:48 层中 39 层滑窗注意力 + 9 层稀疏注意力
- 稀疏注意力每次为骨干挑选前 2048 个 token;滑窗窗口 128 token
- 基座:小米开源的 MiMo-V2.5;API 定价每百万 token 输入 0.10 美元、输出 0.40 美元、缓存读取 0.01 美元
架构上的取舍
主流长上下文方案通常保留少量全局注意力层来维系远程信息,而这些层恰恰是百万级上下文下解码开销的主要来源。Naive-N0.5-Flash 的做法是把它们整体删掉:网络由 8 个六层模块组成,标准模块为 5 层滑窗注意力加 1 层轻量稀疏注意力,稀疏注意力沿用 DeepSeek 的设计思路——由一个轻量索引器扫描完整历史,骨干只对选中的 token 子集做注意力计算;团队同时把原先的 MLA 换成 4 组 KV 的分组查询注意力。
- 索引器仍需扫描全部历史,完整 KV 缓存也仍然保留,稀疏化减少的是注意力计算量与显存访问
- 训练在原生 100 万 token 上下文下完成 3.25 万亿 token:500 亿索引器热身、3 万亿稀疏注意力训练、2000 亿学习率衰减
- 推理栈 NaiveRT 结合大内核融合、程序化依赖启动、推测解码与 FP8 混合精度
速度与「AI 造 AI」的说法
NaiveAI 给出的推理速度是标准模式每用户 50 token/s、极限模式最高 2000 token/s。技术博客补充的单流峰值为 2122 token/s,条件是在 8 张 GPU 上、从 41 个 HTML 与 SVG 生成请求中取最好的一秒窗口,且不计入提示词处理时间。模型卡的标题写为「用 AI 构建前沿 AI」,称训练过程中模型自己写代码、跑实验、监控结果并提出下一轮迭代,人类负责设定目标、约束与评测标准。
不确定之处
两点需要保持警惕。其一,「AI 主导研发」目前只有公司自述,既未公布 AI 与人类的工作量划分与衡量方法,也未说明这种做法是否真正降低了后续模型的开发成本,更贴切的描述是「人类设定方向下的 AI 辅助研发」。其二,速度与能力指标均为公司自报,未经第三方复现,评测环境由公司自设。对准备评估长上下文推理成本的团队来说,更稳妥的做法是在自己的负载上实测,而不要直接采信发布时的纸面峰值。

