返回行业动态
模型与产品

NaiveAI 开源 309B 模型 Naive-N0.5-Flash:拿掉全注意力层撑起百万上下文

北京初创公司 NaiveAI 发布并开源 Naive-N0.5-Flash:总参数 3090 亿、单 token 激活 155 亿的 MoE 模型,原生支持 100 万 token 上下文,全网络不使用全注意力层,改由 39 层滑窗注意力与 9 层 DeepSeek 式稀疏注意力组合支撑,基座为小米开源模型 MiMo-V2.5,权重与推理代码以 MIT 协议开放。公司称模型研发过程由 AI 主导,速度与能力指标均为自报,尚无第三方复现。

来源:Hugging Face 模型卡:NaiveAI/Naive-N0.5-Flash(含技术博客与评测说明)原标题:Naive-N0.5-Flash: Building Frontier AI with AI查看原文
深夜数据中心冷通道纵深画面:成排深色网孔机柜、青色指示灯与反光地面,顶部深色横梁上居中排布白色中文标题「开源模型撑起百万上下文」

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

北京初创公司 NaiveAI 于 9 月 27 日发布并开源 Naive-N0.5-Flash。这是一个总参数 3090 亿、单 token 激活约 155 亿的混合专家(MoE)模型,原生支持 100 万 token 上下文,权重与推理代码以 MIT 协议在 Hugging Face 与 GitHub 开放,模型卡把目标负载直接写为「编码与 AI 研发」。

  • 规模:总参数 3090 亿(309B),单 token 激活 155 亿(15.5B)
  • 上下文:原生 100 万 token,全网络不含任何全注意力层
  • 注意力构成:48 层中 39 层滑窗注意力 + 9 层稀疏注意力
  • 稀疏注意力每次为骨干挑选前 2048 个 token;滑窗窗口 128 token
  • 基座:小米开源的 MiMo-V2.5;API 定价每百万 token 输入 0.10 美元、输出 0.40 美元、缓存读取 0.01 美元

架构上的取舍

主流长上下文方案通常保留少量全局注意力层来维系远程信息,而这些层恰恰是百万级上下文下解码开销的主要来源。Naive-N0.5-Flash 的做法是把它们整体删掉:网络由 8 个六层模块组成,标准模块为 5 层滑窗注意力加 1 层轻量稀疏注意力,稀疏注意力沿用 DeepSeek 的设计思路——由一个轻量索引器扫描完整历史,骨干只对选中的 token 子集做注意力计算;团队同时把原先的 MLA 换成 4 组 KV 的分组查询注意力。

  • 索引器仍需扫描全部历史,完整 KV 缓存也仍然保留,稀疏化减少的是注意力计算量与显存访问
  • 训练在原生 100 万 token 上下文下完成 3.25 万亿 token:500 亿索引器热身、3 万亿稀疏注意力训练、2000 亿学习率衰减
  • 推理栈 NaiveRT 结合大内核融合、程序化依赖启动、推测解码与 FP8 混合精度

速度与「AI 造 AI」的说法

NaiveAI 给出的推理速度是标准模式每用户 50 token/s、极限模式最高 2000 token/s。技术博客补充的单流峰值为 2122 token/s,条件是在 8 张 GPU 上、从 41 个 HTML 与 SVG 生成请求中取最好的一秒窗口,且不计入提示词处理时间。模型卡的标题写为「用 AI 构建前沿 AI」,称训练过程中模型自己写代码、跑实验、监控结果并提出下一轮迭代,人类负责设定目标、约束与评测标准。

不确定之处

两点需要保持警惕。其一,「AI 主导研发」目前只有公司自述,既未公布 AI 与人类的工作量划分与衡量方法,也未说明这种做法是否真正降低了后续模型的开发成本,更贴切的描述是「人类设定方向下的 AI 辅助研发」。其二,速度与能力指标均为公司自报,未经第三方复现,评测环境由公司自设。对准备评估长上下文推理成本的团队来说,更稳妥的做法是在自己的负载上实测,而不要直接采信发布时的纸面峰值。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。