返回行业动态
算力与基础设施

无问芯穹联合清华、上海交大开源具身端侧推理引擎 APXInf:Jetson Thor 上端到端延迟由 278 毫秒降至 26 毫秒

无问芯穹联合清华大学、上海交通大学开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin 与 Jetson Thor 平台。官方数据显示,Pi 0.5 模型在 FP8 精度下于 Jetson Thor 上的端到端推理延迟由 278 毫秒降至 26 毫秒以内,推理频率达 38.46 赫兹,降幅约 10.7 倍。引擎以 Rust 构建极简运行时并封装 Python 接口,首发适配 Pi 0.5 与 WALL-OSS。

来源:无问芯穹(APXInf 开源仓库)原标题:RLinf/APXinf-robo: reimagined edge inference engine for embodied AI查看原文
机器人本体控制板与边缘计算模块特写示意,画面体现实时感知决策闭环

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

无问芯穹联合清华大学与上海交通大学开源了面向机器人本体的端侧推理引擎 APXInf,项目代码托管在 GitHub 的 RLinf 组织下,作为 RLinf 开源生态中的端侧推理项目首发。该引擎支持 RTX 4090、Jetson Orin 与 Jetson Thor 等主流计算平台,覆盖从模型开发、效果验证到机器人本体部署的完整链路,首发适配 Pi 0.5 与 WALL-OSS 两款具身模型,并支持 BF16、FP8 与 INT8 三种精度。

官方给出的核心实测数据是:Pi 0.5 模型在 FP8 精度下运行于 Jetson Thor,端到端推理延迟由 278 毫秒压缩至 26 毫秒以内,推理频率达到 38.46 赫兹,降幅约 10.7 倍。测试条件为 Batch=1 的多视角实时控制,属机器人连续作业的典型负载形态。

  • 优化路径不是单点算子提速,而是围绕真实执行链路做端到端协同优化,涵盖流水线、计算图、算子与量化多个层次
  • 引入 Agent4Kernel 技术生成极限优化的融合算子,配合模型定制运行时削减框架、调度、计算与内存开销
  • 运行时使用 Rust 系统语言构建,利用内存安全特性降低并发与资源生命周期管理中的错误面,同时提供 Python 接口保留算法团队的调用习惯
  • 部署形态轻量,无需 Docker 与外部框架依赖,可在 Jetson Thor / Orin 上直接部署
  • 官方路线图包括扩展 VLA、VLM 与世界模型接入,推进 nvfp4 优化,以及适配国产芯片与国产机器人操作系统后端

为什么这件事值得关注

具身智能的落地瓶颈正在从「模型够不够聪明」转向「端侧跑不跑得起、跑不跑得稳」。云端推理环境下几百毫秒的延迟可能只是体验差异,但在需要持续感知、连续决策与实时控制的机器人上,同样的延迟往往直接表现为动作迟滞、轨迹不连贯乃至任务失败。此外还要叠加算力成本、功耗与有限硬件资源利用率的经济账。

把训练与推理串成同一条工程链路是关键设计考量。2025 年 9 月,无问芯穹曾联合清华大学等团队开源大规模强化学习训练框架 RLinf,用于具身大模型的后训练;APXInf 衔接的正是训练完成之后的端侧推理与部署环节。模型开源解决「跑得对不对」,推理引擎开源解决「跑不跑得动」,两者配套才能把中小团队的部署门槛压下来。

需要注意的边界

  • 26 毫秒与 38.46 赫兹是特定条件下的成绩,依赖 Jetson Thor 硬件、Pi 0.5 模型、FP8 精度与官方优化路径,更换模型、精度或硬件平台后数值会变化
  • 引擎代码与所适配具身模型的开源许可可能并不一致,商用前需分别核对 Apache 或 MIT 等具体条款
  • 首版仅覆盖 Pi 0.5 与 WALL-OSS,更多模型仍处于适配过程中
  • 当前路线图提及国产芯片与国产机器人操作系统后端支持,但尚未给出时间表

对机器人团队而言,这类端侧推理底座的实用价值在于复用。此前多数团队需要针对本体算力从零做算子与调度优化,这部分工作既难以标准化,也很难在模型迭代后继续沿用。若推理引擎能够把模型接入与部署流程沉淀为可复用的工程范式,机器人从演示走向规模化量产的门槛会实质降低一档。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

无问芯穹开源具身推理引擎 APXInf:延迟降至 26 毫秒|北京拓实科技