量产车型端侧部署选型分析报告
·
一、整体结论:端侧选型三条典型路线
- “强算力 + 自研大模型”路线(小鹏、理想、华为)
- 车端算力 750 TOPS 量级(自研图灵芯片或 8295+AI Box),支持 10B 级 VLM 本地运行,偏“端侧优先”。
- 典型:小鹏天玑 AIOS 6.0 的座舱 VLM、理想 Mind GPT 在车端的部署、华为 MoLA 2.0 的 System Agent。
- “中央计算平台 + 端云协同大模型”路线(蔚来)
- 中央计算平台 ADAM:骁龙 8295 座舱 + Orin X 智驾,算力共享,多模态感知模型本地部署,大模型能力以“端云一体认知中枢”形式呈现。
- 强调:隐私敏感的感知在本地,复杂推理在云端。
- “主流座舱芯片 + 适度端侧推理”路线(多数采用 8295 的鸿蒙座舱车型、比亚迪等)
- 座舱芯片以骁龙 8295(AI 算力约 30 TOPS)为主,做增强型语音助手、多模态感知;大模型推理更多在云端,或端侧部署小模型(~1–3B)。
- 代表:搭载鸿蒙座舱 5/6 的合资/自主品牌车型(天籁、铂智 7 等)。
下面按厂商展开。
二、按厂商拆解:量产车型 + 真实披露数据
1. 小鹏天玑 AIOS 6.0(2026 款 P7+ / G7 等)
量产车型:
- 2026 款小鹏 P7+、G7、G6、G9、X9 等搭载天玑 AIOS 6.0。
1)芯片硬件架构
- 座舱算力:
- 天玑 AIOS 6.0 宣称“智能座舱有效算力 750 TOPS”,由自研座舱图灵 AI 芯片提供。
- 部分车型同时搭载高通骁龙 8295P 或联发科 MT8676 作为主控芯片。
- 智驾算力:
- 第二代 VLA 智驾系统采用自研图灵 AI 芯片,旗舰车型(如 P7+)可搭载三颗图灵芯片,总算力 2250 TOPS。
这里的“有效算力 750 TOPS”是官方宣传口径,未拆分 NPU/GPU;但可以确认的是:小鹏在座舱侧部署了远高于 8295(30 TOPS)的算力,为端侧 VLM 提供空间。
2)推理框架与部署形态
- 官方明确:
- “行业首个落地端侧座舱视觉语言模型(VLM)”。
- VLM 可实现:跨场景多轮对话、车况问答、本地记忆库、与第二代 VLA 联动(语音→智驾执行)。
- 推理框架:
- 未公开具体框架名称,但强调“自研 VLM + 图灵芯片”的协同推理。
- 面向视觉大模型,小鹏发布了 TuringViT,主打高分辨率视觉 Transformer 的端侧高效推理——这类技术很可能用于座舱视觉感知与智驾 VLA。
3)模型参数类型与能力分工
| 座舱 VLM | 端侧(图灵芯片) | ~10B 参数级视觉语言模型(官方未精确披露,但行业报道强调“10B 参数大模型在车端运行”) | 多轮对话、车况问答、环境感知(用户穿着、车内状态)、本地记忆库,离线场景问答 |
| 第二代 VLA(智驾) | 端侧(图灵芯片) | 端到端 VLA(视觉-语言-动作)模型 | 智驾感知-预测-规划一体化,与座舱 VLM 协同,实现“一句话自动驾驶” |
| 云端大模型 | 云端 | 更大参数基座模型(未公开具体规模) | 复杂推理、云端知识库、接入第三方服务生态 |
| 协同工作方式: |
- 本地优先:
- 高频语音指令、车况问答、环境感知由端侧 VLM 完成,强调“主动服务座舱”和“离线可用”。
- 端云协同:
- 复杂多步任务、云端知识检索和第三方服务由云端大模型协助完成。
- VLM + VLA 联动:
- VLM 理解用户自然语言意图,交给 VLA 执行自动驾驶,实现“带我去附近星巴克并直接停到门口”的闭环。
2. 蔚来 NOMI GPT(Banyan·榕 智能系统)
量产车型:
- 搭载 Banyan·榕 智能系统的 2024/2025 款 ES6、ET5、ET7、ES7 等车型。
1)芯片硬件架构
- 中央计算平台 ADAM:
- 集成 1 颗骁龙 8295 智能座舱芯片 + 4 颗英伟达 Orin X 智驾芯片。
- 官方宣称总算力 1016 TOPS,并支持“智驾、智舱和整车控制最大 256 TOPS 算力共享”。
- 架构特点:
- 从“舱驾分离域控”升级为“中央计算平台”,跨域带宽从千兆提升到 16 Gbps,实现多域间高速互联。
2)推理框架与部署形态
- NOMI GPT 架构:
- 端云多模态大模型,包含:自研多模态感知、自研认知中枢、情感引擎、多专家 Agent。
- 端侧多模态感知:
- 官方称“行业领先的端侧多模态感知能力”,车内联网不再是使用 NOMI 的必须条件,强调“看得见、认得出”,敏感信息不出车。
- 认知中枢与情感引擎:
- 认知中枢实现调度分发、多模拒识、跨域继承/跳转、多 Agent 决策等。
- 情感引擎结合短期/长期记忆,实现情绪识别、个性化人设等。
3)模型参数类型与能力分工
| 端侧多模态感知模型 | 端侧(骁龙 8295 + Orin X 共享算力) | 未公开具体参数,官方强调“端侧多模态感知大模型” | 车内物体识别、乘员识别、情绪判断、多模态拒识(判断哪些话是对 NOMI 说) |
| NOMI GPT 认知中枢 | 端云一体 | “数十亿级参数模型” | 意图理解、任务调度、多 Agent 协同、百科问答、无限趣聊、场景生成 |
| 情感引擎 | 端侧为主 | 结合记忆网络 | 情绪识别、个性化氛围灯、音乐联动等 |
| 多专家 Agent | 端云协同 | NIO Agents、User Agents、三方 Agents | 车控、服务预约、社区互动、第三方 API 调用 |
注:官方未精确公开端侧模型参数规模,仅披露“数十亿级参数”的总体模型规模,并未拆分端侧与云端的具体参数量。
协同工作方式:
- 端侧感知:
- 多模态感知模型在本地处理视觉、语音等输入,保障隐私和弱网可用。
- 端云协同推理:
- 复杂问答、百科、多 Agent 协同由 NOMI GPT 认知中枢在云端协同完成。
- 跨域算力共享:
- 座舱与智驾算力可在 ADAM 内统一调度,提升多模态大模型部署效率。
3. 理想 Mind GPT(理想同学)
量产车型:
- 理想 L 系列车型(L6/L7/L8/L9/MEGA 等)通过 OTA 升级 Mind GPT,支撑车载“理想同学”。
1)芯片硬件架构
- 座舱芯片:
- 新一代理想 L6 等车型搭载高通骁龙 8295 座舱芯片,为多屏联动和大模型推理提供算力。
- 自研智驾芯片:
- 理想自研马赫 M100 芯片,5nm 车规级工艺,单芯片算力 1280 TOPS,用于智驾 VLA 大模型。
2)推理框架与部署形态
- Mind GPT:
- 自研多模态认知大模型,采用 TaskFormer 架构,训练数据规模 3T Token。
- 通过 OTA 升级,支持免唤醒交互、方言识别、知识问答、出行规划、内容生成等。
- 车端部署:
- Mind GPT 作为“认知大模型”上车,官方强调“围绕车载场景打造”,具备记忆网络、工具调用、搜索引擎接入等能力。
3)模型参数类型与能力分工
| Mind GPT 基座 | 端云协同 | 自研 TaskFormer 架构,3T Token 训练,参数规模未精确披露 | 知识问答、出行规划、内容生成、工具调用(300+ 工具) |
| 理想同学智能体框架 | 端侧为主 | 基于 Mind GPT 的智能体系统 | 任务拆解、工具编排、多轮对话 |
| 马赫 VLA(智驾) | 端侧(马赫 M100) | VLA 端到端大模型 | 智驾规划与控制,与座舱协同 |
官方公开的是训练数据规模与架构,而非具体参数规模;车端部署多少参数目前未披露。
协同工作方式:
- 端侧:
- 多模态感知和部分推理在车端完成,强调车内交互和隐私保护。
- 云端:
- 接入 DeepSeek-R1/V3 等大模型用于复杂推理与联网搜索。
- 工具与 Agent:
- Mind GPT 作为控制器,调用外部工具与搜索引擎,扩展能力边界。
4. 华为鸿蒙座舱 HarmonySpace 5/6(MoLA 2.0)
量产车型:
- 广汽丰田铂智 7 搭载鸿蒙座舱 HarmonySpace 5(MoLA 架构)。
- 东风日产天籁鸿蒙座舱版、阿维塔 12 等搭载鸿蒙座舱 5/5.2/6,使用骁龙 8295 芯片。
1)芯片硬件架构
- 座舱芯片:
- 多款鸿蒙座舱车型搭载高通骁龙 8295,AI 算力约 30 TOPS。
- 例如天籁鸿蒙座舱版:15.6 英寸 2K 华为智慧屏 + 骁龙 8295,实现旗舰级流畅体验。
- AMS 感知硬件:
- HarmonySpace 6 搭载三合一 AMS 系统:800 万像素 RGB + 200 万像素红外 + 星闪传感器,用于疲劳检测、生命体征监测等。
2)推理框架与部署形态
- MoLA 2.0 架构:
- System Agent:千亿级参数多模态端到端大模型,负责全局意图理解与任务拆解。
- 垂域 Agent:导航、车控、智驾 ADS、聊天、生活服务等智能体,各自负责本领域执行。
- 通过 A2A(Agent-to-Agent)协议实现跨域协同。
3)模型参数类型与能力分工
| System Agent | 端侧为主、云端增强 | 千亿级参数多模态大模型 | 全局模糊语义理解、任务拆解、跨 Agent 调度 |
| 垂域 Agent | 端侧 | 多个垂域模型(导航/车控/智驾等) | 领域内指令理解与执行 |
| AMS 多模态感知 | 端侧 | 视觉+红外+星闪感知模型 | 疲劳检测、生命体征监测、肢体动作识别 |
| 云端大模型与服务 | 云端 | 未披露具体参数规模 | 云端知识库、第三方服务接入(点餐、支付等) |
华为官方更多披露的是“千亿级参数”和“MoLA 架构”,并未拆分端侧与云端具体模型规模;在骁龙 8295 上,千亿模型更多是云端/边缘侧协同,端侧通常为裁剪版本。
5. 其他量产路线(简要)
- 广汽星河智舱 ADiGO Intelligence:
- 官方披露“端云一体架构 + 自研 AIOS 底层 + 多模态感知引擎 + 多智能体协同引擎 + 情感表达引擎”。
- 座舱芯片多为骁龙 8295 级别,端侧部署多模态感知模型,大模型推理以云端为主,具体参数规模未披露。
- 比亚迪 DiLink AI + 超级智能体“迪迪虾”:
- 官方定义“AIOS + 超级智能体引擎 + Agent 开放平台”。
- 座舱芯片多为 8295 级,端侧做语音识别与多模态感知,大模型推理更多在云端,具体端侧模型参数未公开。
三、从“选型视角”提炼:端侧模型部署的关键决策点
下面这张表把“芯片算力 → 模型规模 → 能力覆盖”的关系做一梳理(仅基于公开披露与行业经验):
| ~30 TOPS(骁龙 8295) | 1–3B 量化模型;高负载场景可考虑 7B INT4 | 增强型语音助手、简单问答、多模态感知、车控意图理解 | 鸿蒙座舱(天籁等)、比亚迪 DiLink AI 等 |
| ~100–200 TOPS(8295 + 外挂 AI Box) | 3–7B 模型,可尝试 10B 量化(需要强 NPU) | 多轮对话、车况问答、轻量 VLM 能力、部分离线场景 | 部分中高端车型 AI Box 方案 |
| ≥ 750 TOPS(自研座舱 AI 芯片) | 10B 级 VLM/LLM 本地运行 | 多模态感知 + 本地推理 + 离线可用,与智驾 VLA 协同 | 小鹏天玑 AIOS 6.0 |
| 中央计算平台(舱驾融合) | 多模态感知本地 + 大模型端云协同 | 感知隐私数据本地处理;复杂任务云端大模型 + 多 Agent | 蔚来 ADAM + NOMI GPT |
| 自研智驾芯片 + 座舱芯片组合 | VLA 端侧 + 座舱 VLM 端侧 | 智驾与座舱一体化智能体,语音直接控制智驾 | 理想马赫 M100 + 8295;小鹏图灵芯片 |
1. 芯片硬件架构选型要点
- 座舱芯片:骁龙 8295 已成为“AI 座舱标配”
- 5nm 工艺,CPU 230K DMIPS,GPU 3.1 TFLOPS,AI 算力约 30 TOPS。
- 能支撑多屏联动、增强语音助手、多模态感知,但对于 10B 级大模型本地推理仍有压力,需要外挂 AI Box 或自研大算力芯片。
- 舱驾融合 / 中央计算平台
- 蔚来 ADAM 模式:骁龙 8295 + Orin X,跨域算力共享,适合多模态大模型端侧部署。
- 选型时要关注:跨域带宽、内存带宽、散热与功耗约束。
- 自研 AI 芯片(小鹏图灵、理想马赫)
- 优势:
- 座舱与智驾统一算力池,VLM + VLA 协同更顺畅;
- 可针对自研模型做指令集/内存层次优化。
- 劣势:
- 生态和工具链相对高通/英伟达更不成熟,需要自建推理框架与部署工具。
- 优势:
2. 推理框架与软件栈选型
结合行业实践与公开信息,可以归纳为:
- 自研路线(小鹏、理想、蔚来、华为):
- 都有自研训练/推理框架:
- 小鹏:TuringViT 面向高分辨率视觉模型端侧部署;
- 理想:TaskFormer 架构支撑 Mind GPT;
- 蔚来:自研端云一体认知中枢和情感引擎;
- 华为:MoLA 架构 + MindSpore/思云生态(从公开资料推断)。
- 都有自研训练/推理框架:
- 通用芯片路线(骁龙 8295):
- 多采用高通 AI Stack + 厂商自研调度框架:
- 支持 INT4/INT8 量化、多模型并发;
- 需要结合语音、视觉、推荐等多任务做模型编排。
选型建议:
- 多采用高通 AI Stack + 厂商自研调度框架:
- 若采用 8295,建议:
- 端侧部署 1–3B 量化模型为主,通过知识蒸馏/剪枝压缩;
- 将隐私敏感的感知(DMS/OMS)和多模态拒识放在本地;
- 复杂问答和长上下文推理走云端大模型。
- 若采用自研大算力芯片或中央计算平台:
- 可大胆尝试 7–10B 级 VLM/LLM 本地部署,结合智驾 VLA 做端到端闭环;
- 推理框架需支持:多模型编排、端云路由、量化与内存优化、安全与审计。
3. 模型参数类型与能力边界
结合公开资料和行业经验,可以给出一个“经验性”的端侧能力边界:
- ~1–3B 模型(8295 典型):
- 适合:单轮问答、车控意图理解、简单闲聊、轻量推荐。
- 不适合:复杂多步推理、长上下文写作、高质量代码生成。
- ~7B 模型(需要强 NPU/外挂 AI Box):
- 可做多轮对话、简单推理、中等复杂度问答;
- 需要重度量化(INT4)和算子优化,否则首字延迟难以满足车载语音 <500ms 的要求。
- ~10B 级 VLM(需要 750+ TOPS):
- 能做:多模态感知(看车内/看环境)+ 多轮推理 + 本地记忆库;
- 小鹏天玑 AIOS 6.0 宣称“行业首个端侧座舱 VLM + 750 TOPS 算力”,即为此类路线。
四、总结:如何做端侧模型部署调研选型
结合上述量产案例,可以归纳一套“调研→选型”的方法:
- 从量产车型出发,反向确认硬件与算力
- 查阅官方配置页与拆解文章,确认座舱芯片型号(8295/8155/自研)、是否外挂 AI Box、舱驾是否融合。
- 从官方技术文章中提取“端侧部署关键词”
- 若出现“端侧多模态感知”“端侧 VLM”“本地记忆库”“离线可用”,说明端侧模型有实质部署;
- 若仅提“端云大模型”“大模型上车”,多数是云端为主、端侧为辅。
- 从架构推断模型分工与协同方式
- System Agent + 多垂域 Agent(华为 MoLA) → 大模型负责调度,垂域模型负责执行;
- VLM + VLA(小鹏、理想) → 座舱与智驾统一模型空间,语音可直接驱动智驾。
- 根据芯片算力与公开披露,反推“可行模型规模”
- 8295 → 侧重 1–3B 端侧 + 云端大模型;
- 750 TOPS 自研芯片 → 10B 级 VLM 端侧可行;
- 中央计算平台 → 多模态感知本地 + 大模型端云协同。
如果你后续需要,我可以帮你把上述内容整理成一张“车企-芯片-端侧模型规模-能力分工”的对比表,方便直接放入调研报告。
更多推荐



所有评论(0)