一、整体结论:端侧选型三条典型路线

  1. “强算力 + 自研大模型”路线(小鹏、理想、华为)
    • 车端算力 750 TOPS 量级(自研图灵芯片或 8295+AI Box),支持 10B 级 VLM 本地运行,偏“端侧优先”。
    • 典型:小鹏天玑 AIOS 6.0 的座舱 VLM、理想 Mind GPT 在车端的部署、华为 MoLA 2.0 的 System Agent。
  2. “中央计算平台 + 端云协同大模型”路线(蔚来)
    • 中央计算平台 ADAM:骁龙 8295 座舱 + Orin X 智驾,算力共享,多模态感知模型本地部署,大模型能力以“端云一体认知中枢”形式呈现。
    • 强调:隐私敏感的感知在本地,复杂推理在云端。
  3. “主流座舱芯片 + 适度端侧推理”路线(多数采用 8295 的鸿蒙座舱车型、比亚迪等)
    • 座舱芯片以骁龙 8295(AI 算力约 30 TOPS)为主,做增强型语音助手、多模态感知;大模型推理更多在云端,或端侧部署小模型(~1–3B)。
    • 代表:搭载鸿蒙座舱 5/6 的合资/自主品牌车型(天籁、铂智 7 等)。
      下面按厂商展开。

二、按厂商拆解:量产车型 + 真实披露数据

1. 小鹏天玑 AIOS 6.0(2026 款 P7+ / G7 等)

量产车型

  • 2026 款小鹏 P7+、G7、G6、G9、X9 等搭载天玑 AIOS 6.0。
1)芯片硬件架构
  • 座舱算力:
    • 天玑 AIOS 6.0 宣称“智能座舱有效算力 750 TOPS”,由自研座舱图灵 AI 芯片提供。
    • 部分车型同时搭载高通骁龙 8295P 或联发科 MT8676 作为主控芯片。
  • 智驾算力:
    • 第二代 VLA 智驾系统采用自研图灵 AI 芯片,旗舰车型(如 P7+)可搭载三颗图灵芯片,总算力 2250 TOPS。

这里的“有效算力 750 TOPS”是官方宣传口径,未拆分 NPU/GPU;但可以确认的是:小鹏在座舱侧部署了远高于 8295(30 TOPS)的算力,为端侧 VLM 提供空间。

2)推理框架与部署形态
  • 官方明确:
    • “行业首个落地端侧座舱视觉语言模型(VLM)”。
    • VLM 可实现:跨场景多轮对话、车况问答、本地记忆库、与第二代 VLA 联动(语音→智驾执行)。
  • 推理框架:
    • 未公开具体框架名称,但强调“自研 VLM + 图灵芯片”的协同推理。
    • 面向视觉大模型,小鹏发布了 TuringViT,主打高分辨率视觉 Transformer 的端侧高效推理——这类技术很可能用于座舱视觉感知与智驾 VLA。
3)模型参数类型与能力分工
座舱 VLM 端侧(图灵芯片) ~10B 参数级视觉语言模型(官方未精确披露,但行业报道强调“10B 参数大模型在车端运行”) 多轮对话、车况问答、环境感知(用户穿着、车内状态)、本地记忆库,离线场景问答
第二代 VLA(智驾) 端侧(图灵芯片) 端到端 VLA(视觉-语言-动作)模型 智驾感知-预测-规划一体化,与座舱 VLM 协同,实现“一句话自动驾驶”
云端大模型 云端 更大参数基座模型(未公开具体规模) 复杂推理、云端知识库、接入第三方服务生态
协同工作方式
  • 本地优先:
    • 高频语音指令、车况问答、环境感知由端侧 VLM 完成,强调“主动服务座舱”和“离线可用”。
  • 端云协同:
    • 复杂多步任务、云端知识检索和第三方服务由云端大模型协助完成。
  • VLM + VLA 联动:
    • VLM 理解用户自然语言意图,交给 VLA 执行自动驾驶,实现“带我去附近星巴克并直接停到门口”的闭环。

2. 蔚来 NOMI GPT(Banyan·榕 智能系统)

量产车型

  • 搭载 Banyan·榕 智能系统的 2024/2025 款 ES6、ET5、ET7、ES7 等车型。
1)芯片硬件架构
  • 中央计算平台 ADAM:
    • 集成 1 颗骁龙 8295 智能座舱芯片 + 4 颗英伟达 Orin X 智驾芯片。
    • 官方宣称总算力 1016 TOPS,并支持“智驾、智舱和整车控制最大 256 TOPS 算力共享”。
  • 架构特点:
    • 从“舱驾分离域控”升级为“中央计算平台”,跨域带宽从千兆提升到 16 Gbps,实现多域间高速互联。
2)推理框架与部署形态
  • NOMI GPT 架构:
    • 端云多模态大模型,包含:自研多模态感知、自研认知中枢、情感引擎、多专家 Agent。
  • 端侧多模态感知:
    • 官方称“行业领先的端侧多模态感知能力”,车内联网不再是使用 NOMI 的必须条件,强调“看得见、认得出”,敏感信息不出车。
  • 认知中枢与情感引擎:
    • 认知中枢实现调度分发、多模拒识、跨域继承/跳转、多 Agent 决策等。
    • 情感引擎结合短期/长期记忆,实现情绪识别、个性化人设等。
3)模型参数类型与能力分工
端侧多模态感知模型 端侧(骁龙 8295 + Orin X 共享算力) 未公开具体参数,官方强调“端侧多模态感知大模型” 车内物体识别、乘员识别、情绪判断、多模态拒识(判断哪些话是对 NOMI 说)
NOMI GPT 认知中枢 端云一体 “数十亿级参数模型” 意图理解、任务调度、多 Agent 协同、百科问答、无限趣聊、场景生成
情感引擎 端侧为主 结合记忆网络 情绪识别、个性化氛围灯、音乐联动等
多专家 Agent 端云协同 NIO Agents、User Agents、三方 Agents 车控、服务预约、社区互动、第三方 API 调用

注:官方未精确公开端侧模型参数规模,仅披露“数十亿级参数”的总体模型规模,并未拆分端侧与云端的具体参数量。
协同工作方式

  • 端侧感知:
    • 多模态感知模型在本地处理视觉、语音等输入,保障隐私和弱网可用。
  • 端云协同推理:
    • 复杂问答、百科、多 Agent 协同由 NOMI GPT 认知中枢在云端协同完成。
  • 跨域算力共享:
    • 座舱与智驾算力可在 ADAM 内统一调度,提升多模态大模型部署效率。

3. 理想 Mind GPT(理想同学)

量产车型

  • 理想 L 系列车型(L6/L7/L8/L9/MEGA 等)通过 OTA 升级 Mind GPT,支撑车载“理想同学”。
1)芯片硬件架构
  • 座舱芯片:
    • 新一代理想 L6 等车型搭载高通骁龙 8295 座舱芯片,为多屏联动和大模型推理提供算力。
  • 自研智驾芯片:
    • 理想自研马赫 M100 芯片,5nm 车规级工艺,单芯片算力 1280 TOPS,用于智驾 VLA 大模型。
2)推理框架与部署形态
  • Mind GPT:
    • 自研多模态认知大模型,采用 TaskFormer 架构,训练数据规模 3T Token。
    • 通过 OTA 升级,支持免唤醒交互、方言识别、知识问答、出行规划、内容生成等。
  • 车端部署:
    • Mind GPT 作为“认知大模型”上车,官方强调“围绕车载场景打造”,具备记忆网络、工具调用、搜索引擎接入等能力。
3)模型参数类型与能力分工
Mind GPT 基座 端云协同 自研 TaskFormer 架构,3T Token 训练,参数规模未精确披露 知识问答、出行规划、内容生成、工具调用(300+ 工具)
理想同学智能体框架 端侧为主 基于 Mind GPT 的智能体系统 任务拆解、工具编排、多轮对话
马赫 VLA(智驾) 端侧(马赫 M100) VLA 端到端大模型 智驾规划与控制,与座舱协同

官方公开的是训练数据规模与架构,而非具体参数规模;车端部署多少参数目前未披露。
协同工作方式

  • 端侧:
    • 多模态感知和部分推理在车端完成,强调车内交互和隐私保护。
  • 云端:
    • 接入 DeepSeek-R1/V3 等大模型用于复杂推理与联网搜索。
  • 工具与 Agent:
    • Mind GPT 作为控制器,调用外部工具与搜索引擎,扩展能力边界。

4. 华为鸿蒙座舱 HarmonySpace 5/6(MoLA 2.0)

量产车型

  • 广汽丰田铂智 7 搭载鸿蒙座舱 HarmonySpace 5(MoLA 架构)。
  • 东风日产天籁鸿蒙座舱版、阿维塔 12 等搭载鸿蒙座舱 5/5.2/6,使用骁龙 8295 芯片。
1)芯片硬件架构
  • 座舱芯片:
    • 多款鸿蒙座舱车型搭载高通骁龙 8295,AI 算力约 30 TOPS。
    • 例如天籁鸿蒙座舱版:15.6 英寸 2K 华为智慧屏 + 骁龙 8295,实现旗舰级流畅体验。
  • AMS 感知硬件:
    • HarmonySpace 6 搭载三合一 AMS 系统:800 万像素 RGB + 200 万像素红外 + 星闪传感器,用于疲劳检测、生命体征监测等。
2)推理框架与部署形态
  • MoLA 2.0 架构:
    • System Agent:千亿级参数多模态端到端大模型,负责全局意图理解与任务拆解。
    • 垂域 Agent:导航、车控、智驾 ADS、聊天、生活服务等智能体,各自负责本领域执行。
    • 通过 A2A(Agent-to-Agent)协议实现跨域协同。
3)模型参数类型与能力分工
System Agent 端侧为主、云端增强 千亿级参数多模态大模型 全局模糊语义理解、任务拆解、跨 Agent 调度
垂域 Agent 端侧 多个垂域模型(导航/车控/智驾等) 领域内指令理解与执行
AMS 多模态感知 端侧 视觉+红外+星闪感知模型 疲劳检测、生命体征监测、肢体动作识别
云端大模型与服务 云端 未披露具体参数规模 云端知识库、第三方服务接入(点餐、支付等)

华为官方更多披露的是“千亿级参数”和“MoLA 架构”,并未拆分端侧与云端具体模型规模;在骁龙 8295 上,千亿模型更多是云端/边缘侧协同,端侧通常为裁剪版本。


5. 其他量产路线(简要)

  • 广汽星河智舱 ADiGO Intelligence
    • 官方披露“端云一体架构 + 自研 AIOS 底层 + 多模态感知引擎 + 多智能体协同引擎 + 情感表达引擎”。
    • 座舱芯片多为骁龙 8295 级别,端侧部署多模态感知模型,大模型推理以云端为主,具体参数规模未披露。
  • 比亚迪 DiLink AI + 超级智能体“迪迪虾”
    • 官方定义“AIOS + 超级智能体引擎 + Agent 开放平台”。
    • 座舱芯片多为 8295 级,端侧做语音识别与多模态感知,大模型推理更多在云端,具体端侧模型参数未公开。

三、从“选型视角”提炼:端侧模型部署的关键决策点

下面这张表把“芯片算力 → 模型规模 → 能力覆盖”的关系做一梳理(仅基于公开披露与行业经验):

~30 TOPS(骁龙 8295) 1–3B 量化模型;高负载场景可考虑 7B INT4 增强型语音助手、简单问答、多模态感知、车控意图理解 鸿蒙座舱(天籁等)、比亚迪 DiLink AI 等
~100–200 TOPS(8295 + 外挂 AI Box) 3–7B 模型,可尝试 10B 量化(需要强 NPU) 多轮对话、车况问答、轻量 VLM 能力、部分离线场景 部分中高端车型 AI Box 方案
≥ 750 TOPS(自研座舱 AI 芯片) 10B 级 VLM/LLM 本地运行 多模态感知 + 本地推理 + 离线可用,与智驾 VLA 协同 小鹏天玑 AIOS 6.0
中央计算平台(舱驾融合) 多模态感知本地 + 大模型端云协同 感知隐私数据本地处理;复杂任务云端大模型 + 多 Agent 蔚来 ADAM + NOMI GPT
自研智驾芯片 + 座舱芯片组合 VLA 端侧 + 座舱 VLM 端侧 智驾与座舱一体化智能体,语音直接控制智驾 理想马赫 M100 + 8295;小鹏图灵芯片

1. 芯片硬件架构选型要点

  1. 座舱芯片:骁龙 8295 已成为“AI 座舱标配”
    • 5nm 工艺,CPU 230K DMIPS,GPU 3.1 TFLOPS,AI 算力约 30 TOPS。
    • 能支撑多屏联动、增强语音助手、多模态感知,但对于 10B 级大模型本地推理仍有压力,需要外挂 AI Box 或自研大算力芯片。
  2. 舱驾融合 / 中央计算平台
    • 蔚来 ADAM 模式:骁龙 8295 + Orin X,跨域算力共享,适合多模态大模型端侧部署。
    • 选型时要关注:跨域带宽、内存带宽、散热与功耗约束。
  3. 自研 AI 芯片(小鹏图灵、理想马赫)
    • 优势:
      • 座舱与智驾统一算力池,VLM + VLA 协同更顺畅;
      • 可针对自研模型做指令集/内存层次优化。
    • 劣势:
      • 生态和工具链相对高通/英伟达更不成熟,需要自建推理框架与部署工具。

2. 推理框架与软件栈选型

结合行业实践与公开信息,可以归纳为:

  • 自研路线(小鹏、理想、蔚来、华为)
    • 都有自研训练/推理框架:
      • 小鹏:TuringViT 面向高分辨率视觉模型端侧部署;
      • 理想:TaskFormer 架构支撑 Mind GPT;
      • 蔚来:自研端云一体认知中枢和情感引擎;
      • 华为:MoLA 架构 + MindSpore/思云生态(从公开资料推断)。
  • 通用芯片路线(骁龙 8295)
    • 多采用高通 AI Stack + 厂商自研调度框架:
      • 支持 INT4/INT8 量化、多模型并发;
      • 需要结合语音、视觉、推荐等多任务做模型编排。
        选型建议:
  • 若采用 8295,建议:
    • 端侧部署 1–3B 量化模型为主,通过知识蒸馏/剪枝压缩;
    • 将隐私敏感的感知(DMS/OMS)和多模态拒识放在本地;
    • 复杂问答和长上下文推理走云端大模型。
  • 若采用自研大算力芯片或中央计算平台:
    • 可大胆尝试 7–10B 级 VLM/LLM 本地部署,结合智驾 VLA 做端到端闭环;
    • 推理框架需支持:多模型编排、端云路由、量化与内存优化、安全与审计。

3. 模型参数类型与能力边界

结合公开资料和行业经验,可以给出一个“经验性”的端侧能力边界:

  • ~1–3B 模型(8295 典型)
    • 适合:单轮问答、车控意图理解、简单闲聊、轻量推荐。
    • 不适合:复杂多步推理、长上下文写作、高质量代码生成。
  • ~7B 模型(需要强 NPU/外挂 AI Box)
    • 可做多轮对话、简单推理、中等复杂度问答;
    • 需要重度量化(INT4)和算子优化,否则首字延迟难以满足车载语音 <500ms 的要求。
  • ~10B 级 VLM(需要 750+ TOPS)
    • 能做:多模态感知(看车内/看环境)+ 多轮推理 + 本地记忆库;
    • 小鹏天玑 AIOS 6.0 宣称“行业首个端侧座舱 VLM + 750 TOPS 算力”,即为此类路线。

四、总结:如何做端侧模型部署调研选型

结合上述量产案例,可以归纳一套“调研→选型”的方法:

  1. 从量产车型出发,反向确认硬件与算力
    • 查阅官方配置页与拆解文章,确认座舱芯片型号(8295/8155/自研)、是否外挂 AI Box、舱驾是否融合。
  2. 从官方技术文章中提取“端侧部署关键词”
    • 若出现“端侧多模态感知”“端侧 VLM”“本地记忆库”“离线可用”,说明端侧模型有实质部署;
    • 若仅提“端云大模型”“大模型上车”,多数是云端为主、端侧为辅。
  3. 从架构推断模型分工与协同方式
    • System Agent + 多垂域 Agent(华为 MoLA) → 大模型负责调度,垂域模型负责执行;
    • VLM + VLA(小鹏、理想) → 座舱与智驾统一模型空间,语音可直接驱动智驾。
  4. 根据芯片算力与公开披露,反推“可行模型规模”
    • 8295 → 侧重 1–3B 端侧 + 云端大模型;
    • 750 TOPS 自研芯片 → 10B 级 VLM 端侧可行;
    • 中央计算平台 → 多模态感知本地 + 大模型端云协同。
      如果你后续需要,我可以帮你把上述内容整理成一张“车企-芯片-端侧模型规模-能力分工”的对比表,方便直接放入调研报告。
Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐