“你在鸿蒙上能不能跑个大模型?”

电话那头是产品总监老陈,声音听起来不是商量,是通知。我愣了一下,手指无意识地敲着桌面上那台Pura 70真机。跑大模型?不是应该在云端跑吗?手机里那点内存、那点算力、那点电池,能干什么?

"不是云端那种。"老陈像是看穿了我的想法,“我们做的是办公助手,用户可能问一些内部文档的问题,数据上云合规那边过不了。你要想办法让模型在手机本地跑,至少把常见问题在本地消化掉。”

我挂了电话,盯着屏幕上那台HarmonyOS设备的系统信息:12GB RAM,NPU算力大约4 TOPS。云端一个GPT-4级别的模型参数量上万亿,手机里的空间连它的一个零头都装不下。但那天晚上我没睡着,不是因为难,是因为我意识到,过去四年我在移动端踩过的坑——内存、功耗、流畅度、包体积——可能正是一扇新门。

一、那通电话:老板要我在手机里跑个大模型

第二天一早,我把Android组的老王和iOS组的小林叫到会议室。三个人,四杯咖啡,一台投影仪。

"我查了一晚上。"我把笔记本转过去,屏幕上是MLC-LLM和llama.cpp的GitHub页面,“现在要在端侧跑LLM,主要就两条路。一条是MLC-LLM, tvm 那一套,对手机GPU/NPU支持比较好;另一条是llama.cpp,C++实现的,主打纯CPU推理,兼容性好。”
"哪个能跑在HarmonyOS上?"老王问。
"llama.cpp的C++核心可以移植,MLC-LLM现在对HarmonyOS的NPU支持还在社区早期阶段。"我说,“但我们可以先用CPU版本验证,再逐步接入NPU。”
"包体积呢?"小林永远关心这个,“上个版本我们刚把App从180MB压到120MB,加个模型不得炸?”
"会炸。"我直接说,“所以必须做量化。一个7B模型FP16是14GB,GGUF Q4量化之后能到4GB左右,INT4还能更小。我们第一批只服务常见问答,用1B-3B的小模型试试。”

会议室安静了半分钟。大家意识到,这不是一个"加个SDK"的需求,是一个要从底层重新设计的工程问题。

二、端侧模型不是"缩小版云端",是另一个工程问题

很多人以为端侧AI就是"把云端模型变小",放在手机里。真正做起来才发现,这是完全不同的工程范式。

云端模型追求的是吞吐量和准确率,可以堆GPU、做批处理、用大模型。端侧模型追求的是:能不能在用户点击后200毫秒内响应,手机会不会发烫,电池能撑多久,模型文件会不会让App体积翻倍,能不能在后台低功耗运行。

我做的第一件事,不是写代码,是定义指标。我们对端侧模型提了四个硬指标:

  • 首token时间(TTFT)< 500ms
  • 生成速度 > 10 tokens/秒
  • 单次推理耗电 < 50mAh
  • 设备温升 < 5℃(持续3分钟对话后)

这四个指标,以前做App性能优化的时候几乎天天见。帧率、响应时间、CPU占用、发热,换个名字而已。我画了一个简单的架构图:最底层是模型推理引擎(llama.cpp/MLC-LLM),中间是模型管理层(加载、量化、缓存、热切换),上层是业务封装层(对话、摘要、翻译、文档问答)。业务层调用本地模型,本地回答不了时再走云端。

这个"本地优先、云端兜底"的策略,后来成了整个端侧AI应用的核心原则。

三、量化:把70GB的模型塞进4GB运存

端侧模型能不能跑,80%取决于量化做得好不好。

我第一次接触GGUF格式是在llama.cpp的仓库里。它是Georgi Gerganov设计的一种二进制格式,把模型权重和超参数打包在一起,支持多种量化方案:Q4_0、Q5_K_M、Q6_K、Q8_0。简单来说,Q4是4bit量化,每个参数占0.5字节;Q8是8bit,占1字节。精度越高,模型越大,推理质量越好;精度越低,速度越快,内存占用越小。

我们选了一个开源的3B中文对话模型做实验。FP16版本大约6GB,直接放到手机里加载,系统直接杀进程。我们先用Q4_K_M量化,体积降到1.8GB,加载后内存占用约2.5GB。在HarmonyOS后台测试,可以稳定运行,但回答质量有明显下降,偶尔会出现语法不通的句子。

后来改成混合量化:attention层用Q5_K_M,FFN层用Q4_K_M。这样关键层的精度更高,整体体积只增加了约15%,但回答质量提升了一个档次。我们内部用BLEU和人工评分对比,混合量化版本比纯Q4好18%。

# 我们实际用的量化命令示例
python convert_hf_to_gguf.py --outfile model_q4_k_m.gguf --outtype q4_k_m ./model_dir
python convert_hf_to_gguf.py --outfile model_mixed.gguf --outtype q4_k_m --vocab-type bpe ./model_dir
# 后续用llama.cpp的perplexity工具做质量评估
./perplexity -m model_q4_k_m.gguf -f test.txt

量化不是一次性工作。我们要持续测试不同量化方案对业务场景的影响。比如FAQ问答对精度要求不高,可以压得更狠;代码生成对语法敏感,就要保留更高精度。我们建了一个内部模型仓库,每个模型版本都标注了量化类型、端侧指标、业务评分。

四、端云协同:什么时候本地,什么时候上云

端侧模型再强,也不可能替代云端。我们做了一个三层路由策略:

第一层,本地模型处理。常见FAQ、日报摘要、简单翻译、本地文档检索,全部走本地。这些请求占用户日常问题的70%左右,不需要联网,响应快,数据安全。

第二层,云端小模型处理。本地模型回答不了的问题,或者用户明确要求联网查询(比如"今天的股价"“最新的新闻”),走云端。这里用的是和我们内部私有云部署的7B模型通信,数据不外泄。

第三层,云端大模型处理。复杂推理、长文档分析、创意写作,交给云端13B甚至70B模型。这类请求占比不到10%,但对体验很重要。

路由决策不是固定规则。我们在本地模型上加了一个"置信度打分":如果模型对答案的置信度高于0.85,直接返回;低于0.6,直接转云端;中间区间,先尝试本地生成,如果用户不满意再转云端。这个阈值我们也是根据用户反馈反复调的。

"你这个端云协同,和以前的离线缓存是不是一回事?"老王有次问我。
"像,但不完全是。"我说,“离线缓存是静态数据,端云协同是动态推理。模型自己会判断能不能答,这和以前写死规则不一样。”

为了降低切换时的体验断层,我们做了上下文同步。本地对话的最近三轮上下文会加密上传到云端,云端模型接续时不会让用户感觉"换了一个机器人"。这个上下文的同步窗口是5轮,超过后只传摘要,平衡体验与隐私。

五、功耗与流畅度:移动端的旧经验复活

端侧推理最可怕的,不是慢,是手机变烫、电池狂掉。我拿着Pura 70跑了一个未优化版本,3分钟对话后手机背面温度从28℃升到41℃,电量掉了8%。这要是正式上线,用户能直接把App卸载了。

我把以前做移动端性能优化的那套工具全拿出来了。Systrace、Profiler、温度监控、功耗采样,一样样测。发现主要问题有几个:

第一,推理时CPU大核被拉满,没有限制频率。我们加了线程亲和性配置,让推理线程固定跑在小核上,大核只在首token加载时短暂唤醒。 llama.cpp的n_threads参数不能随便拉满,要匹配设备核心数和散热能力。

// 端侧推理配置示例
llama_model_params model_params = llama_model_default_params();
llama_context_params ctx_params = llama_context_default_params();
ctx_params.n_threads = 4;          // 小核4线程,避免拉爆大核
ctx_params.n_threads_batch = 2;      // batch推理用2线程
ctx_params.n_ctx = 2048;           // 上下文长度控制

第二,模型加载时内存抖动。我们改成预加载+热启动:App启动时后台静默加载模型到内存,用户第一次提问时TTFT从原来的1.2秒降到180ms。代价是启动时多占用300MB内存,但现代手机可以接受。

第三,没有推理暂停机制。用户切到后台时,推理还在继续。我们加了生命周期监听:App进入后台3秒后,如果还有未完成的推理任务,先暂停,等回到前台再恢复。这个策略对长文本生成场景特别重要。

第四,是模型切换策略。我们预置了三个模型:本地小模型(1B)、本地中模型(3B)、云端模型。根据任务复杂度动态选择,避免大材小用。小模型单次推理耗电约12mAh,中模型约35mAh,差距三倍。

做完这一轮优化,持续对话3分钟,温度控制在36℃以内,电量消耗降到2.5%。虽然还是不能和纯文本聊天比,但已经到了可接受的商业水准。

六、后记:端侧工程师的独特位置

做端侧AI这半年,我越来越觉得,移动端的经验不是被AI替代了,而是被AI重新定价了。

以前我们做App,拼的是UI流畅、内存稳定、包体小。现在做端侧AI,拼的是模型加载速度、量化精度、功耗控制、端云协同。底层能力没变,只是应用场景换到了模型推理上。

移动端的不可替代性,恰恰在于我们理解"资源受限环境"。我们见过OOM,见过后台被杀,见过弱网,见过发热降频。这些经验放到端侧AI里,都是真实会踩的坑。云端工程师很难想象一个模型推理请求会因为"手机在省电模式"而失败,但我们每天都会面对。

如果你也是移动开发出身,想转端侧AI,我的建议如下:

第一,从llama.cpp或MLC-LLM的Demo跑起。别一上来就追求NPU,先在CPU上把量化和推理流程跑通,理解模型加载、token生成、上下文管理这些基础概念。

第二,把量化当作核心技术来学。GGUF、AWQ、GPTQ这些方案都要了解,知道不同精度对质量、速度、内存的影响。端侧AI的性能上限,很大程度上由量化决定。

第三,关注设备差异。不同手机、不同HarmonyOS版本、不同NPU支持情况,表现可能完全不同。你要建立一套设备分级和降级策略,而不是一套代码跑所有设备。

第四,别忽视功耗和体验。端侧AI不是实验室指标,是要真实用户拿在手里用的。温度、电量、响应时间、流畅度,这些才是决定用户留不留的关键。

那天晚上,我又把Pura 70拿在手里。屏幕上是一个本地运行的对话界面,我输入"帮我总结一下今天收到的三封邮件",模型在本地开始推理,没有转圈,没有上云。200毫秒后,第一个字出现在屏幕上。我忽然觉得,四年的移动端经验,终于找到了下一个值得投入的地方。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐