登录社区云,与社区用户共同成长
邀请您加入社区
时间里程碑意义2024年12月与vLLM社区合作启动Hardware pluggable RFC奠定架构基础2025年2月vllm-project/vllm-ascend仓库创建项目正式诞生2025年5月v0.7.3首个正式版本发布生产就绪2026年8月v0.23.0发布与上游vLLM保持同步。
1)创建用户2)获取显卡对应的驱动(910B)3)安装NPU驱动(1)安装NPU固件(2)安装CANN软件包名称说明开发套件,包含推理/训练工具链、AI框架适配、ATC模型转换工具等面向 Atlas A2 系列 的算子包,910B4 属于 A2 系列,必须安装此包加速库(如深度神经网络库),建议安装,可提升运行时性能昇腾显卡的运行时环境(3)安装Ascend-cann-toolkit(4)安装 A
让一点也不懂推理加速、算子优化的Agent工程师,也能看懂什么是算子优化!记录使用一款阶跃的内测模型在香橙派AI Pro 8T板子上,让minicpm-v4.6跑在华为昇腾310B4 NPU上的经历。
10小时搭建类CUDA底座,并没有颠覆CUDA,但击穿了英伟达最外围的生态壁垒。过去新芯片想要活下去,必须砸重金养几十上百人的底层软件团队;现在依靠AI Agent,初创芯片企业十几小时就能让芯片发挥九成算力,极大降低AI芯片赛道的生态入场门槛,会加速全球异构算力时代到来。如果你需要,我可以补充:昇腾、壁仞、AMD当前自动算子方案和Ignition的横向对比表格。
昇腾 Model-Agent 是华为昇腾面向NPU生态开源的模型全流程自动化智能体框架,核心解决GPU模型迁移昇腾、模型适配、量化、推理调优、部署验证、文档生成全链路重复工程工作,把昇腾CANN、torch_npu专家经验封装成可复用模块化Skill技能库,实现一句话自动完成模型落地,大幅降低昇腾开发门槛。2. 四大核心引擎能力Dynamic Workflow 动态工作流引擎替代静态提示词,LLM
负责技术核验的李工接过话头说,这种情况太常见了,很多厂商标称的算力是硬件裸芯片的理论峰值,根本没算上系统运行、视频解码、算法调度本身要占用的基础算力,最后留给推理任务的可用算力连标称值的30%都不到,项目进场之后返工的人力、时间成本至少是设备采购成本的两倍。在场的另一个做集成的老周说,这种情况他们也遇到过,很多传统的AI硬件设备,要改识别规则必须原厂的算法工程师改代码,普通的现场技术人员根本操作不
在材料科学领域,密度泛函理论(DFT)是计算材料性质的金标准,但其高昂的计算成本严重制约了大规模材料筛选和分子动力学模拟的效率。机器学习势能(Machine Learning Potential, MLP)为这一问题提供了新的解决思路——通过在 DFT 数据上训练神经网络,实现接近 DFT 精度但快几个数量级的原子模拟。CHGNet。
推理应用开发的核心载体,内置完整大模型推理 SDK,集成深度定制模型库、推理优化器、运行时调度环境,开发者通过 Python/C++ API 即可快速封装对话、生成、工具调用等推理业务逻辑,原生支持 MoE、MLA、Multi-LoRA、函数调用等当前主流大模型能力。除此之外,本地轻量化推理开发还有 llama.cpp、Ollama、MLX 等工具,主打单机离线、端侧小型模型调试,高并发云端推理应
PyPTO 确实会自动生成 AscendC(昇腾算子C++)源码,支持JIT隐式生成与手动导出源码两种模式;PyPTO =手写式算子开发框架(可控、高性能、生产首选);全自动代码生成工具(免手写、原型快速验证、学术原型,不适合线上极致性能算子)。
为满足持续增长的算力效率需求,神经网络处理器(NPU)已成为现代AI基础设施的核心组件。但想要充分释放NPU硬件性能,必须基于厂商专属领域专用语言(DSL)开发高性能计算内核,该工作对硬件专业知识要求极高,人力成本巨大。尽管大语言模型(LLM)在通用代码生成领域表现亮眼,但在NPU场景下,受限于严苛的硬件约束与领域训练数据稀缺两大问题,生成效果极差。本文前期验证显示,现有主流通用大模型几乎无法生成
高度重合风险:AscendKernelGen已完整覆盖本方案全部诉求(32B基座、CoT数据集、SFT+RL训练、昇腾内核生成),若跳过基线评测直接从零自研,存在严重重复造轮子问题,技术评审、对外成果输出均存在短板;方法论统一:全赛道SOTA项目均采用两阶段训练,原方案仅SFT单阶段存在明显技术缺陷,必须补充RL执行反馈环节;数据集对标:Ascend-CoT v3样本量级、场景覆盖度远超本方案初始
问题域核心对策并行配置配置抽象层 + 多机模板 + 超参数动态缩放通信环境自动识别后端注入环境变量,调大HCCL Buffer算子兼容建立算子映射表,统一降级为PyTorch原生或昇腾专用APICheckpoint全量权重保存 + 重分片转换,避免直接加载分片MoE调度调整EP/DP比例,开启通信重叠与算法优选经过以上改造,我们的千亿MoE模型成功迁移至昇腾,训练收敛曲线与英伟达差异 < 0.5%
本文摘要:企业级AI硬件选型需关注CPU与GPU的架构差异,GPU更适合大模型(LLM)的并行矩阵运算。LLM处理文本时需保持词序信息,Embedding模型通过池化层压缩向量。GPU选型需重点考虑显存带宽和容量,H200/B200等新型号可解决大模型推理的"内存墙"问题。CPU与GPU需合理配比,避免资源浪费。主流部署框架已转向连续批处理和PD分离架构,提升算力利用率。2026年趋势显示硬件选型
ESM-2(Evolutionary Scale Modeling 2)是 Meta AI(FAIR)推出的蛋白质语言模型,它把自然语言处理里的掩码语言建模(Masked Language Modeling, MLM)思想搬到了蛋白质序列上:把一条氨基酸序列看作一句"蛋白质语言",通过在海量蛋白序列(UniRef50)上做自监督预训练,让模型学会氨基酸之间的进化与结构约束。和依赖多序列比对(MSA
鸿蒙6.0推出CANN Kit,面向PC设备开放大语言模型推理能力,提供端到端的计算加速方案。核心组件CANN LM Engine通过标准化API、计算链路优化及完整工具链,降低开发者接入门槛。该方案支持模型量化转换与异构硬件加速,特别针对PC场景优化,满足知识助手等应用需求。API采用配置驱动设计,通过JSON文件管理模型参数,同时利用内存复用、数据零拷贝等技术提升性能。这一升级标志着鸿蒙端侧A
文章摘要 本文是《大模型知识与部署》系列第21篇,聚焦AI硬件选型中的GPU选择策略。作者指出GPU采购占大模型团队70-90%的成本,错误决策可能导致百万级损失。文章系统分析了主流GPU(A100/H100/H200/B200/4090/910B等)在算力、显存、互联、功耗和价格五个维度的关键参数,并给出典型选型场景建议:H100当前性价比最优,H200适合长上下文推理,B200面向未来训练,4
如何解决多模态智能体推理中,因工具使用的高方差和低频尝试导致的强化学习信号缺失问题?论文提出AXPO算法,通过固定思维前缀并重采样工具调用,有效缩小“思维-行动”差距,显著提升模型性能。
FlagOS三大工具速览与快速调用指南 核心工具: KernelGen:AI自动生成多芯片兼容的高性能算子(支持英伟达/昇腾等) 快速调用:网页版输入算子描述自动生成代码,或通过CLI触发生成 FlagRelease:大模型跨芯片一键迁移部署平台(适配70+主流模型) 三步骤:下载预适配模型 → 拉取优化镜像 → 启动兼容API服务 FlagPerf:异构芯片统一评测工具(支持32款芯片横向对比)
摘要:hccl是昇腾NPU的集合通信库,功能类似NVIDIA的NCCL,支持AllReduce等通信原语,用于多卡训练梯度同步。与hcomm(上层封装)、hixl(单边通信)共同构成昇腾通信体系。使用时需注意:1)PyTorch后端设为"hccl";2)batch_size需按卡数放大;3)AllReduce是同步操作。hccl针对昇腾硬件特性优化,与NCCL底层实现不同,迁移时需重新适配。
文章主要介绍了DeepSeek V4模型即将发布以及AI硬件市场的快速增长,强调了AI技术正在逐渐融入各行各业,并为普通人提供了新的就业机会,如AI大模型训练师。文章通过小米机器人在工业领域的应用,展示了AI技术已经能够解决实际问题,而非仅仅停留在理论层面。同时,文章也提醒读者,AI时代并非充满威胁,而是提供了提升效率和个人发展的机会,鼓励大家积极学习,抓住AI时代的机遇。