登录社区云,与社区用户共同成长
邀请您加入社区
在国产算力领域,2026年6月,依托昇腾910C国产AI算力集群,深圳河套学院AI训练平台项目团队联合哈尔滨工业大学(深圳)、深圳市大数据研究院、华为及深智城AI算力平台,成功完成1.6万亿参数DeepSeek-V4-Pro大模型的全参数后训练。在这一背景下,国内算力平台已分化为三条主要路线:大模型API调用平台(按Token计费,适合应用开发)、GPU算力租用平台(按小时租用裸GPU,适合模型训
在鸿蒙(HarmonyOS)生态中,智能推荐能力依托于系统级的与,结合端云协同 AI 架构,实现了从“用户找服务”到“服务找人”的范式转变。开发者可通过接入系统标准体系或构建应用内推荐引擎,实现精准的个性化推荐。
实现图片自动轮播、左右滑动切换,支持指示器、自动播放、循环切换,首页 Banner 必备组件。本地 / 网络视频播放组件,支持播放、暂停、进度拖拽、全屏、静音等媒体能力。点击交互基础组件,支持文字按钮、图片按钮、圆角、背景色、禁用状态。加载本地资源图、网络图片,支持圆角、缩放、占位图、裁剪模式。
推荐系统现已成为互联网服务的核心基础设施,在大规模推荐场景下,特征的高效表示与检索是关键挑战。Embedding技术通过将离散特征映射为低维连续向量,为推荐模型提供了可计算的特征表示。然而,随着数据规模的爆炸式增长,Embedding的存储与实时查询性能成为系统瓶颈。HierarchicalKV为大规模推荐模型提供了高效的Embedding管理解决方案,通过CPU/GPU协同存储架构,在保证高查询
2026年1月12日,DeepSeek发布论文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》,提出Engram条件记忆模块,其作为MoE之外一种高效的稀疏扩展方式,可以复用于其他模型,提升推理效率。
在构建大规模AI推理平台的过程中,我们面临两大核心挑战:一是多模型、多实例的部署流程繁琐,手动编写和维护大量Kubernetes YAML文件效率低下且易出错;二是推理服务在运行中可能因资源争用、节点异常等原因发生故障,缺乏自动恢复机制,影响服务连续性。为解决上述问题,我们引入AIBrix作为推理服务编排框架,结合自动化部署脚本与实例级故障重调度能力,实现从“手动部署”到“智能运维”的跃迁。本文将
生成式推荐(Generative Recommendation, GR)作为新一代推荐技术范式,突破了传统协同过滤、深度学习推荐模型的特征交互局限,通过生成式建模实现用户长序列兴趣的精准捕捉,已成为搜广推领域的核心技术方向。
当前头部推荐系统面临万亿级稀疏特征带来的算力与存储压力,传统GPU方案依赖HBM全量承载Embedding,但实际计算中仅约1%特征活跃,导致HBM资源99%闲置。主流方案虽在算子与分布式训练上优化,仍难突破HBM容量瓶颈与调度效率问题。因此,实现稀疏表的高效分层管理、低时延动态调度与NPU协同,成为推动推荐系统向高算力密度、低功耗、可扩展演进的关键。
以实现一个自定义的“Swish”激活函数(环境准备安装asc-devkit工具链,配置昇腾NPU开发环境(如安装驱动、CANN Toolkit)。通过命令创建新算子项目,选择“自定义激活函数”模板。编写算子逻辑@operatorsigmoid_x = 1 / (1 + tensor.exp(-x)) # 调用devkit内置的exp算子devkit自动解析代码,生成昇腾NPU可执行的底层内核代
本文详细介绍了华为昇腾CANN框架下的自定义算子开发技术,通过ReLU算子实例演示了从开发环境配置到性能优化的全流程。重点讲解了向量化指令优化、边界处理等核心实现方法,并提供了编译部署、性能分析等实用技巧。文章强调数据对齐、流水线并行等优化原则,帮助开发者提升算子执行效率。通过掌握这些技术,开发者能更好地释放昇腾硬件性能,满足AI模型部署中的特定需求。