登录社区云,与社区用户共同成长
邀请您加入社区
目录 一、先分清:金融的四类负载,算力画像完全不同 1. 智能文档与财报抽取(批处理型) 2. 实时风控与反欺诈(低延迟型) 3. 智能客服与问答(高并发型) 4. 合规审查与审计报告(长文 + 重质量型) 二、算力分层口径:先套负载,再算显存 三、选型:信创合规下,海光/昇腾怎么落 四、落地前先过
你可能会想:能不能做一颗芯片,既有训练芯片的高精度、高带宽,又有推理芯片的低功耗、低成本?答案是不能两全,这是架构层面的本质取舍。一颗芯片的晶体管预算、功耗预算、硅面积预算都是有限的。你把预算投给高精度浮点单元,就没有余量去压功耗;你把预算投给低功耗整数单元,训练时精度就顶不住。高精度浮点单元和低精度整数单元,在晶体管预算上是竞争关系。你把浮点单元堆满,功耗就下不来;你把整数单元做主力,训练精度就
以下从开源内容/开源程度和第三方硬件算力公司接入方式两个维度,对 NVIDIA Agent Toolkit 进行系统性说明。维度实际情况开源程度代码完全开源(Apache 2.0),模型权重开放(OML),社区活跃;但生产级 NIM 和硬件加速库有商业/硬件绑定。第三方硬件接入可行性高。通过架构,任何支持 OpenAI-compatible API 的推理后端均可接入。接入最佳实践AMD/Inte
从CUDA迁移到ROCm时,hipify自动转换工具只能解决基础语法问题。本文基于真实生产案例,总结出5类必须人工干预的代码场景,包括内存操作、原子精度、性能API替换等,并提供可复用的审查清单和测试方法,帮助开发者在AMD AI硬件上实现平滑迁移。
GPU 最大的优势不是硬件本身,而是 CUDA 生态:cuDNN、NCCL、TensorRT,加上 PyTorch、JAX 的原生支持,让它成为"什么都能跑"的默认选项。NPU 的算力数字通常不大(几十 TOPS),但每瓦性能(TOPS/W)能做到 GPU 的 10 倍以上。:除非团队已经全栈投入 JAX,否则 GPU(H100/H200/昇腾 910B)几乎是唯一现实选项,原因无他——出问题时能