openFuyao v26.09正式发布!

多样化算力使能与调度:围绕NPU算力卡切分和动态资源配置,通过vNPU和NPU DRA能力,实现昇腾 NPU 的精细化管理与灵活调度;同时新增超节点拓扑亲和调度能力,有效提升业务性能。

AI推理加速:InferNex进一步优化大模型部署能力与推理性能,多轮对话场景相比基线首token时延最高降低45.8%,总吞吐量最高提升67.5%。

Agent沙箱调度:新增Agent沙箱调度能力,实现沙箱并发创建调度吞吐量>3000 实例/s。

立即体验openFuyao v26.09版本:

https://www.openfuyao.cn/zh/download/

感谢sig-orchestration-engine、sig-ai-inference、sig-agent-sandbox、sig-Installation、security-committee等SIG组的联合研发,感谢社区所有成员单位与开发者的贡献!本次版本具体特性新增与变动如下:

多样化算力使能与调度能力增强

NPU算力卡接入与动态调度:sig-orchestration-engine 围绕NPU算力卡切分和动态资源配置,实现昇腾 NPU 的精细化管理与灵活调度。

  • vNPU:基于K8s的NPU 算力切分与动态调度组件,支持将一张物理NPU按软切分(单卡最多 20 实例、AI Core 粒度最小 1%、显存最小 1Gi、损耗 <5%)或硬切分两种模式共享给多个容器并实现显存与AI Core隔离,同时提供多样化集群调度(binpack/spread、整卡、资源共享、基于DRA调度)和Prometheus可观测能力,形成一体化极简易用的昇腾NPU算力接入与纳管方案。
  • npu-dra-plugin :新增支持软切分,支持 Ascend 910C卡,支持节点内拓扑亲和调度。
  • NPU Operator:新增纳管vNPU和NPU DRA两大能力,支持整卡、硬切分、软切分三种调度模式,并通过ResourceSlice、DeviceClass、与CDI机制实现昇腾NPU的精细化资源管理与灵活调度。

超节点拓扑亲和调度:sig-ub-enable 构建节点侧采集上报能力,由中心侧汇聚超节点对象和超节点拓扑关系资源对象,并与Volcano对接实现集群业务的超节点拓扑感知调度能力,使得业务可以按照不同的诉求调度到合适的超节点中,进而使用超节点的池化内存、大带宽高速通信等能力,提升业务性能。

AI推理加速能力持续升级

sig-ai-inference 持续增强AI推理加速能力,从TTFT、总吞吐量、权重分发等多维度提升推理性能。

InferNex 进一步优化大模型部署能力与推理性能 InferNex新增支持一键部署GLM-5.2、DeepSeek-V4-Flash等主流MOE大模型;推理引擎升级至vLLM-Ascend 0.23.0,并新增vLLM引擎PodMonitor指标采集,新增Decode-first D/PD路由策略,打通Decode节点KVCache感知与请求直达Decode的完整链路。性能上在定长全随机请求与多轮对话两种场景完成验证,多轮对话场景相比基线首token时延最高降低45.8%,总吞吐量最高提升67.5%。

表1 InferNex性能表现

优化策略

TTFT收益(avg)

TPS收益(avg)

random路由策略

基线

基线

GLM-5.2(聚合,多轮4k×6)

45.8%

50.9%

GLM-5.2(聚合,多轮8k×6)

41.6%

67.5%

DeepSeek-V4-Flash(PD分离,多轮4k×6)

7.3%

2.8%

DeepSeek-V4-Flash(PD分离,多轮8k×6)

25.3%

10.0%

*测试环境:昇腾910B4 32G×32卡、vLLM-Ascend 0.23.0、InferNex 26.9.0-rc.2、aiperf 0.13.0。

可观测与部署效率持续增强

  • InferNex:推理引擎升级至vLLM-Ascend 0.23.0,新增GLM-5.2聚合部署、DeepSeek-V4-Flash PD分离部署示例;新增vLLM引擎PodMonitor指标采集与HTTP/1.0客户端兼容开关,支持复用外部Mooncake Master与Redis元数据服务,并打通traceparent请求头透传。
  • InferNex-Bridge:对齐KServe调度器契约,移除scheduler配置webhook补丁,精简KServe部署示例并兼容restricted PSA策略。
  • InferNex-checker:新增单机与跨节点慢卡检测能力,msprof基准测试增加HCCL通信数据采集,辅助慢卡定位;网络连通性检查改为可选开关。
  • eagle-eye:新增面向vLLM-Ascend的非侵入式端到端分布式链路追踪能力,追踪推理请求从AI网关到推理引擎的完整执行路径,记录各环节耗时和关键业务属性。

Decode-first路由编排贯通全局KVCache感知链路

hermes-router:新增Decode-first多级协同路由策略,基于前缀命中率决策:命中充分时直接路由到Decode实例复用其本地KVCache,跳过Prefill环节,否则回落至常规Prefill+Decode编排,有效降低长上下文多轮对话时延。tokenizer sidecar改为单飞初始化并对齐KServe scheduler预设。

cache-indexer:新增Decode节点KVCache感知能力,将Decode Pod纳入L1索引发现链路,支撑Decode-first路由准确决策;L1 ingest兼容vLLM 0.24.0的map编码KV事件,避免缓存索引缺失。

InferNex proxy-server(随 InferNex 发布):支持Decode-first D/PD路由编排,通过x-openfuyao-decode-pod-address-port请求头将D路由请求直达Decode实例,与P→D编排链路协同工作。

权重分发持续优化RDMA传输性能

weight-dispatcher:重构RDMA数据传输实现,新增环形广播(ring broadcast)传输模式,进一步提升模型权重从单一存储节点向多计算节点并发分发的效率。

新增Agent沙箱调度能力

sig-agent-sandbox 新增高性能Kubernetes沙箱调度引擎FluxSandbox,构建K8s原生、高性能、多运行时兼容的AI Agent沙箱调度系统,将E2B沙箱运行时平滑融入K8s集群并提供低时延高并发的极致调度能力。具体能力如下:

  • 实现沙箱与普通业务Pod共集群共节点部署,支撑用户现有云原生基础设施统一运维。
  • 沙箱并发创建调度吞吐量 > 3000 实例/s,单沙箱实例调度时延<30ms,满足 RL Training 等场景高并发诉求。
  • 北向兼容OpenSandbox接入协议,无缝对接主流沙箱生态。
  • 多运行时兼容架构,已支持对接 E2B 和 containerd runc,提供不同安全隔离级别。
  • 支持沙箱创建、删除、快照、暂停、恢复等生命周期管理。

新增Serverless数据库管控面Operator

sig-orchestration-engine 新增Serverless数据库管控面Operator —— serverlessdb-operator。serverlessdb operator是面向短生命周期、突发负载场景的Serverless数据库管控面Operator。基于Kubernetes Operator扩展机制,维护预热数据库计算实例资源池,对外提供REST接口支持数据库计算实例的按需申请、释放与原地垂直扩缩容等操作。具体能力如下:

  • 数据库扩容:将数据库扩缩容从分级运维操作转变为运行时API能力,支持用户在Agent场景实现数据库的快速启动、弹性伸缩与按需释放。
  • 毫秒级申请:申请实例仅做label/status变更,从预热池中秒级分配,无需冷启动。
  • 连接地址不变:数据库实例释放后DNS地址保留,重新申请可复用,保证实例释放后重新申请连接地址保持不变。
  • 兼容K8s机制:支持K8s原生机制的认证鉴权保证安全、支持高可用生产级能力和冗余Service的回收。

安装部署能力持续演进

sig-Installation 增强部署工具核心能力,推出不可变OS部署方案。具体如下:

  • 支持不可变OS:可在普通openEuler 控制平面节点接入KubeOS Worker节点,实现KubeOS Worker节点整镜像原子升级、回滚与生命周期管理。
  • BKE工具增强:新增preflight子命令,用于在集群初始化及创建前执行前置依赖检查,确保环境满足要求。
  • 升级引擎重构:优化声明式升级框架,集成组件执行引擎,实现YAML和Helm组件的标准化适配与执行。
  • 状态管理统一:重构BKECluster资源定义,以ClusterStatus作为集群状态的唯一数据源,消除状态显示歧义。
  • 去中心化负载均衡:worker节点部署Nginx Proxy,实现集群流量去中心化转发与高效负载均衡。
  • 配置热更新:实现K8s核心组件及Etcd静态Pod配置的热更新机制,支持集群运行时动态变更配置。

集群安全加固

security-committee 新增集群安全加固工具 Compliance-hardening :可对于已经识别的弱安全配置,提供一键式加固和回退的能力,不耦合主安全流程。具体能力如下:

  • 六大加固组:覆盖静态Pod manifest权限、apiserver/controller-manager/scheduler参数、etcd参数与数据目录、kubelet配置等。
  • 预览与确认:改动前先预览全集群合规状态,保证不误伤配置。
  • 一键回退:支持各节点回退各自最新备份或统一时间戳回退到同一状态。
Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐