资讯完整解读:初创公司10小时搭建类CUDA软件事件

一、事件核心概况(2026年8月初外媒Business Insider披露)

初创公司 Infinity(2025年成立,仅1年历史),依靠自研AI智能体 Ignition,仅耗时10小时,为推理芯片厂商d-Matrix的Corsai芯片开发出一套类CUDA底层软件栈,上线后芯片直接达成自身理论峰值性能的92%;10天内便可完整跑通3款主流前沿大模型端到端推理流程。
英伟达耗费近20年迭代打磨CUDA生态构筑行业护城河,而AI智能体将芯片适配、算子开发的周期从「数月/数年」压缩至小时级别,引发行业对CUDA壁垒是否松动的讨论。

主体背景

  1. Infinity
    创始人Jeremy Nixon曾任Google Brain研究员,2026年7月完成1500万美元种子轮融资,投后估值1亿美元,成立第一年就依靠芯片软件适配业务实现百万级年收入。核心目标:用AI自动编写跨芯片底层内核代码,抹平各类AI芯片的软件适配门槛。
  2. Ignition AI智能体
    自动化完成全套底层开发闭环:自动生成GPU/AI芯片内核Kernel代码→部署测试、自动定位BUG→采集性能指标→迭代重写优化代码;人类工程师仅负责下达顶层需求、划定约束条件,海量枯燥底层编码、调优工作全部交由AI循环完成。
  3. 合作方 d-Matrix
    主打低功耗AI推理芯片,竞品对标英伟达推理卡,但长期受制于缺少成熟配套软件生态,和早年AMD GPU面临「硬件不差、生态落后」困境一致。

二、为什么这件事具备行业冲击力?CUDA真正的护城河从来不是代码

  1. CUDA的壁垒结构
    CUDA不只是驱动代码,而是三层完整生态:底层芯片调度内核 + 海量成熟算子库(cuBLAS、cuDNN等) + 全球开发者沉淀二十年的工程生态、工具链、海量适配模型、社区积累。
    过往适配一款新芯片,工程师团队需要数月手写算子、调试兼容、性能打磨,这也是AMD、寒武纪、昇腾等芯片硬件性能达标,但生态追赶缓慢的根本原因。
  2. 本次突破的意义
    AI编码Agent直接解决了新芯片生态起步最难的「底层算子适配阶段」:原本数月的芯片软件适配前置工作,10小时就能完成高性能适配,大幅降低新架构AI芯片的生态入场成本,众多国产芯片、非主流AI芯片厂商可以快速补齐软件短板。

三、关键事实澄清:并非10小时复刻完整CUDA全生态

很多自媒体存在夸张误读,真实边界:

  1. 10小时产出的是芯片底层驱动+基础算子运行环境(CUDA最核心的硬件调度层),可以让芯片跑出接近满性能;
  2. 并没有复刻CUDA完整庞大生态(上万算子库、编译工具、分布式集群方案、数十年社区沉淀、开发者工具套件);完整CUDA生态依然需要长期积累;
  3. 本质是AI自动化内核开发工具,可以快速给任意芯片搭建「可用的类CUDA运行底座」,解决新芯片“没软件能用”的开局难题。

四、各方现状与行业连锁反应

1)英伟达应对:同样在用AI加速CUDA迭代

英伟达官方回应:自身早已大规模使用AI编码Agent开发、验证CUDA代码,借助AI提升CUDA迭代速度与测试规模,不会坐视壁垒被单方面突破。

2)国内厂商跟进路线

  • DeepSeek开源TileLang编程语言+TileKernels算子库,靠可编程语言减少手写CUDA内核工作量,降低算子开发门槛;
  • 昇腾、壁仞等国产芯片厂商,也在布局AI自动算子生成工具,用来加速算子库补齐进度。

3)商业格局变化趋势

  1. 芯片竞争正式进入「硬件性能 + AI自动软件适配能力」双赛道,未来芯片厂商比拼的不再只是算力,还有能不能快速用AI补齐软件生态;
  2. CUDA独家垄断格局会缓慢弱化,多芯片生态共存的速度加快;
  3. 诞生全新商业模式:专门用AI智能体为各类芯片做快速软件适配的第三方服务商。

五、机遇与局限

机遇

  1. 国产AI芯片生态追赶周期大幅缩短,不用再耗费数年组建庞大算子工程师团队;
  2. 个人、小团队也能低成本基于小众AI芯片部署大模型推理;
  3. 算子开发、底层驱动这类高薪底层岗位,会出现部分自动化替代。

局限

  1. 成熟生态、上层框架适配、开发者习惯迁移依然需要数年时间,CUDA短期内不会被彻底取代;
  2. Ignition现阶段擅长推理场景内核开发,大规模训练场景的分布式算子、集群调度优化,仍高度依赖人工深耕;
  3. AI生成内核在极端稳定性、超长时序训练场景的可靠性,暂时不如资深工程师手写优化代码。

六、总结

10小时搭建类CUDA底座,并没有颠覆CUDA,但击穿了英伟达最外围的生态壁垒
过去新芯片想要活下去,必须砸重金养几十上百人的底层软件团队;现在依靠AI Agent,初创芯片企业十几小时就能让芯片发挥九成算力,极大降低AI芯片赛道的生态入场门槛,会加速全球异构算力时代到来。

如果你需要,我可以补充:昇腾、壁仞、AMD当前自动算子方案和Ignition的横向对比表格。

四家厂商自动算子/类CUDA构建方案横向对比表

对比维度:Ignition(Infinity)、昇Ascend C自动算子、壁仞BRC AutoKernel、AMD ROCm自动生成方案

整体总览

对比项目 Infinity Ignition 华为昇腾 AutoKernel + Ascend C 壁仞科技 BRC AutoKernel AMD ROCm AutoGen
核心定位 通用AI智能体,快速给任意芯片搭建类CUDA运行底座,解决芯片开机可用问题 专为昇腾架构打造,补齐NPU算子库、补齐CANN生态 壁自研GPU专属算子自动生成,完善BRC生态 完善ROCm生态,实现CU代码一键迁移
搭建完整底层运行底座耗时 约10小时(推理底座) 从零搭建基础运行环境:7~15天 从零搭建基础运行环境:5~12天 CU代码迁移适配完整底座:3~7天
擅长场景 各类推理芯片、小众架构芯片快速适配,快速榨干芯片硬件性能 大模型训练+推理全场景、分布式集群算子、CNN/Transformer算子优化 通用训练推理、游戏GPU+AI推理两用场景 通用GPU训练推理,CUDA工程无缝迁移
实现原理 大模型Agent闭环:自动生成Kernel→部署测试→性能 Profiling→自动修bug迭代,全程极少人工介入 编译层模板生成+昇腾算子库模板匹配+AI微调优化内核,人工配置调度规则 基于ML模型预测最优分块策略,自动生成PTX风格内核,搭配人工优化模板 CLANG编译转换+AI优化重写,CU代码自动转为ROCm可运行代码
性能上限 可达成芯片理论算力92%左右 成熟算子可达理论算力95%~98% 成熟算子可达理论算力93%~97% 成熟算子可达理论算力94%~97%
训练场景能力 薄弱,仅支持小规模推理,不支持分布式训练算子生成 极强,原生支持多卡集群、大模型张量并行、流水线并行算子生成 良好,支持多卡训练,但分布式生态完善度弱于昇腾 优秀,分布式训练生态成熟
稳定性 推理场景够用;长时间训练易出现内存碎片、时序异常 工业级稳定,可用于千亿模型商用训练 商用推理稳定,超大模型长时间训练仍需人工调优 工业级稳定,适配绝大多数开源大模型训练任务
适用芯片范围 全架构通用:英伟达、昇腾、壁仞、d-Matrix、各类小众推理芯片 仅限昇腾910B/910C/310系列NPU 仅限壁仞BR100/BR200系列GPU 仅限AMD RDNA2/RDNA3架构GPU
商业化模式 对外接单:为芯片厂商快速搭建类CUDA软件栈,按项目收费 内部自用为主,对外开放算子生成工具链免费商用 内部完善自身生态,少量对外开放工具 免费开源ROCm+自动迁移工具,拉拢CUDA开发者
短板 1. 无法生成完整cuDNN/cuBLAS庞大算子库
2. 大规模训练稳定性不足
3. 复杂通信算子必须人工编写
1. 仅适配昇腾硬件,无法用于别家芯片
2. 陌生新架构适配依然需要人工配置规则
1. 生态体量偏小,社区算子数量不足
2. 自动算子在超长时序训练优化一般
1. 老旧CUDA特殊写法迁移容易出错
2. 移动端、嵌入式芯片适配能力偏弱

二、各自路线差异详解

1. Infinity Ignition(外来挑战者)

  1. 优势核心:通用性无敌,不管是什么架构的AI推理芯片,只要给出芯片架构参数、寄存器规格,就能在十几个小时内生成可用驱动与基础算子,解决新芯片“有芯片没软件”的最大痛点。
  2. 短板注定无法替代完整CUDA:
    只能搞定「能用、跑出九成算力」的基础底座,上万种经过二十年打磨的高性能专用算子、通信库、调试工具、框架适配层,AI无法自动补齐,依然需要长期人力沉淀。
  3. 商业模式:做异构算力生态的“脚手架”,专门服务初创AI芯片公司。

2. 华为昇腾方案(国产闭环路线)

  1. 思路:不对外做通用适配工具,优先闭环完善自家CANN生态,用AI自动算子降低内部算子团队开发压力。
  2. 落地现状:昇腾算子70%常规算子已经由AutoKernel自动生成,复杂Transformer通信算子、超低精度FP8高性能算子由工程师手写精调,兼顾开发速度与性能稳定性。
  3. 优势契合国内需求:国产算力集群、国产化大模型训练场景适配最好,金融、政企国产化场景壁垒牢固。

3. 壁仞科技(国产通用GPU路线)

介于英伟达与昇腾之间,GPU架构偏向通用计算,自动算子工具主要用来快速补齐生态、追赶CUDA上层适配,兼顾AI训练与通用渲染,面向云厂商算力采购市场。

4. AMD ROCm(英伟达直接竞品)

不走从零搭建底座,主打CUDA无缝搬家,依靠代码迁移工具把存量CUDA项目直接转为ROCm可运行代码,利用存量开发者生态追赶英伟达,也是目前PC/消费级显卡跑大模型性价比最高的方案。

三、落地阶段差距(2026年现状)

  1. 生态成熟度排序:ROCm(AMD)>昇腾CANN>壁仞BRC生态>Ignition临时类CUDA底座
  2. 新芯片生态起步速度排序:Ignition > AMD ROCm迁移方案 > 壁仞AutoKernel > 昇腾适配新架构
  3. 商用大规模训练可靠性:昇腾 ≈ AMD > 壁仞 > Ignition

四、行业推论

  1. Ignition这类工具只会缩短芯片生态冷启动周期,没法复刻CUDA二十年积累的完整生态,英伟达核心护城河依旧稳固;
  2. 国内昇腾、壁仞可以借助AI自动算子工具,把原本35年的生态追赶周期压缩至12年;
  3. 未来分工将会明确:
    • Ignition类工具:给小众新芯片完成冷启动;
    • 昇腾/AMD/壁仞:依靠自研自动算子工具持续完善自有完整生态;
    • 英伟达:用AI加速CUDA迭代维持领先。

Infinity 类CUDA软件(Ignition架构)核心优势

一、极致生态冷启动速度,彻底打破新芯片适配周期瓶颈

  1. 适配周期指数级压缩
    传统芯片厂商搭建可用类CUDA底座、编写基础推理算子,需要专业算子团队耗时3~8个月;Ignition依靠AI闭环自动化流程,仅10小时即可完成芯片底层驱动、调度内核、基础算子环境部署,10天内就能完整跑通主流大模型端到端推理流程,解决新芯片“硬件成型、无软件可用”的致命冷启动难题。
  2. 大幅降低芯片厂商人力成本
    无需组建数十人的专业底层内核工程师团队,人类仅负责下达顶层需求、划定性能约束、管控安全边界,算子编写、编译调试、性能 Profiling、BUG修复、迭代优化等海量枯燥底层工作全部交由AI智能体自动完成,中小芯片初创企业也能补齐软件栈。

二、全域硬件通用适配,无架构绑定特性(最大差异化优势)

  1. 跨架构兼容能力极强
    不受芯片架构限制,既能适配英伟达GPU、AMD GPU、昇腾NPU、壁仞GPU,也可适配脉动阵列推理芯片、移动端SRAM芯片、定制化专用AI芯片等各类自研私有架构,甚至能解析封闭专有指令集完成适配;而英伟达CUDA仅限自家GPU、昇腾AutoKernel仅适配昇腾NPU、ROCm只适配AMD显卡,均为封闭绑定设计。
  2. 一套推理库多硬件复用
    可打造通用推理运行库,开发者编写一次模型推理代码,就能部署在任意异构AI芯片上,不用针对不同硬件反复改写内核,降低异构算力集群部署成本。

三、全自动闭环自优化能力,硬件利用率上限很高

  1. 全自动迭代闭环
    形成「内核生成→编译部署→正确性校验→性能打点剖析→自动重构优化内核」全自动闭环,不间断迭代调优,不需要工程师反复手动测参、调分块策略、优化内存排布。
  2. 硬件算力释放效率优秀
    适配全新推理芯片时,即可榨出芯片92%理论峰值算力,成熟迭代后可逼近95%,对标商用自研算子的性能水准;实测针对通义千问3-8B推理任务,经过1天自动优化后,推理吞吐量相比vLLM原生框架提升34%。
  3. 持续自适应优化
    芯片长期运行、业务负载变化时,Agent可持续采集运行数据,自动改写内核适配实时负载,硬件利用率始终维持高位。

四、商业模式轻量化,降低入局门槛

  1. 无前置高额授权费
    区别于CUDA商业授权收费模式,Infinity主流方案采用性能分成模式:免费为芯片厂商搭建类CUDA底座,后续从芯片算力商用收益中抽取分成,大幅减轻初创芯片公司前期资金压力。
  2. 按需交付模块化软件栈
    芯片厂商不需要完整复刻全套CUDA生态,可以按需只生成推理内核、调度器、编译器其中某一部分模块,灵活补齐自身软件短板。

五、快速追赶前沿模型适配,跟上AI迭代节奏

当下大模型架构迭代速度极快(Transformer变体、MoE、新型稀疏模型层出不穷),传统厂商人工开发算子往往滞后数周甚至数月;Ignition可在一两天内为全新模型架构自动生成专属高性能内核,让非主流芯片第一时间兼容最新开源大模型,不再出现“新模型只能跑英伟达显卡”的局面。

六、补齐小众推理芯片生态短板,助推异构算力普及

大量主打低功耗、高性价比的边缘推理芯片(d-Matrix等)硬件性能优秀,但因无力搭建CUDA级软件生态无法商用;这套工具可以快速补齐其软件短板,让海量边缘国产推理芯片具备商用落地能力,加速全球异构算力时代到来,间接弱化英伟达独家生态垄断格局。

补充:对比CUDA、昇腾CANN的独有长处

  1. CUDA:性能最强、生态最全,但仅支持英伟达硬件、冷启动极慢、绑定生态闭环
  2. 昇腾AutoKernel:性能优秀、适配训练集群,但仅限昇腾硬件,无法对外适配其他芯片
  3. Infinity Ignition:通用全芯片适配、极速冷启动,短板仅为大规模分布式训练场景稳定性弱于成熟人工算子

结论先行

这家做出「10小时搭建类CUDA」的 Infinity(Ignition智能体)完全闭源、不对外开放源代码,现阶段没有开源计划,市面上也不存在可用开源版本。
注意区分:Github上名叫IgnitionAI、Infinity的开源项目均是无关产品,并非这家芯片适配公司的技术。

一、不开源的核心依据

  1. 商业模式是商业私有化服务
    Infinity不靠卖软件授权盈利,采用效果分成模式:上门为芯片厂商私有化部署Ignition、适配芯片生成专属类CUDA栈,后续根据芯片推理吞吐量提升带来的收益抽取分成,核心引擎作为商业私有资产牢牢把控,绝不会开源外泄内核生成逻辑。
  2. 核心壁垒就是Agent闭环算法
    它最大竞争力是全自动生成Kernel、自动Profiling调优、闭环迭代的专属智能体逻辑,一旦开源,所有芯片厂商、巨头都能免费复刻这套冷启动方案,公司独家壁垒直接消失。
  3. 官方公开信息无开源表态
    2026年7月融资发布会、创始人采访里,仅说明会持续对接芯片客户、拓展商用合作,从未公布开源时间表、开源协议、开源组件计划。
  4. 交付形态为私有化部署
    给d-Matrix等客户交付的是封闭二进制部署包,只对外输出适配完成后的类CUDA运行环境,不会交付Ignition本体源码、调度模型、内核生成规则。

二、开源边界:仅有极小部分配套能力对外开放

仅开放极少上层配套工具,核心引擎依旧闭源:

  1. 对外放出简易SDK接口,芯片厂商可以提交芯片架构参数、下发适配任务,但看不到Agent内部代码;
  2. 发布公开技术白皮书讲解原理架构,用来做行业宣传,不附带任何可运行源码;
  3. 开源部分测试基准脚本(用来验证芯片推理性能),不属于核心类CUDA构建模块。

三、容易混淆的同名开源项目(全部无关)

  1. InfiniFlow / Infinity:开源向量数据库,和类CUDA、算子自动生成毫无关系;
  2. IgnitionAI:网页端Agent开发框架、RAG工具,并非用于芯片内核开发的Ignition;
  3. Inductive Automation Ignition:工业组态软件,名称重合而已。

四、未来开源可能性判断

  1. 短期(1~2年):绝不会开源。公司尚处于种子轮商业化阶段,依靠独家技术拿下芯片客户,开源等于放弃核心盈利手段;
  2. 长期远景:大概率只会开源精简社区版(仅支持通用GPU做学习测试,阉割跨私有芯片适配能力、分布式训练能力),商用完整版持续闭源收费。

五、如果你想要实现同类能力的开源替代方案

可以用现有开源工具组合复刻近似效果:

  1. TileLang(DeepSeek开源):自动生成高性能GPU/昇腾算子;
  2. TVM + AutoTVM:自动搜索最优内核调度策略;
  3. OpenAI Function Calling + 编译测试脚本:自建简易闭环Agent,实现「生成内核→编译测试→迭代优化」的简易流程。
Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐