让记忆回归记忆、让推理专注推理,上海AI实验室开源创新架构Mobius,探索破解长程推理与科学发现难题
当前,AI模型研发正经历范式切换:由规模扩张驱动,迈向架构创新牵引的关键阶段。
近日,上海人工智能实验室(上海AI实验室)开源知识与推理解耦新架构Mobius。该架构着力拓展模型在持续学习、组合泛化等方向的能力边界,优化训练与推理效率。相较于Transformer架构,Mobius展现出多维度优势:端到端推理效率提升近4倍;仅用60%训练数据,即可达到相近MMLU得分;部分知识组合泛化任务性能达其2倍,为大模型底层架构创新提供新方案。
Mobius已接入上海AI实验室自研开源可视化平台ArchSpace,依托其“过程开放”创新模式,Mobius的完整方案、实验配置与训练链路未来将全部对外开放,让架构创新实现可查阅、可复现。通过Arch Space,上海AI实验室将持续开放Next-Concept-Prediction、Depth Attention、SiameseNorm、Artificial Hippocampus Network、MorphNorm、March等创新架构方案。
-
Huggingface链接:https://huggingface.co/internlm/Intern-S2-Mobius
-
ArchSpace链接:https://github.com/InternLM/archspace/issues/9
探索原创架构,拓展AI能力新边界
上海AI实验室主任、首席科学家周伯文在首届明珠湖会议上提出“人工智能前沿十问”,其中架构议题指出:2017年诞生的Transformer掀起AI变革,但伴随智能能力需求升级,其短板逐步暴露——计算效率偏低、上下文承载不足、长程推理存在瓶颈。
目前,国内外围绕Transformer已开展大量改进探索,如稀疏注意力、线性注意力等方案,通过削减计算复杂度缓解算力压力,在资源约束下支撑大参数模型训练。但长期来看,这类优化主要聚焦效率提升,能否真正拓展模型能力上限,仍有待验证。
上海AI实验室认为,应优先提升模型架构本身的能力上限,以此为杠杆,撬动训练与推理全链路效率的系统性跃升。遵循这一思路,实验室推出了理论能力上限更高的Mobius架构。其核心创新在于:打破层级内部记忆与推理的强耦合关系,将原本分散于各层的知识统一构建为共享记忆池,使每一层注意力(Attention)均可直接读取池中记忆资源,从而真正实现知识存储与推理计算的解耦。这一设计不仅支持记忆模块的独立扩展与高效复用,也使得Mobius更擅长应对失败学习、长程推理和探索式科学发现等传统架构力难以胜任的复杂任务。
知识推理分离,训推效率与泛化能力协同跃迁
基于知识与推理解耦的设计,Mobius在推理效率、知识更新和组合泛化三个维度上表现出显著优势。
首先,推理效率更高。在推理层数不变的条件下,搭载共享记忆的模型可在单次前向传播中完成更多次知识遍历(Traversal)。这意味着即便面对长程依赖或信息稀疏的场景,模型也有更多机会捕获关键线索,从而提升最终输出的有效性和可靠性。
其次,知识更新更快。扁平化的知识组织方式使得新知识的写入路径清晰可溯,局部调整对全局知识结构的扰动被降至最低。这一特性对于持续学习和动态环境尤为重要——模型可以在不破坏已有能力的前提下,灵活吸收新知识,避免了传统层级记忆中“牵一发而动全身”的连锁问题。
最后,组合泛化增强。访问共享记忆池时,各类知识不再受层级位置限制,有可能被同时激活,这极大地拓展了知识之间的交互空间。模型在面对全新问题时,能够更自由地跨域组合已有知识,展现出更强的泛化迁移能力,而这正是科学发现等探索性任务所迫切需要的。
实验进一步验证了上述理论预期。科研团队在多个基准任务上将Mobius与Transformer进行了对比评测,结果显示,前者在多维度上均表现出显著优势:端到端推理效率提升近4倍;仅使用60%训练数据,便可取得与Transformer相近的MMLU得分;在知识组合泛化的Toy任务上,性能可达Transformer的2倍。
35B模型续训练的推理速度

7B 从头训练的 MMLU 得分
Toy Model 的组合泛化验证
现阶段,Mobius凭借高效推理路径与精简思维链,在端到端复杂推理场景中展现出效率优势,但共享记忆库架构也带来了更大的访存与通信压力,其能力释放上限依赖底层硬件与框架的联合优化。上海AI实验室正联合昇腾基于Atlas 900 A3昇腾超节点,开展Mobius深度适配工作,并已完成 Xtuner训练框架、LMDeploy推理框架的针对性调优,实现了Mobius在该硬件上的训练与推理,为充分释放架构性能挖掘更大潜力。
夯实架构基础,赋能科学发现前沿应用
1900年,开尔文勋爵留下一句广为流传的论断:物理学的宏伟大厦已然落成,天际之上却还漂浮着两朵“乌云”。放眼今日,缩放定律(Scaling Law)搭建起当代人工智能行业的主体大厦,但同样仍悬着多朵亟待驱散的“乌云”:如何实现从失败中学习,如何实现稳定可靠的长程推理,如何在充满不确定性的探索场景下完成有效学习。
Mobius从架构设计层面作出回应。它将知识存储与组合推理进行解耦,原生搭建高密度、可灵活扩展的记忆底座,把知识的留存、更新、扩容和推理计算分离开来。这套机制让模型有能力沉淀历次试错的失败经验,不再仅仅依赖参数隐式记忆;在超长推理链路中,可以精准定位并激活任务所需的关键知识,缓解长程推理衰减问题;同时支持知识的自由重组泛化,适配科研任务固有的不确定性,挖掘那些“未知的未知”。
这一架构创新,也呼应了上海AI实验室“科学研究是下一个Coding,也是突破AI智能上限的终极考题” 这一核心判断。代码生成更多面向确定流程的求解,而科学研究需要流程、直觉与知识泛化的协同。Mobius的解耦记忆‑推理范式,为AI递归自进化、AI辅助科学发现提供底层支撑;其原生的推理机制,也为世界模型的后续演进打开新的想象空间。相关探索将在Mobius后续版本中持续推进。
当前,Mobius已接入上海AI实验室自研开源可视化平台ArchSpace,依托其“过程开放”创新模式,Mobius 的完整方案、实验配置与训练链路后续将全部对外开放,让架构创新实现可查阅、可复现。以Mobius为代表,ArchSpace已沉淀十余项架构创新提案,它们正在等待接受同一套公开、完整的训练与评测验证。欢迎广大AI领域爱好者、研究人员参与,共建开放的架构创新生态。

ArchSpace架构提案与实现流程:从社区提交issue、审阅与投票,到分支实现、阶段性实验和合并
更多推荐




所有评论(0)