AI开放平台模型训练

BAAI智源研究院——人工智能基础模型与开源生态研发机构

BAAI智源研究院是聚焦人工智能核心技术与原始创新的新型研发机构。其构建了包括悟道、Emu系列在内的多模态大模型体系,提供从语言、视觉到具身智能的全栈开源技术基座。通过FlagOS...

标签:

产品简介

BAAI智源研究院(北京智源人工智能研究院)是人工智能领域的新型研发机构,汇集国际顶尖学者,聚焦核心技术与原始创新。研究院旨在推动人工智能在发展政策、学术思想、理论基础、顶尖人才与产业生态五大源头的创新。作为“大模型”概念的首提者之一,智源率先组建攻关团队,推出了中国首个超大规模智能模型系统,并构建了全面开源的大模型技术体系。

核心模型体系

智源研究院研发了覆盖语言、视觉、多模态及科学领域的系列大模型:

  • 悟道系列:包括万亿参数的超大规模信息智能模型,以及“Aquila”语言大模型和“视界”视觉大模型系列,实现了多项国际领先的技术突破。
  • Emu原生多模态世界模型:Emu3基于下一个token预测机制,无需扩散模型即可完成文本、图像、视频的理解与生成;Emu2为10亿参数视觉基础模型,融合语义与几何结构学习。
  • 具身智能模型:包括全球首个基于视频流的端到端导航大模型NaVid,以及四维世界模型Robo4D,旨在解决机器人在开放世界中的泛化问题。
  • 科学基础模型:涵盖全原子生物分子模型OpenComplex 2,用于预测蛋白质、RNA等复合物结构;以及脑科学多模态通用基础模型“见微Brain”,实现脑信号与文本、图像的多向映射。

开源技术基座与算力支持

为解决多元AI算力生态下的开发难题,智源联合合作伙伴共建了面向多种AI芯片的开源统一软件栈FlagOS。该系统在六家厂商的AI芯片上完成了语言、多模态、具身三大模型的端到端训练验证,支持同构和异构千卡集群。此外,智源提供了大模型全栈开源技术基座,包括通用大模型算子库、数据处理工具集及算法框架,支持一键推送数据至算力集群开启训练。

特色能力:具身智能与世界模型

智源在具身智能领域提出了四维世界模型Robo4D,将世界模型从二维拓展至四维时空。该模型采用先验引导的3D Gaussian Splatting算法,基于单一视角视频生成四维世界空间,具备时间与空间智能。结合自研的大规模动作数据仿真合成技术,智源训练的灵巧手抓取模型在泛化场景真机成功率上取得显著突破,为机器人整体AGI迈进提供了基础模拟器。

适用人群与场景

智源研究院的技术成果广泛适用于以下群体与场景:

  • 学术研究人员:利用开源的模型权重、数据集及评测基准,开展大模型机理、具身智能及生物计算研究。
  • AI开发者与企业:使用FlagOS统一软件栈适配异构算力,降低训练成本;调用BGE通用向量模型等成熟组件构建应用。
  • 生命科学专家:应用OpenComplex 2进行大分子结构预测,或使用数字孪生心脏模型进行仿真计算。

使用建议与合规说明

用户可通过智源大模型开放平台获取相关资源。在使用开源模型时,建议关注各模型的具体许可证要求。对于涉及生物医疗、自动驾驶等高风险场景的应用,需严格遵循相关行业法规与安全标准。智源提供的评测平台旨在建立科学、公正的大模型评价体系,用户可参考评测结果选择适合业务需求的模型版本。

常见问题

智源研究院提供了哪些类型的开源资源?

智源提供了包括框架代码、模型权重、数据集与评测基准在内的全面开源资源。涵盖语言、视觉、多模态、具身智能及科学计算等多个领域,如Tele-FLM、Emu系列、BGE向量模型及DexGraspNet数据集等。

FlagOS软件栈的主要优势是什么?

FlagOS是面向异构算力的统一系统软件栈,支持多种AI芯片及主流框架。其核心优势在于完成了“全要素”端到端训练技术验证,能够显著降低大模型在不同硬件环境下的适配难度与训练成本。

如何参与智源的具身智能研究生态?

研究者与开发者可以利用智源开源的具身大脑大模型、NaVid导航模型及Robo4D世界模型进行二次开发。同时,可关注智源举办的具身与世界模型专题峰会,获取前沿技术分享并与产业链上下游企业建立合作。

数据统计

相关导航