图片、文字、语音都能领略这个AI平台是“全能”选手

  图片、文字、语音都能领略 这个AI平台是“全能”选手

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,融易资讯网()动静 ,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿戴航天服站在机器臂上飞舞太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波宣布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不只能读懂图片、看懂视频、中文续写、双语翻译,并且能吟诗作赋,活跃证明白通过图片、文字、语音三种模态的关联与协同,可以有效地晋升呆板的领略和生成本领,让AI靠近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模子为焦点,基于全栈国产化基本软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以领略语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模子、框架等都是自主研发的。”徐波表明道。

  多种模态预练习模子被遍及认为是从限定规模的弱人工智能迈向通用人工智能路径的摸索。依托面向超大局限的高效漫衍式练习框架,自动化所构建了具有业界领先机能的中文预练习模子、语音预练习模子、视觉预练习模子,并开辟性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一暗示,构建了三模态预练习大模子,赋予跨模态通用人工智能平台多种焦点本领。

  徐波先容,“紫东太初”兼具跨模态领略和生成本领。与单模态和图片、文字两种模态对比,“紫东太初”回收一个大模子就可以机动支撑图片、文字以及语音的全场景AI应用,具有了在无监视环境下多任务连系进修、并快速迁移到差异规模数据的强大本领。

  “引入语音模态后的多模态预练习模子,,可实现共性图片、语音和文字的空间表征和操作,并打破性地直接实现三模态的统一暗示。”徐波说,出格值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更遍及、更多样的下游任务提供模子基本支撑,让AI可以或许在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据举办预练习,有效低落了多模态数据收集与清洗本钱。

  “‘紫东太初’跨模态通用人工智能平台包罗三大要害技能和六大焦点本领。”徐波说,三大要害技能别离是多模态领略与生成多任务统一建模、面向国产化软硬件的高效练习与陈设、多模态预练习模子架构设计与优化。六大焦点本领则浮现为多模态统一暗示与语义关联、跨模态内容转化与生成、预练习模子网络架构设计、标注受限自监视模子进修、模子适配与漫衍式练习、模子轻量化与推理加快。

  徐波暗示,“大数据+大模子+多模态”将改变当前单一模子对应单一任务的人工智能研发范式,多模态大模子将成为差异规模的共性平台技能,是迈向通用人工智能路径的摸索,具有辽阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的法则产生重大厘革并逐渐形成壁垒,对我国实现AI规模科技创新、占领焦点技能高地具有重要的计谋意义。

上一篇:数字技术平台助力新职业培训
下一篇:数字化倍增特许策划整体效率