Learn more about Applications - Section 35

来自 Allen Institute for AI 的研究人员介绍了 VISPROG:一种神经符号化方法,用于根据自然语言指令解决复杂和组合的视觉任务

寻找通用人工智能系统推动了具备能力的可训练模型的发展,其中许多旨在为用户提供简单的自然语言接口。大规模无监督预训练后...

认识Video-ControlNet:一款新的游戏改变型文本到视频扩散模型,塑造可控视频生成的未来

近年来,基于文本的视觉内容生成得到了快速发展。通过大规模的图像-文本对进行训练,目前的文本到图像(T2I)扩散模型已经展...

如何使用TensorFlow构建负责任的人工智能?

介绍 人工智能(AI)现在像从未有过的火爆,每周都有数百个新的AI应用程序、功能和平台发布。随着AI发展的速度,确保技术的安...

UC Berkeley和Meta AI研究人员提出了一种拉格朗日动作识别模型,通过融合3D姿态和上下文化外观来跟踪轨迹

在流体力学中,惯性系和欧拉系的流场表示是惯例。根据维基百科,“流场的拉格朗日描述是一种研究流体运动的方法,其中观察者跟...

认识CoDi:一种新的跨模态扩散模型,可用于任意合成

在过去的几年中,出现了一些强大的交叉模态模型,能够从一种信息中生成另一种信息,例如将文本转换为文本、图像或音频。一个...

来自萨里大学的研究人员推出了一款基于素描的机器学习物体检测工具,具有颠覆性的影响

自史前时代起,人们就用草图进行交流和文件记录。在过去的十年中,研究人员在理解如何使用草图从分类和合成到更新颖的应用,...

2023 年必须掌握的前十个强大的数据建模工具

介绍 在数据驱动的决策时代,拥有精确的数据建模工具对于旨在保持竞争力的企业至关重要。作为一名新开发者,强大的数据建模基...

来自马里兰大学学院市分校的最新人工智能研究开发出了一种人工智能系统,可以从人眼中的反射中重建三维场景

人眼是一种奇妙的器官,允许视觉并存储重要的环境数据。它们通常将它们的眼睛用作两个镜头,以将光线引导到组成视网膜的感光...

从声音到视觉:了解用于音频到图像合成的AudioToken

神经生成模型改变了我们消费数字内容的方式,彻底改变了各个方面。它们具有生成高质量图像的能力,确保长篇文本的连贯性,甚...

新兴能力揭示:只有成熟的AI像GPT-4才能自我改进吗?探索语言模型自主增长的影响

研究人员正在调查,类似于AlphaGo Zero,其中AI代理通过反复参与具有明确规则的竞争游戏来发展自己,许多大型语言模型(LLM)...

通过MINILLM揭示人工智能的潜力:深入探讨从更大的语言模型到更小的对应模型的知识蒸馏

知识蒸馏是一种典型的策略,通过大型教师模型的监督训练小型学生模型来减少由于大型语言模型的快速发展而导致的过度计算资源...

认识TRACE:一种新的人工智能方法,使用全局坐标跟踪实现准确的三维人体姿态和形状估计

许多领域可以从最近估计的三维人体姿态和形状(HPS)的进展中受益并使用。然而,大多数方法只考虑一帧图像,估计相对于相机的...