机器学习和人工智能领域的研究,现在几乎是每个行业和公司的一项关键技术,对于任何人来说都过于庞大,无法通读。本专栏Perceptron旨在收集一些最相关的最新发现和论文——特别是但不限于人工智能——并解释它们为何重要。
在过去的几周里,谷歌的研究人员演示了一个人工智能系统PaLI ,它可以用 100 多种语言执行许多任务。在其他地方,总部位于柏林的一个小组启动了一个名为Source+的项目,该项目旨在让艺术家(包括视觉艺术家、音乐家和作家)选择加入和退出,让他们的作品被用作人工智能的训练数据。
像 OpenAI 的 GPT-3 这样的人工智能系统可以生成相当有意义的文本,或者从网络、电子书和其他信息来源中总结现有文本。但从历史上看,它们仅限于一种语言,限制了它们的实用性和范围。
幸运的是,近几个月来,对多语言系统的研究加速了——部分是由 Hugging Face 的Bloom等社区努力推动的。为了利用多语言方面的这些进步,谷歌团队创建了 PaLI,它接受了图像和文本的训练,以执行图像字幕、对象检测和光学字符识别等任务。
图片来源:谷歌
谷歌声称 PaLI 可以理解 109 种语言以及这些语言和图像中的单词之间的关系,使其能够——例如——用法语为一张明信片的图片加上字幕。虽然这项工作仍处于研究阶段,但创作者表示,它说明了语言和图像之间的重要相互作用——并且可以为未来的商业产品奠定基础。
语音是 AI 不断改进的语言的另一个方面。Play.ht 最近展示了一种新的文本转语音模型,该模型将大量的情感和范围纳入其结果。 它上周发布的剪辑听起来很棒,尽管它们当然是精心挑选的。
我们使用本文的介绍生成了自己的剪辑,结果仍然可靠:
这种类型的语音生成究竟对什么最有用还不清楚。我们还没有完全处于他们完成整本书的阶段——或者更确切地说,他们可以,但它可能还不是任何人的首选。但随着质量的提高,应用程序成倍增加。
Mat Dryhurst 和 Holly Herndon——分别是一位学者和音乐家——已与 Spawning 组织合作推出 Source+,他们希望这一标准能够引起人们对使用未知情或不知情的艺术家的艺术品创建的照片生成 AI 系统问题的关注。请求许可。 Source+ 不收取任何费用,旨在让艺术家在他们愿意的情况下禁止将他们的作品用于 AI 培训目的。
像 Stable Diffusion 和 DALL-E 2 这样的图像生成系统接受了从网络上抓取的数十亿张图像的训练,以“学习”如何将文本提示翻译成艺术。其中一些图像来自 ArtStation 和 DeviantArt 等公共艺术社区——不一定具有艺术家的知识——并赋予系统模仿特定创作者的能力, 包括像 Greg Rutowski 这样的艺术家。
来自稳定扩散的样本。
由于系统模仿艺术风格的诀窍,一些创作者担心它们会威胁到生计。德莱赫斯特和赫恩登说,Source+——虽然是自愿的——可能是朝着让艺术家在如何使用他们的艺术方面拥有更大发言权的一个步骤——假设它被大规模采用(一个很大的假设)。
在 DeepMind,一个研究团队正试图解决 AI 长期存在的另一个问题:它倾向于喷出有毒和误导性信息。该团队专注于文本,开发了一个名为 Sparrow 的聊天机器人,它可以通过使用谷歌搜索网络来回答常见问题。谷歌的LaMDA等其他尖端系统也可以做到这一点,但 DeepMind 声称 Sparrow 比其同行更频繁地为问题提供合理、无毒的答案。
诀窍是使系统与人们对它的期望保持一致。 DeepMind 招募人员使用 Sparrow,然后让他们提供反馈来训练模型,了解答案的有用性,向参与者展示同一问题的多个答案,并询问他们最喜欢哪个答案。研究人员还为 Sparrow 定义了规则,例如“不要发表威胁性言论”和“不要发表仇恨或侮辱性评论”,他们让参与者通过试图欺骗系统违反规则来强加这些规则。
DeepMind 的麻雀对话的例子。
DeepMind 承认 Sparrow 有改进的空间。但在一项研究中,该团队发现聊天机器人在 78% 的情况下提供了有证据支持的“合理”答案,当被问到一个事实性问题时,只有 8% 的情况下违反了上述规则。研究人员指出,这比 DeepMind 最初的对话系统要好,后者在被欺骗时违反规则的频率大约是后者的三倍。
DeepMind 的一个独立团队最近处理了一个非常不同的领域:从历史上看,人工智能很难快速掌握视频游戏。据报道,他们的系统(俗称MEME )在 57 种不同的 Atari 游戏上实现了“人类水平”的性能,比之前的最佳系统快 200 倍。
根据 DeepMind 详细介绍 MEME 的论文,该系统可以通过观察大约 3.9 亿帧来学习玩游戏——“帧”是指快速刷新以给人以运动印象的静止图像。这听起来可能很多,但以前最先进的技术需要在相同数量的 Atari 游戏中使用 800亿帧。
图片来源: DeepMind
熟练地玩 Atari 听起来可能不是一个理想的技能。事实上,一些评论家认为游戏是一个有缺陷的人工智能基准,因为它们的抽象性和相对简单性。但像 DeepMind 这样的研究实验室相信,这些方法将来可以应用于其他更有用的领域,比如通过观看视频更有效地学习执行任务的机器人或自我改进的自动驾驶汽车。
英伟达在 20 日举行了现场活动,宣布了数十种产品和服务,其中包括几项有趣的人工智能工作。自动驾驶汽车是该公司的重点之一,既为人工智能提供动力,又对其进行训练。对于后者,模拟器至关重要,虚拟道路与真实道路相似同样重要。他们描述了一种新的、改进的内容流,可以加速将真实汽车上的摄像头和传感器收集的数据带入数字领域。
建立在真实世界数据之上的模拟环境。
可以准确地再现现实世界的车辆和道路或树木覆盖的不规则性,因此自动驾驶 AI 不会在街道的消毒版本中学习。通常,它可以创建更大、更多变量的模拟设置,这有助于提高鲁棒性。 (它的另一张图片在顶部。)
英伟达还为工业环境中的自主平台推出了 IGX 系统——就像你在工厂车间看到的人机协作。当然,不乏这些,但随着任务和操作环境的复杂性增加,旧方法不再适用,希望提高自动化程度的公司正在寻找面向未来的方法。
计算机视觉对工厂车间物体和人员进行分类的示例。
“主动”和“预测”安全是 IGX 旨在帮助解决的问题,也就是说,在安全问题导致中断或伤害之前发现它们。机器人可能有自己的紧急停止机制,但如果监控该区域的摄像头可以在叉车挡道之前告诉它转向,那么一切都会顺利一些。究竟是什么公司或软件实现了这一点(以及在什么硬件上,以及如何获得报酬)仍然是一项正在进行的工作,Nvidia 和Veo Robotics等初创公司都在摸索。
英伟达在游戏的主场又向前迈出了有趣的一步。该公司最新最好的 GPU 不仅用于推动三角形和着色器,还用于快速完成 AI 驱动的任务,例如用于提升和添加帧的 DLSS 技术。
他们试图解决的问题是游戏引擎要求如此之高,以至于在保持视觉保真度的同时每秒生成超过 120 帧(以跟上最新的显示器)是一项艰巨的任务,即使是强大的 GPU 也几乎无法完成。但是 DLSS 有点像智能帧混合器,可以提高源帧的分辨率而不会出现锯齿或伪影,因此游戏不必推送那么多像素。
在 DLSS 3 中,Nvidia 声称它可以以 1:1 的比例生成完整的额外帧,因此您可以自然渲染 60 帧,而通过 AI 渲染其他 60 帧。我可以想到几个可能在高性能游戏环境中使事情变得奇怪的原因,但 Nvidia 可能很清楚这些。无论如何,您都需要为使用新系统的特权支付大笔费用,因为它只能在 RTX 40 系列卡上运行。但是,如果图形保真度是您的首要任务,那就去做吧。
在偏远地区建造无人机的插图。
今天的最后一件事是伦敦帝国理工学院的一种基于无人机的 3D 打印技术,它可以在未来的某个时候用于自主建筑过程。目前,制造比垃圾桶更大的东西绝对不切实际,但仍处于早期阶段。最终他们希望让它更像上面的那样,它看起来确实很酷,但请观看下面的视频,让您的期望直截了当。
感知器: Kyle Wiggers最初发表在TechCrunch上的多语言、大笑、玩陷阱和街头人工智能