在去年大部分时间似乎都处于观望状态之后,苹果开始在人工智能领域,尤其是开源人工智能领域进行变革。
这家总部位于库比蒂诺的科技巨头与圣巴巴拉大学合作开发了一种人工智能模型,可以根据自然语言编辑图像,就像人们与ChatGPT互动一样。苹果公司称之为多模式大语言模型引导图像编辑(MGIE)。
MGIE解释用户提供的文本指令,对其进行处理和细化,以生成精确的图像编辑命令。集成扩散模型增强了该过程,使MGIE能够根据原始图像的特性应用编辑。
可以处理文本和图像的多模式大型语言模型(MLLMs)构成了MGIE方法的基础。与只关注文本或图像的传统单模人工智能不同,MLLM可以处理复杂的指令,并在更广泛的情况下工作。例如,模型可以理解文本指令,分析特定照片的元素,然后从图像中提取一些东西,并创建一个没有该元素的新图片。
要执行这些操作,人工智能系统必须具有不同的能力,包括生成文本、生成图像、分割和CLIP分析,所有这些都在同一过程中。
MGIE的推出使苹果更接近于实现类似于OpenAI的ChatGPT Plus的功能,使用户能够与人工智能模型进行对话交互,以基于文本输入创建自定义图像。使用MGIE,用户可以用自然语言提供详细的指令——“从前台移除交通锥”——这些指令被翻译成图像编辑命令并执行。
换言之,用户可以从一张金发碧眼的人的照片开始,只需说“让这个人变成红发人”,就可以把照片变成姜黄色。在引擎盖下,模型会理解说明,分割这个人的头发,生成一个命令,比如“红头发,非常详细,照片真实,姜黄色调”,然后通过修复来执行更改。
苹果的方法与Stable Diffusion等现有工具保持一致,后者可以通过文本引导图像编辑的基本界面进行扩展。利用Pix2Pix等第三方工具,用户可以使用自然语言命令与Stable Diffusion界面进行交互,见证编辑图像的实时效果。
然而,事实证明,苹果的方法比任何其他类似的方法都更准确。
使用Directive Pix2Pic、LGIE、Apple的MGIE和Ground Truth image:Apple用自然语言编辑图像的结果
除了生成人工智能,Apple MGIE还可以执行其他传统的图像编辑任务,如颜色分级、调整大小、旋转、样式更改和草图绘制。
为什么苹果会将其开源?
苹果的开源尝试是一个明显的战略举措,其范围不仅仅是许可要求。
为了构建MGIE,苹果使用了Llava和Vicuna等开源模型。由于这些型号的许可要求限制了大型企业实体的商业使用,苹果可能被迫在GitHub上公开分享其改进。
但这也使苹果能够利用全球范围内的开发人员来增强其实力和灵活性。这种合作推动事情向前发展的速度远远快于苹果完全依靠自己,从头开始。此外,这种开放性激发了更广泛的想法,吸引了多样化的技术人才,使MGIE更快地发展。
苹果在开源社区与MGIE等项目的合作也推动了该品牌在开发者和技术爱好者中的发展。这方面已经不是什么秘密了,Meta和微软都在开源人工智能方面进行了大量投资。
作为开源软件发布MGIE可能会让苹果在为人工智能,尤其是基于人工智能的图像编辑制定仍在发展的行业标准方面领先一步。有了MGIE,苹果很可能为人工智能艺术家和开发者提供了一个坚实的基础,让他们可以构建下一个大东西,提供比其他地方更高的准确性和效率。
MGIE肯定会让苹果的产品变得更好:合成发送到Siri的语音命令,并使用该文本在用户的智能手机、电脑或内置耳机上编辑照片并不太困难。
精通技术的人工智能开发人员现在可以使用MGIE。只需访问该项目的GitHub存储库。
由Ryan Ozawa编辑。