机器学习(ML)在许多目标明确的领域表现出色。具有正确或错误答案的任务有助于训练过程并允许算法实现其预期目标,无论是正确识别图像中的对象还是正确地将一种语言翻译成另一种语言。但是,有些领域并没有客观的评价标准。比如一张照片美不美,是通过它的审美价值来衡量的,这是一个非常主观的概念。▲加拿大贾斯珀国家公园的专业照片为了探索机器学习是否可以学习主观性的概念,我们引入了一个用于艺术内容创作的实验性深度学习系统:https://arxiv.org/abs/1707.03491该系统模拟了工作流程专业摄影师的照片,浏览来自谷歌街景的全景图,搜索最佳构图,并执行各种后期处理操作以创建美观的图像。我们的虚拟摄影师“浏览”了大约40,000张全景照片(拍摄于加拿大的阿尔卑斯山、班夫和贾斯珀国家公园、加利福尼亚州的大苏尔、黄石公园等),令人印象深刻的照片,根据专业摄影师的判断,有些照片甚至接近专业品质。训练模型虽然可以使用AVA等数据集对美学进行建模,但纯粹使用它来增强照片可能会使其缺乏某些美学,例如照片过度饱和。然而,使用监督学习正确学习美学的多个元素可能需要一个难以收集的带注释的数据集。我们的方法只依赖于专业质量的照片集,没有前后图像比较,也没有任何额外的标签。该方法自动将美学分解为组件,每个组件都是从耦合图像处理生成的负样本中单独学习的。通过保持这些图像操作“半正交”,我们可以通过快速和可分离的优化来改善照片的构图、饱和度/HDR水平和戏剧性的照明。上面的全景图是(a)裁剪成(b)的全景图,在(c)中增强了饱和度和HDR强度,在(d)中应用了戏剧性的遮罩。每一步都是根据所学的一种美学元素完成的。传统的图像过滤器可用于生成饱和度、HDR细节和构图的负面训练示例。我们还引入了一种特殊操作,称为DramaticMasking,这是在学习戏剧照明概念时创建的。负面例子是通过应用一组图像过滤器(随机修改专业照片的亮度,降低照片质量)生成的。我们使用生成对抗网络(GAN)进行训练,其中生成模型创建一个遮罩来修复负面示例的光照,而判别模型则试图区分放大的照片和真实的专业照片。与晕影等固定形状滤镜不同,戏剧性蒙版可以感知照片内容并相应地调整照片亮度。GAN训练的竞争性将推动这些提案的逐步改进。您可以在我们的论文中阅读此培训的详细信息:https://arxiv.org/abs/1707.03491结果下面显示的是我们的系统通过Google街景生成的一些照片。如您所见,通过应用训练有素的美学滤镜(包括本文开头使用的图像!)产生了一些戏剧性的效果。▲加拿大贾斯珀国家公园▲瑞士因特拉肯▲意大利ParcodelleOrobieBergamasche公园。▲加拿大贾斯珀国家公园的专业评价为了判断我们的算法有多成功,我们设计了一个类似于“图灵测试”的实验:我们将自己制作的照片与其他不同质量的照片混合,展示给多位专业摄影师.这些摄影师被要求对每张照片的质量进行评分,评分标准如下:随机照片,不考虑构图、灯光等。好照片是普通大众拍的,没有摄影背景。没有突出的艺术特色。半专业水平。具有明显艺术性的优秀照片。摄影师正在成为专业摄影师。专业水准。在下图中,每条曲线都显示了专业摄影师如何对预测分数在一定范围内的照片进行评分。在我们制作的具有高预测分数的照片中,大约40%的评分介于半专业和专业之间。▲专业摄影师对不同预测分数的照片打分FutureWorkStreetView全景图作为我们项目的试验台。未来,这项技术甚至可以帮助你在现实世界中拍出更好的照片。我们整理了一个照片库来展示我们喜欢的照片:https://google.github.io/creatism如果您看到喜欢的照片,您可以点击它显示附近街景的全景。如果你拿着相机在那里,你会拍出同样水平的照片吗?致谢这项工作是GoogleResearch的机器感知工程师HuiFang和MengZhang的合作。我们要感谢VahidKazemi早期使用Inception网络预测AVA分数的工作,以及SagarikaChalasani、NickBeato、BryanKlingner和RupertBreheny在处理Google街景全景图方面提供的帮助。我们还要感谢PeymanMilanfar、TomasIzo、ChristianSzegedy、JonBarron和SergeyIoffe的建设性意见和评论。最后,非常感谢匿名专业摄影师的无私奉献!作者更多好文章