简化界面并引导工作流程,让评估变得可控
让开放式艺术评估变得可控的第一步,是降低工具本身的复杂性。育碧在2026年的一项行动设计研究中发现,现成的生成式AI工具界面复杂,与生产流程不匹配,容易引发AI素养不足和员工抵触等问题[1]。通过在Stable Diffusion之上引入简化界面并提供工作流引导,他们观察到用户接受度和生产力均有提升[1]。这意味着,在设计评估工具时,应剔除不必要的选项,并给出分步指引——这样即使底层生成过程是开放式的,整个流程也会显得易于掌控。
以人类参考校准判断,确保评估可靠
开放式评估中的一个主要挑战是,人工评分者往往在没有参照点的情况下,无法区分AI生成的艺术与人类创作的艺术。2021年一项关于故事生成的研究发现,即使具备严格资质,亚马逊土耳其机器人(Amazon Mechanical Turk)的工人也无法区分模型生成的文本与人类撰写的文本[5]。然而,当工人们看到模型输出与人类参考作品并列展示时,他们的判断准确度显著提升[5]。这表明,在艺术评估中,你应始终提供并排对比或校准样本——这为评分者提供了具体的锚点,使他们的评估更加一致且可控。
利用文本提示与新颖性搜索,在保持生成开放性的同时引导多样性
要控制开放式生成评估,你需要引导输出的多样性,同时不封闭其空间。MarioGPT,一个用于《超级马里奥兄弟》的文本到关卡生成器,展示了通过文本提示微调语言模型可以实现可控的关卡生成[4]。当与新颖性搜索结合时,它生成了越来越多样化的关卡,并具有不同的玩法动态[4]。这意味着在评估工具中,你可以让用户指定高层次目标(例如,“更抽象”或“更逼真”),然后使用新颖性搜索来确保输出保持多样化——这为开放式过程提供了一种可控感。
关于这些资料来源
本回答基于5项同行评审研究——发表于2021年至2026年,其中3项为2024年或之后发表,1项发表于Q1期刊,合计被引用389次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的48篇文献。
本文引用的文献
面向视觉设计的文本到图像生成式人工智能创意支持工具的设计原则
在育碧开展的一项行动设计研究中,一个带有工作流引导的简化界面提升了用户对Stable Diffusion的接受度和生产力,并由此提炼出七项针对文本到图像生成式AI创意支持工具的设计原则。
学习评估AI生成图像的艺术性
ArtScore是一种基于照片与艺术作品之间插值图像训练的度量指标,与Gram loss和ArtFID等现有指标相比,它与人类艺术评价更为一致,能够实现实例级别且无需参考图像的艺术性评估。
人工蜂群思维:语言模型的开放式同质性(及其超越)
Infinity-Chat是一个包含26,000个开放式查询及31,250条人工标注的数据集,它揭示了一种“人工群体思维”效应,即语言模型会产生同质化的输出,并表明奖励模型和评判者对个性化偏好的校准程度低于人类评分。
MarioGPT:通过大型语言模型实现开放式文本到关卡生成
MarioGPT是一个经过微调的GPT2模型,能够根据文本提示生成多样化的《超级马里奥兄弟》关卡,并且在与新颖性搜索结合后,能够实现开放式生成,持续产出内容日益多样、玩法动态各异的关卡。
使用Mechanical Turk评估开放式文本生成的风险
一项针对45篇开放式文本生成论文的调查发现,大多数论文未能报告关键的AMT任务细节;实验还表明,与英语教师不同,AMT工作者在未看到参考文本的情况下无法区分模型生成文本与人类文本,而提供参考文本则能改善其校准能力。
