前沿AI评估的实际能力与局限
前沿人工智能评估能够直接回应公众关切,不仅衡量技术性能,还关注其与人类价值观及法律标准的契合度。一项2026年的研究测试了结合法律推理与公众情感分析的神经符号人工智能系统,在超过100个城市政策场景中,该系统实现了96.2%的法律合规准确率和91.3%的情感对齐得分[1]。这意味着该系统能够评估一项人工智能政策是否既合法又为社会所接受——这正是公众常担忧的两点。同一系统还以94.5%的准确率预测了冲突风险,并达到93.7%的政策建议采纳率,这表明当评估过程透明且多维度时,能够建立信任。
然而,并非所有评估都同等有效。2022年一项关于AI视觉感知黑箱评估的研究发现,其B-AIS框架虽能以95%和85%的F2分数分别检测出行人与飞机检测的弱点,但在模型层面检测罕见变体(如坐轮椅的行人)时,分数却降至45%和72%[4]。这表明,即便是先进的评估也可能遗漏关乎公共安全的关键边缘案例——而这正是公众担忧的主要来源。若评估仅测试平均性能而非罕见但影响重大的失误,专家乐观与公众忧虑之间的鸿沟或将持续存在。
治理鸿沟:为何仅靠评估远远不够
即使是最出色的技术评估,如果未能嵌入负责任的治理架构,也无法减少公众的担忧。一项针对2024年国际人工智能政策倡议(如英国人工智能安全峰会及七国集团广岛进程)的分析发现,尽管关于历史性变革的言辞引人注目,但实际成果仅限于高层次的自愿承诺和不具约束力的行为准则[3]。作者指出,这种“轻触式”方法未能解决谁掌控人工智能发展、谁从中受益等根本性问题——而这些正是引发公众不信任的关键。他们呼吁将人工智能重新定位为受民主控制的全球公共事业,这就要求评估工作必须以社区为主导、以社会为中心,而非仅由开发者自行开展。
另一项2024年的研究特别建议,前沿人工智能开发者应设立内部审计职能——该职能在组织上独立于高级管理层,直接向董事会汇报——以评估风险管理实践[2]。研究指出,危险能力可能不可预测地出现,已部署的模型难以防止其造成危害,且当前开发者并未遵循风险治理的最佳实践。内部审计能够识别低效做法,使董事会对风险有更准确的理解,但作者也警告称,审计可能被管理层操控,其效果取决于相关人员发现问题的能力。这表明,评估需要具备结构性独立,才能赢得公众的信任。
公众真正想要的是:透明度、问责制与发言权
公众对人工智能的担忧往往集中在谁来决定这些技术的使用方式,以及谁来承担相关风险。2024年关于前沿人工智能治理的分析指出,关键问题不仅涉及技术安全测试,更关乎议程设置权:谁掌握着方向盘,谁定义了创新议程,谁控制着生产资料[3]。这些问题比部署前的安全检查更为深刻,意味着评估必须成为更广泛的民主进程的一部分——而不仅仅是技术性工作。
2023年一项关于使用ChatGPT进行科学研究的研究发现,尽管AI生成的文本能够产出可在高影响力期刊上发表的高质量文章,但评审者对其所有权和研究诚信问题表达了严重担忧[5]。该研究邀请了23位评审者对4篇完整文章和50篇摘要进行评估,结果显示,即使输出内容在技术上表现良好,作者身份和研究过程缺乏透明度仍会削弱信任。这反映了公众对前沿AI的普遍关切:即便评估显示某个模型“安全”,人们仍可能担忧其训练者是谁、使用了哪些数据、以及最终为谁谋利。该研究的作者建议,应更关注方法论和研究设计——这一教训同样适用于AI评估领域。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2022年至2026年间,其中3篇为2024年或之后发表,3篇发表于Q1期刊,累计被引用175次——这些研究是从6篇通过质量筛选的文献中选出的最具相关性的成果,而该6篇文献又源自一个包含超过5亿篇论文的数据库中所检索到的63篇论文。
本文引用的文献
用于评估犬类权利、城市安全及人畜法律共存问题的神经符号人工智能系统
一种融合法律推理(描述逻辑、一阶逻辑)与公众情感分析(BERT、RoBERTa)的神经符号AI系统,在100多个城市政策场景中实现了96.2%的法律合规准确率、91.3%的情感对齐度、94.5%的冲突风险预测率以及93.7%的政策建议采纳率,表明混合评估能够弥合技术维度与社会维度之间的鸿沟。
前沿人工智能开发者需要设立内部审计职能。
认为前沿人工智能开发者需要设立内部审计职能——独立于高级管理层并向董事会汇报——以评估风险管理,因为危险能力可能不可预测地出现,已部署的模型难以控制,且当前开发者并未遵循风险治理的最佳实践。
“前沿人工智能”、权力与公共利益:谁受益,谁决策?
分析国际人工智能政策倡议(英国人工智能安全峰会、七国集团广岛进程)后发现,尽管言辞激烈,但成果仅限于非约束性承诺和宽松监管;呼吁将人工智能重新定位为民主管控下的全球公共事业,以解决谁受益、谁决策的问题。
B-AIS:一种针对AI软件视觉感知能力进行黑盒评估的自动化流程,用于检验其是否符合领域语义
针对AI视觉感知的B-AIS黑盒评估框架在行人检测任务中取得了95%(数据集)和85%(模型)的F2分数,但在检测罕见变体(如坐轮椅的行人)时仅达到45%和72%,这表明评估可能遗漏对公共安全至关重要的边缘案例。
人工智能在科学研究中的应用潜力与隐忧:ChatGPT性能评估
在一项由23位评审员对ChatGPT生成的4篇完整论文和50篇摘要进行评估的研究中,AI生成的文本能够产出可发表于高影响力期刊的高质量研究,但评审员对所有权和研究诚信问题表达了严重关切,强调仅凭技术质量并不能确保可信度。
