什么算作算法评估中可靠的现实世界证据?
最可靠的真实世界证据来自那些将问题性使用与常规使用区分开的研究,因为两者与心理健康的关系截然不同。一项纳入58项研究、涵盖96,676名参与者的2026年荟萃分析发现,问题性短视频使用与抑郁(r=0.24)、焦虑(r=0.26)、压力(r=0.41)、孤独感(r=0.33)和无聊感(r=0.42)显著相关[1]。通俗来说,这些属于中等程度的相关——意味着随着问题性使用的增加,这些负面状态也会加剧。而常规使用(仅考虑使用时长或频率)与焦虑之间并无显著关联,整体影响也更弱且不一致[1]。因此,若要评估算法的真实世界影响,你需要衡量的是参与质量,而非单纯的屏幕使用时间。
算法特征如何驱动我们衡量的行为?
该算法的设计特性——如个性化推荐、实时互动和评论功能——直接助长了导致过度使用的动机。一项2024年针对351名TikTok用户的调查发现,“推荐”和“元发声”(评论、反应)等功能提升了用户感知的娱乐价值和社交价值,进而触发负面情感预期(错失恐惧),最终导致过度使用[5]。这意味着算法并非中立工具;其可供性被刻意设计,通过回避动机来吸引用户。另一项2026年针对1728名用户的研究开发了一个动机量表,结果显示,回避动机(逃避现实、害怕社交脱节)比工具性动机(娱乐、获取信息)更能预测高强度使用[4]。因此,可靠的评估必须衡量算法是否放大了回避驱动行为。
内容本身揭示了算法效应的什么?
算法驱动下走红的内容,揭示了系统放大传播的倾向,而这一点可以通过现实基线来评估。2023年一项针对TikTok上排名前100的试管婴儿相关视频分析发现,这些视频中同性伴侣(38.1%,远超现实人口比例)、代孕母亲(14.0%)以及活产案例(89.3%)的出现比例均显著偏高[2]。这意味着算法系统性地过度呈现了某些结果,可能扭曲观众的认知。然而,同一研究也指出,93.8%提出科学主张的视频准确度达到中高水平,表明算法未必会助长虚假信息[2]。这类内容审计正是有效的现实评估方法。
我们能否衡量算法对现实行为的影响?
是的,一个具体的行为衡量指标是决策中的风险偏好。一项2025年针对85名大学生(分为过度使用短视频组与非过度使用组)的研究发现,过度使用组在爱荷华赌博任务的风险阶段(最后40次试验)得分显著更低,意味着他们承担了更多风险[3]。过度使用得分越高,风险偏好越强,但与模糊决策无关[3]。这表明,算法驱动的过度使用可能以类似其他成瘾的方式损害现实判断力,为评估算法影响提供了行为标记。
关于这些来源
该答案基于5篇经同行评审的研究——发表于2023年至2026年,其中4篇为2024年或之后发表,5篇均来自Q1期刊——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源自从超过5亿篇论文数据库中检索到的49篇文献。
本文引用的文献
短视频使用与心理健康之间的关联:系统综述与荟萃分析。
一项涵盖58项研究(共96,676名参与者)的荟萃分析发现,问题性短视频使用与抑郁(r=0.24)、焦虑(r=0.26)、压力(r=0.41)、孤独感(r=0.33)和无聊感(r=0.42)显著相关,而常规使用则仅表现出微弱且不一致的关联。
#IVF之旅:TikTok上试管婴儿视频的内容分析
对TikTok上排名前100的IVF视频(总观看量7.31亿次)进行的横断面分析发现,同性伴侣(38.1%)、代孕者(14.0%)和活产(89.3%)的比例与现实数据相比存在显著偏差,但93.8%的科学陈述是准确的。
过度使用短视频与风险承担增加相关,但并未改变基于模糊性的决策方式。
一项针对85名大学生的实验研究发现,过度使用短视频的用户在风险情境下(后40轮测试)的爱荷华赌博任务得分显著较低,表明其风险倾向增加,而在模糊决策方面未发现显著差异。
是什么驱动了短视频消费?短视频使用动机多维量表的开发与验证。
基于对1,728名用户的量表开发,研究识别出短视频使用的五种动机:寻求乐趣、获取信息、便利性、逃避现实以及避免社交脱节;其中,回避性动机比工具性动机更能预测用户的过度使用行为。
短视频应用过度使用的形成机制:一项信息技术可供性视角的研究
一项针对351名TikTok用户的调查发现,算法功能(推荐、元语音、直播)提升了用户感知的娱乐价值和社交价值,进而引发负面情绪预期,最终导致过度使用。
