← 返回日报
🌐 机器翻译 · DeepSeek · MIT TR

We still don’t know how people are really using AI


人工智能 我们仍然不知道人们实际上如何使用AI 但一项新研究表明,工作场景的使用占比远低于AI公司所声称的水平。 作者:Eileen Guo 存档页面 2026年8月18日 Stephanie Arnett/MIT Technology Review | Adobe Stock 执行摘要 Anthropic和OpenAI等AI公司定期发布关于人们如何使用Claude和ChatGPT等产品的报告,但AI研究人员表示,这些公司只公布了它们希望我们看到的数据。“没有独立来源可以佐证这些数据,”斯坦福可信AI研究实验室的计算机科学博士生Anka Reuel表示。Reuel是一个名为AI Observatory的新研究项目的联合负责人,该项目旨在填补这一空白。这是一个公共平台,汇总并分析了用户通过七个现有数据集同意收集的、与Claude和Gemini等流行模型的真实AI对话。其目的是提供独立的信息来源,帮助研究人员和政策制定者评估人们如何使用生成式AI。Reuel表示,目前关于AI益处和风险的重大决策正是基于非常有限的数据做出的。 相关报道 我们计算了AI的能源足迹。以下是你尚未听到的故事。 继续阅读 AI Observatory发现,AI的使用在不同模型之间存在显著差异,并且随时间发生了变化。其研究显示,敏感行为比主要AI公司报告中所捕捉到的要多得多,这些公司报告据称更侧重于工作而非个人使用。 Anthropic经济指数是最知名、被引用最广泛的AI使用数据来源之一,但它存在盲区。正如其名称所示,它侧重于Claude AI在工作与生产力相关的使用——过滤掉了与此类用途无关的对话。当AI Observatory的研究人员将Anthropic的方法应用于他们的数据集时,他们发现近一半的对话——48%——会被过滤掉。这些与工作无关的对话更可能涉及健康和人际关系(44.2%对比Anthropic分析中的31.2%)、成人或非法话题(7.9%对比2.1%)、骚扰和仇恨(27.5%对比5.66%)以及性内容(16.7%对比2.4%)。(OpenAI 2025年关于ChatGPT的报告同样发现,消费者使用中只有30%与工作相关。) Anthropic已发布单独的博客文章,介绍人们如何使用Claude进行支持或陪伴,甚至生成儿童性虐待材料,但德克萨斯大学奥斯汀分校助理教授David Widder表示,“拥有AI Observatory的全景式分析”而不是将这些信息“分割到单独的报告中”,有助于研究人员更一致地理解不同的使用方式。Widder研究人们如何与AI系统互动,并未参与AI Observatory项目。 AI Observatory所查看的数据集包括2023年至2025年间发生的对话,并发现人们使用AI的方式以及各AI平台的回应方式都存在差异。WildChat是AI Observatory研究中包含的最大、最详细的数据集之一,其中对话随时间变得更长、更精细,表现为提示令牌、响应令牌和对话轮数的不断增加。闲聊的比例也显著增加。这表明AI陪伴正在增加;与此同时,AI助手的自我披露(即承认自己是聊天机器人)有所减少。此外,研究人员标记为敏感的交流——即可能包含有害或受限内容(包括性骚扰和仇恨言论)的交流——变得不那么频繁。这可能表明平台总体上部署了更有效的防护措施。 AI Observatory还发现,话题、互动风格、对话结构以及敏感用例的可能性和类型在不同模型之间存在差异。例如,研究人员发现人们更频繁地使用Grok和Gemini进行信息检索。尤其是Grok,在新闻和政治信息方面特别受欢迎,但也是错误信息容易集中的地方。(这与其他研究表明错误信息在Grok上容易扩散的结论一致。xAI未回应置评请求。)与此同时,人们更倾向于使用Anthropic进行编程,使用Gemini进行社交和角色扮演,使用ChatGPT完成作业。即使是同一模型的不同版本之间也存在差异。研究人员发现,当ChatGPT由GPT-3.5驱动时,人们的对话较短,而与GPT-4o的对话则更长、更具迭代性——考虑到该版本以导致情感依赖而闻名,这很合理。然而,公司的报告往往没有捕捉到这些模型之间甚至模型内部的细微差别。 “没有哪一份公司报告能讲述全部故事,”麻省理工学院媒体实验室近期毕业的博士Shayne Longpre表示,他与Reuel共同领导了这项研究。 为了创建AI Observatory,Reuel与来自麻省理工学院、斯坦福大学、数据溯源倡议及其他机构的研究人员汇总了来自七个先前研究中收集的真实世界数据集的24,521段对话中的85,633个对话轮次(即用户提示和相应的AI响应)。这些对话来自5,000名用户在2023年至2025年间与52种不同模型(包括ChatGPT、Gemini、Claude和Grok)的互动。但与大型实验室自身掌握的数据相比,这些对话只是沧海一粟。例如,最新的Anthropic经济AI指数基于对100万段Claude对话的分析;OpenAI关于人们如何使用ChatGPT的报告分析了150万段对话。Anthropic的一位代表表示,该公司发布的研究反映了其研究团队的具体问题和研究兴趣。

📖 阅读原文 →