Chunlin 的论文科普

当AI能以假乱真填问卷:为什么廉价开源智能体才是更大的麻烦?

你填过的在线问卷、看过的民调结果,可能早就混进了AI生成的假答案。过去我们以为贵的商业AI才是威胁,最新研究却发现:几乎零成本的本地开源智能体,反而更难防。

一、你看到的民调,可能已经被AI”掺水”了

先讲一个有点颠覆常识的事实:我们过去默认”能认真填完问卷的就是真人”,这个假设可能已经不成立了。2025年发表在PNAS上的研究 The potential existential threat of large language models to online survey research 直接测试了一个自主合成受访者,结果它在6000次标准注意力检查中通过率达到99.8%——包括指令跟随任务、逻辑谜题,甚至专门用来检测非人类的”反向口令题”都没能拦住它 [6]。

这个AI不只是乱选答案,它会维持一个连贯的人口统计学人设,记住自己之前选过什么,在心理量表、情景理解题、复杂的社会经济权衡题上都能给出看起来合理的数据。连开放题回答都能根据设定的教育水平调整语言复杂度 [6]。换句话说,你看到的一份”高质量”问卷数据,可能从头到尾都是AI编的。

这件事为什么重要?因为在线调查是社会科学、市场研究、民意调查的基础工具。如果合成数据能轻易混入真实样本,小到一个产品的用户调研,大到选举前的民意预测,都可能被污染。更麻烦的是,AI还可以被故意用来操纵结果——比如定向推高某类观点的比例,或者”刚好”证实研究者想要的结论 [6]。

当然,你可能会问:能力归能力,现实中真的有这么多AI在填问卷吗?2026年一项覆盖10个平台、5200名受访者的研究 AI Agent Prevalence and Data Quality Across Multiple Online Sample Providers 发现,目前AI代理的实际渗透率其实很低:除了亚马逊MTurk平台有11%–16%的检测率,其他平台都在1%甚至更低 [7]。而且MTurk上检测到的更像是传统脚本机器人,不是高级LLM智能体 [7]。

但别急着松口气。这项研究同时指出一个问题:现在的低渗透率,不代表未来不会快速增长。过去限制AI大规模污染的核心因素其实是成本——用商业API跑大量智能体不划算。但如果成本几乎降到零呢?

二、反直觉:越便宜的开源智能体,行为越像人?

2026年9月的论文 Cheap, open agents make LLM pollution harder to mitigate 做了一个非常关键的对比:它把9种不同开放程度的自主调查智能体分成三类——完全开源(开源模型+开源框架Nanobrowser,本地运行)、混合(商业API模型+开源框架)、完全闭源(商业云代理)——让它们各自带着人设自主完成同一份人类调查,然后比成本、比表现、比能不能被检测出来 [1]。

先看成本,差距大到离谱:完全开源的智能体没有API费、没有订阅费,边际成本几乎就是电费,可以忽略不计;混合配置单次调查成本从0.04美元(Gemini 2.5 Flash)到0.60美元(GPT-4o)不等;最贵的闭源配置单次要1.81美元(Manus 1.6 Lite)[1]。最贵和最便宜之间,差了成百上千倍。

再看表现,结果就有点反直觉了:开源智能体在调查任务上的整体表现,居然和商业替代品不相上下 [1]。更有意思的是它们的”失败模式”完全不一样——

这就很有意思了:你以为越贵的AI越会”装人”,但在行为痕迹层面,便宜的开源代理反而更接近人类。研究用**标准化欧氏距离(SED,一种量化两组数据分布差异程度的统计指标,数值越小说明两组越相似)**来量化智能体和人类在各类指标上的分布差异,结果发现:在行为指标上,开源代理的表现比闭源代理更接近人类 [1]。

为什么会这样?一个合理的猜测是,开源代理用的是直接操作网页DOM的框架,而闭源视觉代理是”真的用眼睛看屏幕”再操作,操作模式反而更不自然。当然,实际情况比这个比喻更复杂,因为框架差异和模型差异是混在一起的,研究并没有把两者分开测试。

但不管原因是什么,结论很明确:开源智能体因为成本几乎为零,而且失败模式和商业代理完全不同,它是一种被低估的、独特的LLM污染风险源 [1]。过去靠”成本不划算”建立的防线,在开源时代可能直接失效。

三、为什么没有一种检测能”通杀”所有AI?

那检测呢?有没有什么万能的方法能把所有AI都揪出来?

很遗憾,没有。这项研究一共设计了18项检测指标,从外部工具(Cloudflare、reCAPTCHA v3)到行为痕迹(计时、复制粘贴、右键操作),再到内容检测(蜜罐复选框、视觉错觉题、AI使用自陈、越狱蜜罐、开放文本语义分析),结果发现没有任何一项单一检测能可靠识别所有智能体 [1]。

比如Cloudflare和提示泄露蜜罐,一个代理都没检测出来;蜜罐复选框是最难通过的,但也不是对所有类型都有效 [1]。开源和闭源代理会栽在完全不同的检测上,就像两种不同的病原体,对同一种抗生素的敏感性完全不一样。

那目前最有效的检测手段是什么?答案是开放文本语义分析——也就是把开放题的回答转换成向量嵌入(研究用的是qwen3-embedding:0.6b模型),然后计算它和人类回答分布的语义距离 [1]。

数据很说明问题:在三类检测指标中,开放文本语义嵌入对人和代理的区分度最高。开源模型的文本SED中位数是21.11,闭源模型是15.96,混合模型是16.91——都和人类有明显差距 [1]。换句话说,AI在选择题上可以装得很像,但一让它自由写点什么,语义层面的”AI味”就藏不住了。

这也呼应了2026年那项多平台研究的发现:传统的注意力检查、行为指标在LLM时代越来越不够用,真正有效的检测需要往内容深层走 [7]。

所以现在的共识是,必须搞多层检测策略——不能只靠某一种方法,得把行为检测、蜜罐、开放文本分析叠在一起用 [1]。就像机场安检,不能只查身份证,得过X光、还要开箱抽查,多层叠加才能把风险降下来。

当然,这个结论也有它的边界。研究只测试了一份关于AI认知的特定调查、9种特定的代理配置,换个主题、换个长度、换种结构的问卷,结果可能不一样 [1]。而且所有代理都没有经过专门针对检测的对抗优化——换句话说,现在测的是AI”裸奔”时的状态,不是它”刻意伪装”时的水平 [1]。

四、从”像不像人”到”能不能骗过检测”:AI模拟能力的进化脉络

其实AI模拟人类行为这件事,不是突然冒出来的。我们可以简单捋一下这条线,就能明白为什么现在开源智能体是个新节点。

最早大家关心的是”AI能不能在总体层面复制人类的回答分布”——比如模拟一群人的平均态度。2025年PNAS那篇研究证明,AI不仅能做到,还能骗过绝大多数质量检查,通过率99.8% [6]。这时候的威胁还是”AI可以批量生成假数据”,但成本还是个问题。

然后大家开始往下沉,问”AI能不能预测具体某个人的反应”?2026年4月的研究 LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers 做了一个大规模基准测试,用1511名塞尔维亚参与者的画像,生成了12万多个智能体-人设组合,测试它们预测人类社交媒体反应的准确率 [8]。

结果有点意思:LLM代理确实有真实的预测能力,**马修斯相关系数(MCC,一种经过随机猜测校正的分类效果指标,取值在-1到1之间,0表示和瞎猜差不多,越高说明预测越准)**达到0.29——比瞎猜强,但还不如用TF-IDF加逻辑回归的传统文本分类器(MCC=0.36)[8]。这说明LLM代理的预测力主要来自对文本语义的理解,而不是什么独特的”代理式推理” [8]。而且在二元点赞预测任务里,给代理更丰富的人设信息(态度+人口统计),比只给人口统计信息提升非常有限 [8]。

几乎同一时间,另一项研究把这件事往前推了一步:不是预测,而是模拟——不是问”AI猜得对不对”,而是问”AI装得像不像”。2026年9月的 Thinking Less to Simulate Better 发现了一个很妙的技巧:你让模型”凭直觉立刻反应,不要分析推理”,它模拟个体社交媒体反应的保真度反而最高,个体差异的压缩程度从7倍人类水平降到了3倍 [3]。

这个发现很关键,因为它戳破了一个误区:我们以前觉得AI越”深思熟虑”越像人,但真实的人刷社交媒体、填问卷的时候,本来就不是每次都深思熟虑的。让AI”少想点”,反而更像真人的直觉反应 [3]。

而且这项研究还发现了另一个反直觉的点:AI如果严格按照人设表回答,一致性可以达到90%以上,但真人自己的态度和行为一致性只有71.3% [3]。换句话说,太完美的一致性反而可疑——真实的人本来就会有前后不一致、态度和行为打架的时候。

把这些串起来你就会发现:AI模拟人类的能力,正在从”总体平均”走到”个体差异”,从”靠推理装”走到”靠直觉装”。而检测技术也在对应地进化——从查注意力、查逻辑,到查行为痕迹,再到查开放文本的语义特征。这是一场典型的攻防迭代,而且两边都在快速升级。

五、未来的麻烦:当开源智能体学会”伪装”之后

说到这儿,你可能已经意识到了:现在我们能检测到开源智能体,很大程度上是因为它们还没”认真装”。

核心论文的作者自己也承认,研究里的所有代理都没有经过针对检测的对抗优化——没有在人类回答上微调,也没有专门设计绕过检测的prompt工程 [1]。现在测出来的是基线水平,不是开源代理的上限。

那如果开源代理学会了伪装呢?比如,用人类回答数据微调一下,或者专门针对开放文本语义检测做对抗优化,让自己写出来的东西在嵌入空间里更像人类?这正是论文提出的开放问题之一:开源智能体能在多大程度上被优化以逃避开放文本检测?[1]

而且别忘了我们前面说的”直觉提示”技巧——只要改一改prompt,让模型”凭直觉回答、不要太一致”,模拟保真度就能上一个台阶 [3]。这类技巧几乎零成本,任何人都可以用在开源模型上。

还有一个变量是模型本身的进步。今天开源模型写的文本和人类还有明显的语义距离(SED中位数21.11),但明年呢?后年呢?随着开源模型能力快速追赶闭源模型,开放文本这个目前最有效的检测手段,效果会不会慢慢下降?[1]

更麻烦的是,成本的门槛已经没了。商业AI你还可以通过监控API调用、限制批量访问来控制风险,但开源模型是本地运行的,你根本不知道对面是一个人在填问卷,还是一台服务器同时跑着几百个智能体 [1]。

那我们有什么办法?目前看来,多层检测策略还是最务实的方向——行为痕迹、蜜罐、开放文本语义分析多管齐下,因为不同类型的代理会栽在不同的检测上,叠在一起就能提高整体命中率 [1]。但多层检测在大规模数据收集中的可扩展性如何,也是个悬而未决的问题 [1]。

还有一个思路可能被很多人忽略了:既然AI越来越会装,那我们是不是不应该只盯着”区分人和AI”,而是反过来提升数据本身的可信度?比如2026年多平台研究发现,平台类型对数据质量的影响,比AI渗透的影响大好几倍——直接招募的专门面板,虽然名义成本高,但算上质量过滤之后反而是最划算的 [7]。也许在AI时代,“从源头保证样本质量”会重新变得重要起来。

如果你只记住一件事

如果这篇文章你只能带走一个结论,那就是:真正把LLM污染从”理论威胁”变成”现实麻烦”的,不是越来越强的商业大模型,而是越来越便宜的开源智能体。当成本从几美元降到几乎为零,过去靠”不划算”建立的防线就直接失效了。而更棘手的是,开源和闭源智能体的失败模式完全不同,没有任何一种单一检测能通杀所有情况,我们只能靠多层检测策略艰难应对——而且随着开源模型学会更好的伪装,这场攻防战还会越来越难打。


参考文献

  1. Cheap, open agents make LLM pollution harder to mitigate(arXiv、2026、全文精读)
  2. Financial Fragility in Societies of LLM Agents: Coordination Failures and Stabilizing Mechanisms(arXiv、2026、全文精读)
  3. Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content(arXiv、2026、全文精读)
  4. Improving Visual Sensitivity of LLMs on Multimodal Machine Translation with Metric-based Loss Weighting(arXiv、2026、全文精读)
  5. Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence(arXiv、2026、全文精读)
  6. The potential existential threat of large language models to online survey research(Proceedings of the National Academy of Sciences、2025、仅摘要)
  7. AI Agent Prevalence and Data Quality Across Multiple Online Sample Providers(2026、仅摘要)
  8. LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans(arXiv、2026、仅摘要)