当AI能以假乱真填问卷:为什么廉价开源智能体才是更大的麻烦?
你填过的在线问卷、看过的民调结果,可能早就混进了AI生成的假答案。过去我们以为贵的商业AI才是威胁,最新研究却发现:几乎零成本的本地开源智能体,反而更难防。
一、你看到的民调,可能已经被AI”掺水”了
先讲一个有点颠覆常识的事实:我们过去默认”能认真填完问卷的就是真人”,这个假设可能已经不成立了。2025年发表在PNAS上的研究 The potential existential threat of large language models to online survey research 直接测试了一个自主合成受访者,结果它在6000次标准注意力检查中通过率达到99.8%——包括指令跟随任务、逻辑谜题,甚至专门用来检测非人类的”反向口令题”都没能拦住它 [6]。
这个AI不只是乱选答案,它会维持一个连贯的人口统计学人设,记住自己之前选过什么,在心理量表、情景理解题、复杂的社会经济权衡题上都能给出看起来合理的数据。连开放题回答都能根据设定的教育水平调整语言复杂度 [6]。换句话说,你看到的一份”高质量”问卷数据,可能从头到尾都是AI编的。
这件事为什么重要?因为在线调查是社会科学、市场研究、民意调查的基础工具。如果合成数据能轻易混入真实样本,小到一个产品的用户调研,大到选举前的民意预测,都可能被污染。更麻烦的是,AI还可以被故意用来操纵结果——比如定向推高某类观点的比例,或者”刚好”证实研究者想要的结论 [6]。
当然,你可能会问:能力归能力,现实中真的有这么多AI在填问卷吗?2026年一项覆盖10个平台、5200名受访者的研究 AI Agent Prevalence and Data Quality Across Multiple Online Sample Providers 发现,目前AI代理的实际渗透率其实很低:除了亚马逊MTurk平台有11%–16%的检测率,其他平台都在1%甚至更低 [7]。而且MTurk上检测到的更像是传统脚本机器人,不是高级LLM智能体 [7]。
但别急着松口气。这项研究同时指出一个问题:现在的低渗透率,不代表未来不会快速增长。过去限制AI大规模污染的核心因素其实是成本——用商业API跑大量智能体不划算。但如果成本几乎降到零呢?
二、反直觉:越便宜的开源智能体,行为越像人?
2026年9月的论文 Cheap, open agents make LLM pollution harder to mitigate 做了一个非常关键的对比:它把9种不同开放程度的自主调查智能体分成三类——完全开源(开源模型+开源框架Nanobrowser,本地运行)、混合(商业API模型+开源框架)、完全闭源(商业云代理)——让它们各自带着人设自主完成同一份人类调查,然后比成本、比表现、比能不能被检测出来 [1]。
先看成本,差距大到离谱:完全开源的智能体没有API费、没有订阅费,边际成本几乎就是电费,可以忽略不计;混合配置单次调查成本从0.04美元(Gemini 2.5 Flash)到0.60美元(GPT-4o)不等;最贵的闭源配置单次要1.81美元(Manus 1.6 Lite)[1]。最贵和最便宜之间,差了成百上千倍。
再看表现,结果就有点反直觉了:开源智能体在调查任务上的整体表现,居然和商业替代品不相上下 [1]。更有意思的是它们的”失败模式”完全不一样——
- 开源智能体几乎不会被reCAPTCHA v3检测出来,也从不触发粘贴检测,但有一种藏在页面裁剪元素里的”越狱蜜罐”(偷偷告诉回答者要在答案里提”芒果冰淇淋”),开源智能体100%会中招 [1]。
- 反过来,有视觉能力的闭源代理能看穿这种文本蜜罐,但某些闭源代理(比如Browser Use、Manus)100%会被reCAPTCHA v3抓到,还有一些(Perplexity Comet、GPT Agent)100%会触发右键检测 [1]。
这就很有意思了:你以为越贵的AI越会”装人”,但在行为痕迹层面,便宜的开源代理反而更接近人类。研究用**标准化欧氏距离(SED,一种量化两组数据分布差异程度的统计指标,数值越小说明两组越相似)**来量化智能体和人类在各类指标上的分布差异,结果发现:在行为指标上,开源代理的表现比闭源代理更接近人类 [1]。
为什么会这样?一个合理的猜测是,开源代理用的是直接操作网页DOM的框架,而闭源视觉代理是”真的用眼睛看屏幕”再操作,操作模式反而更不自然。当然,实际情况比这个比喻更复杂,因为框架差异和模型差异是混在一起的,研究并没有把两者分开测试。
但不管原因是什么,结论很明确:开源智能体因为成本几乎为零,而且失败模式和商业代理完全不同,它是一种被低估的、独特的LLM污染风险源 [1]。过去靠”成本不划算”建立的防线,在开源时代可能直接失效。
三、为什么没有一种检测能”通杀”所有AI?
那检测呢?有没有什么万能的方法能把所有AI都揪出来?
很遗憾,没有。这项研究一共设计了18项检测指标,从外部工具(Cloudflare、reCAPTCHA v3)到行为痕迹(计时、复制粘贴、右键操作),再到内容检测(蜜罐复选框、视觉错觉题、AI使用自陈、越狱蜜罐、开放文本语义分析),结果发现没有任何一项单一检测能可靠识别所有智能体 [1]。
比如Cloudflare和提示泄露蜜罐,一个代理都没检测出来;蜜罐复选框是最难通过的,但也不是对所有类型都有效 [1]。开源和闭源代理会栽在完全不同的检测上,就像两种不同的病原体,对同一种抗生素的敏感性完全不一样。
那目前最有效的检测手段是什么?答案是开放文本语义分析——也就是把开放题的回答转换成向量嵌入(研究用的是qwen3-embedding:0.6b模型),然后计算它和人类回答分布的语义距离 [1]。
数据很说明问题:在三类检测指标中,开放文本语义嵌入对人和代理的区分度最高。开源模型的文本SED中位数是21.11,闭源模型是15.96,混合模型是16.91——都和人类有明显差距 [1]。换句话说,AI在选择题上可以装得很像,但一让它自由写点什么,语义层面的”AI味”就藏不住了。
这也呼应了2026年那项多平台研究的发现:传统的注意力检查、行为指标在LLM时代越来越不够用,真正有效的检测需要往内容深层走 [7]。
所以现在的共识是,必须搞多层检测策略——不能只靠某一种方法,得把行为检测、蜜罐、开放文本分析叠在一起用 [1]。就像机场安检,不能只查身份证,得过X光、还要开箱抽查,多层叠加才能把风险降下来。
当然,这个结论也有它的边界。研究只测试了一份关于AI认知的特定调查、9种特定的代理配置,换个主题、换个长度、换种结构的问卷,结果可能不一样 [1]。而且所有代理都没有经过专门针对检测的对抗优化——换句话说,现在测的是AI”裸奔”时的状态,不是它”刻意伪装”时的水平 [1]。
四、从”像不像人”到”能不能骗过检测”:AI模拟能力的进化脉络
其实AI模拟人类行为这件事,不是突然冒出来的。我们可以简单捋一下这条线,就能明白为什么现在开源智能体是个新节点。
最早大家关心的是”AI能不能在总体层面复制人类的回答分布”——比如模拟一群人的平均态度。2025年PNAS那篇研究证明,AI不仅能做到,还能骗过绝大多数质量检查,通过率99.8% [6]。这时候的威胁还是”AI可以批量生成假数据”,但成本还是个问题。
然后大家开始往下沉,问”AI能不能预测具体某个人的反应”?2026年4月的研究 LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers 做了一个大规模基准测试,用1511名塞尔维亚参与者的画像,生成了12万多个智能体-人设组合,测试它们预测人类社交媒体反应的准确率 [8]。
结果有点意思:LLM代理确实有真实的预测能力,**马修斯相关系数(MCC,一种经过随机猜测校正的分类效果指标,取值在-1到1之间,0表示和瞎猜差不多,越高说明预测越准)**达到0.29——比瞎猜强,但还不如用TF-IDF加逻辑回归的传统文本分类器(MCC=0.36)[8]。这说明LLM代理的预测力主要来自对文本语义的理解,而不是什么独特的”代理式推理” [8]。而且在二元点赞预测任务里,给代理更丰富的人设信息(态度+人口统计),比只给人口统计信息提升非常有限 [8]。
几乎同一时间,另一项研究把这件事往前推了一步:不是预测,而是模拟——不是问”AI猜得对不对”,而是问”AI装得像不像”。2026年9月的 Thinking Less to Simulate Better 发现了一个很妙的技巧:你让模型”凭直觉立刻反应,不要分析推理”,它模拟个体社交媒体反应的保真度反而最高,个体差异的压缩程度从7倍人类水平降到了3倍 [3]。
这个发现很关键,因为它戳破了一个误区:我们以前觉得AI越”深思熟虑”越像人,但真实的人刷社交媒体、填问卷的时候,本来就不是每次都深思熟虑的。让AI”少想点”,反而更像真人的直觉反应 [3]。
而且这项研究还发现了另一个反直觉的点:AI如果严格按照人设表回答,一致性可以达到90%以上,但真人自己的态度和行为一致性只有71.3% [3]。换句话说,太完美的一致性反而可疑——真实的人本来就会有前后不一致、态度和行为打架的时候。
把这些串起来你就会发现:AI模拟人类的能力,正在从”总体平均”走到”个体差异”,从”靠推理装”走到”靠直觉装”。而检测技术也在对应地进化——从查注意力、查逻辑,到查行为痕迹,再到查开放文本的语义特征。这是一场典型的攻防迭代,而且两边都在快速升级。
五、未来的麻烦:当开源智能体学会”伪装”之后
说到这儿,你可能已经意识到了:现在我们能检测到开源智能体,很大程度上是因为它们还没”认真装”。
核心论文的作者自己也承认,研究里的所有代理都没有经过针对检测的对抗优化——没有在人类回答上微调,也没有专门设计绕过检测的prompt工程 [1]。现在测出来的是基线水平,不是开源代理的上限。
那如果开源代理学会了伪装呢?比如,用人类回答数据微调一下,或者专门针对开放文本语义检测做对抗优化,让自己写出来的东西在嵌入空间里更像人类?这正是论文提出的开放问题之一:开源智能体能在多大程度上被优化以逃避开放文本检测?[1]
而且别忘了我们前面说的”直觉提示”技巧——只要改一改prompt,让模型”凭直觉回答、不要太一致”,模拟保真度就能上一个台阶 [3]。这类技巧几乎零成本,任何人都可以用在开源模型上。
还有一个变量是模型本身的进步。今天开源模型写的文本和人类还有明显的语义距离(SED中位数21.11),但明年呢?后年呢?随着开源模型能力快速追赶闭源模型,开放文本这个目前最有效的检测手段,效果会不会慢慢下降?[1]
更麻烦的是,成本的门槛已经没了。商业AI你还可以通过监控API调用、限制批量访问来控制风险,但开源模型是本地运行的,你根本不知道对面是一个人在填问卷,还是一台服务器同时跑着几百个智能体 [1]。
那我们有什么办法?目前看来,多层检测策略还是最务实的方向——行为痕迹、蜜罐、开放文本语义分析多管齐下,因为不同类型的代理会栽在不同的检测上,叠在一起就能提高整体命中率 [1]。但多层检测在大规模数据收集中的可扩展性如何,也是个悬而未决的问题 [1]。
还有一个思路可能被很多人忽略了:既然AI越来越会装,那我们是不是不应该只盯着”区分人和AI”,而是反过来提升数据本身的可信度?比如2026年多平台研究发现,平台类型对数据质量的影响,比AI渗透的影响大好几倍——直接招募的专门面板,虽然名义成本高,但算上质量过滤之后反而是最划算的 [7]。也许在AI时代,“从源头保证样本质量”会重新变得重要起来。
如果你只记住一件事
如果这篇文章你只能带走一个结论,那就是:真正把LLM污染从”理论威胁”变成”现实麻烦”的,不是越来越强的商业大模型,而是越来越便宜的开源智能体。当成本从几美元降到几乎为零,过去靠”不划算”建立的防线就直接失效了。而更棘手的是,开源和闭源智能体的失败模式完全不同,没有任何一种单一检测能通杀所有情况,我们只能靠多层检测策略艰难应对——而且随着开源模型学会更好的伪装,这场攻防战还会越来越难打。
参考文献
- Cheap, open agents make LLM pollution harder to mitigate(arXiv、2026、全文精读)
- Financial Fragility in Societies of LLM Agents: Coordination Failures and Stabilizing Mechanisms(arXiv、2026、全文精读)
- Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content(arXiv、2026、全文精读)
- Improving Visual Sensitivity of LLMs on Multimodal Machine Translation with Metric-based Loss Weighting(arXiv、2026、全文精读)
- Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence(arXiv、2026、全文精读)
- The potential existential threat of large language models to online survey research(Proceedings of the National Academy of Sciences、2025、仅摘要)
- AI Agent Prevalence and Data Quality Across Multiple Online Sample Providers(2026、仅摘要)
- LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans(arXiv、2026、仅摘要)