Chunlin 的论文科普

为什么给 AI 「找对人问对事」比「知道更多」更重要?

你有没有过这种体验:问一个知识渊博的朋友专业问题,他反而不如只懂那一行的人答得准?AI 也一样——不是知道得越多越好,而是能不能把问题交到对的「人」手里、再把好质量关。

一个反直觉的发现:「什么都知道」的 AI 反而容易错

我们先看两个真实场景的错误。

第一个是临床病历摘要。帕金森病患者要定期做运动能力、日常活动、非运动症状、生活质量四项评估,每次随访都有一堆分数。普通大模型直接拿这些数据写摘要,在纵向 UPDRS-only 场景下事实准确率只有 43.6% 左右——比如把「运动评分从第 1 次 28 分、第 2 次 31 分、第 3 次 35 分(持续加重)」说成「从 28 分改善到 22 分」,中间数值和变化方向全是编的 [3]。你可能以为换个医学专用模型会好,但实验发现,专门的医学模型(如 Meditron-7B)确实能把就诊时间顺序排得整整齐齐,可事实准确率反而不如通用指令模型 Llama-3.1-8B——它更会「装得像」,但里面的数照样编 [3]。

第二个是知识图谱问答。我们常说知识图谱是 AI 的「外部记忆」,但如果只是把从文档里抽出来的三元组一股脑塞进图谱,就像把所有书乱堆在一个大书架上。抽的时候就有不少错,问答时再全局检索,错上加错。实验显示,这种「扁平插入」的图谱,在 SciERC 科学文献数据集上严格三元组 F1 只有 0.106,人类盲审里只有 62.5% 的三元组能找到原文证据支持 [1]。

问题出在哪?不是模型知道得不够多,而是没有分工,也没有把关。一个智能体既要抽知识、又要存知识、还要回答问题,既当运动员又当裁判员,不出错才怪。

方案一:把知识图谱从「乱书架」变成「分科图书馆」

第一篇论文提出的 MAGG 框架,思路很直接:给知识图谱加一个「治理层」,把「谁管这块知识、凭什么准入、出了问题找谁」都明明白白记下来 [1]。

你可以把它想象成一座分科图书馆,分三层运作:

第一层是创建层,相当于采购部。文档进来后,先按领域分类,再抽实体、抽关系、找证据。大部分高置信度(置信度≥0.7)的条目直接往下走,低置信度的会走一个「黑板式审议侧路」——让 3 个不同角色的智能体投票辩论,就像采购时拿不准的东西要开会讨论 [1]。

第二层是治理层,相当于各学科的馆长。抽出来的候选三元组,会按领域分给对应的「域专家智能体」(由大模型扮演,非人类)。这个专家只懂自己这一科,它会对照原始证据和自己管的那部分图谱,决定是批准、拒绝、修改还是上报更高级别。每一条决策都会写进审计日志——谁批的、依据是什么,清清楚楚 [1]。

第三层是应用层,相当于咨询台。有人来问问题时,不是在全馆乱翻,而是先由编排器分解问题、判断属于哪个学科,直接找对应领域的专家回答,再把答案拼起来 [1]。

效果怎么样?在 SciERC 数据集上,MAGG 的严格三元组 F1 比扁平插入提升了 47%,映射 F1 提升了 51% [1]。人类盲审更说明问题:经过治理修订的三元组,100% 都有原文证据支持 [1]。下游问答上,在多跳开放域问答数据集 MuSiQue 上,MAGG 比微软的 GraphRAG 精确匹配高 9.0 个百分点,token-F1 高 11.2 个百分点 [1]。

当然,实际情况比这个比喻更复杂。比如一个实体可以属于多个领域,「生物标志物」既归炎症管也归心血管代谢管,所以所有权是集合映射而不是单一归属,支持跨域推理 [1]。另外治理也不是全靠人工规则,域专家本身也是大模型,它的能力边界受限于基座模型 [1]。

还有一笔账要算:MAGG 每篇文档要调用约 18.45 次 LLM,消耗约 8 万 token,大概是扁平插入的 2.5 倍 [1]——质量提升是有成本的。

方案二:把临床推理拆成四个「专科医生」再加一个「总编」

如果说 MAGG 管的是「知识怎么建」,那第二篇论文的 MA-RAG 管的就是「知识怎么用」,内核却惊人地一致:分治 + 校验 [3]。

MA-RAG 面向的是帕金森病纵向临床评估的查询式摘要。它的架构也可以用医院来类比:

首先,检索不靠向量相似度,靠元数据精确匹配——患者 ID、就诊时间戳,对得上才调出来,避免把不同患者的相似记录混在一起 [3]。这就像挂号时先核对身份证,不会因为两个病人症状像就把病历搞混。

然后,把临床推理拆成四个专科医生:运动科、日常活动科、非运动科、生活质量科。每个医生只看自己领域的那部分量表数据,各写各的报告 [3]。为什么要拆?因为一个医生同时看四张表,很容易看串数字、漏项;四个专科各管一摊,出错概率小得多。

最后,加一个总编做最终核验。四个专科的草稿汇总上来,总编不会直接润色发表,而是拿着原始结构化分数表一条一条对:这个 28 分有没有出处?那个「加重」的结论对不对得上时间点?核对无误了,才合成最终摘要 [3]。

这个设计的效果有多夸张?在纵向 UPDRS-only 场景下,事实精度从传统方法的 0.436 提升到 0.970,相对提升 122%;幻觉率从 0.564 降到 0.010 左右,降了约 98% [3]。相当于从「一半都是编的」变成「几乎没有瞎编」。

有意思的是,提升最大的是事实准确性,而语义相似度和时间保真度的提升幅度没那么大,甚至某些基线在这两项上得分还更高 [3]——说白了,普通模型写得可能更「通顺」「像那么回事」,但里面的数不能信;MA-RAG 写得可能没那么花哨,但每句话都有依据。

MA-RAG 也有自己的局限:目前只针对帕金森病的 UPDRS 和 PDQ-8 两种结构化量表,要扩展到其他疾病得改造领域层;而且计算成本是单轮 RAG 的 3 到 6 倍 [3]。

你看,MAGG 和 MA-RAG 一个管知识构建,一个管知识应用,长得完全不一样,但底层逻辑是同一个:先把问题拆给专门的人,再有人专门负责校验。

校验该怎么给反馈?说「错了」没用,说「哪错了」才有用

说到校验,你可能会问:校验不就是说一句「不对,重写」吗?还真不是。第三篇论文告诉我们,反馈的质量直接决定了修正的效率,差得不是一点半点 [2]。

这篇论文研究的是自然语言转正则表达式的任务——就是你用大白话说「匹配所有包含 dog 的邮箱地址」,让 AI 写正则。为什么选正则?因为它紧凑、易碎,而且可以用程序确定性地检查对错,能把「修正能力」单独拎出来研究,不混入检索、工具使用等其他干扰 [2]。

实验对比了四种反馈方式,都给模型四次改正机会(基于 Gemini 3 Flash Preview 模型):

第一种是零样本,就是一次生成,没反馈,成功率 17% [2]。

第二种是通用自我修正,就是告诉模型「不对,再想想」,成功率 27% [2]——比零样本强点,但有限,相当于老师改作业只打个叉。

第三种是仅错误数量反馈,告诉模型「错了 3 个正例、2 个反例」,但不说具体是哪几个,成功率 23%,还不如第二种 [2]。

第四种是诊断式反例反馈,也就是 A-CEGIS 的做法:把具体哪条字符串匹配错了、是不该匹配却匹配了(假阳性)还是该匹配却没匹配(假阴性),清清楚楚列出来,最多各给两个短例子。成功率多少?90% [2]。

差了两倍多。这就像改数学题,打个叉、扣几分都没用,你得圈出「第三步这里算错了」,学生才知道往哪改。

而且这种修正是净进步的。论文里有个指标叫「修正效率比(RER)」,等于修好的问题数除以修坏的问题数,A-CEGIS 下这个数是 2.61——每修坏 1 个,能修好 2.6 个 [2]。好的修正应该是局部微调,不是每次都推倒重来。

不过也要注意,「全对」也可能藏着漏洞。30 个任务在隐藏测试集上全部通过后,再用边界案例一「刁难」,立刻有 7 个露馅,比如接受了空串、通配符放太宽 [2]。所以论文还加了一步「硬化(hardening)」,专门找边界案例来测,测出来问题就继续修 [2]。

当然,这个结论目前只在正则任务上验证过,能不能推广到 SQL、配置策略等其他领域,还需要更多研究 [2]。但核心道理是通用的:校验不是拍脑袋审批,而是给出具体的、可定位的反例证据。

从「抽取时代」到「治理时代」:知识系统正在换范式

把这三篇论文放在一起看,你会发现一个清晰的脉络:我们对 AI 知识系统的关注点,正在从「怎么把知识提出来」转向「怎么把知识管起来」。

过去的思路是「抽取优先」:想尽办法从文本里挖出更多三元组、更多事实,堆得越多越好。但三篇论文共同告诉我们,堆信息解决不了可靠性问题——扁平插入的图谱三元组多了近两倍(2881 个 vs 1077 个),但有用的反而少 [1];单智能体什么都看,但事实准确率不到一半 [3];零样本生成一次出结果,但正确率只有 17% [2]。

新的思路是「治理优先」:不追求一次就对,而是靠分工和校验来逐步逼近正确。MAGG 的域专家 + 审计日志是治理 [1],MA-RAG 的专科分解 + 最终核验是治理 [3],A-CEGIS 的反例引导迭代也是治理 [2]。它们的共同结构是「分治 + 校验」——先拆分降低每个单元的复杂度,再用反馈循环保证质量。

但这条路还刚开始,有不少未解决的问题:

第一,冲突更新怎么办?知识不是一成不变的,新的研究可能推翻旧结论,不同来源的事实可能打架。MAGG 目前还没有很好地处理这个问题 [1]。

第二,规模化怎么做?领域越多、知识量越大,治理的成本会不会指数级增长?现在的实验还都是中小规模 [1]。

第三,基座模型依赖。不管是域专家还是校验者,本身都是大模型,治理的可靠性最终受限于基座模型的能力,还没有引入人类专家或形式化规则做最终兜底 [1]。

第四,成本问题。MAGG 是扁平插入的 2.5 倍 token 成本 [1],MA-RAG 是单轮 RAG 的 3 到 6 倍 [3]——质量提升很诱人,但钱包也要扛得住。

补记:别忘了——很多语言连「被正确分词」都还没做到

聊了这么多智能体治理、知识图谱、临床推理,你可能觉得这就是 AI 的前沿全貌了。但还有一个很容易被忽略的事实:前面讨论的这一切,都是高资源语言的奢侈品。对很多低资源语言来说,连最基础的分词效率和评估基准都还没配齐。

先看分词。现代大模型的分词器(tokenizer)是按训练语料里的出现频率来合并子词的。英语因为训练数据多,很多常用词能合并成一个 token;而乌克兰语等西里尔字母语言就没这待遇了——同样的内容,乌克兰语的 token 数是英语的 1.68 到 3.2 倍,旧版 cl100k 分词器甚至能到 3.2 倍 [5]。

这意味着什么?同样的上下文窗口,乌克兰语能装的内容只有英语的一半甚至三分之一;同样的 API 调用,乌克兰语用户要花两三倍的钱。而且这不是因为西里尔字母本身占字节多——只要训练数据里加 10% 的乌克兰语,开销立刻降到原来的五分之一 [5]。本质上是训练数据分配的问题。

还有个反直觉的发现:把乌克兰文转成拉丁字母(罗马化),以为能省 token,结果在 5/6 的现代分词器下反而增加 2% 到 19% 的 token 数 [5]。因为分词器已经学过西里尔文的合并规则,转写反而破坏了这些规则。

再看评估基准。就算分词问题解决了,你怎么知道模型好不好?得有基准测试吧?但对斯拉夫语族来说,基准数据的稀缺程度超乎想象。俄语还有全部 8 类任务的数据,波斯尼亚语、白俄罗斯语只有 2 类有数据 [4]。很多任务看起来有好几个数据集,其实彼此高度相关,等于「同一道题换了个问法」,不算真正的独立验证 [4]。

论文提出了一个「证据强度评分(ESS)」来衡量基准结论的可靠性,结果发现:就算是俄语这种相对高资源的语言,整体证据强度也只有 0.49(满分 1)[4]。很多「模型排名稳定」的结论,其实只是因为只有一个数据集可测——就像只考了一道题就说学生水平稳定,那当然「稳定」了 [4]。

所以你看,AI 技术栈的分层差距非常大:顶层在研究多智能体治理、知识图谱治理,底层还有大量语言连分词效率、评估基准这些基础设施都没搞定。我们在聊「智能体的未来」时,得记得这只是全球语言版图里很小的一部分。

如果你只记住一件事

AI 系统的可靠性,核心不是「知道多少」,而是「谁来负责、谁来把关、反馈够不够具体」。 分治降低复杂度,校验保证质量,具体的反例驱动修正——这三件事加起来,比单纯堆信息、堆模型能力有效得多。


参考文献

  1. From Extraction to Governed Memory: Multi-Agent Knowledge Graph Construction with Domain-Expert Review(arXiv、2026、全文精读)
  2. Counterexamples as Feedback for Agent Self-Correction(arXiv、2026、全文精读)
  3. MA-RAG: Multi-Agent Retrieval-Augmented Generation for Query-Driven Summarization of Longitudinal Parkinson s Disease Assessments(arXiv、2026、全文精读)
  4. Dataset Scarcity Limits Robust Evaluation of Multilingual Embedding Models: A Case Study of Slavic Languages(arXiv、2026、全文精读)
  5. Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems(arXiv、2026、全文精读)