每天从新论文里,讲点值得懂的
- AI 家教到底会不会教?从3项新研究看智能辅导的「教学能力」边界
AI辅导工具效果参差不齐,关键不在模型大小,而在是否掌握了「教学决策」的专业能力。
- 同一个AI,换个规则就像换了个脑子?制度设计才是智能体模拟的隐形变量
从市场实验到AI竞赛,智能体表现不只取决于模型能力,更被交互规则深刻塑造。
- AI 智能体真的会「越用越聪明」吗?
从持续技能学习基准出发,拆解智能体能力进化的真实来源、局限与未来方向。
- AI教学代理只能当答疑工具?TUM的实验把它变成了「会造代理的代理」
从慕尼黑工业大学的Dr. AGENTONOMICS实验出发,探讨AI教学代理如何从单一答疑角色进化为多角色元代理,以及当前的技术边界与未来挑战。
- AI家教总忍不住提前说答案?我们离「会忍」的智能辅导还有多远
从学生「先看答案」的真实行为切入,拆解AI辅导「教学泄漏」的技术定义与最新防控方案,探讨安全与有用性的两难。
- AI 做科研为什么会「越做越笨」?
从百次架构搜索实验看,AI 研究员的瓶颈不在模型能力,而在工作流设计——它也会陷入舒适区、犯经验主义错误。
- AI 写代码越来越慢,是模型变笨了还是框架的锅?
固定模型、只换中间件,35个版本实验告诉你:编码代理的质量波动,很多时候不该怪大模型。
- AI出的物理题,真的能直接给学生用吗?
从89%可用的同构题生成系统出发,拆解AI出题的优势、瓶颈与教学效度边界。
- AI科学家做科研,我们能信吗?——从「黑箱干活」到「可审计推理」还差几步
AI科研智能体越来越能干,但它怎么得出结论、会不会自己骗自己?本文从最新的假设演化协议说起,拆解可审计AI的三条路径。
- AI 能模拟人类的“非理性”吗?从路径选择到市场定价的智能体行为实验
本文探讨 LLM 智能体能否复现人类决策中的非理性偏差,及其在路径选择、市场定价等场景中的应用与局限。
- LLM 连工作流都做不对,下一代 AI 为什么要靠「世界模型」?
从 LLM 工作流的真实失效案例出发,梳理世界模型的来龙去脉,以及它能否成为下一代 AI 的核心方向。
- 用大模型「模拟学生」:教育实验能告别真人受试吗?
当大模型能模拟不同学习风格、认知阶段甚至课堂互动,教育研究的方法范式正在发生什么变化?又有哪些瓶颈待突破?
- AI 智能体到底能有多自主?从工程实践到五级治理模型的答案
结合最新系统综述与工业案例,拆解智能体的成熟度边界、工程取舍与治理框架。
- LLM 能当认知科学的「通用研究工具」吗?从五大挑战到五个未解缺口
从认知科学的长期困境出发,梳理 LLM 作为研究工具的五大用例、四类风险,以及与经典认知架构的传承与差距。