AI Agent 的演进与自主性崛起
AI Agent 在我们未来工作中的冲击,尤其是在学术研究领域,正变得日益显著。AI 的角色正在经历一次根本性的转变:从最初的工具,只需一个指令便能执行单一任务;到协作伙伴,与人类共同完成复杂任务;再到现在,许多 AI Agent 已展现出更强的自主性,能够独立完成整个任务。这种演进对于学术研究而言,引发了一个核心问题:AI Agent 是否能够独立撰写一篇文章?
AI Agent 在学术研究中的实践:以论文撰写为例
斯坦福大学政治经济学教授 Andrew Hall 在 X (原 Twitter) 上分享了他的经验。他展示了 Claude Code 如何能够独立撰写一篇文章。Hall 教授将 AI Agent 比作“迎面而来的货车”,强调其在学术研究领域带来的颠覆性力量。他花费约一个小时,通过精心设计的 prompt,指导 Claude Code 扩展了他过去一项关于美国大选的研究。该 prompt 细致入微,如同指导研究生进行研究,要求 AI Agent 使用新的数据,并套用他过往的研究方法来重写论文。
效率与成本的颠覆:100x 研究助理
研究完成后,Andrew Hall 撰写了《100 倍的 research assistant》一文,详细对比了 AI 与人类研究者的效率。他让一位博士生执行与 Claude Code 完全相同的任务,结果是,AI Agent 花费约 10 美元和 1 小时完成,而博士生则花费了 16 小时(约 2 个工作日)并需支付约 1000 美元。尽管 AI 的结果在数据贴错方面略有瑕疵,但其效率和成本优势是压倒性的。Hall 教授提出,未来最高效的研究机构可能不再是带领一群研究生,而是由资深学者带领一群 LLM (Large Language Model) 或 AI Agent 来进行研究。
反思与挑战:AI 错误的严重性与人类价值
尽管 AI Agent 展现出惊人潜力,但也伴随着挑战。Claude Code 在 Andrew Hall 的实验中犯了一个数据错误,其严重性尚待评估。这引发了关于人类在 AI 研究中的价值的讨论:是否AI的错误可能极其严重,影响整个研究判断?成本效益的权衡也需要更深入的考量,例如 AI 辅助人类检查错误的总成本,或是 AI 反复自我检查的能力。更有甚者,一些人对 AI 代劳研究工作表示反感,但从研究的本源——找出问题、解决问题、改进世界——来看,若 AI 能够更有效地达成这些目标,则并非不可接受。
AI Agent 在研究全流程的应用
AI Agent 的能力已不局限于文献收集。在社会科学领域,AI Agent 可以辅助分析现有文献和数据。更进一步,在需要建模型、训练模型、跑模型的领域,AI Agent 也展现出强大能力。Andrej Karpathy 发布的 autoresearch 项目展示了 LLM 如何自动训练模型,通过约 5 分钟一次的实验迭代,不断优化模型表现,且整个过程无需人类干预。此外,在教育领域,AI Agent 也开始承担教学任务,例如通过操控 AI Agent 完成机器学习作业。
AI 的创造力:生成新颖研究想法的潜力与局限
关于 AI Agent 的问题发想能力,一项 2024 年的研究(在 AI 发展史上已属“古老”)探讨了 LLM 生成新颖研究想法的潜力。研究对比了 AI 与人类产生的研究想法,发现在新颖性 (novelty) 和兴奋度 (excitement) 等指标上,AI 表现优于人类;但在可行性 (feasibility) 上,人类仍占优势。AI 产生的想法可能过于堆砌新颖词汇,执行起来却困难重重。后续研究证实,当 AI 的点子被真正实现后,其新颖性便不如最初预期,人类在点子发想和实验设计阶段的早期介入,对于产出高质量研究成果仍然至关重要。
AI 在学术评审中的角色演变
AI Agent 已开始进入论文评审环节。在 2026 年的 AAAI 国际会议上,AI 不仅作为审稿人(reviewer),也作为元审稿人 (Meta Reviewer) 出现。AI 审稿人主要提供意见而非分数,但其意见是人类最终决策的参考。演讲者指出,表面上的人类审稿人背后可能也隐藏着 AI Agent。尽管如此,演讲者并非反对 AI 辅助审稿,而是反对不够优秀的 AI 进行评审。他认为,AI 评审的真正意义在于帮助论文发现问题并改进,若 AI 能比人类更有效地识别问题,则应被采用。
"小金":AI 助教与个性化评审的范例
演讲者以其 AI 助手“小金”为例,展示了 AI 如何通过定制化指示,提供高质量的论文反馈。小金在成为 YouTuber 前,曾为实验室同学提供论文建议。经过调整,小金的评审不再仅是批评,而是附带建设性建议,并能考虑论文截止日期,在临近截稿时给予学生鼓励。这体现了 AI Agent 在理解情境、提供个性化反馈方面的潜力。
AI 驱动的闭环研究与未来展望
AI Agent 撰写论文、AI Agent 评审论文,正形成一个闭环,可能实现无需人类干预的自动化研究进步。"AI Agent for Science" 会议的尝试,要求 AI 必须是论文的主要贡献者,并由 AI 审稿,其较低的接受率表明,即使在 AI 主导的评审中,高质量论文的产出依然不易。研究发现,在 AI Agent 主导的论文中,人类在点子发想和实验设计阶段的介入,对于论文被接受起到了关键作用,而 AI 则在资料分析和论文写作方面表现出色。
AI Agent 在教学领域的潜力
AI Agent 在教学领域也展现出巨大潜力。小金自主完成的教学影片,证明了 AI 已能达到一定水平的教学能力。台大 AI 卓越中心举办的教学 AI 比赛,进一步探索 AI Agent 在制作教学内容方面的能力。
课程展望
本次分享(AI Agent 对工作的影响)是系列科普内容的收尾,接下来的课程将深入探讨语言模型内部的推断(inference)机制。建议提前预习相关的机器学习导论视频,以便更好地理解下周内容。