北大团队开源 AutoSci:一个让 AI 学会"持续做科研"的项目

“

“Read, think, experiment, write, evolve” — 这不只是一句口号,而是一个正在北大校园里发生的科研 Agent 进化实验。

起因:一个被反复验证的行业痛点

2024-2025 年,AI 科研 Agent 领域爆发式增长:

  • The AI Scientist(Nature 2025):端到端自动生成论文,已过 ICLR workshop 评审

  • AutoScientists(arXiv):多 Agent 协作团队,BioML-Bench 24 任务平均达 74.4% 百分位

  • Autoresearch(Karpathy):24/7 自主跑实验,改代码迭代模型

但这些系统都有一个共同问题:任务结束 = 经验清零。

每次新建项目,Agent 仍然要从头理解领域、重新摸索实验套路、重新踩一遍坑。像一个永远不长记性的实习生——你教了他三遍的技巧,下次遇到新任务他又忘了。

AutoSci 正是针对这个痛点而来。

AutoSci 是什么

AutoSci 是北京大学 DAIR Lab 开发的一个以知识库为中心的科研 Agent 系统,核心理念:

“

让 AI 研究 Agent 的记忆能够在不同项目之间累积和复用。

GitHub 地址:[1]https://github.com/skyllwt/AutoSci[2]

基于 Claude Code 构建,底层是 Claude 的强推理能力,上层是一套结构化的科研工作流和持久化记忆层。

团队成员全部来自北京大学,包括本科和博士研究生,由 Weitong Qian(2023 级本科生)主导。

核心架构:从论文到反驳的全流程覆盖

AutoSci 设计了一套完整的科研生命周期:

摄入论文(/daily-arxiv)→ 想法生成(/ideate)→ 实验设计(/exp-design)→ 实验执行(/exp-run)→ 结果评估(/exp-eval)→ 论文写作(/paper-draft)→ 反驳(rebuttal)

每个环节都设计成可累积经验的节点——上一次实验的失败教训,会成为下一次实验的先验知识。

主要技能(Skills)

技能 作用
/init 初始化项目,构建研究记忆
/ideate 结构化生成研究想法,包含 5 条路径(A-E)和试点实验设计
/exp-design 实验设计:方法候选生成 + 5 种实验块类型 + 迭代消融循环
/exp-run 部署并运行实验,支持本地/远程环境
/exp-status 监控实验进度
/exp-eval 评估实验结果,给出判决
/paper-draft 生成论文草稿
/paper-compile 编译论文
/poster 从论文草稿生成会议海报(1400×900 HTML + PNG)
/discover 从顶会论文列表中筛选与你的研究相关的论文(按相关度排序)
/daily-arxiv 每日 arXiv 摘要,支持自动摄入知识库

记忆机制:跨项目的知识累积

AutoSci 区别于其他科研 Agent 的关键,是它的持久化记忆层。

当你把论文扔进 raw/papers/ 目录,系统会:

  1. 解析论文内容

  2. 提取关键方法、实验设计、结论

  3. 存入研究图谱(Research Graph)

  4. 下次 /ideate 时,这些知识会成为上下文的一部分

这意味着:

  • 你之前读过的每篇论文,都在为下一次研究想法提供养分

  • 实验失败的模式会被记住,避免重复踩坑

  • 领域内的方法演进会被自动追踪

研究图谱可视化

AutoSci 提供了两种图谱查看方式:

  • Web UI:运行 python3 tools/serve.py,打开 http://localhost:8765/#/graph,点击节点查看邻居,支持按实体类型和边类别过滤

  • Obsidian:生成颜色编码的图谱配置,或生成带标注的力导向 Canvas 图

实测效果:已经跑出过三篇真实论文

AutoSci 不是概念演示——已经有三篇论文是 AutoSci 全流程端到端生成的:

论文 领域 状态
Agent-driven iterative optimization of Triton GPU kernels GPU 内核优化 PDF 已生成
PTM-aware degrader target nomination via calibrated ternary-complex scoring 生物医药药物发现 PDF 已生成
Forced Honesty Dissociates Polite Speech from Motivated Cognition in LLM Attitude Ratings LLM 认知建模 PDF 已生成

三篇论文都是完整覆盖:文献调研 → 想法生成 → 实验执行 → 论文写作全流程。

独特优势:个性化顶会论文发现

/discover 技能是 AutoSci 的一个亮点功能。

你还在为”ICLR 2024 有 7000 篇论文,不知道从哪看起”而发愁吗?

运行:

/discover --venue iclr --year 2024

AutoSci 会:

  1. 获取该会议的完整论文列表

  2. 对比你知识库中已有的研究主题

  3. 按相关性排序,筛选出与你的研究方向最相关的论文

  4. 每篇论文附上筛选理由( tied to topics and methods you already track )

不需要额外 API Key,不会在你的知识库中产生副作用,只给你真正有用的推荐。

快速上手

环境要求

  • Python 3.9+

  • Node.js 18+

  • Claude Code(需要 Claude 账号登录)

安装步骤

# 1. 克隆仓库 git clone https://github.com/skyllwt/AutoSci.git cd AutoSci # 2. 安装 Claude Code npm install -g @anthropic-ai/claude-code claude login # 3. 一键安装依赖 chmod +x setup.sh && ./setup.sh # 4. 放入你自己的论文(可选) # .tex 或 .pdf 放入 raw/papers/ # 笔记放入 raw/notes/ # 5. 构建研究记忆,启动项目 claude # 然后输入:/init [your-research-topic]

技术定位:第三代科研 Agent

如果把科研 Agent 的发展分为三代:

  • 第一代(工具型):给 LLM 配上专业工具(化学数据库、分子模拟器),本质是更强的问答系统

  • 第二代(工作流型):让 AI 自主完成完整科研流程(想法→代码→实验→论文),本质是更长的自动化流水线

  • 第三代(记忆型):在二代基础上叠加持久化记忆层,让经验跨项目累积,本质是会成长的系统

AutoSci 处于第三代的开端——记忆机制已经有了,但还处在早期迭代阶段(Beta 状态)。

局限与挑战

客观说几点:

  1. Beta 状态:作者明确表示”正在积极测试和迭代新功能”,不适合生产环境直接跑严肃科研项目

  2. Claude Code 依赖:底层依赖 Anthropic 的 Claude Code,对国内用户来说有一定门槛

  3. 实验执行能力:实验的代码质量和执行效率,取决于 Claude 的推理能力和工具调用水平

  4. 记忆质量:知识累积的效果依赖论文解析和知识提取的质量,这块仍有提升空间

写在最后

AutoSci 最大的价值,不在于它已经能做什么,而在于它提出的问题:

“

科研 Agent 的记忆,能否像人类研究者一样,在项目中累积、在时间里成长?

这个问题,AutoSci 正在尝试回答。虽然还处于早期阶段,但它指向的方向是对的。

如果你对 AI 科研自动化感兴趣,或者在找一个大学生的毕业设计级别的优秀项目——这个 GitHub 仓库值得 star 一个。

项目地址:https://github.com/skyllwt/AutoSci[3]

相关链接

引用链接

[1]undefined: https://github.com/skyllwt/AutoSci

[2]https://github.com/skyllwt/AutoSci

[3]https://github.com/skyllwt/AutoSci

[4]https://github.com/skyllwt/AutoSci

[5]https://www.bilibili.com/video/BV19gVg6pEk6/

[6]https://cuibinpku.github.io/


北大团队开源 AutoSci:一个让 AI 学会"持续做科研"的项目
https://maoyu92.github.io/2026/05/31/07 AI笔记/AI写作与发布/a119_北大团队开源 AutoSci:一个让 AI 学会_持续做科研_的项目/
作者
陈文茂
发布于
2026年5月31日
许可协议