北大团队开源 AutoSci:一个让 AI 学会"持续做科研"的项目
“
“Read, think, experiment, write, evolve” — 这不只是一句口号,而是一个正在北大校园里发生的科研 Agent 进化实验。
起因:一个被反复验证的行业痛点
2024-2025 年,AI 科研 Agent 领域爆发式增长:
The AI Scientist(Nature 2025):端到端自动生成论文,已过 ICLR workshop 评审
AutoScientists(arXiv):多 Agent 协作团队,BioML-Bench 24 任务平均达 74.4% 百分位
Autoresearch(Karpathy):24/7 自主跑实验,改代码迭代模型
但这些系统都有一个共同问题:任务结束 = 经验清零。
每次新建项目,Agent 仍然要从头理解领域、重新摸索实验套路、重新踩一遍坑。像一个永远不长记性的实习生——你教了他三遍的技巧,下次遇到新任务他又忘了。
AutoSci 正是针对这个痛点而来。
AutoSci 是什么
AutoSci 是北京大学 DAIR Lab 开发的一个以知识库为中心的科研 Agent 系统,核心理念:
“
让 AI 研究 Agent 的记忆能够在不同项目之间累积和复用。
GitHub 地址:[1]https://github.com/skyllwt/AutoSci[2]
基于 Claude Code 构建,底层是 Claude 的强推理能力,上层是一套结构化的科研工作流和持久化记忆层。
团队成员全部来自北京大学,包括本科和博士研究生,由 Weitong Qian(2023 级本科生)主导。
核心架构:从论文到反驳的全流程覆盖
AutoSci 设计了一套完整的科研生命周期:
摄入论文(/daily-arxiv)→ 想法生成(/ideate)→ 实验设计(/exp-design)→ 实验执行(/exp-run)→ 结果评估(/exp-eval)→ 论文写作(/paper-draft)→ 反驳(rebuttal)
每个环节都设计成可累积经验的节点——上一次实验的失败教训,会成为下一次实验的先验知识。
主要技能(Skills)
| 技能 | 作用 |
|---|---|
/init |
初始化项目,构建研究记忆 |
/ideate |
结构化生成研究想法,包含 5 条路径(A-E)和试点实验设计 |
/exp-design |
实验设计:方法候选生成 + 5 种实验块类型 + 迭代消融循环 |
/exp-run |
部署并运行实验,支持本地/远程环境 |
/exp-status |
监控实验进度 |
/exp-eval |
评估实验结果,给出判决 |
/paper-draft |
生成论文草稿 |
/paper-compile |
编译论文 |
/poster |
从论文草稿生成会议海报(1400×900 HTML + PNG) |
/discover |
从顶会论文列表中筛选与你的研究相关的论文(按相关度排序) |
/daily-arxiv |
每日 arXiv 摘要,支持自动摄入知识库 |
记忆机制:跨项目的知识累积
AutoSci 区别于其他科研 Agent 的关键,是它的持久化记忆层。
当你把论文扔进 raw/papers/ 目录,系统会:
解析论文内容
提取关键方法、实验设计、结论
存入研究图谱(Research Graph)
下次
/ideate时,这些知识会成为上下文的一部分
这意味着:
你之前读过的每篇论文,都在为下一次研究想法提供养分
实验失败的模式会被记住,避免重复踩坑
领域内的方法演进会被自动追踪
研究图谱可视化
AutoSci 提供了两种图谱查看方式:
Web UI:运行
python3 tools/serve.py,打开http://localhost:8765/#/graph,点击节点查看邻居,支持按实体类型和边类别过滤Obsidian:生成颜色编码的图谱配置,或生成带标注的力导向 Canvas 图
实测效果:已经跑出过三篇真实论文
AutoSci 不是概念演示——已经有三篇论文是 AutoSci 全流程端到端生成的:
| 论文 | 领域 | 状态 |
|---|---|---|
| Agent-driven iterative optimization of Triton GPU kernels | GPU 内核优化 | PDF 已生成 |
| PTM-aware degrader target nomination via calibrated ternary-complex scoring | 生物医药药物发现 | PDF 已生成 |
| Forced Honesty Dissociates Polite Speech from Motivated Cognition in LLM Attitude Ratings | LLM 认知建模 | PDF 已生成 |
三篇论文都是完整覆盖:文献调研 → 想法生成 → 实验执行 → 论文写作全流程。
独特优势:个性化顶会论文发现
/discover 技能是 AutoSci 的一个亮点功能。
你还在为”ICLR 2024 有 7000 篇论文,不知道从哪看起”而发愁吗?
运行:
/discover --venue iclr --year 2024
AutoSci 会:
获取该会议的完整论文列表
对比你知识库中已有的研究主题
按相关性排序,筛选出与你的研究方向最相关的论文
每篇论文附上筛选理由( tied to topics and methods you already track )
不需要额外 API Key,不会在你的知识库中产生副作用,只给你真正有用的推荐。
快速上手
环境要求
Python 3.9+
Node.js 18+
Claude Code(需要 Claude 账号登录)
安装步骤
# 1. 克隆仓库 git clone https://github.com/skyllwt/AutoSci.git cd AutoSci # 2. 安装 Claude Code npm install -g @anthropic-ai/claude-code claude login # 3. 一键安装依赖 chmod +x setup.sh && ./setup.sh # 4. 放入你自己的论文(可选) # .tex 或 .pdf 放入 raw/papers/ # 笔记放入 raw/notes/ # 5. 构建研究记忆,启动项目 claude # 然后输入:/init [your-research-topic]
技术定位:第三代科研 Agent
如果把科研 Agent 的发展分为三代:
第一代(工具型):给 LLM 配上专业工具(化学数据库、分子模拟器),本质是更强的问答系统
第二代(工作流型):让 AI 自主完成完整科研流程(想法→代码→实验→论文),本质是更长的自动化流水线
第三代(记忆型):在二代基础上叠加持久化记忆层,让经验跨项目累积,本质是会成长的系统
AutoSci 处于第三代的开端——记忆机制已经有了,但还处在早期迭代阶段(Beta 状态)。
局限与挑战
客观说几点:
Beta 状态:作者明确表示”正在积极测试和迭代新功能”,不适合生产环境直接跑严肃科研项目
Claude Code 依赖:底层依赖 Anthropic 的 Claude Code,对国内用户来说有一定门槛
实验执行能力:实验的代码质量和执行效率,取决于 Claude 的推理能力和工具调用水平
记忆质量:知识累积的效果依赖论文解析和知识提取的质量,这块仍有提升空间
写在最后
AutoSci 最大的价值,不在于它已经能做什么,而在于它提出的问题:
“
科研 Agent 的记忆,能否像人类研究者一样,在项目中累积、在时间里成长?
这个问题,AutoSci 正在尝试回答。虽然还处于早期阶段,但它指向的方向是对的。
如果你对 AI 科研自动化感兴趣,或者在找一个大学生的毕业设计级别的优秀项目——这个 GitHub 仓库值得 star 一个。
项目地址:https://github.com/skyllwt/AutoSci[3]
相关链接
Demo 视频(B站):https://www.bilibili.com/video/BV19gVg6pEk6/[5]
DAIR Lab:https://cuibinpku.github.io/[6]
引用链接
[1]undefined: https://github.com/skyllwt/AutoSci
[2]https://github.com/skyllwt/AutoSci
[3]https://github.com/skyllwt/AutoSci
[4]https://github.com/skyllwt/AutoSci