Meta-Harness:让AI自动优化自己的框架代码
Meta-Harness:让AI自动优化自己的框架代码
斯坦福大学最近发表了一篇有意思的论文 Meta-Harness: End-to-End Optimization of Model Harnesses (arXiv:2603.28052),提出了一个大胆的想法:既然LLM已经会写代码了,为什么不让它**自动优化自己的”harness”**呢?
什么是 Harness?
在LLM系统中,harness 指的是决定模型如何与世界交互的外围代码:存储什么信息、检索什么内容、如何构造prompt给模型。
说白了:
模型权重 = 核心智力
Harness = 让智力正确发挥作用的框架
到目前为止,harness 几乎都是人工设计的。但 Meta-Harness 说:为什么不让AI自己搜、自己改、自己优化呢?
Meta-Harness 的核心思路

问题背景
现有的文本优化方法(比如prompt优化)通常会过度压缩反馈信息,把完整的执行日志压缩成一个简单分数,丢失了很多细节。而harness优化是代码级别的优化,需要更完整的反馈。
核心方案
Meta-Harness 设计了一个外循环优化框架:
Agentic Proposer:智能提案代理可以访问所有历史候选的源代码、评分、执行轨迹
完整反馈保留:不压缩日志,让AI直接阅读完整诊断信息
迭代搜索:基于历史经验不断提出新的harness代码改进
实验结果惊艳
在三个不同领域测试,都取得了显著提升:
| 任务领域 | 提升效果 |
|---|---|
| 在线文本分类 | +7.7 个准确率点,同时减少 4x 上下文token |
| 检索增强数学推理 | 在200道IMO级问题上,平均提升 +4.7 个点(跨5个持有的模型) |
| Agent编程(TerminalBench-2) | 自动发现的harness超过了最好的人工设计基线,达到 76.4% |
GitHub 开源代码
对应论文,斯坦福 IRIS 实验室开源了 TerminalBench 2.0 上的实验代码:
https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact[1]
这是一个已经通过自动进化发现的agent scaffold,基于 KRAFTON AI 的 Terminus-KIRA 和 Harbor 的 Terminus-2 框架构建:
核心改进:环境自举(environment bootstrapping)
工作原理:在agent循环开始前,自动收集沙箱环境快照(工作目录、文件列表、可用语言/工具、包管理器、内存),注入到初始prompt中
收益:节省了2-5轮早期探索回合(这些回合原本被用来问
ls、which python3这类问题)
实测效果:76.4% on Terminal-Bench 2.0 (89 tasks × 5 trials, Claude Opus 4.6)
按难度分解:
| 难度 | 任务数 | 正确率 |
|---|---|---|
| Easy | 4 | 100.0% |
| Medium | 55 | 81.1% |
| Hard | 30 | 64.7% |
| All | 89 | 76.4% |
论文 × GitHub 关联分析
| 维度 | 论文 | GitHub 代码 |
|---|---|---|
| 贡献 | 提出端到端harness自动优化的整体框架 | 发布在TerminalBench上发现的最优agent harness |
| 内容 | 完整算法描述 + 三个领域 ablation 研究 | 可复现的实验代码 + 已经进化好的agent scaffold |
| 创新 | 完整反馈日志不压缩 + agent直接读源码历史 | 环境自举技巧,节省早期探索回合 |
| 关系 | 理论方法基础 | 实际应用实例(编程agent领域) |
整个思路很清晰:论文提出通用方法,在三个不同领域验证有效性,GitHub 放出其中一个领域(agent编程)的具体成果。
这篇论文有意思在哪?
1. 方向正确:让AI优化AI
现在大家都在说”AI写代码”,但大多数停留在”人类提需求,AI写一遍”。Meta-Harness走得更远:让AI持续迭代优化自己的基础设施代码。
2. 细节到位:完整反馈比压缩分数更有用
之前很多方法把执行结果压缩成一个标量分数给LLM,丢失了大量诊断信息。Meta-Harness让LLM直接看完整日志、源码、历史——既然LLM能读代码,为什么要帮它总结?
3. 收益立竿见影:不改模型权重,只调框架就能涨点
这对于工业界特别有吸引力:你已经有了模型,不需要重新训练,只要让AI帮你调外围框架,就能直接涨点还省token。
如何试用?
# 安装harbor框架 pip install harbor # 设置API key export ANTHROPIC_API_KEY=<your-key> # 运行Meta-Harness agent harbor run \ --agent-import-path agent:AgentHarness \ -d terminal-bench@2.0 \ -m anthropic/claude-opus-4-6 \ -e runloop \ -n 20 \ --n-attempts 5
总结
Meta-Harness 这篇论文提出了一个很有前途的方向:harness工程也可以自动化。
当我们已经有了足够强大的基础模型,接下来的问题就是:如何让框架也跟上?既然AI已经能帮我们写代码了,为什么不让它自己优化自己的运行框架呢?
目前来看,这个思路在三个不同领域都验证有效:文本分类、数学推理、Agent编程。说不定未来越来越多AI系统的框架代码,真的会完全由AI自动发现和维护。
论文链接: https://arxiv.org/abs/2603.28052[2]
GitHub 代码: https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact[3]
关注「环境猫er」,我们一起探索AI前沿技术交叉创新。
引用链接
[1]https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact
[2]https://arxiv.org/abs/2603.28052
[3]https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact