
OpenThoughts-Agent: Data Recipes for Agentic Models作者Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt核心发表机构UC Berkeley、Stanford University、JSC、LAION、Open-Ψ (Open-Sci) Collective、University of Texas at Austin、Bespoke Labs、Laude Institute、UCLA、Harvard University Harvard Medical School、TU Munich Munich Center for Machine Learning、New York University、Medical University of South Carolina、The LLM Data Company、Oumi.AI、BenchFlow、Independent Researcher、Northeastern University、University of Wisconsin–Madison、University of Washington、TU Darmstadt、University of Southern California、UC San Diego、Amazon、Microsoft、Korea University、Cornell Tech、University of Michigan论文链接arXiv:2606.24855v1发布于arXiv 预印本cs.AI|—|—|| SWE-Bench Verified | 500 | 真实仓库 issue 解决agent 生成 patch由上游测试 harness 二元评分 || Terminal-Bench 2.0 | 89 | 手工制作、人类验证的终端任务覆盖软件工程、生物学、安全、系统管理和机器学习 || Aider Polyglot | 225 | 多语言代码编辑C、Go、Java、JavaScript、Python、Rust源自 Exercism || BFCL-Parity | 123 | Berkeley Function Calling Leaderboard v4 的分层随机子集 || MedAgentBench | 300 | 临床 agent 基准基于约 70 万条记录的 FHIR 服务器 || GAIA-127 | 127 | GAIA 验证集纯文本子集需多步事实问答网页浏览、文件处理、工具使用 || FinanceAgent-Terminal | 50 | Vals AI Finance Agent 的终端版基于 SEC 10-K/10-Q 文件 |两个辅助基准分别为 OpenThoughts-TB-Lite100 个任务和 SWE-Bench Verified-100100 个任务它们在管道消融中用作快速信号不计入最终平均分。评估过程使用 terminus-2 作为默认 agent harness对每个 (model, benchmark) 组合重复 3 次报告平均 pass1 准确率和标准误。一个值得注意的细节是超时感知评估agentic trials 受 token 数限制相同 agent 轮数下慢速模型需要更长时间保持每 trial 超时不变会在模型尺寸/速度之间混淆准确率。为此Harbor 配置使用超时乘数m mm--timeout-multiplier标志8B 模型m 2 m2m232B 模型m 16 m16m16并施加 2 小时上限effective_timeout min ( cap , base × m ) \text{effective\_timeout} \min(\text{cap},\ \text{base} \times m)effective_timeoutmin(cap,base×m)对于无法获得可比吞吐量的更大模型则使用第三方 API 以确保公平比较。另外所有基线模型都在两种条件下评估一是 terminus-2 harness与训练模型相同的环境二是其原始报告推荐的 scaffold/服务配置每格取最优结果。4.2 主实验结果 / Main Results32B 规模。最终模型 OpenThinkerAgent-32B基于 OT-Agent 数据集的 100K SFT 微调 Qwen3-32B在七个主基准上的平均准确率为44.8%显著超过此前最强的开放数据 agentic 模型 Nemotron-Terminal-32B40.9%。分基准来看SWE-Bench Verified 54.0% vs 41.9%12.1、Terminal-Bench 2.0 26.2% vs 25.1%1.1、Aider Polyglot 32.4% vs 24.9%7.5、BFCL-Parity 85.9% vs 69.1%16.8、GAIA-127 23.6% vs 22.3%1.3、FinanceAgent-Terminal 44.0% vs 40.7%3.3。唯一的例外是 MedAgentBench47.8% vs 62.6%-14.8说明 OT-Agent 数据在医疗 agent 任务上的覆盖仍有不足。在 32B 规模的其他对比中GLM-4.7-Flash 为 37.7%Nemotron-Terminal-14B 为 35.8%SWE-Lego-Qwen3-32B 为 34.7%Qwen3-32B 底座为 22.8%进一步凸显了后训练数据配方的巨大增益。8B 规模。在 8B 规模上SFT RL 的两阶段管道继续展现优势表 3模型平均SWE-Bench VerifiedTerminal-Bench 2.0Aider PolyglotBFCL-ParityMedAgentBenchGAIA-127FinanceAgent-TerminalOT-Agent-ColdSFTRL-8B27.931.913.518.171.531.16.822.7OT-Agent-SFT-8B (100K)27.438.910.915.965.936.26.617.3Nemotron-Terminal-8B26.022.113.112.659.948.614.411.3OT-Agent-SFT-8B (10K)24.322.77.914.279.425.85.514.7SWE-Lego-Qwen3-8B18.537.60.73.775.35.06.01.3Qwen3-8B base10.213.22.211.734.43.85.01.3SFTRL 的 8B 模型平均最高纯 SFT 的 100K 版本在 SWE-Bench Verified 上最高但 RL 在 Terminal-Bench 和部分 OOD 任务上提供了更好的均衡性。此外SFTRL 管道消融进一步确认了训练顺序的重要性在中等强度 SFT 模型上做 RLOT-Agent-ColdSFTRL平均 21.7优于纯 SFT15.9、纯冷启动 SFT15.1、以及直接从底座 Qwen3-8B 做 RL3.6。值得注意的是Qwen3-8B 底座在 agentic 基准上表现极差且无法从 agentic RL 中获得收益——这或可归因于底座模型缺乏基本的工具使用能力RL 无法从零开始教会策略。缩放曲线。图 5 展示了 OT-Agent 数据配方在 8B 规模上的缩放行为在大多数匹配的数据集规模下OT-Agent 训练数据都领先于 Nemotron-Terminal-Corpus 基线。10K 行时 SWE-Bench Verified-100 为 24.3% vs 9.3%100K 行时 8B 模型达到 SWE-Bench 39.7%、Terminal-Bench 10.9%均超过基线34.3%、9.0%。最关键的观测是最大规模下性能持续上升而未见平台化这与 32B 规模上合成任务增强的效果一致说明通过扩展任务描述多样性可以持续获得收益。图 1 展示了完整规模下的缩放曲线对比OT-Agent-SFT 数据集在 Terminal-Bench 2.0 和 SWE-Bench Verified-100 子集上在大数据集规模时达到最优性能其缩放曲线在所有训练集大小上计算受控都优于其他开放数据集。图中还包含对 SERA 的特殊处理由于 SERA 使用 SWE-agent 进行数据生成和评估论文同时报告 SWE-agent实线和 Terminus-2虚线两种 harness 的结果平均时取每个基准上两个 harness 中的最优值。4.3 消融实验 / Ablation Study任务来源消融。95 种任务生成策略的完整排名显示来源选择是管道中方差最大的环节。前四名策略swe-smith、stackexchange-superuser、stackexchange-tezos、issue-tasks的归一化 z-score 在 1.37 到 1.92 之间排名末尾的 AgentTuning-OS 在 SWE-Bench Verified-100 上准确率为 0.00Terminal-Bench 2.0 为 0.37归一化降至 -2.31。二者在下游平均性能上的差距超过 16 个百分点。有趣的是pymethods2test在 SFT 排名中仅列第 85 位归一化 -1.05但在 RL 消融中却是最佳源。SFT 与 RL 对数据源偏好的显著差异说明在评估一个数据源的价值时必须明确其目标训练范式。任务混合消融。Top-4 到 Top-8 的混合策略在两种呈现方式随机 shuffle 与 round-robin下均产生最强均衡性能。Top-1 导致单一基准过度特化Top-32 则因稀释效应表现不佳。任务过滤消融。四种过滤策略的比较结果如下排名Filtering StrategySWE-Bench Verified-100OT-TBLiteTerminal-Bench 2.0Normalized1Response Length (GPT-5, longest)22.6719.5110.111.382Response Length (GPT-5, shortest)21.3316.919.740.313AskLLM20.6715.8710.860.194Embedding diversity20.0016.417.87-0.725Random (baseline)19.6714.777.87-1.17“GPT-5 生成长响应”的子集比随机选择平均高约 3 个百分点验证了响应长度作为任务难度代理信号的有效性。轨迹过滤消融。三种轨迹过滤策略——最少轮数 ≥ 5、过滤超时、过滤子代理轨迹——中min-turns 过滤表现最佳29.00、19.10、11.61归一化 1.25过滤超时次之0.35过滤子代理轨迹最差-0.90。计算受控的实验进一步确认了这一结论在约 145M token 预算下min-turns ≥ 5 的过滤组达到 18.00 的平均原始分数而随机子采样控制组仅 14.50。多轮监督的价值不依赖额外计算量。扩展方法消融。图 3 对比了四种扩展策略在三个核心基准上的表现Method 1重复 rollouts从 31.6K 到 100K 进入平台期Method 3合成增强在三个基准上持续改进。这一对比清楚地说明扩展 agentic 训练数据的瓶颈不是轨迹数量而是任务描述多样性。合成增强通过改写指令表层形式而非引入新底层问题有效扩大了任务空间。RL 数据源消融与行为分析。RL 数据源消融的平均原始准确率跨度达 7.6 个百分点。在 8 种数据源中pymethods2test是唯一在 ID 和 OOD 上均居首的源。训练动态的对比揭示了这一结果的深层次原因。图 6 展示了 hero 运行pymethods2test的奖励轨迹与行为指标英雄运行的奖励轨迹呈现“中等、未饱和、难以提升”的特征从约 0.47 缓慢上升到 0.51 后在约 step 35 之后崩溃至约 0.13同时 agent 超时率达到约 80%。图 7 展示了基线运行llm-verifier-freelancer的对应轨迹基线运行中奖励从约 0.54 近单调上升到约 0.73无崩塌agent 超时率保持在 18–36%。图 8 给出了英雄运行的时间分箱行为动态面板英雄运行在 RL 后表现出显著的策略扩张每条轨迹的思考 tokens 从 30.3 增至 65.4116%自校正短语从 0.63 增至 1.1481%工具调用从 31.3 增至 40.931%对话轮数从 40.5 增至 53.332%。LLM judge 偏好 post-RL 策略的比例为 83.3%25/30主导标签是more-tool-calls73%。行为变化与下游评估的关联也很有启发性post-RL checkpoint 将 base 策略的 all-trial reward错误/超时 trials 计为 0几乎翻倍0.19 → 0.33尽管 completed-trial 的条件平均奖励下降0.652 → 0.541。原因是 RL 将许多原本被放弃超时的 trials 转化为完成尝试被救回的 trial 与未被尝试一样困难导致条件平均下降但全局精度上升。基线运行则表现出相反的策略压缩平均轮数减少 7.8-11%工具调用减少 8%思考 tokens 减少 42%自校正短语从 19.7 降至 8.0-59%。LLM judge 偏好比例 73.3%主导标签为fewer-tool-calls53%、shorter-trace40%。压缩策略在特定 OOD 任务上具有竞争力如 FinanceAgent-Terminal 从 0.173 提升至 0.224但对依赖“彻底性”的 ID Core 基准迁移较差。为什么pymethods2test能推动探索一个重要线索是它的奖励动态在 RL 时间内始终围绕 0.47–0.51 波动远未饱和且难以提升。在 RLOO 下这种奖励信号恰好鼓励“更加努力”的行为——更多思考、更多工具调用、更多修复尝试——因为增量回报来自更彻底地解决问题。相反llm-verifier-freelancer的奖励容易被快速优化策略便沿着“压缩”方向演进减少冗余操作并直接逼近目标。此外hero 运行的崩溃也被解释为同一探索压力的负面效应在奖励无法进一步提升后策略继续扩张直至过度。可复现性研究在 step 45 导出、10-step 变体、lr5e-6 变体表明崩溃前的状态是稳定的因此实际使用中在正确时机导出 checkpoint 即可获得稳定的性能收益。五、相关工作 / Related Work数据整理Data Curation。随着大语言模型和缩放律研究的深入数据整理的重要性日益凸显。已有面向视觉-语言模型DataComp、语言模型DataComp-LM、推理模型OpenThoughts的公开数据整理工作但针对 agent 的严格公开数据整理研究仍然稀缺。本工作将 OpenThoughts 系列的推理数据方法论扩展到 agentic 领域并增加了对 RL 数据源的系统消融。Agent 及其基准演进。Agent 评估从早期的多项选择如 MMLU演进到开放生成评估进而到需要多步工具交互的动态基准LiveBench、LiveCodeBench。当前前沿基准如 SWE-Bench、Terminal-Bench 对诸如 GitHub issue 解决这样的离散任务进行二元打分。标准化评估平台如 Evalchemy 和 Harbor 使基准评估更便宜、更具可重复性本工作深度依赖 Harbor 框架实现沙箱隔离与并发评估。Agentic 模型训练数据策略。过去一年半涌现了多种 SFT 和 RL 数据整理策略。SWE-Smith 和 R2EGym 采用“选仓库→合成错误提交→生成问题描述→要求 agent 修复”的路线SERA 和 Nemotron-Terminal 提出面向单一基准的管道SWE-Lego、Endless-Terminal 等尝试扩展数据多样性。这些工作有两个主要局限它们几乎只关注 SFT 或 RL 中的一者而很少关注两者的交互它们往往聚焦单个基准或一小簇紧密相关的 agentic 基准。本工作则关注跨 agentic 基准的泛化、SFT 与 RL 的交互、多个常见模型规模并使用多种基准包括新提出的 OpenThoughts-TB-Lite进行评估。工程框架。SFT 使用 Llama-Factory 的一个 fork扩展支持 ALST 长序列训练RL 使用 SkyRL 的扩展版本环境/基准/harness 管理使用 Harbor 框架。这些开源工具的选择保证了方法的可复现性——论文固定了所有源码提交哈希并公开了完整 wandb 运行记录。六、局限性与展望 / Limitations Future Work本工作虽然在数据管道的系统研究上迈出了重要一步但仍存在若干明确的局限。第一RL 实验仅在 8B 规模进行。由于计算约束RL 配方是否迁移到 32B 尚未验证。SFT 数据配方在 8B 和 32B 上的缩放规律已经确认但 RL 数据源的偏好特征如pymethods2test的探索驱动效应是否在更大模型上保持不变仍然未知。第二基础模型选择未做消融。所有实验以 Qwen-3 家族为起点而近期一些工作已使用 Qwen-3.5其基础能力差异可能改变数据配方的相对收益。论文明确将“将数据改进移植到 Qwen-3.5 并研究基础模型与 SFT/RL 数据的交互”列为未来工作。第三最大训练集仅 100K 轨迹。虽然合成增强在 100K 规模上仍未平台化但百万级轨迹规模下的趋势外推尚不可知。工业界的 Frontier 模型往往使用更大规模的数据从 100K 到 1M 的扩展是否遵循同样的规律需要进一步验证。第四RL 训练存在稳定性风险。pymethods2test运行的奖励轨迹在峰值后崩溃agent 超时率升至约 80%。虽然崩溃前的 checkpoint 是稳定的且可通过早期导出规避风险但这一现象本身说明当前 RL 配方对训练动态的控制仍不够精细需要在算法层面如更保守的探索约束加以改进。第五小基准的评估噪声较大。FinanceAgent-Terminal 仅 50 个任务两次重复评估的差异可达约 11 点符合二项采样误差。这意味着单点指标的变化在小规模基准上可能不可靠需要更多试验次数或更大的基准规模来增强统计效力。第六外部结果的可复现性问题。部分已有模型如 OpenSWE-32B的已发表结果未能被本工作完整复现论文在 SWE-Bench Verified-100 子集上仅测得 44.0%而报告值为 62.4%基于全 500 任务。由于 scaffold/harness 未完全公开差异无法归因论文将其在主表中排除并以橙色标注保持了对评估透明性的严谨态度。此外Terminal-Bench 2.1 发布后由于对所有模型全面重新评估的成本过高论文继续报告 TB2.0 结果并以代表性基线验证了版本间差异约 3.0 个百分点远小于审计报告中前沿 agent 的变化幅度12.0 个百分点。七、总结 / ConclusionOpenThoughts-Agent 以超过 100 个受控消融实验为基础系统性地回答了“如何为通用 agentic 模型整理训练数据”这一开放问题。研究得出了一系列可操作且可复现的结论任务来源与多样性是数据管道的决定性因素。95 种任务生成策略在下游性能上的差异可达 30 个百分点SWE-Bench和 10 个百分点Terminal-Bench远大于其他阶段的影响。最优策略具备“尖峰”式特质需要混合 4–8 个来源才能实现均衡的多基准性能。最强模型不一定是最好的教师。GLM-4.7-AWQ 作为教师的综合表现优于更强的 GPT-5.3-Codex说明教师选择需要基于轨迹的可学性而非教师自身的基准分数。多轮监督信号具有独立价值。在等量 token 预算下保留 ≥5 轮的轨迹仍然带来显著增益确认了长轨迹对于学习多步决策与错误恢复的关键作用。扩展的瓶颈是任务描述多样性而非轨迹数量。简单上采样在 31.6K 后进入平台期而合成增强可以通过改写表层形式突破瓶颈使性能在 100K 规模持续增长。SFT 与 RL 需要协同设计而非孤立优化。8B 实验表明在中等强度的 SFT 模型上进行 RL 效果最佳而直接从底座做 RL 几乎无效。RL 数据源的消融进一步发现不同数据源会诱导截然不同的策略形态探索扩张 vs. 策略压缩这为 RL 训练数据的选取提供了新的理解维度。最终基于 100K SFT 数据微调的 Qwen3-32B 模型在七个 agentic 基准上以 44.8% 的平均准确率实现了开放数据模型的最优性能且数据配方在 8B 与 32B 上均表现出持续且尚未平台化的缩放趋势。训练集、数据管道、实验数据和模型权重均已公开为开放 agentic 研究社区提供了可复现的基础设施与可参考的实证依据。原文摘要:Agentic language models dramatically expand the applications of AI yet little is publicly known about how to curate training data for broadly capable agents. Existing open efforts such as SWE-Smith, SERA, and Nemotron-Terminal typically target a single benchmark, leaving open the question of how to train models that generalize across diverse agentic tasks. The OpenThoughts-Agent (OT-Agent) project addresses this gap with a fully open data curation pipeline for training agentic models. We conduct more than 100 controlled ablation experiments to systematically investigate each stage of the pipeline, yielding insights on the importance of task sources and diversity. We then assemble a training set of 100K examples from our pipeline and fine-tune Qwen3-32B on this dataset, which yields an average accuracy of 44.8% across seven agentic benchmarks and a 3.9 percentage point improvement over the strongest existing open data agentic model (Nemotron-Terminal-32B, 40.9%). Moreover, our training data exhibits strong scaling properties, outperforming alternative open datasets at every training set size in compute-controlled comparisons. We publicly release our training sets, data pipeline, experimental data, and models at openthoughts.ai to support future open research on agentic model training.PDF链接:https://arxiv.org/pdf/2606.24855v1部分平台可能图片显示异常请以我的博客内容为准