前言当前的深度搜索代理Deep Search Agents陷入了一个“扩展性悖论”单步串行搜索因信息覆盖不足而遇到瓶颈而多步并行搜索则因缺乏结构化聚合能力导致推理混乱两者均无法实现真正的测试时搜索扩展Test-Time Search Scaling。来自首尔大学与 LG AI Research 的研究团队提出了HybridDeepSearcher一种创新的混合搜索架构。它通过引入HDS-QA 数据集进行监督微调教会模型在每一步中动态结合宽泛的并行查询与显式的证据聚合从而在深入推理前构建完整的知识图谱。实验表明该方法在 FanOutQA 和 BrowseComp 等高难度基准上分别提升15.9和9.2个 F1 点且是唯一一个随着搜索次数Turns和调用量Calls增加而性能持续单调上升的模型。简单来说这篇文章提出了一个多跳问答的数据集 论文基本信息项目内容论文标题Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning核心方法名HybridDeepSearcher作者/机构Dayoon Ko, Jihyuk Kim et al. (Seoul National Univ, LG AI Research)发表年份/会议ICLR 2026核心领域Agentic RAG, Test-Time Scaling, Hybrid Search, Supervised Fine-Tuning关键数据集HDS-QA(新构建), FanOutQA, BrowseComp, MuSiQue, FRAMES, MedBrowseComp基座模型Qwen3-8B (主要), Qwen2.5-7B, Qwen3-32B (用于数据生成)代码开源Project Page 研究背景与痛点1. “搜索扩展性失效” (The Failure of Search Scaling)现象现有的 Large Reasoning Models (LRMs) 结合 RAG 后虽然能进行多步推理但增加计算资源搜索次数并不能线性提升性能。串行搜索 (Sequential Search)如 Search-R1每步只发一个查询。后果信息覆盖窄容易陷入局部最优。例如问“John Carpenter 导演最长的电影”它可能先搜到一部再搜下一部效率极低且易漏掉关键影片。并行搜索 (Parallel Search)如 RAG-R1每步发多个查询。后果缺乏结构化聚合。模型一次性扔出大量文档却不知道怎么在下一步推理前把这些信息“消化”掉导致上下文混乱过早终止搜索。本质现有方法要么广度不够串行要么深度不足并行但无聚合无法像人类专家那样“先广泛搜集线索再综合归纳最后深入挖掘”。2. 现有解决方案的局限纯 RL 训练如 Search-R1 使用 GRPO 强化学习倾向于让模型生成长链条但往往只是机械地增加步数并未学会高效的搜索策略。静态分解如 GenDec预先分解问题无法根据中间检索结果动态调整策略如发现线索不够时自动扩大搜索面。数据缺失现有的训练数据如 HotpotQA大多只包含简单的 2 跳推理缺乏教导模型如何进行“大规模并行搜集 深度串行推理”的复杂轨迹。3. HybridDeepSearcher 的核心洞察混合即扩展真正的可扩展搜索必须是混合式的。在需要广度的步骤如列举所有电影执行并行查询在需要深度的步骤如比较时长执行显式聚合后的串行推理。监督即可学会不需要昂贵的在线 RL通过高质量的**混合搜索轨迹数据HDS-QA**进行监督微调SFT就能让模型内化这种复杂的搜索策略。️ 核心方法HybridDeepSearcher 架构详解HybridDeepSearcher 的核心在于数据驱动的策略内化。它不依赖复杂的提示工程或在线奖励优化而是通过特制的数据集教会模型何时并行、何时串行。1. HDS-QA 数据集构建 —— “制造混合推理场景”这是本文最大的贡献之一。作者设计了一套自动化流水线专门生成需要先并行后串行的复杂问题。四步生成法实体提取与相关问题收集从单跳问题如“Queen 乐队主唱是谁”提取实体利用 Google “People Also Ask” 收集该实体的多个独立特征如“成名曲”、“解散时间”、“风格”。特征摘要将检索到的文档摘要为简洁的特征描述。并行跳问题构造利用这些特征构造一个隐式问题不直接提及实体名迫使模型必须同时搜索多个特征才能锁定实体并行需求。例“哪个摇滚乐队以歌剧风格融合闻名且有一首常在体育赛事播放的国歌”答案隐含是 Queen。混合跳问题集成将上述隐式问题作为条件嵌入到原始的单跳问题中形成最终的混合跳问题串行需求。最终问题“那个以歌剧风格融合闻名…的乐队其主唱是谁”推理路径Step 1 (并行搜特征 - 锁定 Queen) - Step 2 (串行搜主唱 - Freddie Mercury)。轨迹生成使用 Qwen3-32B 生成包含并行查询块的正确推理轨迹。只有最终答案正确的轨迹会被保留确保训练数据的准确性。共收集2,111条高质量轨迹。 核心逻辑传统数据教模型“一步步走”HDS-QA 教模型“一步看全貌并行再走下一步串行”。2. 混合搜索代理 (The Hybrid Agent)基于 Qwen3-8B 微调而成的 HybridDeepSearcher其推理过程具有独特的结构思维链 (Reasoning)在think标签中分析当前缺口。混合查询 (Querying)模型被训练为在单个步骤中输出多个由分号分隔的查询。格式|begin search queries| Query A; Query B; Query C |end search queries|系统会并行执行这些查询。显式聚合 (Aggregation)检索结果经过外部大模型Summarizer去噪和摘要。所有结果的摘要被拼接并包裹在|begin search results|标签中作为一个整体输入给模型。模型必须在下一个think步骤中综合阅读这些结果提炼出关键信息再进行下一步决策。类比解释侦探办案传统串行 (Search-R1)侦探每次只问一个证人。问完 A 再想问谁效率低容易漏掉关键团伙成员。传统并行 (RAG-R1)侦探一次性把所有人叫来七嘴八舌说话侦探听晕了没法理清线索草草结案。HybridDeepSearcher侦探先列出所有需要核实的线索如案发时间、地点、嫌疑人特征同时派助手去调查并行。助手回来后侦探先开会总结显式聚合整理出一份清晰的情报简报然后再决定下一步抓谁串行。 实验结果与分析作者在 5 个高难度基准上进行了全面评估重点考察准确性和扩展性。1. 性能全面碾压 SOTA数据集任务特点HybridDeepSearcher (F1)最强基线 (F1)提升幅度FanOutQA需检索大量分散实体44.1RAG-R1 (28.2)↑ 56.0%BrowseComp†极难的网络浏览推理15.1RAG-R1 (5.9)↑ 155.9%FRAMES复杂多跳事实核查39.1RAG-R1 (35.8)↑ 9.2%MuSiQue标准多跳 QA31.2Search-R1 (26.6)↑ 17.3%MedBrowseComp医疗专业搜索19.8DeepResearcher (14.7)↑ 34.7%注意在 FanOutQA 这种需要“扇出”大量检索的任务中优势最为巨大证明了并行能力的有效性。2. 真正的“测试时搜索扩展” (Test-Time Search Scaling)这是本文最核心的发现。作者通过限制最大搜索轮数Turns和调用次数Calls来观察性能变化。基线表现串行模型随着 Turns 增加性能很快** plateau (停滞)**因为单步信息量太少搜再多也没用。并行模型随着 Calls 增加性能也停滞因为无法有效聚合过多信息。HybridDeepSearcher 表现单调上升无论是增加 Turns (1→8) 还是 Calls (2→16)性能都持续线性增长。数据在 BrowseComp 上当 Turns 从 1 增加到 8 时F1 从 4.0 飙升至15.1(3.8 倍提升)当 Calls 从 2 增加到 16 时F1 从 3.4 飙升至15.1(4.4 倍提升)。结论只有混合策略才能真正利用更多的计算资源来解决更难的问题。3. 证据覆盖率 (Evidence Coverage)在 FanOutQA 上HybridDeepSearcher 的金标证据覆盖率高达61.0%而最强的并行基线 RAG-R1 仅为 53.2%串行基线 Search-o1 仅为 38.3%。这证明模型确实学会了“把网撒得更大”从而捕获了更多必要的碎片信息。4. 消融实验与 RL 的对比混合行为是关键如果只用 HDS-QA 数据但强制模型单步单查去除并行性能大幅下降甚至不如基线。证明并行聚合的混合行为本身才是增益来源。SFT vs RL作者在 HybridDeepSearcher 基础上又加了 GRPO (RL) 训练。结果RL 能略微提升准确率但会导致搜索步数显著增加效率 (AUC) 反而下降。启示对于搜索策略的学习高质量的监督微调 (SFT) 比盲目试错的 RL 更高效、更直接。 主要创新点总结提出“混合搜索”范式首次明确指出了单纯串行或并行搜索在扩展性上的缺陷并提出了“并行搜集 显式聚合 串行推理”的闭环架构。构建 HDS-QA 数据集填补了训练数据中“大规模并行推理轨迹”的空白通过自动化流水线生成了 2000 条高质量混合跳问答数据。验证了 SFT 的有效性证明了通过精心设计的监督数据小模型8B也能学会复杂的搜索调度策略且效果优于昂贵的在线 RL 方法。实现了真正的测试时扩展模型性能随资源投入搜索次数单调递增解决了当前 Agentic RAG“算力堆砌无效”的痛点。⚠️ 局限性与挑战数据依赖性模型的表现高度依赖于 HDS-QA 数据的质量和分布。如果真实场景中的问题模式与训练数据差异过大如不需要并行只需极深串行效果可能打折。摘要器开销为了处理并行检索的大量噪音系统依赖一个强大的外部摘要模型实验中用了 32B 模型这增加了系统的延迟和成本尽管论文提到用 8B 摘要器效果下降不多。长上下文压力虽然做了聚合但在极端并行下聚合后的上下文长度仍可能对基座模型的注意力机制构成挑战。 对开发者的实战建议如果你正在构建需要高准确度、复杂推理的 RAG 应用如深度研报、法律案情分析实施“并行 - 聚合”循环不要让用户的问题直接触发单条搜索。让 Agent 先思考“要回答这个问题我需要哪几个方面的信息”动作一次性并发执行 3-5 个不同维度的搜索查询。关键在拿到结果后必须有一个独立的步骤或 Prompt 指令让模型对这些结果进行“综合摘要”或“冲突消解”然后再决定是否进行下一轮搜索。构建自己的“混合轨迹”数据如果资源允许模仿 HDS-QA 的思路收集一些需要多路并行的复杂问题并人工或通过大模型编写“标准推理过程”包含并行查询和综合步骤。用这些数据对你的 RAG Agent 进行微调比单纯调 Prompt 效果好得多。动态资源分配对于简单问题限制并行度对于检测到实体多、条件复杂的问题如“比较 A、B、C 三个产品的参数”自动放宽并行查询的数量限制。优先选择 SFT 而非 RL在搜索策略优化上先尝试构建高质量的 Few-shot 示例或进行 SFT。除非你有极强的算力和奖励模型设计能力否则不要轻易上 PPO/GRPO性价比可能不高。一句话总结HybridDeepSearcher 证明了**“先广撒网并行再精提炼聚合后深挖掘串行”**是人类解决复杂问题的核心智慧也是让 AI 搜索代理真正具备扩展性的唯一路径。