LoHoSearch 基准开源:为搜索智能体评测与上下文管理研究带来新挑战

Search Agent 能力演进与新挑战

过去一年,Search Agent 能力显著演进,在 BrowseComp 等评测上,顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。BrowseComp 的题目由人工设计,存在局限,只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断哪些条件难检索、哪些约束的候选空间足够大。这不禁让人思考:能不能让机器自己来出题?

LoHoSearch 基准:让机器出题成为现实

美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,将让机器出题的可能性变成了现实。

LoHoSearch 的核心看点

LoHoSearch 有以下核心看点:一是知识图谱自动化构造,以覆盖 762 万维基百科实体的知识图谱为基础自动生成题目,替代人工出题,基准含 544 道经人工核验的题目,覆盖 11 个领域;二是双维度难度控制,在生成中系统控制搜索空间与结构复杂度,构建出难度显著高于现有基准的挑战性问题;三是当前模型性能表现,已评测模型中,GPT - 5.5 准确率为 34.74%;现有上下文管理策略在 LoHoSearch 上提升幅度为 6.8%,低于在 BrowseComp 上的 14.03%。

设计原理:让机器出题的四个环节

机器出题的前提是让机器拥有全局视野,整个构建流程分为四个环节:建图、控制难度、质量把关、数据概览。

建图:搭建知识图谱,让机器获得全局视野

LoHoSearch 的第一步是从完整的英文维基百科出发搭建一张大规模知识图谱,包含 762 万个实体(每个维基页面是一个实体节点)、2.65 亿条有向边(页面正文中指向其他维基页面的超链接),每个实体的类型取自其 Wikidata P31 类别,实体热度用入度来衡量。这张图谱为后续在全局视角下挑选“难题”提供了基础。

控制难度:搜索空间和结构复杂度两个维度

决定搜索难度的核心有搜索空间和结构复杂度两个维度,而这恰恰是人工出题最难把控的。搜索空间指满足一个条件的候选实体有多少,候选越多,排除成本越高;结构复杂度指要同时满足多少条件才能锁定答案,条件越多、咬合越紧,求解链条越长。针对这两个维度,LoHoSearch 设计了树结构和图结构两种子图结构。树结构主要通过放大“搜索空间”来制造难度;图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了“结构复杂度”。

质量把关:从生成到验证,层层把关

子图采样完成后,还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层:题目生成,从子图抽取维基描述,改写为自然语言问题;自动验证,检查问题是否完整覆盖子图关系,并由搜索智能体验证标准答案满足所有条件;筛选与复核,排除多答案题和易答题,再由人工审核。经过三层筛选,自动化流程的整体质量表现如下:75.5% 的题目直接通过人工复核,22.3% 经标注员微调后接受,仅有 2.2% 因严重问题被丢弃。

数据概览:544 道题目,11 个主题领域

LoHoSearch 最终收录 544 道经人工核验的题目。对比树结构和图结构可以看出,图结构子图明显更稠密,节点更多、边数接近前者的两倍,这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。最强模型 GPT - 5.5 准确率仅 34.74%,DeepSeek - V4 - Pro、Claude - Opus - 4.6 和 Kimi - K2.6 集中在 15.53% - 15.99%,其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照,说明 LoHoSearch 对当前最先进搜索智能体构成了实质挑战。

四大洞察揭示 LoHoSearch 特点

洞察一:解一道题,平均工具调用从 35 次增至 61 次

用 DeepSeek - V4 - Flash 作为探针对比两个基准,同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%。解一道 LoHoSearch 题目,平均工具调用从 35 次增至 61 次(+74%),中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%,远低于树结构的 11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。

洞察二:重复采样收益可观,但天花板依然很低

对 DeepSeek - V4 - Flash 采样 16 个独立回答,pass[@N] 从 N = 1 的 9.3% 升至 N = 16 的 38.3%,重复采样收益可观,但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best - of - N 表现最优(24.6%),远低于 pass[@16] 上界,说明模型在答案置信度校准上存在明显不足。

洞察三:现有的上下文管理策略,在这里已失真

以标准 ReAct 为基线,测试 Summary 和 Discard - all 两种策略,并加入 Verify 模块。表现最佳的组合(Discard - all + Verify)将成绩从 10.02% 提至 16.82%,绝对提升仅 6.8 个百分点,而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题,这使其成为下一代上下文管理技术更有价值的试验场。

洞察四:知识图谱是系统化构造高难度题目不可或缺的基础

对比两个基准中“隐藏实体”的特征可以发现,BrowseComp 的隐藏实体流行度明显更高,人工出题难以精确控制实体知名度,导致实体偏易;即便将流行度控制在同一水平,LoHoSearch 的关系搜索空间仍显著更大,实体推断难度远高于 BrowseComp。这说明人工构建存在系统性局限,知识图谱是系统化构造高难度题目不可或缺的基础。

总结:为下一代智能搜索提供新标尺

LoHoSearch 的价值体现在三项具体贡献上:一是基于知识图谱的自动化构造流程,以覆盖 762 万实体的知识图谱为基础自动生成题目,系统控制搜索空间与结构复杂度,突破人工出题的难度上限;二是更具区分度的评测标准,最强模型 GPT - 5.5 准确率仅 34.74%,正确轨迹所需工具调用次数是 BrowseComp 的 1.7 倍,为搜索智能体建立了更具区分度的评测标尺;三是面向上下文管理研究的挑战性平台,最优策略仅带来 6.8% 的提升,远低于其在 BrowseComp 上 14.03% 的增益,表明 LoHoSearch 可成为推动下一代上下文管理技术研究的理想试验场。LoHoSearch 已全面开源,各大模型能否通过“长程搜索”大考?

内容概要 本资源是一套完整可运行的 Qt Widgets 批量图片压缩桌面工具源码,基于 Qt5/C++ 从零开发,专为初学者设计,分步实现图片批量处理全套功能。工具支持多选单张图片、直接读取整个文件夹内所有 JPG/PNG 图像,可自定义输出图片分辨率、调节 JPG0~100 区间压缩质量,自带锁定宽高比防拉伸变形功能;批量处理完成后自动统计每张图片压缩前后文件体积,计算整体压缩缩小比例,直观展示压缩效果。 适用人群 Qt/C++ 零基础初学者,学习 QImage 图像绘图、文件目录遍历、UI 交互开发; 需要本地批量处理图片的办公、设计、自媒体从业者; 想要学习图片缩放、JPG 压缩、本地文件 IO、进度条交互的开发学习者。 使用场景 自媒体批量压缩配图,降低图片体积节省上传流量; 摄影、设计批量统一图片尺寸,批量轻量化相册图片; 程序开发学习:QFileDialog 文件选择、QDir 文件夹遍历、QImage 缩放保存、QSlider 参数联动、批量循环界面防卡顿、文件大小格式化转换全套 Qt 图像开发实战案例。 工具核心功能清单 双模式导入图片:手动多选单张图片 / 一键读取整个文件夹全部图片; 自定义输出宽高分辨率,支持锁定原始宽高比,避免图片拉伸变形; 滑块调节 JPG 压缩质量 0~100,平衡图片清晰度文件占用大小; 自定义输出保存目录,批量生成压缩后的图片文件; 实时进度条展示处理进度,循环中刷界面,程序不会假死卡顿; 自动统计每张图片压缩前后体积,换算 KB/MB 直观展示; 批量完成弹窗汇总:图片总数、成功数量、单张大小对比、整体压缩节省空间比例; 完整模块化代码,功能拆分清晰,每段代码附带详细注释,手可分步拆解学习。 其他说明 开发环境:Qt Creator + Qt5.15 MSVC,Windows 平台可直接编译运行; 源码结构清晰,功能
Trivy(发音)是一款全面且多用途的安全扫描工具。Trivy 配备了用于检测安全问题的扫描器,以及可发现这些问题的目标对象。 目标对象(Trivy 可扫描的内容): 容器镜像 文件系统 Git 仓库(远程) 虚拟机镜像 Kubernetes 扫描器(Trivy 可在目标对象中发现的内容): 正在使用的操作系统软件包和软件依赖项(SBOM) 已知漏洞(CVE) IaC 问题和配置错误 敏感信息和密钥 软件许可证 Trivy 支持大多数主流编程语言、操作系统和平台。完整列表请参见[扫描覆盖范围]页面。 要了解更多信息,请访问 Trivy 主页 了解功能亮点,或访问 文档站点 获取详细信息。 快速开始 获取 Trivy Trivy 可通过大多数常见的分发渠道获取。完整的安装选项列表请参见[安装]页面。以下是一些常用示例: brew install trivy docker run aquasec/trivy 从 https://github.com/aquasecurity/trivy/releases/latest/ 下载二进制文件 更多方式请参见[安装] Trivy 已许多流行平台和应用程序集成。完整的集成列表请参见[生态系统]页面。以下是一些常用示例: GitHub Actions Kubernetes operator VS Code 插件 更多方式请参见[生态系统] 预览版构建 每次推送到主分支时,都会生成预览版构建(Docker Hub、GitHub、ECR 镜像以及 二进制文件)。 请注意:预览版构建可能存在严重错误,因此不建议在生产环境中使用。 基本用法 trivy <target> [--scanners <scanner1,scanner2>] <subject> 示例: trivy image python:3.4-alpine
企业创活动具有投入周期长、不确定性高和收益实现滞后等特征,持续稳定的资源支持是保障企业长期创的重要基础。耐心资本作为一种强调长期价值创造、具备较高风险容忍度并积极参企业治理的资本形态,能够通过缓解融资约束、优化公司治理结构以及增强企业风险承担能力,为企业持续开展创活动提供长期稳定支持 本文基于2010—2024年中国A股上市公司样本数据,借鉴《耐心资本对企业持续性创投入的影响研究》一文中的基准回归设计思路和研究方法,围绕“耐心资本是否能够促进企业持续性创投入”这一问题展开基准回归实证检验,基准回归结果显示,耐心资本能显著促进企业持续性创,数据集含原始数据、处理代码、基准回归实证结果 关键指标构建: 1.耐心资本:本文从稳定型股权和关系型债权两个维度刻画企业耐心资本水平,并采用熵权法对两个指标进行加权整合,构建综合耐心资本指数。其中,稳定型股权参考温磊和李思飞(2024)的研究,以长期机构投资者持股比例作为衡量指标;关系型债权参考吴旻佳(2022)、姜中裕(2024)的研究,采用上市公司长期负债占负债总额的比例衡量 2.企业持续性创:基于研发投入三期动态变化构建,借鉴何郁冰(2017)、杨仁发(2025)的研究思路,计算第t-1至t年研发投入之和第t-2至t-1年研发投入之和的比值,再将该比值乘以第t-1至t年研发投入之和,以此反映企业在创投入上的持续性特征 相关数据:上市公司耐心资本数据,上市公司耐心资本投资数据,上市公司研发投入专利数据 一、数据介绍 数据名称:耐心资本对企业持续性创投入的影响研究 数据范围:上市公司企业 时间范围:2010-2024年 样本数量:31725条 数据来源:上市公司年报 数据说明:含原始数据、处理过程dofile文件、基准回归结果
内容概要:本文针对传统三电平并网逆变器存在的谐波含量高、电网不平衡工况适应性差及动态响应滞后等问题,以有源中点箝位(ANPC)三电平逆变器为研究对象,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相电网电压前馈控制的一体化高性能并网控制策略。文章首先分析了ANPC拓扑在开关损耗均衡、中点电位稳定和输出谐波抑制方面的硬件优势,继而系统设计了三项核心控制技术:DPWMA调制通过等效倍频效应显著优化输出波形质量;正负序分离锁相技术实现电网电压正负序分量的精准解耦,保障不平衡电网下的相位同步精度;电网电压前馈控制则提前补偿电网扰动,提升系统动态响应能力。三者协同构成“精准同步-扰动补偿-优质调制”的分层控制架构,并通过Simulink仿真在稳态、电网不平衡及动态扰动等多种工况下验证了该策略在降低谐波、稳定功率、抑制电流畸变等方面的优越性能。; 适合人群:具备电力电子、自动控制或能源发电相关基础知识,从事并网逆变器、微电网、能源系统等领域研究研究生、科研人员及工程技术人员。; 使用场景及目标:①研究高性能三电平并网逆变器的复合控制策略设计方法;②掌握DPWMA调制、正负序分离锁相前馈控制的技术原理实现方式;③通过Simulink仿真平台复现并验证控制策略在复杂电网工况下的动态响应抗扰性能。; 阅读建议:读者应结合提供的仿真模型,重点理解控制策略的整体架构各模块间的协同机制,建议在仿真中调整电网不平衡度、电压骤变等扰动参数,深入分析系统在不同工况下的响应特性,以全面掌握该控制策略的工程应用价值。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值