VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
移动 GUI 智能体近年来发展迅速,但现有基准测试过于以应用为中心且任务单一,无法反映真实移动设备使用场景的多样性与不稳定性。研究团队敏锐地观察到,当前智能体在真实环境中的感知与记忆能力存在显著缺陷,且对环境变化极度脆弱,而现有基准恰恰掩盖了这些关键不足。
为此,团队构建了VenusBench-Mobile——一个更具挑战性且以用户为中心的评测基准。该基准以用户意图为驱动进行任务设计,建立了基于能力的标注体系,并通过细粒度行为分析全面评估智能体性能。大量实验表明,现有最先进的智能体在 VenusBench-Mobile 上性能显著落后于传统基准,揭示了更真实但复杂的任务及评估方法带来的全新挑战。
VenusBench-Mobile 为移动 GUI 智能体的鲁棒性和真实环境适应能力评估提供了重要基准,为其可靠的实际部署铺平了道路,也为智能体研究社区指明了从实验室走向真实世界的方向。
论文链接:https://arxiv.org/abs/2604.06182 03
连续场的主动感知重建
LASER: Learning Active Sensing for Continuum Field Reconstruction
在稀疏和受限的传感条件下,实现连续物理场的高保真测量对科学研究与工程设计至关重要。然而,传统方法通常依赖静态或离线优化的传感策略,在面对复杂的连续物理场时缺乏弹性,难以高效捕捉关键信息,更无法适应动态物理状态的变化。
研究团队提出了LASER 框架,将主动感知建模为部分可观测马尔科夫决策过程(POMDP),利用连续场潜在世界模型和强化学习策略,在潜在状态空间中模拟多种传感场景以动态调整传感器位置。这一闭环设计打破了固定传感器布局的局限,使系统能够根据物理场的实时变化自适应地优化信息采集策略。
通过多个不同连续物理场的实验验证,LASER 在稠密和稀疏条件下均显著优于静态和离线优化传感方法,表现出一致的高保真重建能力。该研究提出了首个将主动感知与连续场重建相结合的闭环方法,利用潜在世界模型和强化学习的创新策略,实现了动态、高效的高保真连续场重建,为科学观测和工程监测领域提供了全新的技术范式。
论文链接:https://arxiv.org/abs/2604.19355 04
LoRA 梯度下降收敛性首次获证
On the Convergence Rate of LoRA Gradient Descent LoRA(低秩适配)算法因其在低参数量条件下高效微调大模型的能力而备受青睐,但其梯度下降的收敛性因缺乏 Lipschitz 平滑性条件,长期以来尚未被清晰理解。当前理论主要集中于渐近性分析或假设强界限条件,而 LoRA 算法在真实使用场景中的行为未得到充分解释。
为避免强加人工约束,该研究首次对真实场景中的 LoRA 梯度下降算法进行了非渐近性收敛分析。研究团队重新表述了适配器矩阵的外积问题,使用修正的下降引理处理类似 Lipschitz 性质,并严格控制步长参数。通过数值实验,研究结果与理论预测高度一致,验证了 LoRA 梯度下降能够以 O(1/log T) 的速率收敛。
该研究首次在无假设情况下证明了 LoRA 梯度下降的非渐近性收敛性,补充了重要的理论空白并提供了实践指导。这一理论突破不仅为 LoRA 算法的超参数调优提供了科学依据,也为低秩适配方法在更大规模模型中的应用奠定了坚实的理论基础。
论文链接:https://arxiv.org/abs/2512.18248 05
VLM"说而不看"的视觉幻觉
Are vlms seeing or just saying? uncovering the illusion of visual re-examination
视觉语言模型(VLMs)在推理过程中常常生成自我反思性语句,如"让我再仔细看看这张图片",但这些语句是否真正触发了视觉再检查?研究团队发现,这一现象尚不明确,模型可能只是在利用学习的文本模式"表演"思考,而非真正依赖视觉信息。
实验结果令人警醒:模型在检测视觉变化时表现极差,准确率下降高达 60%,且"思考型"模型的脆弱性是"指令型"模型的 3 倍,模型尺度扩展也无助于改善视觉语义匹配能力。研究团队提出 VisualSwap 框架,在模型生成推理后替换为语义不同但视觉相似的图像,以此评估模型是否真正识别变化;同时设计了 VS-Bench 基准测试集,从 MathVista 等 4 个数据集创建 800 对图像对,深入测试了 Qwen3-VL、Kimi-VL、ERNIE-VL 等主流模型。
该研究揭示了一个令人担忧的现象:现有 VLMs 存在"说而不看"的问题,证明用户指令交互能提升视觉信息利用,但自反性语句本身无效。通过注意力机制分析,研究进一步揭示了模型的视觉注意力分配问题,为多模态模型的真实视觉理解能力评估敲响了警钟。
论文链接:https://arxiv.org/abs/2605.15864 06
预训练数据的动态高效选择
OPUs: Towards Efficient and Principled Data Selection in Large Language Model Pre-Training in Every Iteration
大语言模型预训练正从追求更多数据转向追求更高质量的数据,但现有数据选择方法存在明显短板:静态过滤过于依赖启发式方案,动态方法又无法充分结合优化器特点。与此同时,高质量公共文本资源日益枯竭,LLM 训练亟需从关注数据量转变为关注数据质量。
研究团队提出动态框架 OPUS,通过优化器诱导的更新空间定义数据效用,并使用 Ghost 技术结合 CountSketch 和 Boltzmann 采样,确保计算效率和数据多样性。这一设计将数据选择过程与训练动态紧密耦合,让每一轮迭代都能自适应地筛选最有价值的数据。在 GPT-2 Large/XL 的 FineWeb 和 FineWeb-Edu 数据集上,30B token 训练中 OPUS 显著超越基线;在 Qwen3-8B-Base 上,仅用 0.5B token 即可优于完整 3B token 训练,展现出惊人的跨领域数据高效性。
OPUS 提供了一种能结合动态训练和优化器特性的高效数据选择框架,不仅提升了跨规模和领域的数据利用效率,还对工业级预训练基线产生了显著优化效果,为 LLM 预训练的数据策略提供了新的方法论指导。
Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
当前推理模型在研究级数学问题上取得显著进展,但验证过程耗费大量专家时间,成为制约发展的瓶颈。研究团队观察到,正确解答应包含足够的解题方法信息,可用于提升解决相关可验证问题的效果,而错误解答则无法实现这一点——这一差异为自动化评估提供了突破口。
研究团队提出了一种基于后果的评估指标,通过测试候选解作为上下文示例在相关问题中的表现来评分,完全不依赖于外部验证者。这一设计巧妙地将评估问题转化为一个自举过程:好的解答能够帮助模型解决更多相关问题,而差的解答则无此效果。研究团队构建了包含研究级数学问题、专家解答及生成解答的数据集,实验结果表明,该方法在排名质量和评估准确性上均显著优于奖励模型和语言模型评估器。
该研究引入了一种无专家依赖的新型评估方法,在大规模语言模型上实现了显著性能提升,为数学推理任务的解答评估提供了一种通用框架,有望大幅降低研究级数学问题评估的成本和门槛。
论文链接:https://arxiv.org/abs/2602.06291
以上 8 篇论文从理论、方法、评测到应用,展现了 ICML 2026 的多元前沿图景。雷峰网与 AI 科技评论将持续在现场为大家带来更多一线报道,如有遗漏或希望进一步交流,欢迎联系我们!
一个人读论文太孤单,一群人刷顶会才好玩。 ICML 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。 进群传送门:扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈