淡淡-荷香 发表于 2026-7-10 05:17:09

ICML 2026现场:8篇论文,从LoRA收敛到VLM「说而不看」



从理论到评测,带你快速把握前沿脉络。
作者丨陆   毅
编辑丨岑   峰
7月8日,机器学习领域最具影响力的顶级学术会议ICML 2026进入正会第二天。本次大会共接收6352篇论文,其中Spotlight论文536篇(占投稿总数的 2.2%),Oral 论文168篇 (仅占投稿总数的 0.7 %)。
作为机器学习领域最顶级的学术会议之一,ICML 今年的 Spotlight 论文涵盖了从图像美学评估到无线电信号理解、从3D生成到Agent优化等多个前沿方向。
雷峰网与 AI 科技评论记者在现场为大家带来一线报道,从 536 篇 Spotlight 论文中精选 8 篇代表作,涵盖优化理论、智能体评测、强化学习、多模态理解、数据选择、长上下文推理与数学评估等方向,带你一文速览机器学习最前沿的研究风向。(如果你也想让你的研究成果出现在这里,请与我们联系)
01


无参数在线保序预测新框架

Online Conformal Prediction via Universal Portfolio Algorithms
在线保序预测(Online Conformal Prediction, OCP)是机器学习领域一个经典问题——如何在保证预测区间长期覆盖率的同时,生成信息量最大的预测区间。然而,现有方法在学习率调节和特定算法分析上存在明显局限,往往需要手动调参且适用范围有限。研究团队通过对线性化遗憾的理论分析,发现其控制机制直接影响预测区间的覆盖率,这为方法的通用性和理论基础提供了关键支撑。
基于这一发现,研究团队提出了UP-OCP 框架,巧妙地将预测问题转化为两资产组合选择问题,借助普适投资组合算法实现无参数的在线保序预测。这一设计摆脱了对人工调参的依赖,让方法具备更广泛的适用性。在多个实验验证中,UP-OCP 在区间大小与覆盖率的权衡上均优于现有基准方法,展现出卓越的泛化能力。
该研究的核心贡献在于发展了一套通用的覆盖率理论,首次提出了无需手动参数调节的在线保序预测方法,并通过实验充分验证了其广泛适用性和优越性能,为在线学习领域的预测置信度研究开辟了新的路径。


论文链接:https://arxiv.org/abs/2602.03168
02


移动端 GUI 智能体的"真实考场"

VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
移动 GUI 智能体近年来发展迅速,但现有基准测试过于以应用为中心且任务单一,无法反映真实移动设备使用场景的多样性与不稳定性。研究团队敏锐地观察到,当前智能体在真实环境中的感知与记忆能力存在显著缺陷,且对环境变化极度脆弱,而现有基准恰恰掩盖了这些关键不足。
为此,团队构建了VenusBench-Mobile——一个更具挑战性且以用户为中心的评测基准。该基准以用户意图为驱动进行任务设计,建立了基于能力的标注体系,并通过细粒度行为分析全面评估智能体性能。大量实验表明,现有最先进的智能体在 VenusBench-Mobile 上性能显著落后于传统基准,揭示了更真实但复杂的任务及评估方法带来的全新挑战。
VenusBench-Mobile 为移动 GUI 智能体的鲁棒性和真实环境适应能力评估提供了重要基准,为其可靠的实际部署铺平了道路,也为智能体研究社区指明了从实验室走向真实世界的方向。


论文链接:https://arxiv.org/abs/2604.06182
03


连续场的主动感知重建

LASER: Learning Active Sensing for Continuum Field Reconstruction
在稀疏和受限的传感条件下,实现连续物理场的高保真测量对科学研究与工程设计至关重要。然而,传统方法通常依赖静态或离线优化的传感策略,在面对复杂的连续物理场时缺乏弹性,难以高效捕捉关键信息,更无法适应动态物理状态的变化。
研究团队提出了LASER 框架,将主动感知建模为部分可观测马尔科夫决策过程(POMDP),利用连续场潜在世界模型和强化学习策略,在潜在状态空间中模拟多种传感场景以动态调整传感器位置。这一闭环设计打破了固定传感器布局的局限,使系统能够根据物理场的实时变化自适应地优化信息采集策略。
通过多个不同连续物理场的实验验证,LASER 在稠密和稀疏条件下均显著优于静态和离线优化传感方法,表现出一致的高保真重建能力。该研究提出了首个将主动感知与连续场重建相结合的闭环方法,利用潜在世界模型和强化学习的创新策略,实现了动态、高效的高保真连续场重建,为科学观测和工程监测领域提供了全新的技术范式。


论文链接:https://arxiv.org/abs/2604.19355
04


LoRA 梯度下降收敛性首次获证

On the Convergence Rate of LoRA Gradient Descent
LoRA(低秩适配)算法因其在低参数量条件下高效微调大模型的能力而备受青睐,但其梯度下降的收敛性因缺乏 Lipschitz 平滑性条件,长期以来尚未被清晰理解。当前理论主要集中于渐近性分析或假设强界限条件,而 LoRA 算法在真实使用场景中的行为未得到充分解释。
为避免强加人工约束,该研究首次对真实场景中的 LoRA 梯度下降算法进行了非渐近性收敛分析。研究团队重新表述了适配器矩阵的外积问题,使用修正的下降引理处理类似 Lipschitz 性质,并严格控制步长参数。通过数值实验,研究结果与理论预测高度一致,验证了 LoRA 梯度下降能够以 O(1/log T) 的速率收敛。
该研究首次在无假设情况下证明了 LoRA 梯度下降的非渐近性收敛性,补充了重要的理论空白并提供了实践指导。这一理论突破不仅为 LoRA 算法的超参数调优提供了科学依据,也为低秩适配方法在更大规模模型中的应用奠定了坚实的理论基础。


论文链接:https://arxiv.org/abs/2512.18248
05


VLM"说而不看"的视觉幻觉

Are vlms seeing or just saying? uncovering the illusion of visual re-examination
视觉语言模型(VLMs)在推理过程中常常生成自我反思性语句,如"让我再仔细看看这张图片",但这些语句是否真正触发了视觉再检查?研究团队发现,这一现象尚不明确,模型可能只是在利用学习的文本模式"表演"思考,而非真正依赖视觉信息。
实验结果令人警醒:模型在检测视觉变化时表现极差,准确率下降高达 60%,且"思考型"模型的脆弱性是"指令型"模型的 3 倍,模型尺度扩展也无助于改善视觉语义匹配能力。研究团队提出 VisualSwap 框架,在模型生成推理后替换为语义不同但视觉相似的图像,以此评估模型是否真正识别变化;同时设计了 VS-Bench 基准测试集,从 MathVista 等 4 个数据集创建 800 对图像对,深入测试了 Qwen3-VL、Kimi-VL、ERNIE-VL 等主流模型。
该研究揭示了一个令人担忧的现象:现有 VLMs 存在"说而不看"的问题,证明用户指令交互能提升视觉信息利用,但自反性语句本身无效。通过注意力机制分析,研究进一步揭示了模型的视觉注意力分配问题,为多模态模型的真实视觉理解能力评估敲响了警钟。


论文链接:https://arxiv.org/abs/2605.15864
06


预训练数据的动态高效选择

OPUs: Towards Efficient and Principled Data Selection in Large Language Model Pre-Training in Every Iteration
大语言模型预训练正从追求更多数据转向追求更高质量的数据,但现有数据选择方法存在明显短板:静态过滤过于依赖启发式方案,动态方法又无法充分结合优化器特点。与此同时,高质量公共文本资源日益枯竭,LLM 训练亟需从关注数据量转变为关注数据质量。
研究团队提出动态框架 OPUS,通过优化器诱导的更新空间定义数据效用,并使用 Ghost 技术结合 CountSketch 和 Boltzmann 采样,确保计算效率和数据多样性。这一设计将数据选择过程与训练动态紧密耦合,让每一轮迭代都能自适应地筛选最有价值的数据。在 GPT-2 Large/XL 的 FineWeb 和 FineWeb-Edu 数据集上,30B token 训练中 OPUS 显著超越基线;在 Qwen3-8B-Base 上,仅用 0.5B token 即可优于完整 3B token 训练,展现出惊人的跨领域数据高效性。
OPUS 提供了一种能结合动态训练和优化器特性的高效数据选择框架,不仅提升了跨规模和领域的数据利用效率,还对工业级预训练基线产生了显著优化效果,为 LLM 预训练的数据策略提供了新的方法论指导。


论文链接:https://arxiv.org/abs/2602.05400
07


长上下文推理的 KV 缓存优化

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
大语言模型的长上下文推理能力日益重要,但标准的软注意力机制导致 KV 缓存随序列长度线性增长,成为严重的性能瓶颈。现有的 KV 驱逐策略大多为启发式方法,难以捕捉输入依赖型的重要性分布,且驱逐操作导致不可逆的信息丢失,极大影响长距离的注意力检索性能。
研究团队提出了IndexMem,包含一个可学习的索引模块预测 KV 重要性,同时设计轻量级潜在记忆模块压缩被驱逐的 token,以残差形式补偿注意力损失。这一双重机制既保留了关键信息,又有效控制了缓存规模。在 RULER、LongBench 等基准测试中,通过 Qwen、Mistral 和 Llama 等模型验证,IndexMem 在高强度驱逐下实现了高达 25 点的性能提升,同时保持了稳定的长距离检索能力。
该研究提出了结合可学习索引器和潜在记忆模块的 KV 管理方法,高效进行长上下文推理,显著提升了大语言模型的性能和鲁棒性,为长上下文 LLM 的推理优化提供了实用的技术方案。


论文链接:https://arxiv.org/abs/2605.25475
08


无需专家的数学解答自动评估

Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
当前推理模型在研究级数学问题上取得显著进展,但验证过程耗费大量专家时间,成为制约发展的瓶颈。研究团队观察到,正确解答应包含足够的解题方法信息,可用于提升解决相关可验证问题的效果,而错误解答则无法实现这一点——这一差异为自动化评估提供了突破口。
研究团队提出了一种基于后果的评估指标,通过测试候选解作为上下文示例在相关问题中的表现来评分,完全不依赖于外部验证者。这一设计巧妙地将评估问题转化为一个自举过程:好的解答能够帮助模型解决更多相关问题,而差的解答则无此效果。研究团队构建了包含研究级数学问题、专家解答及生成解答的数据集,实验结果表明,该方法在排名质量和评估准确性上均显著优于奖励模型和语言模型评估器。
该研究引入了一种无专家依赖的新型评估方法,在大规模语言模型上实现了显著性能提升,为数学推理任务的解答评估提供了一种通用框架,有望大幅降低研究级数学问题评估的成本和门槛。


论文链接:https://arxiv.org/abs/2602.06291
以上 8 篇论文从理论、方法、评测到应用,展现了 ICML 2026 的多元前沿图景。雷峰网与 AI 科技评论将持续在现场为大家带来更多一线报道,如有遗漏或希望进一步交流,欢迎联系我们!
一个人读论文太孤单,一群人刷顶会才好玩。
ICML 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
进群传送门:扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。


搞科研/搞技术,信息差很重要。
来,一起快人一步!


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈


未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
页: [1]
查看完整版本: ICML 2026现场:8篇论文,从LoRA收敛到VLM「说而不看」

SCI期刊发表辅导