快照更新时间: 2026-10-09
Lina Magoula, Nikolaos Koursioumpas +2
2026-10-08
本文提出ED3R,一种能量感知的分布式野火检测框架,在不确定性下实现机器人与遥控器分层协同决策,以高置信度检测野火同时最小化能耗,并引入前瞻能力,在仿真中实现了97.18%成功率和显著节能加速。
Jacobus Arthur, Ahmad Sait +7
2026-10-08
本文提出了SoccerNet-FoulRet,首个面向足球比赛中语义犯规检索的基准,帮助裁判查找相似的历史犯规先例。评估了零样本模型和微调基线,发现语义犯规检索极具挑战性,最强零样本模型在人工验证先例上的HitRate@10不到5%。
Ruoshi Xu, Mingqi Gao +2
2026-10-08
CIRSeg是一个基于nnU-Netv2的由粗到细的肝脏分割框架,通过混合数据增强、级联架构、测试时自适应和最大连通分量后处理,在域内和未见域MRI上均取得高精度分割结果。
Adam Pardyl, Siddhartha Gairola +5
2026-10-08
DisParQ从冻结的自监督视觉主干中学习空间定位的离散概念表示,无需类别标签或语言监督。每个图像块分配至可学习原型,并量化残差属性,通过空间解码器重建表示,性能接近教师模型,且概念一致性更高。
Giovanni Affatato, Sara Mandelli +2
2026-10-08
本文分析了针对特定人物(POI)的视频深度伪造检测中,3D可变形模型(3DMM)系数各部分的作用,发现形状系数冗余度大,仅形状块即可恢复几乎全部精度,而稠密表面携带系数未包含的身份信息。基于此构建的MOTIF检测器仅用真实视频训练,在多个数据集和篡改上优于现有方法。
Jiapan Wang, Daan Hulskemper +3
2026-10-08
本文提出DeepTopoClustering(DTC)无监督框架,将永久激光扫描获取的4D变化对象转换为GeoMorphogram,利用卷积自编码器与层次深度聚类目标,自动构建地表过程分类层次,在沙滩数据上获得与专家标注高度一致的结果。
Ankita Das, Ambarish Parthasarathy +2
2026-10-08
本文提出FedSSMCoOp,一种基于状态空间模型(SSM)的联邦少样本图像分类框架,通过Vision Mamba和Cross Mamba块实现多模态对齐,仅优化软提示和通信提示,无需外部LLM,在保护隐私的同时应对联邦场景下的数据异质性,比基线轻量1.96倍且性能稳定。
Yang Deng, Eleftherios Ioannou +4
2026-10-08
本文提出ASTRA,一种用于风格迁移算法的自动评估方法,通过用户研究构建基准数据集并训练学习型评估器,实现与人类偏好高度一致的自动评分。
Zijian Chen, Zhengyu Chen +8
2026-10-08
提出FigCodeBench基准,用于评估多模态大语言模型在图表复现中统一多模态理解和代码生成的能力,涵盖6194个实例、7个功能类别和4种编程语言,通过三维难度和多项评价指标,在24个模型上发现跨语言和难度的非线性能悬崖,特别是声明式语言中性能显著下降。
Leon Mayer, Lucas Luttner +43
2026-10-08
论文提出了HeiCo-FOCUS,一个用于评估手术场景长视频理解的数据集,包含3万条视觉问答对,要求模型在长达数小时的手术中持续跟踪多物体。实验表明现有视觉语言模型在时间定位上尤为困难(平均准确率仅19.7%),而事件与流程理解相对较好(56.5%)。该数据集旨在推动具有长期时序一致性推理能力的模型发展。
Yongchao Xu, Bowen Ye +6
2026-10-08
提出VideoEvolve自我进化框架,通过交替智能体强化学习协同更新记忆与检索,解决长视频理解中记忆固定与检索动态之间的不匹配,在多个基准上取得显著效果。
Hao Wang, Qiwei Zeng +6
2026-10-08
本文提出PureVision框架,通过几何监督的视觉表示学习和解剖引导的证据聚合,解决医学视觉语言模型在多表型病变解读中因缺乏几何约束和证据稀疏导致的表征层级缺失问题,在影像问答和报告生成任务上提升了病变定位与表型表征能力。
Dayou Li, Hao Wang +24
2026-10-08
TouchScale 是一个 500 小时的大规模人类接触交互数据集,统一采集了自我中心的 RGB-D 视频、腕部 RGB 视频及双手密集触觉数据,证明一致传感的大规模数据能显著提升零样本触觉预测、动作识别及机器人操作成功率。
Hui Wei, Hao Yu +2
2026-10-08
本文针对人脸去标识化评估碎片化问题,提出统一基准UtilFace和分层指标HiFD,实现跨方法一致比较,揭示以往不可见的权衡与失效模式。
Xingtai Gui, Yucheng Zhou +4
2026-10-08
GeoCoTDrive 提出了一种显式几何思维链框架,先通过 2D 语义定位关键区域,再提取局部 3D 几何先验,以提升自动驾驶中视觉-语言-动作模型的规划安全性。
Subhransu S. Bhattacharjee, Dylan Campbell +1
2026-10-08
Rubix提出了一种全局求解平面Procrustes-Wasserstein对齐问题的方法,通过排列多边形的凸包和分支定界,避免了交替最小化的局部最优,实现了快速精确的形状匹配与三维点云对齐。
Xuefei Sun, Lorin Achey +5
2026-10-08
本文提出了上下文物体放置任务和ECHO数据集,将室内场景的RGB-D扫描与人类搬运物体的具身活动及自然语言标注相结合,用于预测物体的合理放置位置,并评估表明需要多模态联合推理。
Yucheng Mao, Zeyuan Chen +5
2026-10-08
QuadTok 提出基于四叉树结构的图像标记化和自回归生成框架,动态分配标记容量,在保持重建质量的同时减少标记数量,并支持零样本空间控制生成。
Jaeyeong Kim, Jinhyuk Jang +3
2026-10-08
Tetris3D是一个从单张图像重建三维场景的生成框架,通过显式考虑物体间的几何与物理关系,确保生成场景的物理与几何一致性,并引入包含120万场景的ComOb数据集以支持训练。
Francesca Mussa, Divyanshu Tak +6
2026-10-08
针对深度学习在纵向医学影像分析中的应用进行了范围综述,涵盖102项2018-2025年的研究。发现神经病学和眼科为最常见应用,MRI为主导模态,CNN结合经典时序模型为主要方法,但仅少数研究进行了外部验证,领域潜力大但成熟度不足。
Fengbei Liu, Rachit Saluja +6
2026-10-08
该论文揭示了将多目标优化求解器与Adam优化器直接耦合时存在的权重不匹配和几何不匹配问题,并提出了MAdam,一种即插即用的包装器,通过偏好条件化曲率进行预条件处理,从而消除这些不匹配,在多种任务上提升所有求解器类别的性能。
Mariia Baidachna, Nicolas Pugeault
2026-10-08
Flow-of-Thought (FoT) 通过生成视觉草图作为中间推理步骤模拟心理意象,在空间推理任务上取得突破:锁定测试中俄罗斯方块准确率100.0%、彩色形状99.0%,并在BLINK多视角迁移中显著优于端点控制方法,证明了连续视觉轨迹在空间推理中的有效性和可解释性。
Keke Yang, Erqi Wang +2
2026-10-08
超世界(UltraWorld)通过自蒸馏方法从临床超声视频中学习交互式世界模型,无需真实动作标注,并引入声学采样图(AsMap)表示探头姿态,显著提升超声扫描的动作跟随和预测能力。
Akshat Dobhal, Sanjay Singh
2026-10-08
在固定合成数据预算下,不确定性引导的生成策略并不优于随机分配,预算集中才是训练效果差异的原因;同时发现CHAMELEON数据集存在严重的数据污染。
Arshia Hemmat, Amirhossein Vahidi +5
2026-10-08
ORCA通过低秩跨模态对齐损失,在无需推理开销下提升扩散模型组合性生成能力。
Bill Psomas, Mohammad Mahdi +4
2026-10-08
本文提出全局平均精度(gAP)的可微分替代损失gSAP,通过将所有查询-候选对联合排序实现跨查询相似度可比性,在统一决策阈值下大幅提升检索性能。gSAP可作为即插即用的替代方案,改善监督度量学习、跨模态对齐和自监督预训练,是首个在后两个任务中替代InfoNCE的排序损失。
Taiki Fukiage
2026-10-08
本文研究生成模型的原生先验是否与人类对图像自然度的感知一致。通过25个生成模型的方向性损失差异,在面部和光照干预条件下,发现这些差异能复现人类选择性敏感度(如撒切尔效应),并与人类自然度判断高度相关(面孔r=.84,场景r=.64),即使控制低级特征后仍保留独特信号。此外,敏感度与人类对齐在去噪过程中解耦,表明类人自然度判断与通用违规检测分离。
Jean Cousty, Laurent Najman +2
2026-10-08
本文综述了基于边加权图的分水岭分割方法,将其与最小生成树等优化问题关联,并首次系统整合了计算分层分水岭分割的完整算法管线,涵盖多种变体,旨在为研究者提供参考。
Melih Yazgan, Ahmed Abouelazm +1
2026-10-08
本文提出一种面向异步协同感知的时间残差预测方法,通过时间残差瓶颈与xLSTM处理延迟和丢包,在严重通信劣化下具有鲁棒性。
Vita Santa Barletta, Danilo Caivano +3
2026-10-08
本文利用DINOv3基础模型结合LoRA参数高效自适应,解决无标签情况下的行李视觉重识别问题,在MVB基准上证明了其有效性。
Salma Galaaoui, Nermin Samet +1
2026-10-08
本文提出HuLiGen,一种从参数化人体模型生成逼真人体激光雷达点云的生成模型,使用点变换器和流匹配目标训练。利用生成的合成数据进行仅合成预训练,实现了激光雷达人体姿态估计的领先性能,尤其在标注数据稀缺时,MPJPE最多降低50%。
Nairouz Mrabah, Youssef Melki +4
2026-10-08
LoomSC通过投影器因子分解和精确谱约简,克服了稠密自表达矩阵和全亲和度谱聚类带来的可扩展性瓶颈,实现线性复杂度,并在多个基准上大幅领先现有方法。
Junhyeok Kim, Jinyeong Kim +2
2026-10-08
引入融合注意力和FFN的AttenFeed模块构建uViT模型,发现标准ViT中Attention-FFN二分结构在小模型规模下因参数分配僵化而限制性能。
Cheng Wan, Chenjun Li +1
2026-10-08
本文诊断了视觉上下文学习在医学影像中的配对依赖性问题,即模型过度依赖支持图像与标签的具体配对,并提出晚期解耦课程(LUC)策略,在训练后期随机打乱标签,有效缩小配对间隙、提升模型性能。
Benoît Roussel, Damien Bouet +2
2026-10-08
本文针对端到端多目标跟踪器常出现空间上不合理的身份分配错误(如将画面两端物体分配同一身份),提出三种空间先验,分别在数据增强、损失函数和特征表示阶段显式编码空间信息,并构建MOTIP2模型,无需额外数据即达到多个基准上的最新水平,同时兼顾速度与精度。
Arash Vashagh, Roozbeh Razavi-Far
2026-10-08
本文提出GraphRectify,一种基于图的框架,用于在不同分类器骨干网络间迁移对抗图像检测器,避免重复训练。
Yuxiang Xiong, Ruiyan Wang +6
2026-10-08
针对扩散变换器视频生成推理延迟问题,提出MORCA缓存调度框架,通过潜变量感知和终端误差导向,利用离线到在线强化学习实现重用/重计算决策,可在用户指定加速比下提升生成视频保真度。
Chen Xu, Yunqi Li +4
2026-10-08
JoHan是一个统一生成框架,直接从视频序列中恢复3D手部运动,无需逐帧姿态估计,通过联合生成对齐的2D与3D手部姿态序列,利用时序动态和跨表示对应关系,显著提升准确性和运动平滑性。
Antonius Bima Murti Wijaya, Paul Henderson +1
2026-10-08
本文提出了一种基于聚类的即插即用方法,用于密集人群轨迹预测。该方法利用个体随时间变化的相似属性进行分组,以群组质心替代个体输入,从而加速预测并降低内存占用,同时保持准确率。
Wenhao Guo, Changchang Yin +4
2026-10-08
提出STRIDE框架,利用配对的治疗后MRI扫描及其时间间隔,预测胶质母细胞瘤的稳定、假性进展或真性进展状态,在Burdenko数据集上取得宏ROC-AUC 0.816和宏F1 0.796。
Leon Pohl, Lukas Beer +2
2026-10-08
该论文将机器人数据集构建建模为基于构件的构建过程,并实现了开源Bazel扩展Bagzel,显著减少了数据集更新的延迟,提升了迭代工作流程的效率。
Sung Ju Lee, Nam Ik Cho
2026-10-08
本文提出了一个用于比较扩散生成图像水印系统的框架,通过分类法、形式化流水线和案例研究,将方法沿嵌入机制和信号表示两个轴进行组织,并分离内容级攻击家族,从而支持协议感知的匹配比较,而非建立通用排名。
Shikun Zhang, Yong Li +3
2026-10-08
本文针对头部头像建模中多目标优化权重难以动态调整的问题,提出反事实路径优化框架,通过前瞻对比不同更新路径的效果来自适应调整优化方向,提升几何、外观与跨视角一致性。
Umar Farooq, Jean-Yves Guillemaut +2
2026-10-08
本文提出一种高效的无条件3D高斯头部化身生成器,通过参数高效的合成模块和深度可分离卷积大幅降低计算复杂度(FLOPs减少94%,参数量减少70%,模型大小减少81%),同时保持生成质量,并支持在CPU和移动端浏览器上运行。
Chunming He, Kailai Zhou +7
2026-10-08
提出受控可缩减退化差距(cRDG)来评估合成退化在密集预测中的训练效用,并基于cRDG进行数据筛选(可缩减波段筛选),在语义分割和显著目标检测任务中以匹配的合成数据预算提升预测器性能,同时保持干净数据上的表现。
Paul Longour, Julien Moreau +1
2026-10-08
本文将二值神经网络(BNN)与事件相机数据结合,提出极坐标二值事件体(PBEV)表示,通过跨模态RGB预训练提升分类性能,在N-Caltech101上以7.5倍运算量减少达到90.58%准确率。
Bojun Yang, Haochen Zhou +4
2026-10-08
OrthoPurify是一种高效防御大视觉语言模型后门攻击的方法,通过一步正交投影净化权重,无需重训练或推理开销,将攻击成功率降至接近零。
Maximilian Seitzer, Gabriele Trivigno +6
2026-10-08
JEM是一个基于信息论原则的自监督学习算法,通过多视图下图像块表示对齐与信息结构保持正则化,稳定训练至70亿参数,在分割任务上超越DINOv2和DINOv3,用更少数据实现强大表征。
Arnold Brosch, Abdelrahman Eldesokey +2
2026-10-08
本文提出在证据深度学习框架中采用Wasserstein目标替代传统欧几里得目标,以更好地校准认知不确定性,从而提升语义分割网络对分布外对象的检测能力,并发现最优Wasserstein阶数与网络架构相关。
Anas Filali Razzouki, Killian Steunou +4
2026-10-08
该论文提出一个身份感知的视频描述与人物中心问答框架,通过自动角色识别、空间定位和轻量级任务适应,显著提升视频理解性能,并发布基准、数据与模型。
Zhuo Chen, Yihua Cheng +2
2026-10-08
本文提出体积接触(VolCo)表示和VolCoDiff框架,将表面点扩展为三维体素网格以编码手物接触,结合局部变分自编码器与全局扩散模型,实现更精准、低穿透的抓握生成。
Yanjiang Guo, Haodong Yan +16
2026-10-08
本文提出VPP2,一种世界动作模型,通过大规模操作视频的事件级预训练和混合Transformer动作模块,显著提升了视频预测与动作生成的零样本泛化能力,并在多个基准上超越现有方法。
Kerui Chen, Jianrong Zhang +2
2026-10-08
本文提出了DIGHT框架,通过协同自适应地将文本条件交互生成与物理仿真中的跟踪策略相结合,利用物理偏好和直接偏好优化来提升双足人形机器人交互运动的可执行性和交互保真度。
Ziheng Ouyang, Zeqiang Lai +8
2026-10-08
本文针对单阶段3D生成模型中VecSet表示缺乏显式位置引导的问题,提出位置强制(Position Forcing)自条件框架,通过从潜在估计恢复令牌位置并渐进量化,为扩散Transformer提供粗细粒度的空间反馈,显著提升生成质量。
Miao Shang, Yabin Wang +1
2026-10-08
本文提出高斯密度泼溅网络(GDSNet),用连续高斯基元叠加表示人群,通过可微渲染实现端到端计数,在多个基准上达到最优性能。
Zihan Su, Junhao Zhuang +11
2026-10-08
SGF+ 针对自回归视频生成中上下文写入与去噪共享参数导致的梯度冲突,提出将两角色分配独立参数并用因果注意力交互,仅凭原始生成目标联合优化,在仅训练5秒片段的情况下实现长达24小时的连续生成,验证了角色特定参数化的有效性。
Amir Reza Vazifeh, Christian Zeigler +3
2026-10-08
本文提出ViabiLens,一种基于人工智能的无标记细胞活力分析软件,通过明场图像训练模型识别活死细胞,避免传统染色方法的局限性,在CHO细胞上验证误差仅为2.68%。
Jiyoung Kim, Paul Hyunbin Cho +6
2026-10-08
本文提出GRACE,一个两阶段框架,通过压缩预训练视频自编码器并保持与扩散Transformer(DiT)的兼容性,实现高效视频生成。GRACE将Wan2.1-I2V-14B的令牌数减少8倍、延迟降低11.1倍,同时保持生成质量。
Marco Giberna, Miguel Fernandez-Cortizas +2
2026-10-08
这篇综述全面回顾了如何在基于图的世界模型(尤其是因子图和场景图)中处理动态环境,整合了表征、构建更新管道及下游任务利用,并强调了混合模型的新趋势,最后指出了不确定性传播、可观测性等开放挑战。
Santiago Vitale, Duilio Deangeli +2
2026-10-08
提出一种学习驱动的双阶段流水线,从解剖语义标签直接生成逼真超声图像,无需推理时依赖患者CT数据。该方法通过编辑语义图灵活模拟变形和病变。
Rovhona Mudau, Jean Frederic Isingizwe Nturambirwe +1
2026-10-08
该文使用哈斯牛油果数据集评估了从图像预测剩余货架期的视觉模型,发现基于样本独立划分的评估比基于观测划分的评估更严格,轻量级骨干网络在样本独立评估下能取得与较重模型相当的精度且吞吐量更高,空间归因分析揭示了不同骨干网络的关注差异。
Ana Ezquerro, Ozan Özdenizci
2026-10-08
本文提出通过无监督对象发现和关系抽象为扩散模型提供结构先验,从而增强其在解谜类任务中的空间推理能力,实现约束下的条件图像生成。
Tsz-Yui Qin, Siyu Zhou +3
2026-10-08
FLAIR是一个无需参考条件的手术视频生成框架,通过光流学习动作先验并根据文本提示注入潜在动作,实现高质量视频生成;同时构建了大规模手术视频数据集SurgActionClip-30K和专用评估指标SurgMetrics。
Deyuan Liu, Yihao Hu +14
2026-10-08
本文提出了UltraText Bench,一个针对密集视觉文本生成的双语基准,包含432个提示,涵盖24个场景类别和三个难度级别,使用Q-Judger视觉语言模型评估文本保真度、清晰度、空间质量和场景质量,测试了24种模型配置,发现不同维度上的权衡和困难级别下的性能下降。
Chanung Park, Seunghyeon Song +3
2026-10-08
DeltaSplat 提出一种轻量级高斯细化模块,通过迭代渲染残差并借助 Plücker 射线和深度先验修正无姿态前馈 3D 高斯泼溅中的几何与光度误差,显著提升重建质量,超越使用真实相机参数的基线。
Yingmei Zhang, Wangtao Bao +6
2026-10-08
本文提出了一种用于红外小目标检测的选择性注意力网络(SANet),通过双路径语义感知模块和选择性注意力融合模块,有效提升了在复杂背景下对暗淡目标的检测精度,并在三个公开数据集上取得了显著的性能提升。
Artem Filippov, Aleksandr Gushchin +3
2026-10-08
该论文提出了一种模块化检测与解释框架,结合多骨干网络和伪迹证据图进行深度伪造检测,并利用对比学习和语言模型生成可解释的视觉与文本证据,在XPlainVerse数据集上取得了0.9349的检测准确率和0.7456的最终挑战分数。
Zhifei Yang, Zhao Jiang +7
2026-10-08
本文提出了AdSpark,一个面向产品导向广告视频生成的大规模数据集和评测基准,包含约30万条数据及覆盖六维度的评测框架,以填补该领域数据与评测的空白。
Xiangtao Kong, Shuaizheng Liu +6
2026-10-08
HarnessIR是一个基于多模态基础模型的智能图像修复框架,通过感知诊断、按需工具调用、提示组合、执行及验证驱动优化五步流程,直接利用现有多模态模型一次性修复复杂退化图像,在合成和真实场景中均取得领先效果。
Ruihan Xu, Jiae Yoon +3
2026-10-08
本文提出Argos,利用几何基础模型(GFM)的隐式3D知识实现联合场景变化检测与三维重建,并构建大规模跨域基准,显著提升变化检测精度与泛化性,同时推出面向机器人的实时系统Argos-SLAM。
Haoyu He, Basile Tessier-Cloutier +2
2026-10-08
MFE-MIL提出了一种特征空间掩码框架,通过联合训练轻量MLP适配器的分类与窗口掩码重建任务,在不依赖坐标信息的情况下抑制切片内差异,提升WSI分析性能,并在生存预测中取得一致改进。
Hao Wang, Qiwei Zeng +7
2026-10-08
论文提出了ΔRepresentation框架,通过反事实推理学习医学视觉语言模型中的视觉表型表征,建模病灶表征相对于正常解剖表征的增量,从而提升病灶定位和表型识别准确率。
Eiram Mahera Sheikh, Alaa Tharwat +1
2026-10-08
本文提出可持续性感知性能指数 (SAPI), 在细胞核实例分割任务中综合性能、能耗与模型大小, 对 19 个预训练模型进行零样本推断和 16 个可微调模型进行少样本适应评估, 发现更大模型未必带来成比例的性能提升, 资源成本差异导致 SAPI 排名与传统性能排名不同。
Jingyu Li, Xiaoxiao Xiang +1
2026-10-08
本文提出将实时流式音视频生成的因果注意力与少步采样两种能力并行获取:在冻结的骨干网络上分别训练因果适配器和采用现成的少步采样适配器,利用二者权重更新的近正交性,在推理时直接相加,无需联合训练,即可实现实时、高质量的音视频流式生成。
Xin You, Zhiwei Ning +8
2026-10-08
本文提出了一种无需训练的自校正优化方法SCO,用于改善多模态大语言模型在交错图像-文本生成中的时间连贯性和视觉主体保持,并展示其在视频生成与物理过程建模中的扩展应用。
Arash Vashagh, Roozbeh Razavi-Far
2026-10-08
本文提出利用冻结视觉语言模型对通用语义提示的响应模式来检测对抗性扰动,通过构建响应特征并用轻量级分类器判别,在多种攻击下取得良好检测效果,且对未知攻击具有泛化性。
Justinas Lekavicius, Kursat Komurcu +2
2026-10-08
本文研究AutoResearch协议,语言模型在一小时GPU预算内编辑训练程序,仅当验证IoU提升时保留修改。在光伏板分割任务上,使用DeepLabV3-ResNet-50,多次实验中模型提升基线,但修改不跨硬件迁移,且无增强的真实图像训练达到与GAN增强相近的性能。
Shravan Chaudhari, William Paul +3
2026-10-08
本文提出Ledger,一种从自我中心视频构建的持久3D物体记忆,能记录物体位置、历史与上下文描述,显著提升空间问答准确率和物体定位精度。
Sammuel R. Silva, Vander L. S. Freitas +3
2026-10-08
本文提出 HCPN-GCN,通过引入图卷积网络和锥形原型,显著抑制层次原型网络在持续图学习中的原型膨胀,在六个基准上以近零遗忘取得最高平均分类精度,同时将原子原型数量压缩至原模型的约 1/30。
Ci Zhang, Enfu Nan +7
2026-10-08
CIRRA是一个双层次框架,可在机器人执行任务时,通过保持既有计划结构并局部插入新指令的方式,解决因重新规划导致的模糊、不一致与冗余问题。