快照更新时间: 2026-08-24
Aman Sunesh, Ali Alshehhi +1
2026-08-21
RequestRouter是一个轻量级请求边界控制器,通过为每个请求动态选择最优推理模式,在单GPU大语言模型推理中实现延迟降低和能效提升,无需重新训练或修改模型。
Reza Khanmohammadi, Kundan Thind +1
2026-08-21
本文评估了视觉语言模型在医学视觉问答中的九种置信度估计器,发现标准指标具有误导性,且没有一个估计器能在所有领域和模型中始终最优。在20%错误容忍度下,最强估计器可在分布无关保证下安全推迟约四分之一的放射学病例,但对病理学病例几乎无效。置信度估计器的实用角色是在临床监督下进行校准分诊,而非自主推迟。
Yao Liang, Dongcheng Zhao +5
2026-08-21
本文提出了DiverValue-Bench,一个覆盖74个国家/地区、包含23,763个实例的群体感知基准,用于评估大语言模型在多维价值对齐中的文化和人口差异。实验表明,现有模型存在显著的地域和人口偏差,而基于LoRA和DPO的轻量偏好微调能有效改善对齐效果。
Yongliang Zhang, Feng Song +7
2026-08-21
SceneGTMM是一种基于共形映射场景相对策略的可迁移图神经网络-Transformer双图交互地图匹配框架,通过GNN与Transformer分别捕捉局部拓扑和全局时序依赖,并利用CRF增强结构化预测,在定位误差16-50米的多源轨迹上实现超过80%的准确率,跨城市迁移性能优于现有方法。
Yuanhao Ban, Jiaqi Feng +4
2026-08-21
Stream4D 通过用前馈 4D 重建奖励替代静态 3D 重建奖励,并引入运动先验,解决了流式自回归视频生成中的几何漂移和运动退化问题,提升了长序列视频的运动保持和人类偏好。
Eunsoo Im, Junghun Suh +2
2026-08-21
CVSD-Reg通过将视觉基础模型的语义先验蒸馏到LiDAR表示中,实现了鲁棒的全局点云配准,在多个数据集上显著超越几何方法,且无需相机输入或后处理。
Xuan He, Cong Wei +20
2026-08-21
本文提出VGI-bench基准,系统评估视频生成模型的视觉推理能力,发现当前最强模型仅达51.0%正确率,且后期去噪步骤主要细化早期假设而非纠正错误,自我纠正能力有限。
Yiwei Li, Jiannong Cao +5
2026-08-21
S2GS通过结构化时序稀疏性选择性地更新高斯残差,在自由视点视频流式重建中显著减少每帧优化时间和存储占用,在边缘设备上实现60+FPS实时渲染,同时保持视觉质量。
Haoqiang Kang, Yinpeng Chen +6
2026-08-21
本文提出 Scaffolding Minds,通过改进潜在推理的两阶段训练范式,在监督微调阶段学习专用脚手架编码器以优化潜在表示,并在强化学习阶段学习采样器的均值和方差以探索替代潜在轨迹,从而在多个视觉推理基准上取得显著提升。
Chenxi Shao, Bozhong Wang +7
2026-08-21
StreamSoccer是一个事件驱动的流式足球解说系统,通过事件记忆管理视频流,支持当前事件描述、近期总结和历史回忆,在有限计算资源下高效运行,在多个解说任务上取得领先性能。
Nicolò Savioli
2026-08-21
该工作在不进行任何梯度更新(微调)的情况下,通过对预训练4D骨干网络进行推理时的三种解码配置集成,以0.58356 APD的成绩在PhysAI动态4D重建挑战赛中位列第三,超过所有微调尝试。
Yunseo Lee, Hyun Jun Kim +2
2026-08-21
本文提出一种框架,通过分离训练时和推理时对齐来增强医学图像字幕的临床对齐性,使用多编码器、Q-Former、LLaMA解码器,结合UMLS概念辅助学习和强化学习MedPAIR-SCST,实验表明该方法可提升字幕的临床可信度。
François Costa, Raphael Kreft +7
2026-08-21
本文提出UPAL,一种在单一轻量级架构中联合提取点、线特征及其描述子的统一高效方法,通过共享骨干与加速后处理,实现计算效率大幅提升,性能媲美或超越现有方法。
Jakub Micorek, Mateusz Koziński +1
2026-08-21
本文提出STEP框架,通过PCA将骨架序列投影到紧凑白化空间,解决基于能量的模型在添加噪声时产生物理不可能姿态的问题,并引入置信度加权机制,在UBnormal数据集上取得90.1% AUROC,优于现有方法12.2%。
Tim Elsner, Nicole McNally +2
2026-08-21
该论文展示通过重新设计视觉语言模型管道,可在兽医放射学中从零训练出超越大型基础模型的领域专家模型,无需依赖外部数据,显著提升了诊断报告生成性能。
Minghang Zheng, Jingli Wei +2
2026-08-21
本文提出图像消歧视频时序定位(ID-VTG)任务,利用参考图像和文本描述的多模态查询,精确定位特定实例执行描述动作的视频片段。构建了两个基准数据集IDVTG-Gym和IDVTG-InternVid,并提出了视觉引导消歧聚合(VGD-Agg)框架,采用双分支快慢架构,通过Compare Token和Depress Value增强区分能力,在基准上取得了最优性能。
Cong Wang, Liyan Wang +5
2026-08-21
UHDformer++ 是一种通用 Transformer 框架,通过四个协同学习空间(高分辨率、低分辨率、超分辨率和融合重建)高效处理超高清图像复原任务,并引入 FR-CMT 和 ACM 模块跨空间传递特征,参数减少 86% 以上,在五个任务上取得显著性能提升。
Radim Spetlik, David Futschik +5
2026-08-21
本文提出了一种从视频中去除眼镜的迁移框架,通过从商用生成模型提取合成人脸并经过三阶段结构过滤保留身份、表情和姿态,再结合物理镜头模拟生成配对数据,训练出JFSnet模型,在保持高保真度和结构准确性的同时实现27.68 FPS推理速度,并在感知研究中优于现有方法。
Yufei Liu, Xixi Wang +9
2026-08-21
本文提出DreamHand,一种将视频扩散模型重新用作确定性几何编码器的离线框架,结合确定性清洁潜变量编码器和双向时空解码器,能从以自我为中心的视频中恢复连续的双手3D轨迹,即使在严重遮挡和手部出画情况下也能实现,并在多个基准上大幅超越现有方法。
Hengyuan Xu, Qixun Wang +6
2026-08-21
WithEveryone 是一个用于生成包含多达十个参考身份的群组图像的统一框架,通过注入身份标记、预测身份布局计划并渲染为视觉条件,结合布局锚定身份损失和身份表征强制,实现了更好的身份保持和更少的复制粘贴伪影。
Li Zhao, Rui Sun +6
2026-08-21
ContestTrade是一个多智能体交易系统,通过内部竞争机制在数据团队和研究团队间分配资源,提升交易决策鲁棒性,在A股回测中表现优于基线。
Bin Zhu, Yi Xie +1
2026-08-21
本文研究有限人工标注下,何时使用低维聚合模型(标量/可靠性)与无限制联合输出表来校准LLM评委面板,提出有限校准制度图及FCPS方法,在真实基准上标量聚合常优于联合表,而在高交互合成数据中联合表需捕获交互项。部署关键在于下一评委信息是否可估计。
Tingyi Liu, Kun Li +6
2026-08-21
XInsight Lab在IJCAI 2026微手势分类挑战赛中提出多模态集成框架,融合自监督RGB模型与监督多流模型,以74.419% top-1准确率夺冠,超越此前最佳结果1.206个百分点。
Jai Kumar Sharma, Amartya Dutta
2026-08-21
该论文审计了在分布偏移下,分体式共形预测作为零样本视觉语言模型(VLM)的弃权层时的表现,发现尽管边际覆盖仍较高,但最差类别的条件覆盖会崩溃至接近零,边际覆盖不能作为尾部类别的安全保证。
Manasi Nerurkar, Ali A. Minai
2026-08-21
本文提出了一种名为HiRA-CAM的改进方法,通过自适应地利用CNN所有层的激活图,生成更聚焦的显著性图,在对象分类任务上优于LayerCAM和Grad-CAM。
Bo Ma
2026-08-21
本文提出了一种无标签精度优化方法(LFPR),通过将预测区域路由到高分辨率裁剪并重新定位,利用几何约束筛选候选框,无需额外标注即可提升冻结视觉语言模型的边界框预测精度。
Jiawei Feng, Jiancan Wu +4
2026-08-21
本文提出感知增强对齐DPO(PEA-DPO)框架,旨在解决多模态大语言模型对齐中的视觉不敏感性问题,通过显式利用视觉偏好信号,有效缓解跨图像和图像内不敏感,从而减少幻觉并提升多模态对齐性能。
Wenshuai Yao, Wenyong Zhou
2026-08-21
本文研究模拟存内计算非理想性对扩散变换器采样的影响,发现无分类器引导残差被显著衰减和旋转,并提出一种无需重新训练的采样端引导尺度重校准方法,通过调整引导尺度恢复生成质量。
Johannes Künzel, Peter Eisert +1
2026-08-21
本文提出基于强化学习的稀疏关键点提取与匹配方法,仅利用正图像对中的几何一致性信号进行奖励,无需负样本,实现了弱监督训练,并在基准测试和医学视频上取得有竞争力的结果。
Ling Zhou, Yihao Huang +5
2026-08-21
本文提出TempJail,一种利用字幕序列的时序优化对大型视觉语言模型进行黑盒视频越狱的框架,显著提升了攻击成功率。
Daniele Rege Cambrin, Francesco Rossi +1
2026-08-21
本文提出一种基于地理隔离度排序的课程学习策略,用于遥感图像自监督预训练,仅利用地理元数据,无需图像解码或模型反馈,在大幅降低训练预算的同时提升了多个下游任务的性能,并产生更高维且更均匀的嵌入空间。
Airin Akter Tania, Md Raihan Khan +1
2026-08-21
AutoLumNet 将单次曝光校正分解为全局单调色调曲线与受限局部残差,通过密度积分构造保证严格单调性,并利用 Wasserstein-2 最优传输驱动曲线学习,在多个基准上取得 SOTA 性能且零样本泛化。
Guoxing Sun, Heming Zhu +4
2026-08-21
本文提出AvatarDynamizer,一种生成式方法,将静态3D化身转化为具有逼真表面动态的4D化身,通过纹理空间动力学嵌入和条件纹理生成,并利用新的大规模多视图数据集实现。
Magnus Kaufmann Gjerde, Joakim Bruslund Haurum +4
2026-08-21
本文提出基于贝塔曲面片的可微点渲染方法,利用伴随光传输为几何和外观提供梯度,在稀疏视角重建中以平均仅267个曲面片实现最低Chamfer距离,比最强点基线降低28.5%。
Muhammad Asad Ali, Nadia Robertini +1
2026-08-21
HandMvNet是一种实时多视角3D手部运动与形状估计方法,通过注意力融合机制消除相机参数依赖,在保持高精度的同时大幅减少推理时间。
Joonas Järve, Halil Ibrahim Aysel +2
2026-08-21
本文通过可视化视觉Transformer(ViT)训练过程中网络深度和训练时间两个维度,利用稀疏自编码器从CLS令牌表征中提取稀疏特征,研究特征迁移等动态,发现迁移集中在训练早期、更偏向浅层,且深层特征稳定更早。
Pietro Mascagni, Julia Alekseenko +11
2026-08-21
AI-ColoWorkflow是一个基于深度学习的模型,能够自动分析微创结直肠手术视频中的手术阶段和步骤,在阶段识别上全局模型优于单中心/单术式模型,而步骤识别在特定术式上仍具优势。
Mosharof Hossain, Md Rabiul Islam +3
2026-08-21
本文提出了一种提示条件通道注意力机制(PCCA)和PROMISE-Net框架,通过深层层次化集成语义提示,实现交互式医学图像分割中特征的自适应重校准,在多个基准上显著提升了分割精度。
Liang Xu, Chengqun Yang +7
2026-08-21
论文提出了Inter-X++大规模高保真人-人交互数据集和统一建模框架OpenHHI,解决了现有数据集低精度、缺少手部动作和标注不足的问题,通过标准化评估协议和统一表示,在交互生成与理解任务上均达到最优性能。
Yinfeng Wang, Zhiyuan Yao +3
2026-08-21
无关上下文会系统性地影响多模态大语言模型的视觉判断,其影响并非随机噪声,而是遵循可估计的仿射变换规律。
Ru Zhang, Weijie Qiu
2026-08-21
SPyCE框架将多模态推理轨迹提炼为可复用的分层技能库,并与策略协同进化,在8个基准上显著优于现有方法。
Aarik Gulaya
2026-08-21
本文提出表征准确性概念,用于衡量AI系统对用户个人解读的忠实程度。通过将个人数据压缩为行为规范作为语言模型的上下文,在基准测试中,该方法显著提升了表征准确性,几乎消除了模型犹豫,且以约25倍的上下文成本节约实现了原始语料库的大部分性能,尤其对预训练中代表性不足的个体提升最大,但在需要回忆的问题上可能产生干扰。
Eric Bigelow, Amir Zur +8
2026-08-21
大语言模型推理具有随机性,重采样分析可揭示推理链的不确定性,但成本高。本文提出统计模型平滑低采样数据,捕捉稳定不确定性模式,大幅降低采样成本。
Sparsh Garg, Yi-Wen Chen +2
2026-08-21
本文提出了CAViAR,一个包含2249个真实事故视频的基准,用于评估自动驾驶系统的事故因果推理能力。实验表明,现有视觉语言模型能识别环境上下文,但在事故责任归属和规则违反推理上表现大幅下降,揭示了感知与推理之间的差距。
Luis F. Gomez, Julian Fierrez +6
2026-08-21
本文介绍VideoRun2D Demo框架,利用人体姿态估计器进行短跑生物力学分析,评估关节角度误差,并展示后处理模块可降低误差,验证了姿态追踪在跑步生物力学中的价值。
Bowen Cui, Weijie Wang +8
2026-08-21
Block3D通过分块扩散框架将文本到3D生成速度提升5.15倍,从25.71秒降至4.99秒,且不牺牲几何保真度。
Honglie Wang, Jia Sun +12
2026-08-21
TextRefine是一种针对产品海报文本编辑的后训练框架,通过结合监督微调与操作特定的奖励优化,解决了文本插入和替换中的文本遗漏、错误放置及字形失真问题,并引入OpenTextEdit数据集,实验表明其性能优于现有基线。
Yunhao Zhao, Haoying Sun +6
2026-08-21
本文构建了首个进攻回合级篮球视频数据集PL-NBA,包含60场NBA比赛的11000个完整进攻回合片段及31567个带标注事件,支持事件识别、视频描述、时序动作定位和动作预测等任务,现有方法表现有限,证明该数据集具有挑战性。
Mohammad Arif Ul Alam
2026-08-21
本文研究水下机器人感知中视觉退化时的跨模态鲁棒性,利用冻结的DINOv2视觉编码器和声纳,提出退化感知自适应门控融合方法,在极端退化下将视觉-声纳融合的平衡准确率从0.4610提升至0.6152,相对提升33.5%,声纳贡献从干净条件下的14.2%自适应增至41.3%。
Xuan Yang, Xiaohan Yuan +5
2026-08-21
本文提出了一种从单帧舒张末期(ED)双心室网格合成全周期运动的方法,通过区域特异性和表型自适应框架,结合运动信息功能分区与条件潜在流,显著提升了合成精度与生理一致性,并在多个数据集上优于现有方法。
Xiang Gu, Jian Sun +1
2026-08-21
本文提出一种耦合最优传输框架,利用少量标注地标引导分布间形变场的恢复,通过互一致性约束将传输计划和形变场耦合,实现从稀疏几何监督中恢复传输映射,并在形状匹配中验证有效性。
Niklas Voigt, Hartmut Surmann
2026-08-21
本文提出了一种数据驱动方法,使微型无人机在无GPS和通信受限的室内环境中,利用360度相机学习偏航控制器,自主导航至开阔区域以保存传感器数据,主要面向灾害应急响应。
Sidi Mohamed Sid'El Moctar, Nicolas Vitry +1
2026-08-21
3D-CurvSegFlow是一种基于流匹配的三维曲线结构分割模型,通过从简单分布到血管表示的连续变换,实现高效且精准的细化,在多个解剖部位和模态上优于现有方法。
Joan Perez, Giovanni Fusco
2026-08-21
本文利用SAGAI工作流与视觉语言模型对尼斯东北部郊区街景品质进行大规模评估,发现步行友好特征仅存在于少数街景中。
Siphesihle Sithungu
2026-08-21
本文研究了结构化、无梯度的免疫亲和力能否使深度人工免疫网络成为无需回放的视觉类别增量表示记忆学习器,并通过响应图保留和自适应潜在重组等机制,在多个数字数据集上取得了高精度。
Zhaokun He, Kangbiao Shi +5
2026-08-21
提出DPC-Net,结合退化-语义耦合先验和底层视觉先验,通过VLM监督和知识库实现高质量图像恢复,性能优于现有方法。
Marko Haralović, Akash Ramakrishnan +1
2026-08-21
G3Ego 利用注视作为结构线索,从稀疏帧构建动作场景图,高效地表示第一人称视频中的关键手物交互,无需大规模视频预训练即可在动作识别与预测中取得竞争性能,并在类别不平衡下提升 Macro-F1。
Weiliang Huang, Huanrong Liu +6
2026-08-21
本文提出了一种联合预测手术未来视觉状态和器械轨迹的世界-动作模型,通过块状自回归滚动策略,证明初步可行性,但长期预测仍存在视觉退化和轨迹累积误差。
Taihang Hu, Zhao Wang +19
2026-08-21
Swift-Image是一个紧凑的统一模型,能同时处理文本到图像生成、单图编辑和多图编辑,仅用6B参数和243K GPU小时即达到领先性能,压缩至3B几乎无性能损失。
Sanjeev Khatiwada
2026-08-21
本文介绍了首个尼泊尔语为主的上下文不匹配错误信息基准NepOOC,包含1090个图像-文本对,评估发现纯文本模型性能与多模态模型相当,图像模型接近随机,数据集扩展比架构改进更有效。
Filip Sondej, Yushi Yang +1
2026-08-21
现有LLM遗忘方法容易被微调或少量示例恢复,且损害通用能力。本文提出RepSelect方法,通过选择性编辑遗忘集特定表示,实现深度遗忘,显著降低恢复概率并保持通用能力。
Jingyi Sun, Qianli Wang +3
2026-08-21
本文提出 FaithMATE,一个统一偏好对齐接口,用于优化模型的链式思维(CoT)忠实性,并发现上下文与参数两种忠实性范式正相关但不对称,且上下文指标间存在权衡,表明 CoT 忠实性需多面优化。
Baptiste Rossigneux, Inna Kucher +2
2026-08-21
ClustRS是一种无需训练的令牌剪枝方法,通过注意力加权聚类和残差收缩两步,从视觉令牌中选出鲁棒性强的代表令牌,大幅降低计算量并提升抗噪能力,在极端条件下可减少97%令牌仍保持高性能。
Abdullah Ahmed Ali, Mohammed Thamer Abdulhadi +2
2026-08-21
本文提出面向阿拉伯历史手稿的转录系统Phoenix(CNN-BiLSTM-CTC识别器)与Athar(证据感知审校流程)。Phoenix通过文档感知回放、81符号编解码及遗忘防护实现多领域适应,将两组大样本的字符加权CER从19.98%降至14.93%(相对误差降低25.3%)。Athar保留视觉阅读、公开有限候选、保守使用语言模型,并导出可审计的TEI/PAGE-XML记录,强调手稿转录应作为可审计的证据管理而非无声文本替换。
Libo Chen, Souvik Ghosh +3
2026-08-21
提出一种基于多速度联合扩散的条件机制,利用插件校正项在推理时施加条件控制,推导出条件SDE与概率流ODE采样器,并通过log-Fokker-Planck残差正则化提升ODE采样质量,在条件图像生成任务中表现优异。
Md Mahmuddun Nabi Murad, Bora San Turgut +1
2026-08-21
提出Mix&Fix-Net,一种双阶段混合器模型,融合AIS与视觉数据预测小船轨迹,并引入新视频数据集,在多个指标上优于现有方法。
Yigit Ekin, Enes Sanli +3
2026-08-21
本文提出BeyondMasks基准和CORE评估协议,用于评估视频对象移除中的因果一致性,即不仅移除对象本身,还需消除其引发的物理效应。现有方法在掩码区域保真度上表现良好,但在去除阴影、反射等次生效应时存在系统性缺陷。
Bashirul Azam Biswas, Amartya Bhattacharya +4
2026-08-21
提出多示踪剂多模态自监督框架MUST-PET,结合上下文感知掩码重建,在全身PET-CT病变分割中实现标签高效且泛化能力强的分割。
Jingtao Zhang, Haorui Gao +2
2026-08-21
SEFS提出一种无风格编码器的条件化框架,通过随机低分辨率裁剪形成风格令牌,避免使用成对数据或额外视觉编码器,从而减少数据成本并抑制全局布局泄露,在艺术风格化中提升内容一致性与风格亲和度。
Alin-Ionut Popa
2026-08-21
Q-Guide是一个文档视觉问答智能体,通过逐步调用工具(如文本读取、区域放大、定位)来弥补感知缺失,在DocVQA2026和Manga109上显著优于直接提示和多智能体系统,且增益来自精准感知引导而非复杂控制逻辑。
Lan Guo, Mengling Li +5
2026-08-21
Core-KAN 提出了一种连续相对尺度卷积算子,通过解耦几何尺度自适应与内容依赖滤波,利用 KAN 生成器将深度核表示为连续坐标函数,结合尺度控制器和混合控制器,以低秩动态卷积形式高效实现任意分辨率的尺度自适应滤波,显著超越现有动态卷积基线。
Hangyu Tian, Zhenqi He +2
2026-08-21
该论文提出DIFFCZSL框架,通过将预训练扩散模型的中间表示注入CLIP嵌入空间,结合对比学习,无需额外推理成本,提升了组合零样本学习的性能。
Shangbo Yuan, Jie Xu +2
2026-08-21
本文提出创新框架,通过共蒸馏策略和双引导学习方案,提升开放词汇3D目标检测中新物体发现的可靠性和模型训练的鲁棒性,在SUN RGB-D和ScanNetV2上取得显著性能提升。
Marcus Valtonen Örnhag, Alberto Jaenal +1
2026-08-21
该论文提出利用IMU重力向量和特征局部几何信息,只需少量对应点(单个仿射对应或两个方向协变特征)即可联合估计绝对位姿和焦距,比传统四点法更具鲁棒性和效率。
Linhan Cao, Siyuan Li +9
2026-08-21
本文提出针对对抗性OCR的定位感知基准AdvSpot和训练框架ArmorOCR,通过两阶段训练(在策略自蒸馏与分组相对策略优化)提升大模型对对抗性视觉文本的定位与识别能力,同时保持通用OCR性能。
Siam Tahsin Bhuiyan, Rashedur Rahman +6
2026-08-21
本文提出PelviNeXt,一种模态无关的混合架构,用于解决女性盆腔影像(如PCOS超声和盆腔骨折X光)数据稀缺问题。该架构在PCOSGen去重数据集上设定了首个完整性审计基准,并在盆腔骨折X光数据集上超越了现有最佳结果。
Shaoxuan Wang, Guangting Zheng +5
2026-08-21
RoMAN-Flow 提出了一种离线强化学习框架,通过无采样的优势加权似然目标优化自回归归一化流策略,并将其蒸馏为一步动作生成器,从而在保持策略性能的同时显著降低推理延迟。
Nivetha Jayakumar, Hannah Kim +2
2026-08-21
本文提出CalcSeg框架,利用置信度感知的潜在上下文课程学习,从单堆栈2D LGE-CMR图像中融合3D特征表示,以鲁棒地分割心肌疤痕,特别在挑战性病例上表现显著提升。
Yudong Jin, Tao Xie +7
2026-08-21
4DAnyone 从单目未标定视频重建 4D 人体,通过生成重建级多视角一致视频并提升到 4D 高斯泼溅(4DGS),解决现有相机控制视频扩散模型在大量目标视角下的一致性瓶颈。
Dongcheng Zhao, Sicheng Shen +7
2026-08-21
针对脉冲Transformer中脉冲自注意力因二值查询/键导致关系稀疏离散、抑制弱关系与局部上下文的问题,提出脉冲局部交互与自适应互补融合,在多种任务中取得一致提升。