每日论文

快照更新时间: 2026-08-24


2026-08-21
ARXIV

RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference

Aman Sunesh, Ali Alshehhi +1

2026-08-21

RequestRouter是一个轻量级请求边界控制器,通过为每个请求动态选择最优推理模式,在单GPU大语言模型推理中实现延迟降低和能效提升,无需重新训练或修改模型。

ARXIV

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

Reza Khanmohammadi, Kundan Thind +1

2026-08-21

本文评估了视觉语言模型医学视觉问答中的九种置信度估计器,发现标准指标具有误导性,且没有一个估计器能在所有领域和模型中始终最优。在20%错误容忍度下,最强估计器可在分布无关保证下安全推迟约四分之一的放射学病例,但对病理学病例几乎无效。置信度估计器的实用角色是在临床监督下进行校准分诊,而非自主推迟。

ARXIV

DiverValue-Bench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values

Yao Liang, Dongcheng Zhao +5

2026-08-21

本文提出了DiverValue-Bench,一个覆盖74个国家/地区、包含23,763个实例的群体感知基准,用于评估大语言模型在多维价值对齐中的文化和人口差异。实验表明,现有模型存在显著的地域和人口偏差,而基于LoRA和DPO的轻量偏好微调能有效改善对齐效果。

ARXIV

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

Yongliang Zhang, Feng Song +7

2026-08-21

SceneGTMM是一种基于共形映射场景相对策略的可迁移图神经网络-Transformer双图交互地图匹配框架,通过GNN与Transformer分别捕捉局部拓扑和全局时序依赖,并利用CRF增强结构化预测,在定位误差16-50米的多源轨迹上实现超过80%的准确率,跨城市迁移性能优于现有方法。

ARXIV

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Yuanhao Ban, Jiaqi Feng +4

2026-08-21

Stream4D 通过用前馈 4D 重建奖励替代静态 3D 重建奖励,并引入运动先验,解决了流式自回归视频生成中的几何漂移和运动退化问题,提升了长序列视频的运动保持和人类偏好。

ARXIV

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

Eunsoo Im, Junghun Suh +2

2026-08-21

CVSD-Reg通过将视觉基础模型的语义先验蒸馏到LiDAR表示中,实现了鲁棒的全局点云配准,在多个数据集上显著超越几何方法,且无需相机输入或后处理。

ARXIV

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

Xuan He, Cong Wei +20

2026-08-21

本文提出VGI-bench基准,系统评估视频生成模型的视觉推理能力,发现当前最强模型仅达51.0%正确率,且后期去噪步骤主要细化早期假设而非纠正错误,自我纠正能力有限。

ARXIV

S$^2$GS: Structured Sparse Gaussian Streaming for Efficient Free-Viewpoint Video Reconstruction on Edge-IoT Devices

Yiwei Li, Jiannong Cao +5

2026-08-21

S2GS通过结构化时序稀疏性选择性地更新高斯残差,在自由视点视频流式重建中显著减少每帧优化时间和存储占用,在边缘设备上实现60+FPS实时渲染,同时保持视觉质量。

ARXIV

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

Haoqiang Kang, Yinpeng Chen +6

2026-08-21

本文提出 Scaffolding Minds,通过改进潜在推理的两阶段训练范式,在监督微调阶段学习专用脚手架编码器以优化潜在表示,并在强化学习阶段学习采样器的均值和方差以探索替代潜在轨迹,从而在多个视觉推理基准上取得显著提升。

ARXIV

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

Chenxi Shao, Bozhong Wang +7

2026-08-21

StreamSoccer是一个事件驱动的流式足球解说系统,通过事件记忆管理视频流,支持当前事件描述、近期总结和历史回忆,在有限计算资源下高效运行,在多个解说任务上取得领先性能。

ARXIV

Gallileo-4D: Frozen Backbone Ensemble for Dynamic 4D Reconstruction

Nicolò Savioli

2026-08-21

该工作在不进行任何梯度更新(微调)的情况下,通过对预训练4D骨干网络进行推理时的三种解码配置集成,以0.58356 APD的成绩在PhysAI动态4D重建挑战赛中位列第三,超过所有微调尝试。

ARXIV

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

Yunseo Lee, Hyun Jun Kim +2

2026-08-21

本文提出一种框架,通过分离训练时和推理时对齐来增强医学图像字幕的临床对齐性,使用多编码器、Q-Former、LLaMA解码器,结合UMLS概念辅助学习和强化学习MedPAIR-SCST,实验表明该方法可提升字幕的临床可信度。

ARXIV

Unified and Efficient Point-Line Local Features

François Costa, Raphael Kreft +7

2026-08-21

本文提出UPAL,一种在单一轻量级架构中联合提取点、线特征及其描述子的统一高效方法,通过共享骨干与加速后处理,实现计算效率大幅提升,性能媲美或超越现有方法。

ARXIV

STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection

Jakub Micorek, Mateusz Koziński +1

2026-08-21

本文提出STEP框架,通过PCA将骨架序列投影到紧凑白化空间,解决基于能量的模型在添加噪声时产生物理不可能姿态的问题,并引入置信度加权机制,在UBnormal数据集上取得90.1% AUROC,优于现有方法12.2%。

ARXIV

V-REX: Efficient Specialist VLM Training for Veterinary X-Rays

Tim Elsner, Nicole McNally +2

2026-08-21

该论文展示通过重新设计视觉语言模型管道,可在兽医放射学中从零训练出超越大型基础模型的领域专家模型,无需依赖外部数据,显著提升了诊断报告生成性能。

ARXIV

ID-VTG: Image-Disambiguated Video Temporal Grounding

Minghang Zheng, Jingli Wei +2

2026-08-21

本文提出图像消歧视频时序定位(ID-VTG)任务,利用参考图像和文本描述的多模态查询,精确定位特定实例执行描述动作的视频片段。构建了两个基准数据集IDVTG-Gym和IDVTG-InternVid,并提出了视觉引导消歧聚合(VGD-Agg)框架,采用双分支快慢架构,通过Compare Token和Depress Value增强区分能力,在基准上取得了最优性能。

ARXIV

Ultra-High-Definition Restoration Transformers with Correlation Matching Transformation

Cong Wang, Liyan Wang +5

2026-08-21

UHDformer++ 是一种通用 Transformer 框架,通过四个协同学习空间(高分辨率、低分辨率、超分辨率和融合重建)高效处理超高清图像复原任务,并引入 FR-CMT 和 ACM 模块跨空间传递特征,参数减少 86% 以上,在五个任务上取得显著性能提升。

ARXIV

Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal

Radim Spetlik, David Futschik +5

2026-08-21

本文提出了一种从视频中去除眼镜的迁移框架,通过从商用生成模型提取合成人脸并经过三阶段结构过滤保留身份、表情和姿态,再结合物理镜头模拟生成配对数据,训练出JFSnet模型,在保持高保真度和结构准确性的同时实现27.68 FPS推理速度,并在感知研究中优于现有方法。

ARXIV

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

Yufei Liu, Xixi Wang +9

2026-08-21

本文提出DreamHand,一种将视频扩散模型重新用作确定性几何编码器的离线框架,结合确定性清洁潜变量编码器双向时空解码器,能从以自我为中心的视频中恢复连续的双手3D轨迹,即使在严重遮挡和手部出画情况下也能实现,并在多个基准上大幅超越现有方法。

ARXIV

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

Hengyuan Xu, Qixun Wang +6

2026-08-21

WithEveryone 是一个用于生成包含多达十个参考身份的群组图像的统一框架,通过注入身份标记、预测身份布局计划并渲染为视觉条件,结合布局锚定身份损失身份表征强制,实现了更好的身份保持和更少的复制粘贴伪影。

ARXIV

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

Li Zhao, Rui Sun +6

2026-08-21

ContestTrade是一个多智能体交易系统,通过内部竞争机制在数据团队和研究团队间分配资源,提升交易决策鲁棒性,在A股回测中表现优于基线。

ARXIV

A Finite-Calibration Regime Map for LLM Judge Panels

Bin Zhu, Yi Xie +1

2026-08-21

本文研究有限人工标注下,何时使用低维聚合模型(标量/可靠性)与无限制联合输出表来校准LLM评委面板,提出有限校准制度图及FCPS方法,在真实基准上标量聚合常优于联合表,而在高交互合成数据中联合表需捕获交互项。部署关键在于下一评委信息是否可估计。

ARXIV

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

Tingyi Liu, Kun Li +6

2026-08-21

XInsight Lab在IJCAI 2026微手势分类挑战赛中提出多模态集成框架,融合自监督RGB模型与监督多流模型,以74.419% top-1准确率夺冠,超越此前最佳结果1.206个百分点。

ARXIV

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

Jai Kumar Sharma, Amartya Dutta

2026-08-21

该论文审计了在分布偏移下,分体式共形预测作为零样本视觉语言模型(VLM)的弃权层时的表现,发现尽管边际覆盖仍较高,但最差类别的条件覆盖会崩溃至接近零,边际覆盖不能作为尾部类别的安全保证。

ARXIV

HiRA-CAM: Preserving Fine-Grained Spatial Relevance in Gradient-Based Visual Explanations

Manasi Nerurkar, Ali A. Minai

2026-08-21

本文提出了一种名为HiRA-CAM的改进方法,通过自适应地利用CNN所有层的激活图,生成更聚焦的显著性图,在对象分类任务上优于LayerCAM和Grad-CAM。

ARXIV

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

Bo Ma

2026-08-21

本文提出了一种无标签精度优化方法(LFPR),通过将预测区域路由到高分辨率裁剪并重新定位,利用几何约束筛选候选框,无需额外标注即可提升冻结视觉语言模型的边界框预测精度。

ARXIV

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

Jiawei Feng, Jiancan Wu +4

2026-08-21

本文提出感知增强对齐DPO(PEA-DPO)框架,旨在解决多模态大语言模型对齐中的视觉不敏感性问题,通过显式利用视觉偏好信号,有效缓解跨图像和图像内不敏感,从而减少幻觉并提升多模态对齐性能。

ARXIV

When Guidance Goes Off-Scale: Recalibrating Diffusion Transformers under Analog Compute-in-Memory Nonidealities

Wenshuai Yao, Wenyong Zhou

2026-08-21

本文研究模拟存内计算非理想性扩散变换器采样的影响,发现无分类器引导残差被显著衰减和旋转,并提出一种无需重新训练的采样端引导尺度重校准方法,通过调整引导尺度恢复生成质量。

ARXIV

RIPE++: Reinforced Keypoint Learning from Positive Pairs Only

Johannes Künzel, Peter Eisert +1

2026-08-21

本文提出基于强化学习的稀疏关键点提取与匹配方法,仅利用正图像对中的几何一致性信号进行奖励,无需负样本,实现了弱监督训练,并在基准测试和医学视频上取得有竞争力的结果。

ARXIV

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

Ling Zhou, Yihao Huang +5

2026-08-21

本文提出TempJail,一种利用字幕序列的时序优化对大型视觉语言模型进行黑盒视频越狱的框架,显著提升了攻击成功率。

ARXIV

Far from the Crowd: Scalable Self-Supervised Learning via Geographic Isolation

Daniele Rege Cambrin, Francesco Rossi +1

2026-08-21

本文提出一种基于地理隔离度排序的课程学习策略,用于遥感图像自监督预训练,仅利用地理元数据,无需图像解码或模型反馈,在大幅降低训练预算的同时提升了多个下游任务的性能,并产生更高维且更均匀的嵌入空间。

ARXIV

AutoLumNet: Monotone Optimal Transport for Single-Shot Exposure Correction

Airin Akter Tania, Md Raihan Khan +1

2026-08-21

AutoLumNet 将单次曝光校正分解为全局单调色调曲线与受限局部残差,通过密度积分构造保证严格单调性,并利用 Wasserstein-2 最优传输驱动曲线学习,在多个基准上取得 SOTA 性能且零样本泛化。

ARXIV

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

Guoxing Sun, Heming Zhu +4

2026-08-21

本文提出AvatarDynamizer,一种生成式方法,将静态3D化身转化为具有逼真表面动态的4D化身,通过纹理空间动力学嵌入和条件纹理生成,并利用新的大规模多视图数据集实现。

ARXIV

Point-Based 3D Reconstruction from Sparse Views under Known Illumination

Magnus Kaufmann Gjerde, Joakim Bruslund Haurum +4

2026-08-21

本文提出基于贝塔曲面片可微点渲染方法,利用伴随光传输为几何和外观提供梯度,在稀疏视角重建中以平均仅267个曲面片实现最低Chamfer距离,比最强点基线降低28.5%。

ARXIV

HandMvNet: Real-Time 3D Hand Pose Estimation Using Multi-View Cross-Attention Fusion

Muhammad Asad Ali, Nadia Robertini +1

2026-08-21

HandMvNet是一种实时多视角3D手部运动与形状估计方法,通过注意力融合机制消除相机参数依赖,在保持高精度的同时大幅减少推理时间。

ARXIV

Feature Evolution and Migration during Vision Transformer Training

Joonas Järve, Halil Ibrahim Aysel +2

2026-08-21

本文通过可视化视觉Transformer(ViT)训练过程中网络深度和训练时间两个维度,利用稀疏自编码器从CLS令牌表征中提取稀疏特征,研究特征迁移等动态,发现迁移集中在训练早期、更偏向浅层,且深层特征稳定更早。

ARXIV

Artificial Intelligence for Workflow Analysis in Colorectal Surgery: A Multicentric, Cross-Procedural Development and Generalization Study

Pietro Mascagni, Julia Alekseenko +11

2026-08-21

AI-ColoWorkflow是一个基于深度学习的模型,能够自动分析微创结直肠手术视频中的手术阶段和步骤,在阶段识别上全局模型优于单中心/单术式模型,而步骤识别在特定术式上仍具优势。

ARXIV

Prompt-Conditioned Channel Attention for Hierarchical Feature Modulation toward Anatomy-Agnostic Segmentation

Mosharof Hossain, Md Rabiul Islam +3

2026-08-21

本文提出了一种提示条件通道注意力机制(PCCA)和PROMISE-Net框架,通过深层层次化集成语义提示,实现交互式医学图像分割中特征的自适应重校准,在多个基准上显著提升了分割精度。

ARXIV

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Liang Xu, Chengqun Yang +7

2026-08-21

论文提出了Inter-X++大规模高保真人-人交互数据集和统一建模框架OpenHHI,解决了现有数据集低精度、缺少手部动作和标注不足的问题,通过标准化评估协议和统一表示,在交互生成与理解任务上均达到最优性能。

ARXIV

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

Yinfeng Wang, Zhiyuan Yao +3

2026-08-21

无关上下文会系统性地影响多模态大语言模型的视觉判断,其影响并非随机噪声,而是遵循可估计的仿射变换规律。

ARXIV

SPyCE: Skill-Policy Co-evolution for Multimodal Agents

Ru Zhang, Weijie Qiu

2026-08-21

SPyCE框架将多模态推理轨迹提炼为可复用的分层技能库,并与策略协同进化,在8个基准上显著优于现有方法。

ARXIV

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

Aarik Gulaya

2026-08-21

本文提出表征准确性概念,用于衡量AI系统对用户个人解读的忠实程度。通过将个人数据压缩为行为规范作为语言模型的上下文,在基准测试中,该方法显著提升了表征准确性,几乎消除了模型犹豫,且以约25倍的上下文成本节约实现了原始语料库的大部分性能,尤其对预训练中代表性不足的个体提升最大,但在需要回忆的问题上可能产生干扰。

ARXIV

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

Eric Bigelow, Amir Zur +8

2026-08-21

大语言模型推理具有随机性,重采样分析可揭示推理链的不确定性,但成本高。本文提出统计模型平滑低采样数据,捕捉稳定不确定性模式,大幅降低采样成本。

ARXIV

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

Sparsh Garg, Yi-Wen Chen +2

2026-08-21

本文提出了CAViAR,一个包含2249个真实事故视频的基准,用于评估自动驾驶系统的事故因果推理能力。实验表明,现有视觉语言模型能识别环境上下文,但在事故责任归属和规则违反推理上表现大幅下降,揭示了感知与推理之间的差距。

ARXIV

VideoRun2D Demo: Markerless Body Tracking for Biomechanical Analysis of Running

Luis F. Gomez, Julian Fierrez +6

2026-08-21

本文介绍VideoRun2D Demo框架,利用人体姿态估计器进行短跑生物力学分析,评估关节角度误差,并展示后处理模块可降低误差,验证了姿态追踪在跑步生物力学中的价值。

ARXIV

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Bowen Cui, Weijie Wang +8

2026-08-21

Block3D通过分块扩散框架将文本到3D生成速度提升5.15倍,从25.71秒降至4.99秒,且不牺牲几何保真度。

ARXIV

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

Honglie Wang, Jia Sun +12

2026-08-21

TextRefine是一种针对产品海报文本编辑的后训练框架,通过结合监督微调与操作特定的奖励优化,解决了文本插入和替换中的文本遗漏、错误放置及字形失真问题,并引入OpenTextEdit数据集,实验表明其性能优于现有基线。

ARXIV

PL-NBA: A Possession-level Universal Basketball Video Dataset Supporting Multiple Visual Understanding Tasks

Yunhao Zhao, Haoying Sun +6

2026-08-21

本文构建了首个进攻回合级篮球视频数据集PL-NBA,包含60场NBA比赛的11000个完整进攻回合片段及31567个带标注事件,支持事件识别、视频描述、时序动作定位动作预测等任务,现有方法表现有限,证明该数据集具有挑战性。

ARXIV

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

Mohammad Arif Ul Alam

2026-08-21

本文研究水下机器人感知中视觉退化时的跨模态鲁棒性,利用冻结的DINOv2视觉编码器和声纳,提出退化感知自适应门控融合方法,在极端退化下将视觉-声纳融合的平衡准确率从0.4610提升至0.6152,相对提升33.5%,声纳贡献从干净条件下的14.2%自适应增至41.3%。

ARXIV

Learning to Beat: Phenotype-Guided Latent Flow with Regional Motion Priors for Biventricular Motion Synthesis

Xuan Yang, Xiaohan Yuan +5

2026-08-21

本文提出了一种从单帧舒张末期(ED)双心室网格合成全周期运动的方法,通过区域特异性和表型自适应框架,结合运动信息功能分区条件潜在流,显著提升了合成精度与生理一致性,并在多个数据集上优于现有方法。

ARXIV

Coupled Optimal Transport with Landmark Constraints

Xiang Gu, Jian Sun +1

2026-08-21

本文提出一种耦合最优传输框架,利用少量标注地标引导分布间形变场的恢复,通过互一致性约束将传输计划和形变场耦合,实现从稀疏几何监督中恢复传输映射,并在形状匹配中验证有效性。

ARXIV

A 360-Degree Vision Dataset for Learning Yaw Control on GPS-Denied Micro-UAVs in Disaster-Response-Relevant Environments

Niklas Voigt, Hartmut Surmann

2026-08-21

本文提出了一种数据驱动方法,使微型无人机在无GPS和通信受限的室内环境中,利用360度相机学习偏航控制器,自主导航至开阔区域以保存传感器数据,主要面向灾害应急响应。

ARXIV

Flow Matching Meets 3D Curvilinear Structure Segmentation in Medical Imaging

Sidi Mohamed Sid'El Moctar, Nicolas Vitry +1

2026-08-21

3D-CurvSegFlow是一种基于流匹配三维曲线结构分割模型,通过从简单分布到血管表示的连续变换,实现高效且精准的细化,在多个解剖部位和模态上优于现有方法。

ARXIV

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

Joan Perez, Giovanni Fusco

2026-08-21

本文利用SAGAI工作流与视觉语言模型对尼斯东北部郊区街景品质进行大规模评估,发现步行友好特征仅存在于少数街景中。

ARXIV

Structured Affinity for Unsupervised Visual Class-Incremental Memory in Deep Artificial Immune Networks

Siphesihle Sithungu

2026-08-21

本文研究了结构化、无梯度的免疫亲和力能否使深度人工免疫网络成为无需回放的视觉类别增量表示记忆学习器,并通过响应图保留自适应潜在重组等机制,在多个数字数据集上取得了高精度。

ARXIV

DPC-Net: Dual-Prior Collaborative Network for All-in-One Image Restoration

Zhaokun He, Kangbiao Shi +5

2026-08-21

提出DPC-Net,结合退化-语义耦合先验和底层视觉先验,通过VLM监督和知识库实现高质量图像恢复,性能优于现有方法。

ARXIV

G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding

Marko Haralović, Akash Ramakrishnan +1

2026-08-21

G3Ego 利用注视作为结构线索,从稀疏帧构建动作场景图,高效地表示第一人称视频中的关键手物交互,无需大规模视频预训练即可在动作识别与预测中取得竞争性能,并在类别不平衡下提升 Macro-F1。

ARXIV

Towards Surgical World-Action Modeling: A Preliminary Joint Visual-Trajectory Forecasting for Surgical Motion Planning

Weiliang Huang, Huanrong Liu +6

2026-08-21

本文提出了一种联合预测手术未来视觉状态和器械轨迹的世界-动作模型,通过块状自回归滚动策略,证明初步可行性,但长期预测仍存在视觉退化和轨迹累积误差。

ARXIV

Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models

Taihang Hu, Zhao Wang +19

2026-08-21

Swift-Image是一个紧凑的统一模型,能同时处理文本到图像生成、单图编辑和多图编辑,仅用6B参数和243K GPU小时即达到领先性能,压缩至3B几乎无性能损失。

ARXIV

NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection

Sanjeev Khatiwada

2026-08-21

本文介绍了首个尼泊尔语为主的上下文不匹配错误信息基准NepOOC,包含1090个图像-文本对,评估发现纯文本模型性能与多模态模型相当,图像模型接近随机,数据集扩展比架构改进更有效。

ARXIV

RepSelect: Robust LLM Unlearning via Representation Selectivity

Filip Sondej, Yushi Yang +1

2026-08-21

现有LLM遗忘方法容易被微调或少量示例恢复,且损害通用能力。本文提出RepSelect方法,通过选择性编辑遗忘集特定表示,实现深度遗忘,显著降低恢复概率并保持通用能力。

ARXIV

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

Jingyi Sun, Qianli Wang +3

2026-08-21

本文提出 FaithMATE,一个统一偏好对齐接口,用于优化模型的链式思维(CoT)忠实性,并发现上下文与参数两种忠实性范式正相关但不对称,且上下文指标间存在权衡,表明 CoT 忠实性需多面优化

ARXIV

Clustering and Token Denoising for Faster and More Robust VLMs

Baptiste Rossigneux, Inna Kucher +2

2026-08-21

ClustRS是一种无需训练令牌剪枝方法,通过注意力加权聚类残差收缩两步,从视觉令牌中选出鲁棒性强的代表令牌,大幅降低计算量并提升抗噪能力,在极端条件下可减少97%令牌仍保持高性能。

ARXIV

Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review

Abdullah Ahmed Ali, Mohammed Thamer Abdulhadi +2

2026-08-21

本文提出面向阿拉伯历史手稿的转录系统Phoenix(CNN-BiLSTM-CTC识别器)与Athar(证据感知审校流程)。Phoenix通过文档感知回放、81符号编解码及遗忘防护实现多领域适应,将两组大样本的字符加权CER从19.98%降至14.93%(相对误差降低25.3%)。Athar保留视觉阅读、公开有限候选、保守使用语言模型,并导出可审计的TEI/PAGE-XML记录,强调手稿转录应作为可审计的证据管理而非无声文本替换。

ARXIV

A Plug-in Interpretation of Conditioning in Score-Based Diffusion Models

Libo Chen, Souvik Ghosh +3

2026-08-21

提出一种基于多速度联合扩散的条件机制,利用插件校正项在推理时施加条件控制,推导出条件SDE与概率流ODE采样器,并通过log-Fokker-Planck残差正则化提升ODE采样质量,在条件图像生成任务中表现优异。

ARXIV

Mix&Fix-Net: A Dual-Stage Trajectory Prediction Model for AIS and Vision-Derived Vessel Data

Md Mahmuddun Nabi Murad, Bora San Turgut +1

2026-08-21

提出Mix&Fix-Net,一种双阶段混合器模型,融合AIS与视觉数据预测小船轨迹,并引入新视频数据集,在多个指标上优于现有方法。

ARXIV

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

Yigit Ekin, Enes Sanli +3

2026-08-21

本文提出BeyondMasks基准和CORE评估协议,用于评估视频对象移除中的因果一致性,即不仅移除对象本身,还需消除其引发的物理效应。现有方法在掩码区域保真度上表现良好,但在去除阴影、反射等次生效应时存在系统性缺陷。

ARXIV

MUST-PET: MUltimodal Self-supervised learning across Tracers for whole-body PET/CT-based lesion segmentation

Bashirul Azam Biswas, Amartya Bhattacharya +4

2026-08-21

提出多示踪剂多模态自监督框架MUST-PET,结合上下文感知掩码重建,在全身PET-CT病变分割中实现标签高效且泛化能力强的分割。

ARXIV

Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization

Jingtao Zhang, Haorui Gao +2

2026-08-21

SEFS提出一种无风格编码器的条件化框架,通过随机低分辨率裁剪形成风格令牌,避免使用成对数据或额外视觉编码器,从而减少数据成本并抑制全局布局泄露,在艺术风格化中提升内容一致性与风格亲和度。

ARXIV

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

Alin-Ionut Popa

2026-08-21

Q-Guide是一个文档视觉问答智能体,通过逐步调用工具(如文本读取、区域放大、定位)来弥补感知缺失,在DocVQA2026和Manga109上显著优于直接提示和多智能体系统,且增益来自精准感知引导而非复杂控制逻辑。

ARXIV

Core-KAN: Continuous Vision Kernels with Kolmogorov-Arnold Networks

Lan Guo, Mengling Li +5

2026-08-21

Core-KAN 提出了一种连续相对尺度卷积算子,通过解耦几何尺度自适应与内容依赖滤波,利用 KAN 生成器将深度核表示为连续坐标函数,结合尺度控制器和混合控制器,以低秩动态卷积形式高效实现任意分辨率的尺度自适应滤波,显著超越现有动态卷积基线。

ARXIV

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

Hangyu Tian, Zhenqi He +2

2026-08-21

该论文提出DIFFCZSL框架,通过将预训练扩散模型的中间表示注入CLIP嵌入空间,结合对比学习,无需额外推理成本,提升了组合零样本学习的性能。

ARXIV

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

Shangbo Yuan, Jie Xu +2

2026-08-21

本文提出创新框架,通过共蒸馏策略双引导学习方案,提升开放词汇3D目标检测中新物体发现的可靠性和模型训练的鲁棒性,在SUN RGB-D和ScanNetV2上取得显著性能提升。

ARXIV

Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features

Marcus Valtonen Örnhag, Alberto Jaenal +1

2026-08-21

该论文提出利用IMU重力向量和特征局部几何信息,只需少量对应点(单个仿射对应或两个方向协变特征)即可联合估计绝对位姿和焦距,比传统四点法更具鲁棒性和效率。

ARXIV

ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

Linhan Cao, Siyuan Li +9

2026-08-21

本文提出针对对抗性OCR的定位感知基准AdvSpot和训练框架ArmorOCR,通过两阶段训练(在策略自蒸馏分组相对策略优化)提升大模型对对抗性视觉文本的定位与识别能力,同时保持通用OCR性能。

ARXIV

PelviNeXt: A Modality-Agnostic Hybrid Network for Pelvic Imaging in Women's Health

Siam Tahsin Bhuiyan, Rashedur Rahman +6

2026-08-21

本文提出PelviNeXt,一种模态无关的混合架构,用于解决女性盆腔影像(如PCOS超声和盆腔骨折X光)数据稀缺问题。该架构在PCOSGen去重数据集上设定了首个完整性审计基准,并在盆腔骨折X光数据集上超越了现有最佳结果。

ARXIV

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

Shaoxuan Wang, Guangting Zheng +5

2026-08-21

RoMAN-Flow 提出了一种离线强化学习框架,通过无采样的优势加权似然目标优化自回归归一化流策略,并将其蒸馏为一步动作生成器,从而在保持策略性能的同时显著降低推理延迟。

ARXIV

CalcSeg: Confidence-aware 3D Latent Context Curriculum Learning For Myocardial Scar Segmentation From Single-Stack LGE-CMRs

Nivetha Jayakumar, Hannah Kim +2

2026-08-21

本文提出CalcSeg框架,利用置信度感知的潜在上下文课程学习,从单堆栈2D LGE-CMR图像中融合3D特征表示,以鲁棒地分割心肌疤痕,特别在挑战性病例上表现显著提升。

ARXIV

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

Yudong Jin, Tao Xie +7

2026-08-21

4DAnyone 从单目未标定视频重建 4D 人体,通过生成重建级多视角一致视频并提升到 4D 高斯泼溅(4DGS),解决现有相机控制视频扩散模型在大量目标视角下的一致性瓶颈。

ARXIV

Spiking Local Interaction and Adaptive Complementary Fusion for Spiking Transformer

Dongcheng Zhao, Sicheng Shen +7

2026-08-21

针对脉冲Transformer脉冲自注意力因二值查询/键导致关系稀疏离散、抑制弱关系与局部上下文的问题,提出脉冲局部交互自适应互补融合,在多种任务中取得一致提升。