Xingjian Wang
Papers - 2026-07-18Blur image

Thinking with Images#

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

这篇论文提出 SC-CMJP 和训练无关的单步采样器 CO2Jump,用于同时进行图像理解、图像生成与编辑。方法的核心是把一个模态的转移率建立在另一模态置信度和跨模态注意力之上,并加入 remasking 机制,在发现跨模态冲突时回退错误决定。作者还构建并发布了 JEdit-1M、JMaze-200K 和 JNono-200K 三个大规模联合多模态数据集及对应基准。实验表明,CO2Jump 在图像理解与编辑、以及迷宫和 nonogram 等视觉推理任务上取得了最佳联合性能,而且随着去噪步数增加性能单调提升。

UniVR: Thinking in Visual Space for Unified Visual Reasoning

这篇论文提出 UniVR,探索仅通过纯视觉演示同时学习复杂推理、细粒度物理动力学和长时规划。作者设计了 VR-GRPO 强化学习范式,用全局奖励和步级奖励共同约束推理过程,从而在不依赖图文对或任务特定启发式的情况下维持逻辑一致性与物理一致性。为训练和评测,论文构建了 VR-X 大规模基准,覆盖长时程操作、空间谜题和物理推理等 16 个来源。实验显示 UniVR 在 VR-X 上最高提升 25%,并且其更强的视觉推理能力还能迁移提升多个多模态理解基准的表现。

3D LLM#

Video = World + Event Stream

We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.

Embodied Agent#

BadWAM: When World-Action Models Dream Right but Act Wrong

这篇工作提出 BadWAM,用于系统分析和攻击 world-action models 在视觉扰动下的“想得对、做得错”现象。方法上,它定义了 world-action drift attacks,并分别构造 action-only attack 和 imagination-preserving attack,用来在破坏执行动作的同时控制对未来想象的影响。实验表明,这类攻击会显著降低闭环执行成功率,例如 action-only attack 可把成功率从 96.5% 降到 43.1%,说明这类模型的想象与行动对齐并不稳固。

Spatial Intelligence (Image/Video)#

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

这篇工作提出了完全开源的视频多模态大模型 VideoChat3,目标是在通用、长视频和流式视频理解上同时兼顾效果与效率。方法上,它引入了 I3D-ViT 和自适应帧分辨率来降低视频建模成本,并通过可扩展的视频数据合成管线构建了多个高质量训练集。实验显示,VideoChat3 仅用 4B 参数就在通用、长视频和流式基准上超过了参数规模相当或更大的开源模型,同时保持更高的推理和训练效率。

Agent Training and Evaluation#

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

这篇工作提出 SEED,一种面向 agentic 强化学习的自演化 on-policy 蒸馏框架,解决仅有 episode 级奖励而缺少中间监督的问题。它先把完成的轨迹转成自然语言 hindsight skills,再用技能增强上下文重新打分动作,把技能带来的概率变化转成 token 级的稠密蒸馏信号,并与 outcome-based RL 联合优化。作者在文本和视觉 agent 任务上做了大量实验,结果表明 SEED 能稳定提升性能和样本效率,并且对未见场景具有更强泛化能力。

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

这篇工作提出 SearchOS,一个面向开放域信息检索的多智能体协作框架,重点解决搜索过程里进展难跟踪、失败后容易重复循环的问题。方法上,它把搜索任务显式建模为带证据引用的关系表补全,并设计 SOCM,将前沿任务、证据图、覆盖图和失败记忆外显为共享状态;同时通过流水线式调度、搜索工具中间件和层级技能系统来提升利用率并避免重复失败。实验在 WideSearch 和 GISA 上都取得了所评估单/多智能体基线中的最佳表现。

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

这篇工作提出 LongStraw,一个面向百万级上下文 RL 后训练的执行栈,用于在固定 GPU 预算下扩展长上下文强化学习。它针对 GRPO 采用架构感知的执行策略,对共享 prompt 关闭 autograd,只保留后续 token 所需的模型状态,并把短响应分支逐个重放,从而显著压低训练图的峰值显存。实验在 H20 GPU 上把 Qwen3.6-27B 的分组评分和反向传播推进到 210 万 token 位置,并在更大的 stress test 中达到 446 万 token,验证了其执行容量。

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

这篇论文系统分析了 on-policy distillation(OPD)在大模型后训练中的作用、失效模式与约束手段。作者将 OPD 定位为一种探索催化器,核心价值是通过稠密的 token 级指导把学生模型引向正确推理路径,但不会提升能力上限。论文进一步揭示了两个主要问题:师生分布差异过大导致的 Student-Teacher Mismatch,以及 token 级目标引发的长度投机。为缓解这些问题,作者提出 advantage clipping 和 log-scale compression 等轻量约束来稳定指导信号。实验覆盖七个基准,结果表明这些约束能有效抑制长度投机,并稳定优于 OPD 变体和 RLVR 基线。

Multimodal World Model#

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

这篇论文提出 KeyFrame-Compass,用于系统评估关键帧条件视频生成。作者构建了一个包含 386 个样本的基准,覆盖多种应用场景、视频结构、提示粒度、条件格式和关键帧密度,并设计了同时衡量关键帧执行与整体视频质量的自动化评测框架。关键帧执行被拆成存在性、忠实度、时序、定位、持续性和唯一性六个指标,整体质量则结合 MLLM 判断与专用感知模型评估。对 9 个代表性视频生成系统的实验表明,当前模型在忠实执行关键帧和保持自然视频质量之间存在明显权衡,且随着关键帧约束变密性能进一步下降。

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

这篇论文提出 MultiRef-Compass,用于评估多参考到音视频生成任务中的多参考绑定、主体保持与音画一致性。作者构建了 350 个样本的统一基准,覆盖多视角主体保持、多实体绑定以及人-物-场景组合等设置,并通过 14 个子指标组织成四个评测维度。评测协议结合自动指标与带复审增强的 MLLM-as-a-Judge 框架,使得对感知保真度和参考条件组合能力的分析更可解释、可审计。对 8 个代表性系统的实验显示,各维度仍有较大提升空间,尤其在复杂参考组合和音画协同方面表现不足。

From Pixels to States: Rethinking Interactive World Models as Game Engines

这篇论文从游戏引擎的视角重新审视交互式世界模型,讨论如何让生成式视频模型真正支持动作驱动、状态演化和长时程持久性。作者围绕玩家动作控制、游戏状态动力学、状态-观测持久性和实时交互生成四个维度梳理了现有方法,并分析了各类方案的优缺点。论文还提供了一个面向黑神话:悟空的数据引擎,收集了 90 多小时带有帧对齐动作、真实游戏状态和视觉观测的数据。作为综述与资源型工作,它给出了当前领域的能力边界和未来走向,并为状态感知的游戏世界建模提供了可复用数据基础。

Papers - 2026-07-18
https://xingjianwang.com/blog/papers-2026-07-18
Author 猫柒-
Published at July 18, 2026