Xingjian Wang
Papers - 2026-07-02Blur image

3D/Space Reasoning#

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

这篇工作把3D场景表示从“点/高斯等原语集合”推进到“实例结构化的3D token 组”。作者提出一种无需3D标注的前馈框架,从未标定的多视角图像中直接分解出对象级 token,每个实例由表示身份的 instance token 和编码局部几何外观的 anchor tokens 组成,再解码为3D Gaussians。该表示通过可微渲染联合重建与分割监督学习,能够同时支持重建、分割和对象级编辑。实验表明,它在类无关实例分割上超过了逐场景优化基线,同时在新视角合成上保持有竞争力,并且还能高效支持对象删除、平移、插入和开放词汇3D实例检索。

Embodied Agent#

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

这篇工作研究视觉-语言-动作模型是否仍保留基础常识和世界知识,并提出 Act2Answer 评测协议。它把知识问答改造成短桌面操作任务,让智能体通过单步物体放置动作在候选答案间做选择,从而减少低层控制带来的干扰。作者还提出 layerwise intent probing,用来定位答案相关信息在 VLM 主干和动作头中的分布。对 7 个 VLA 模型和 9 个 VLM 基线的大规模实验显示,VLA 在简单概念上表现尚可,但在更丰富语义类别上相对源 VLM 存在明显退化;VQA 预训练有助于知识保留,且答案相关信号更多集中在中间层、在高层逐渐衰减。

Agent Training and Evaluation#

Dockerless: Environment-Free Program Verifier for Coding Agents

这篇论文提出 Dockerless,一种不依赖运行单元测试环境的代码补丁验证器,用于编码代理的训练与评估。它不直接对照参考答案,而是通过代理式仓库探索收集证据,再判断补丁是否正确,从而避免为每个仓库搭建 Docker 环境的高昂开销。作者还把它用于 SFT 轨迹筛选和 RL 奖励,形成完全 environment-free 的后训练流水线。实验中,Dockerless 在 verifier benchmark 上比最强开源验证器高 14.3 AUC,最终模型在 SWE-bench Verified、Multilingual 和 Pro 上分别达到 62.0%、50.0% 和 35.2% 的 resolve rate,整体优于 Qwen3.5-9B 基线并接近有环境的后训练效果。

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

这篇论文提出 Evolution Fine-Tuning,用于让语言模型学会跨任务的“进化式发现”能力。作者把进化搜索过程中的轨迹转换成监督信号,构建了包含10个领域、371个优化任务、156K轨迹的 Finch Collection,并据此对2B到9B参数的开源模型进行中期训练。实验显示,这种训练方式能带来明显的跨任务泛化,在22个保留任务上平均比基座模型提升10.22%。进一步结合 test-time RL 后,模型在两个圆形打包任务上达到SOTA水平,并在 Erdős minimum-overlap 问题上优于基座模型。

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

这篇工作提出 SkillHone,用于让代理技能在持续迭代中保留决策历史并不断进化。方法将技能修订与评测侧证据绑定,结构化记录诊断、修改、证据和结果,避免只保存最终产物而丢失中间推理。系统还使用角色分离的子代理在脱敏报告下运行候选技能,并根据历史决策提出下一轮修订。实验中,SkillHone 在 deep-research 基准上不带预集成搜索栈也优于商业 deep-research agent,在 GAIA 上提升15.8分,在 WebWalkerQA-EN 上提升3.2分,并在7个内部工具分析场景中平均提升18.8分。

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

这篇工作提出用元认知反馈来训练大模型,让模型更诚实地表达自身不确定性。作者设计了两项机制:基于自我判断质量来重排偏好优化的强化学习元认知反馈(RLMF),以及利用同类自我判断挑选高价值样本的数据选择方法。方法上先校准模型对任务表现的自评置信度,再通过定向输出编辑把置信度映射为更自然的语言化不确定性表达。实验表明,RLMF在多项任务上实现了更好的 faithful calibration,整体达到新的最优水平,同时保持准确率,并且相较标准强化学习最高提升达63%。

Multimodal World Model#

Orca: The World is in Your Mind

这篇工作提出 Orca,作为一种通用世界基础模型的初步实现,用统一的世界潜空间来建模世界状态转移。它不再只做下一词、下一帧或下一动作预测,而是以 Next-State-Prediction 为核心,结合视频中的连续状态转移和语言事件、VQA 监督进行预训练。作者构建了大规模 world-learning inventory 数据,包含 12.5 万小时视频和 1.6 亿事件标注。实验表明,Orca 学到的世界潜空间可迁移到文本生成、图像预测和具身动作生成等下游读出任务,且更强的潜空间会带来更好的下游性能,并优于同规模专用基线。

MemLearner: Learning to Query Context memory for Video World Models

这篇论文针对视频世界模型长时序生成中的记忆缺失问题,提出 MemLearner。作者设计了基于 query tokens 的自适应上下文查询机制,让模型从历史帧中动态检索有用信息,并用视频生成模型自身来完成上下文查询,而不是额外训练独立记忆模块。为训练与评估,论文构建了包含遮挡和动态物体的长视频数据集,并结合带相机位姿标注的渲染数据与真实世界无标注数据进行多数据集训练。实验结果表明,MemLearner 在场景一致性和记忆能力上显著优于此前的视频世界模型,尤其在遮挡和动态场景下优势更明显。

Papers - 2026-07-02
https://xingjianwang.com/blog/papers-2026-07-02
Author 猫柒-
Published at July 2, 2026