

3D LLM#
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
这篇工作提出 Hunyuan3D-Buffalo 1.0,一个统一的 3D 多模态模型,支持 3D 理解、文本到 3D 生成、指令式 3D 编辑和基于文本的部件生成。方法上,作者构建了一个 8700 万规模的 3D 多模态语料,并结合 Hunyuan3D-VLM 负责语义、结构和空间理解,Hunyuan3D DiT 负责高保真 3D 合成。编辑与部件生成还会条件化到源对象表示,以尽量保持整体结构和未编辑区域。实验表明,该方法在文本到 3D 和 3D 编辑基准上达到 SOTA 或领先水平,同时在理解与部件生成方面也表现较强。
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
No summary available.
Agent Training and Evaluation#
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
这篇工作提出 MerchantBench,用于评测大模型智能体在电商运营中的长期一致性与跨时间规划能力。作者构建了一个基于 98,843 条真实商品记录、覆盖 365 天订单级模拟的环境,并提供 26 个可交互工具,要求智能体在采购、定价、现金流和延迟反馈之间持续做出协调决策。实验中在 8 个 LLM、2 类智能体框架、共 48 次运行上进行评估。结果显示当前最强模型与人类仍有明显差距,最佳配置的最终净资产仅达到人类平均水平的 27.3%。
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
这篇工作提出 PCSD,用于解决 agent 强化学习中稀疏奖励下的自蒸馏训练问题。方法上,它从教师偏好信号的局部持续性出发,利用自适应窗口、指数衰减聚合和趋势感知调制来生成连续的 token 级蒸馏权重,并与 GRPO 联合优化。实验显示,在不依赖推理时技能的条件下,PCSD 在 ALFWorld 上取得所有基线中的最佳 Overall 结果,相比 GRPO 提升 15.6 和 13.3 分、相比 SDAR 提升 6.2 和 5.5 分,同时在 WebShop 上保持竞争力,并在未见过的 ALFWorld 划分上比 GRPO 高 15.8 分。
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
这篇工作提出 PAST-Bench,用于系统评估个人智能体是否真的能把累积经验转化为后续性能提升。作者设计了 26 个场景、204 个 episode,并通过对照“开启/关闭”保留经验来隔离记忆、程序复用、信息收集和更新等能力路径,同时用 Hermes+ 在智能体循环中加入五项针对性改进。实验结果表明,不同基础模型和框架都能从保留经验中获益,但增益强弱和是否符合预期路径差异很大;Hermes+ 进一步提高了平均增益,并增强了对过时状态替换类任务的表现。
CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
这篇论文提出了 CAPEval,一个将图像描述评测拆分为 Coverage 和 Precision 的基准,用来分别衡量描述对事实内容的覆盖程度和陈述是否忠实于图像。作者构建了人写参考描述和人工核验的原子级检查项,从而把原来混在一起的单一分数拆解成两个更可解释的维度。实验中,他们评测了 10 个 captioner,并进一步在四类模型家族上做了受控端到端实验,确保只比较 caption 来源带来的影响。结果表明,Coverage 与下游理解任务相关性更强,而 Precision 更能预测生成任务表现。该工作为选择和优化 captioner 提供了更细粒度、面向任务的评测依据。