跳转到文献清单

Literature Review

Video generation · World reasoning · Human exploration

RESEARCH & LITERATURE 问题 · 条件 · 证据

面向世界推演与人类探索的视频生成

从示例中归纳机制,按给定规则推演后果,在不完备设定下补充假设并拓展世界。关注视频生成模型承担了哪部分推理,以及人如何在 XR 中比较、检查和修正这些未来。

398 篇本地文献5 个研究者收藏更新于 2026-09-19

当前关注 长期方向与文献问题

先标注文献,再收敛选题
01 · 世界机制与演化

从示例与部分规则构造可推演世界

规则如何获得?哪些后果能推出,哪些需要补充假设?世界拓展后,如何持续检验机制与反馈?

查看能力进展、前作与评估 →
02 · XR 与人机协作

借助生成的未来理解、比较与修正行动

人需要看到哪些分支?如何检查关键假设?等待、打扰与信息负担如何影响协作?

查看检查、反馈与修复的文献 →

阅读时重点区分

预测未知后果 / 呈现给定结果视频模型推演 / 外部求解真实物理 / 用户指定机制已观察到失败 / 尚未测试

这些母问题用于组织文献。近期候选题聚焦“给定规则的未见组合与多步视频后果”,新颖性与训练可行性仍需验证。规则编辑方向(B3)暂缓拟题。世界状态演化、规则修订与模型自我改进分别标注。

RULES → WORLDS

从少量规则,到可推演的世界

下载研究综述 JSON ↗

如何从稀疏示例和部分规则构造可扩展的世界,区分推导与补充假设,并使多步、跨领域的演化持续符合已确定的机制?

当前判断

局部能力已有实证,完整目标仍缺少联合验证。规则归纳、程序执行、约束创作、人工生命和社会模拟各自覆盖了一部分;这些结果还不能拼成一个已验证的、从几条规则自动生长出生态—社会—文化的通用系统。

综合现有资料库及本轮补充前作,核对截至 2026-09-19。以下成熟度是对任务条件与证据范围的归纳,不是统一排行榜,也不声称穷尽全部相关研究。

用一个例子区分:设定:植物只能从月光获得外部能量。

观察不足以唯一归纳

若示例只是“夜间生长、白天不生长”,月光、温度或人为控制都可能解释,需要区分性实验。

由规则直接推出

完全没有月光时,植物无法通过该途径获得新的外部能量;这不等于它会立刻死亡。

补充后才能推出

还需声明储能、耗能与生存阈值,才能推算连续无月夜的影响。默认重力等规则是否保留,也应写清。

可选的世界拓展

夜间农业、食物分配制度或月亮崇拜都可能成为设定;它们不是原规则唯一蕴含的社会与文化。

概念示例,用来区分推理类型;不是论文实验或真实生态学结论。四类工作可以循环进行,不是能力已依次解决的流水线。

● 已收集 PDF● 未收集 PDF点击论文查看来源、方法与证据深度

八条文献脉络,各自证明了什么

8 条脉络 · 同一工作可以支撑多类问题

限定环境已有实证

规则归纳与主动发现

SolverLearner 将规则归纳与执行分离;Alchemy、DiscoveryWorld 让智能体在可检验环境中发现隐藏机制。

在哪些条件下
从固定或受限机制族、预先构建的实验世界出发,评估留出预测、实验过程与发现的知识。
尚不能推出
能拟合已见例子,不代表唯一识别了机制;开放世界的假设空间仍需定义。

可执行接口已有实证

可执行世界与组合动力学

WorldCoder 学习并修订代码世界模型;PoE-World 组合程序化专家;Text2World 将描述转成 PDDL 并用执行检验。

在哪些条件下
分别依赖确定性环境假设、对象状态接口或形式化规划语言。
尚不能推出
解释、规划与执行的外部工具是方法的一部分;不能据此推断像素生成器具备同等机制能力。

已有方法,更新对象不同

机制修订与适应

ESBM 讨论机制记忆与局部编辑;WorldEvolver 根据预测失配更新可检索的经验记忆。

在哪些条件下
必须标明更新的是程序、记忆、参数还是世界规则;WorldEvolver 的基础模型与 agent 保持冻结。
尚不能推出
模型或记忆的自我改进,不等于世界内部生态与社会的演化;摘要证据不能替代端到端实验。

有长期前作与局部系统

不完备设定与约束创作

开放世界故事规划可补充初始设定;Imaginarium 用约束生成对象;Retcon 保留未定设定并筛去冲突片段;PWM 以符号贝叶斯推断更新世界模型。

在哪些条件下
分别依赖作者提供的动作、类型、约束、片段或语言表示;各自验证的任务不同。
尚不能推出
AutoWorldBuilder 能组织概念生成,但其当前实验尚未实现关系解析;完成一次生成不代表世界机制正确。

局部规则涌现已有实证

人工生命与开放演化

Lenia 等底层系统产生复杂形态;ASAL 用基础模型评价仿真视频,搜索目标现象、持续新颖性与多样性。

在哪些条件下
演化发生在指定的人工生命底层规则与参数空间中,视频主要用于评价。
尚不能推出
涌现丰富形态,还不能验证生态资源、经济制度与文化之间的统一因果闭环。

已有行为与社会实验

社会行为、规范与个体模拟

Generative Agents 展示群体协调;Concordia 提供社会模拟框架;命名博弈研究规范形成与改变;自述数据研究在留出问项与行为任务中检验个体模拟。

在哪些条件下
区分可信感、群体协调、局部博弈规律与真实人群预测;这些是不同评价目标。
尚不能推出
尚不能把这些局部结果直接外推为任意虚构生态—社会—文化的长期正确演化。

已有直接评测与改进方法

视频生成执行规则

RULER 分开评估规则一致性、视觉一致性、画质和指令遵循;VLMTeachers 用外部 VLM 反馈指导测试时训练。

在哪些条件下
先辨认视频模型输入中是否已包含答案、未来轨迹或外部求解结果。
尚不能推出
短片规则评分不等于多步、跨分支的整段成功;外部教师带来的收益要单独归因。

经典问题,现代条件待检验

常识、例外与表示拓展

Elaboration Tolerance 已讨论新增事实、参数、谓词参数和情境;非单调推理允许撤销默认结论。现有因果叙事任务检验模型能否服从给定条件。

在哪些条件下
需区分默认常识、用户硬规则与观测证据,并给出冲突处理范围。
尚不能推出
提出新设定后,选择性保留其余常识并在生成视频中持续执行,需要专门的组合与干预测试。
读结果时,三个容易混淆的边界

先明确任务,再选择正确性标准

以上是本综述提出的组合评测方案。每行论文提供相关任务、方法或评价依据,不表示某一篇已经实现整行协议;新增指标与切分须在具体项目中预先定义。

评价对象与依据 怎样测试 报告什么 避免的误判
规则归纳 按机制或组合划分训练/测试,加入能区分候选解释的干预。 留出转移准确率、机制等价类恢复、校准与交互样本数。 只验证对已见例子的拟合。
假设与逻辑一致性 记录给定事实、推导结论、可撤销默认和新假设;用独立约束检查器检查所编码规则。 约束满足率、冲突定位、结论对额外假设的依赖。 把未编码部分也算作已证明,或仅让生成者给自己打分。
组合与多步推演 保留单规则训练,留出规则组合、触发次序、实体绑定与更长链条。 逐步事件正确率、整条轨迹通过率、首次违规位置,随深度变化的曲线。 把换措辞、换背景当成未见机制组合。
长期演化与干预 同一初态重复触发规则,成对改变一个行动或规则条件,并复查无关对象。 状态保持、受影响变量响应、不应变化部分的保持、资源收支误差。 只核对终帧,忽略中间违规;用空场景或静止视频规避规则。
跨层反馈 在明确建模的资源—行动—制度链条中扰动一个变量,沿依赖追踪传播与反馈。 响应方向与延迟、跨层约束、反馈稳定性;现实用途另测经验吻合。 把任何合理故事当作被规则蕴含的唯一演化。
有效多样性 同样的部分设定生成多个世界,只在约束合格且完成指定事件的结果中统计差异。 有效世界比例、机制/结构覆盖与新颖性,多随机种子置信区间。 单纯奖励视觉差异,或牺牲可执行性增加新颖性。
视频中的可见证据 盲评生成视频中的对象、动作和状态转移;对事件检测器与 VLM 裁判做人工校验。 画质、指令、事件完成、规则一致性分别报告,并给整段成功率。 从提示词或外部轨迹推断视频已经实现了同样的后果。
人类探索与修复 让用户依据 Foresee 分支预测未见后果、识别额外假设并纠正错误;控制视频质量与等待差异。 机制理解、迁移决策、纠错成本、恰当依赖;同时测首分支延迟与多分支总耗时。 只问喜好、沉浸感或看起来是否可信。

视频推理的贡献归因:测试时究竟给了什么?

视频模型直接推演

测试只给初态、规则与行动,不给未来答案。训练可以使用仿真真值或教师标签,但要披露来源并严格留出测试组合。

外部推理后生成

测试时 LLM、VLM 或搜索先给出后果/计划,再交给生成器。衡量系统收益,并用去掉外援的对照分离贡献。

给定未来约束再生成

未来轨迹、关键帧或完整仿真状态已给定时,重点是渲染和条件遵循;不能单凭画面正确归因为未知后果推理。

六组需要进一步验证的条件

这里列的是现有证据尚未充分联合覆盖的条件,不是已确认的无人研究空白。每项先列前作,再说明需要增加什么测试;新颖性仍需围绕选定的具体条件继续检索。

01多个候选世界与可见的不确定性

已有前作
Alchemy 的机制不确定性、PWM 的溯因和 Retcon 的未定设定都是直接前作。
进一步改变条件
将多个仍合法的机制分别演成视频,并明确哪些差异来自证据不足、哪些来自创作选择。
可证伪的测试
新证据到来后,淘汰不相容分支,同时保留仍可行分支。

02反常识规则下,选择性保留日常机制

已有前作
Elaboration Tolerance、非单调推理与反常识推理任务已讨论默认与例外。
进一步改变条件
只替换指定机制,检测其他物理、对象身份和动作后果是否仍按声明的默认规则执行。
可证伪的测试
成对反常识规则、互不相关对象与多次触发;分别统计必须改变与必须保持的部分。

03生态—经济—社会的闭环反馈

已有前作
ASAL、Concordia 和规范涌现各有局部实验,并非无人考虑群体或社会演化。
进一步改变条件
把资源、个体行动、制度形成和资源再分配接到同一个可检验的反馈系统。
可证伪的测试
明确跨层接口与资源账目,再做扰动和长期追踪;逐层报告失效。

04拓展对象、属性与制度,同时保留已定事实

已有前作
开放世界规划、Imaginarium、Retcon 已研究补全初态、对象生成和延迟承诺。
进一步改变条件
允许新的对象类型、可执行动作或制度进入世界,并验证它们与已有机制共同运行。
可证伪的测试
新增对象或规则后重放历史、检查新旧实体交互,区分新增设定和推导后果。

05区分世界事实、角色信念和社会规范

已有前作
社会模拟、符号世界模型与叙事研究分别处理世界、角色信息和约束。
进一步改变条件
允许角色误解或违反规范,同时保持真实状态与后果一致。不能把违背社会规范直接判为物理或逻辑错误。
可证伪的测试
构造错误信念、信息不对称和规范违反,分别验证行为动机、世界转移与社会反馈。

06生成模型在未见规则组合中的持续执行

已有前作
RULER 已有规则推理评测,VLMTeachers 已有外部反馈改进。
进一步改变条件
将规则组合、实体绑定、重复触发和链条深度系统分离,测试不给未来轨迹时能否生成正确新后果。
可证伪的测试
同样基础模型与推理预算,对比直接生成、训练改进、外部求解和已知轨迹条件。

三个月候选切口 · 给定规则的组合推演

给定少量日常或反常识规则,不提供未来轨迹,视频生成模型能否把这些规则组合应用到未见情境,生成多步一致的后果?

先隔离“执行规则”与“发现规则”,才能判断失败发生在理解、组合、生成还是评价。完整生态与社会拓展保留为长期方向。

训练贡献在哪里

候选训练贡献:用可执行环境提供事件/状态监督,对视频生成器进行轻量训练,针对组合、对象绑定和多次触发约束学习。是否需要奖励训练,由第一轮失败类型决定。

先验证计算预算

以 4 × 24 GB A10 为预算,先测模型、分辨率、帧数与 LoRA 的实际显存和耗时;多卡显存不能直接当作单卡大显存。三个月可行性和实时性均需据实测收敛。

  1. 第 1–2 周 · 复核失败

    复用 RULER 适配子集,固定版本与采样设置;建立事件标注和人工复核,先确认稳定、可重复的失败。

  2. 第 3–6 周 · 训练与切分

    从单规则到组合规则,留出实体、组合与触发顺序;先用小规模训练检验收益,避免同一视频或机制模板泄漏。

  3. 第 7–9 周 · 归因与泛化

    比较同底座无训练、训练改进、外部后果提示和给定轨迹;报告整段成功、深度曲线、泛化与计算成本。

  4. 第 10–12 周 · Foresee 验证

    模型结果可信后再接入分支探索,检验用户能否理解并迁移规则;若训练无效,收敛为有证据的能力边界,调整论文主张。

继续条件:基线在所选规则上有稳定缺陷,事件裁判经人工校验可用,且训练在留出组合上改善整段成功。若仅改善画质、依赖测试时答案或算力不适配,则缩小任务或更换方法。

与 Foresee 的连接:呈现同一初态下可检验的操作—后果分支,让用户看懂规则与假设。首个分支延迟、多分支总耗时和机制理解分别评价。

候选问题与实验计划;不是已经证明的新颖性、性能或三个月产出承诺。B3 规则编辑方向继续暂缓拟题。

论文标注与团队收藏 2023 — 2026-09-19

下载标注 JSON ↗

按研究者署名关联收藏,覆盖视频生成、世界模型、视频推理、4D / 物理建模及相邻 agent / HCI。论文可以出现在多个收藏中;署名关联不代表该团队主导。

● 已收集 PDF● 未收集 PDF“未测试”不表示失败;“作者报告”不表示已独立复现。

收藏范围与标注方式

2023年至2026-09-19公开的相关工作;2022预印本仅在已核实2023正式发表时纳入。以作者署名关联,不声称穷尽全部团队工作。

先从公开作者记录建立候选清单,再按研究主题筛选。蓝色和橙色只表示本地 PDF 是否存在。摘要初读仅用于定位问题与待核查事项;方法核查记录 PDF 页码,实验结果仍为作者报告。

未知规则发现、创作者规则补全、固定世界中的误解修正、真实机制变化与给定反常识规则分别标注。提供未来轨迹的可控生成,与隐藏未来结果的预测使用不同评价条件。

RESEARCH QUESTION ATLAS

从问题读懂文献脉络 RQ · 条件变化 · 来源

下载脉络 JSON ↗

沿「长期母问题 → 问题分支 → 论文证据」展开。层级用于组织文献;当前选题另行界定。点击论文查看输入条件、已有能力、适用范围与来源。

● 已收集 PDF● 未收集 PDF · 滚雪球补充实线 → 已核实引用虚线 ⇢ 综合关联 / 并行对照

如何解读这些 RQ、箭头和覆盖数字?
  1. 长期母问题、父子层级及条件变化均为文献组织框架。候选选题与母问题分别呈现;B3 暂缓拟题,先标注文献。
  2. 实线箭头表示后者正文/参考文献确实引用前者;箭头上的问题变化是归纳比较,引用本身不等于全部方法继承。虚线表示本图的概念关联或并行对照。
  3. 颜色仅表示本地 PDF 是否存在:蓝色已收集,橙色未收集。证据深度与复现状态另用文字标注;在线摘要、下载 PDF、提取全文与方法核查是不同状态。
  4. 按当前目录与 SHA-256 清单核对:398 个活跃 PDF、398 个本地文献节点。duplicate-paper-archive 中归档的重复/旧版本不重复计数,历史 ID 保留别名跳转。
  5. 覆盖现有文献目录及研究者收藏。新增记录注明摘要初读或方法核查;方法支撑不等于已解决对应应用问题。
  6. 以本地论文及草稿为种子,优先向后追溯作者在引言/相关工作明确定位的问题;核对论文原文、官方记录或作者页面。第二轮实例:Genie→Dreamer→PlaNet,AgentHands→GazePointAR→Put-That-There。
  7. 检索快照更新至 2026-09-19;作者署名检索与引用滚雪球分别记录。未穷尽全部团队工作或参考文献,没有证据时不建立引用继承边。
  8. TeaCache、ASAL、Diffusion as Shader 已随本地目录同步成为 P162–P164,使用当前正式笔记;没有把这些已收集文献误标成外部检索项。
  9. 世界构建补充区分主题检索与引用滚雪球:C04–C09 为主题补充,C10 由 Retcon 参考文献 [17] 向后追溯。新增 W1e、W3e 是综合组织分支,不是某篇原文的统一命名。

文献清单 Literature

398 / 398 份笔记

点击标题展开完整笔记
P404 / 2023研究者收藏DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object ManipulationBardienus P. Duisterhof; Zhao Mandi; Yunchao Yao; Jia-Wei Liu; Jenny Seidenschwarz; Mike Zheng Shou; Deva Ramanan; Shuran Song; Stan Birchfield; Bowen Wen; Jeffrey IchnowskiDeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。世界机制与演化展开标注
#P40418 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。

本篇研究的问题

多视角视频怎样重建高形变物体的稠密运动?

适用条件

这是已观测动态的重建;物理启发正则不等于未知未来的完整模拟器。

方法与训练

DeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这是已观测动态的重建;物理启发正则不等于未知未来的完整模拟器。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3742577278088e5e7589b8eec7a7b5b77fee18a397040a6f83677fdc26dca3bb

返回筛选与清单
P403 / 2023研究者收藏MagicAnimate: Temporally Consistent Human Image Animation using Diffusion ModelZhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Hanshu Yan; Jia-Wei Liu; Chenxu Zhang; Jiashi Feng; Mike Zheng ShouMagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。创作与规则补全展开标注
#P40310 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。

本篇研究的问题

人物图像动画怎样保持身份和时间连续?

适用条件

运动条件控制与物理规律推断需要不同实验。

方法与训练

MagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】运动条件控制与物理规律推断需要不同实验。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5193981db6663482b98892b14935ce49ff9f76073360817f93021916f06af8b9

返回筛选与清单
P402 / 2023研究者收藏MotionDirector: Motion Customization of Text-to-Video Diffusion ModelsRui Zhao; Yuchao Gu; Jay Zhangjie Wu; David Junhao Zhang; Jiawei Liu; Weijia Wu; Jussi Keppo; Mike Zheng ShouMotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。创作与规则补全展开标注
#P40219 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。

本篇研究的问题

少量视频中的运动概念怎样与外观解耦迁移?

适用条件

运动风格迁移不直接验证动作导致的对象状态变化。

方法与训练

MotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】运动风格迁移不直接验证动作导致的对象状态变化。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b3954f5fe89602da976141a2109c78bccd8f928aefdfbcf759fb2f2ee0fdfcb5

返回筛选与清单
P401 / 2026研究者收藏Show-Harness: Just a VLM Agent Can Play RobotsYanzhe Chen; Zechen Bai; Zhijun Cao; Wenzheng Zeng; Kevin Qinghong Lin; Yiqi Lin; Guoqiang Liang; Kevin Yuchen Ma; Qiming Huang; Mike Zheng ShouShow-Harness 通过语义动作接口连接意图与执行,并以 GUMI 支持 GUI 示范采集。AI方法与评测XR与人机协作展开标注
#P40130 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Show-Harness 通过语义动作接口连接意图与执行,并以 GUMI 支持 GUI 示范采集。

本篇研究的问题

怎样用紧凑的语义接口让人和 VLM 操控不同机器人?

适用条件

属于机器人交互与执行接口,不直接生成或验证未来视频。

方法与训练

Show-Harness 通过语义动作接口连接意图与执行,并以 GUMI 支持 GUI 示范采集。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】属于机器人交互与执行接口,不直接生成或验证未来视频。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 383f91ed602bbe1bbba46e49dfa146ea20fa40f7555e576a17bfd081e7d357f6

返回筛选与清单
P400 / 2026研究者收藏One Demonstration, Many Objects: Generalizing Manipulation via Local Contact GeometrySatvik Sharma; Samrat Sahoo; Huang Huang; Fei-Fei Li; Jiajun Wu; Dorsa Sadigh; Jeannette BohgDemoMimic 关注接触点附近的物体几何,学习更可泛化的灵巧操作策略。世界机制与演化展开标注
#P40021 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DemoMimic 关注接触点附近的物体几何,学习更可泛化的灵巧操作策略。

本篇研究的问题

少量示范如何通过局部接触几何迁移到不同物体?

适用条件

策略的接触泛化不是视频生成的直接证据;奖励和真实测试条件仍需细读。

方法与训练

DemoMimic 关注接触点附近的物体几何,学习更可泛化的灵巧操作策略。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】策略的接触泛化不是视频生成的直接证据;奖励和真实测试条件仍需细读。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 511f00ee6bbcf92bf104dea7dd8f9a8f389d19e7d976a86e411954a5fcafcfce

返回筛选与清单
P399 / 2026研究者收藏LeVJEPA: Efficient & Scalable Video Pretraining without the HeuristicsLukas Kuhn; Lucas Maes; Giuseppe Serra; Quentin Le Lidec; Yann LeCun; Randall Balestriero; Florian BuettnerLeVJEPA 将 LeJEPA 的表征学习目标扩展到视频,并比较外观与运动任务中的表示质量。世界机制与演化展开标注
#P39912 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LeVJEPA 将 LeJEPA 的表征学习目标扩展到视频,并比较外观与运动任务中的表示质量。

本篇研究的问题

怎样以较少训练启发式学习兼顾外观与运动的视频表征?

适用条件

视频编码能力不等于像素级未来生成;需另测动作条件预测。

方法与训练

LeVJEPA 将 LeJEPA 的表征学习目标扩展到视频,并比较外观与运动任务中的表示质量。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视频编码能力不等于像素级未来生成;需另测动作条件预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 047a945c5ccc7846269aa077fabce672f2b6c62b1aefba38ffa23004e63bad08

返回筛选与清单
P398 / 2026研究者收藏TrAct: Bridging Robot Control and Visual Prediction with Visual TracksZhi Cao; Howard Ji; Kevin Zhang; Kuangzhi Ge; Li Fei-Fei; Jiajun Wu; Huang HuangTrAct 联合提出动作及视觉轨迹,用轨迹条件世界模型预测后果,再由视觉语言奖励模型排序。世界机制与演化展开标注
#P39822 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

TrAct 联合提出动作及视觉轨迹,用轨迹条件世界模型预测后果,再由视觉语言奖励模型排序。

本篇研究的问题

视觉轨迹能否连接候选机器人动作与未来视频评价?

适用条件

动作提出与结果评分有独立模块;需要区分轨迹跟随、被动物体预测及最终执行成功。

方法与训练

π0.5 改为动作/轨迹联合 flow 训练;SVD 加轨迹 ControlNet。预训练用 DROID/EgoDex,轨迹来自校准投影和 CoTracker;动作模型报告 4 张 H100、3 万步。

验证范围

LIBERO-INTEGRAL 包括稳健性和跨本体任务;比较 π0.5、仅 VLAT、动作条件及轨迹条件世界模型,并测试真实 Franka。统一数据适配用于检验轨迹接口的作用。

边界与待核查事项

【作者对照观察】动作条件基线出现夹爪姿态错误、物体消失与跨视图位置不一致;这是论文 Fig.3 的方法对照,不是所有当前模型的普遍缺陷结论。

证据定位

PDF pp.3–5 §3–4:完整接口、训练、推理与 LIBERO-INTEGRAL;p.5 §4.2:对照错误。方法已核查,未复现实验。

版本指纹 2663c30640474871fa2f844ba3861b850cde109d85954ae99867887780cde74d

返回筛选与清单
P397 / 2026研究者收藏LpWM: A Case for Sparse Representations in World ModelsYilun Kuang; Yash Dagade; Quentin Le Lidec; Lucas Maes; Randall Balestriero; Yann LeCunLpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。世界机制与演化展开标注
#P39728 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。

本篇研究的问题

什么潜空间几何更适合学习和规划非线性动力学?

适用条件

理论假设与实验环境需单独核对,不能直接推成任意真实世界的可解释规则。

方法与训练

LpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】理论假设与实验环境需单独核对,不能直接推成任意真实世界的可解释规则。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 76ab29b8610553410ac6b3c0683ccc6d71baabedf49ee6a4463a652a82c3d5ae

返回筛选与清单
P396 / 2026研究者收藏Masked Visual Actions for Unified World ModelingHadi Alzayer; Wenlong Huang; Haonan Chen; Christopher Luey; Lvmin Zhang; Maneesh Agrawala; Gordon Wetzstein; Li Fei-Fei; Yilun Du; Jiajun Wu; Jia-Bin HuangMasked Visual Actions 以部分可见的实体轨迹视频作为动作接口,预测其余交互并支持候选策略评价。世界机制与演化展开标注
#P39621 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Masked Visual Actions 以部分可见的实体轨迹视频作为动作接口,预测其余交互并支持候选策略评价。

本篇研究的问题

遮挡不同实体的未来轨迹能否统一前向、逆向与无条件世界建模?

适用条件

部分实体未来已知,但被遮挡实体后果仍需预测;输入条件强于仅给首帧。

方法与训练

Wan-Fun-Control 2.2 14B;同一 VAE 编码条件,缺失区域置灰后拼接。LoRA rank 256,batch 4,8 张 H200,约 1 万步/4 天。

验证范围

DROID、未见末端形态与 BEHAVIOR 本体上的视觉保真和控制比较,另有策略评价、规划和逆向建模实验。Table 1 各基线条件不完全相同,需连同正文说明比较。

边界与待核查事项

【资料库适用范围判断】部分实体未来已知,但被遮挡实体后果仍需预测;输入条件强于仅给首帧。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.3–5:实体掩码接口、数据构造;p.6 §4.2:训练规模;p.7 §5.1、Tables 1–2:跨本体条件与比较。方法已核查,未复现实验。

版本指纹 feef3cb2cd12955f1ac8daf4d5493a9a1f22f2855f2be03abe71373a0e4e8dee

返回筛选与清单
P395 / 2026研究者收藏Patch Policy: Efficient Embodied Control via Dense Visual RepresentationsGaoyue Zhou; Zichen Jeff Cui; Ada Langford; Bowen Tan; Yann LeCun; Lerrel PintoPatch Policy 使用预训练视觉特征中的局部 token,减少对完整视觉语言模型的依赖。AI方法与评测展开标注
#P39527 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Patch Policy 使用预训练视觉特征中的局部 token,减少对完整视觉语言模型的依赖。

本篇研究的问题

能否直接利用稠密视觉 token 学习高效的机器人策略?

适用条件

机器人动作策略并非可供人浏览的后果视频生成器。

方法与训练

Patch Policy 使用预训练视觉特征中的局部 token,减少对完整视觉语言模型的依赖。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】机器人动作策略并非可供人浏览的后果视频生成器。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9c4c9a5416831e337a9b76ac5edd6f0c2cc8746ec7b76f582565b53b2d37b919

返回筛选与清单
P394 / 2026研究者收藏RoboTTT: Context Scaling for Robot PoliciesYunfan Jiang; Yevgen Chebotar; Ruijie Zheng; Fengyuan Hu; Yunhao Ge; Jimmy Wu; Tianyuan Dai; Scott Reed; Li Fei-Fei; Yuke Zhu; Linxi "Jim" FanRoboTTT 用测试时训练机制扩展视觉运动上下文,研究示范学习、扰动恢复与多阶段任务。世界机制与演化展开标注
#P39422 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

RoboTTT 用测试时训练机制扩展视觉运动上下文,研究示范学习、扰动恢复与多阶段任务。

本篇研究的问题

机器人策略怎样利用很长的交互历史而控制推理成本?

适用条件

长策略上下文不等于像素视频的长期世界记忆。

方法与训练

RoboTTT 用测试时训练机制扩展视觉运动上下文,研究示范学习、扰动恢复与多阶段任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】长策略上下文不等于像素视频的长期世界记忆。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6e3cbcbc0ab4db0c20e693c905c9ff4e7f7afe726b15f8fb6dc3a6d7415e4ca0

返回筛选与清单
P393 / 2026研究者收藏ThinkBLOX: 3D Indoor Scene Generation with Progressive ReasoningYuan Xiao; Can Wang; Xiangyu Kong; Jing LiaoThinkBLOX 用 VLM 逐步放置和修整场景,构建带多视图、推理说明和 JSON 布局的训练数据,并使用分层奖励优化。创作与规则补全展开标注
#P39320 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ThinkBLOX 用 VLM 逐步放置和修整场景,构建带多视图、推理说明和 JSON 布局的训练数据,并使用分层奖励优化。

本篇研究的问题

三维室内场景能否通过逐步推理与局部反馈来构建和修改?

适用条件

推理发生在 VLM 与显式场景布局层;尚不能据此认定视频模型自身推断物理后果。

方法与训练

ThinkBLOX 用 VLM 逐步放置和修整场景,构建带多视图、推理说明和 JSON 布局的训练数据,并使用分层奖励优化。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】推理发生在 VLM 与显式场景布局层;尚不能据此认定视频模型自身推断物理后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 de4aa660b0bf398e069ce0f3a2a6d4bd0a340330571e29d4984a65c95a1b054b

返回筛选与清单
P392 / 2026研究者收藏Video Generation Models are General-Purpose Vision LearnersLetian Wang; Chuhan Zhang; Rishabh Kabra; Jasper Uijlings; Steven Waslander; Andrew Zisserman; Joao Carreira; Kaiming He; Misha Andriluka; Eduard Gabriel Bazavan; Andrei Zanfir; Cristian SminchisescuGenCeption 将预训练视频扩散骨干改为前馈感知模型,经任务条件后训练支持深度、法线、分割、姿态和关键点等任务。创作与规则补全展开标注
#P39219 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GenCeption 将预训练视频扩散骨干改为前馈感知模型,经任务条件后训练支持深度、法线、分割、姿态和关键点等任务。

本篇研究的问题

视频生成预训练能否提供可迁移到多种视觉任务的通用表征?

适用条件

重点是生成预训练到感知的迁移,不能把感知任务泛化等同于视频模型预测干预后果。

方法与训练

将视频扩散骨干改成干净 latent、固定 t=0 的单次前向感知模型;稠密任务映射到 RGB,稀疏任务加可学习 token,主要使用合成监督。

验证范围

多类稠密与稀疏视觉感知任务;本条核查了接口和训练任务,未逐表复核全部分数。

边界与待核查事项

【资料库适用范围判断】重点是生成预训练到感知的迁移,不能把感知任务泛化等同于视频模型预测干预后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.5–7 §3、Fig.4–5:生成到感知改造和统一输出;方法已核查,未复现实验。

版本指纹 26bd3358e5d33da3f221c3dce11878af6635d478bc9d5986d5f7535542218dac

返回筛选与清单
P391 / 2026研究者收藏AdaJEPA: An Adaptive Latent World ModelYing Wang; Oumayma Bounou; Yann LeCun; Mengye RenAdaJEPA 在执行动作后,用观测到的转移更新编码器和预测器的部分参数,再进行规划。世界机制与演化展开标注
#P39119 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AdaJEPA 在执行动作后,用观测到的转移更新编码器和预测器的部分参数,再进行规划。

本篇研究的问题

部署时遇到外观或动力学变化,潜空间世界模型能否利用刚发生的交互快速适应?

适用条件

属于潜空间模型的测试时适应;不等于显式规则编辑,也没有直接验证写实视频质量。

方法与训练

测试时每次 MPC 后用自监督转移损失更新编码器、预测器的后层;近期 5 个样本回放,每次一步梯度更新。

验证范围

PushT、PointMaze 上的变化测试;按目标达成评价,而不是视频 FVD。正文给出种子和每种环境的具体变化,不能概括为任意机制突变均已解决。

边界与待核查事项

【资料库适用范围判断】属于潜空间模型的测试时适应;不等于显式规则编辑,也没有直接验证写实视频质量。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.2–6:方法闭环、更新参数、回放、数据与变化设置。方法已核查,未复现实验。

版本指纹 8e4dfbf66b1f4b0ef46122dab4a291a470ff55cd736a384de298516df3c4b2f1

返回筛选与清单
P390 / 2026研究者收藏ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using AgentsBinjie Zhang; Mike Zheng ShouReGRPO 用错误类型、证据和修复计划构造训练数据,再联合优化反思与纠正动作并计入反思成本。AI方法与评测展开标注
#P39029 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ReGRPO 用错误类型、证据和修复计划构造训练数据,再联合优化反思与纠正动作并计入反思成本。

本篇研究的问题

工具智能体怎样从实际失败中学习有效且不过量的反思?

适用条件

工具任务中的纠错不直接证明物理世界机制修订或视频推理。

方法与训练

ReGRPO 用错误类型、证据和修复计划构造训练数据,再联合优化反思与纠正动作并计入反思成本。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】工具任务中的纠错不直接证明物理世界机制修订或视频推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 90a758137f9f806a368585afe21ac6cb3989279dd10463d92842f3bd38e51bb6

返回筛选与清单
P389 / 2026研究者收藏SimFoundry: Modular and Automated Scene Generation for Policy Learning and EvaluationNadun Ranawaka; Josiah Wong; Wei-Lin Pai; Wei-Teng Chu; Tianyuan Dai; Masoud Moghani; Hang Yin; Yunfan Jiang; Wesley Durbano; Brandon Huynh; Yu Fang; Danfei Xu; Ruohan Zhang; Li Fei-Fei; Linxi Fan; Bowen Wen; Ajay Mandlekar; Yuke ZhuSimFoundry 以模块化 real-to-sim 管线生成场景,并比较仿真排序和真实执行结果。世界机制与演化展开标注
#P38952 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

SimFoundry 以模块化 real-to-sim 管线生成场景,并比较仿真排序和真实执行结果。

本篇研究的问题

真实视频能否自动转成适合策略学习和评价的模拟场景?

适用条件

仿真与真实的相关性在所测任务中成立,不能作为所有生成世界的物理保真保证。

方法与训练

SimFoundry 以模块化 real-to-sim 管线生成场景,并比较仿真排序和真实执行结果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】仿真与真实的相关性在所测任务中成立,不能作为所有生成世界的物理保真保证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 2a4e30098edc6561be9ae0aa9ba39815a3f3566cb76e28c5abb073c951e0896e

返回筛选与清单
P388 / 2026研究者收藏Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot VideosDanze Chen; Yanzhe Chen; Qiming Huang; Zhijun Cao; Chen Gao; Mike Zheng ShouGRA 将合成数据中的几何运动提炼为二维末端路径,用辅助预测和表征对齐适配 VLA。创作与规则补全展开标注
#P38814 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GRA 将合成数据中的几何运动提炼为二维末端路径,用辅助预测和表征对齐适配 VLA。

本篇研究的问题

合成机器人视频中的哪些信息适合监督真实动作模型?

适用条件

视频中的几何轨迹与低层电机控制分开处理;不能直接把像素恢复成可靠控制标签。

方法与训练

GRA 将合成数据中的几何运动提炼为二维末端路径,用辅助预测和表征对齐适配 VLA。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视频中的几何轨迹与低层电机控制分开处理;不能直接把像素恢复成可靠控制标签。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f9aabeb548ce5d5b8d2e523174ba013d72e1db271236011f44bc8a1bc4be4aec

返回筛选与清单
P387 / 2026研究者收藏MeshFlow: Mesh Generation with Equivariant Flow MatchingQi Sun; Kiyohiro Nakayama; Jing Nathan Yan; Qixing Huang; Alexander Rush; Leonidas Guibas; Gordon Wetzstein; Jing Liao; Guandao YangMeshFlow 在三角形集合上使用等变最优传输流匹配,修改 Transformer 与训练目标以保持排列对称性。创作与规则补全展开标注
#P38719 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MeshFlow 在三角形集合上使用等变最优传输流匹配,修改 Transformer 与训练目标以保持排列对称性。

本篇研究的问题

网格生成如何尊重面与顶点排列的对称性?

适用条件

研究网格表示和生成,未在摘要中提出动态机制学习或动作后果预测。

方法与训练

MeshFlow 在三角形集合上使用等变最优传输流匹配,修改 Transformer 与训练目标以保持排列对称性。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】研究网格表示和生成,未在摘要中提出动态机制学习或动作后果预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c4544385bea3f55672e34ecbbc73af07beb0681407cac9984a8bc611bf4157d9

返回筛选与清单
P386 / 2026研究者收藏SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of QuadrotorsPratyaksh Rao; Wancong Zhang; Randall Balestriero; Yann LeCun; Giuseppe LoiannoSkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合,研究仿真到真实的飞行控制。世界机制与演化展开标注
#P38618 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

SkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合,研究仿真到真实的飞行控制。

本篇研究的问题

如何把潜空间世界模型用于高频无人机控制?

适用条件

可读出的物理状态与控制成功不代表模型内部是完整可解释的物理机制。

方法与训练

SkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合,研究仿真到真实的飞行控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】可读出的物理状态与控制成功不代表模型内部是完整可解释的物理机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 523eab23420bb1180313472d4ecac96e496241f09a57a5f1b469bb61b4e8f03e

返回筛选与清单
P385 / 2026研究者收藏BoxCtrl: 3D-Aware Visual Prompting for Geometric Image EditingFeifei Wang; Shiyuan Yang; Xiaoyu Li; Jing LiaoBoxCtrl 以 RGB 三维框的二维投影作为视觉提示,先使用合成数据监督微调,再通过真实数据与几何、画质奖励进行强化学习。创作与规则补全展开标注
#P38510 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

BoxCtrl 以 RGB 三维框的二维投影作为视觉提示,先使用合成数据监督微调,再通过真实数据与几何、画质奖励进行强化学习。

本篇研究的问题

如何通过投影的三维框精确控制图像中的几何编辑?

适用条件

编辑目标由用户的几何控制给定;几何编辑准确性与未知物理后果预测应分别评价。

方法与训练

BoxCtrl 以 RGB 三维框的二维投影作为视觉提示,先使用合成数据监督微调,再通过真实数据与几何、画质奖励进行强化学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】编辑目标由用户的几何控制给定;几何编辑准确性与未知物理后果预测应分别评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9e0a06eee81e9ac0b84faf94287b9cf7cb03cfc40645716ecf4c9980f919f5f3

返回筛选与清单
P384 / 2026研究者收藏Learning Stable Canonical Worlds for Novel View Synthesis and BeyondXiaoyu Xu; Jian Zou; Sheyang Tang; Zhihua Wang; Jing Liao; Kede MaCanonicalGS 将多视图观测聚合成场景中心表示,降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。世界机制与演化展开标注
#P38420 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

CanonicalGS 将多视图观测聚合成场景中心表示,降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。

本篇研究的问题

增加输入视图时,三维表示怎样收敛到稳定的场景坐标?

适用条件

摘要报告新视角合成与分割收益;静态表示稳定性不直接检验动态世界机制。

方法与训练

CanonicalGS 将多视图观测聚合成场景中心表示,降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】摘要报告新视角合成与分割收益;静态表示稳定性不直接检验动态世界机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 96a4d8784d971b86d842a097d559c9d6a78a184ec5cea306bc2b31dba4ca748b

返回筛选与清单
P383 / 2026研究者收藏Cinematic Compositing Using Character-Environment-Harmonized Video Generation ModelsTianyi Xiang; Mingming He; Li Ma; Jing Liao通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境,并构造重光照训练配对。世界机制与演化展开标注
#P38314 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境,并构造重光照训练配对。

本篇研究的问题

视频合成如何同时表现角色对环境的交互与环境对角色的光照影响?

适用条件

视频合成中的交互合理性需要与指定动作下的正确后果区分;控制输入与配对数据条件待正文核查。

方法与训练

通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境,并构造重光照训练配对。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视频合成中的交互合理性需要与指定动作下的正确后果区分;控制输入与配对数据条件待正文核查。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 78fb1df14e456ece6967a9b4122a9f10d0a2b99e0660fa5c3cde6d5385f457f6

返回筛选与清单
P382 / 2026研究者收藏You Don't Need Strong Assumptions: Visual Representation Learning via Temporal DifferencesNinad Daithankar; Alexi Gladstone; Yann LeCun; Heng Ji这项工作研究利用时间差分学习视觉表示,重新审视常见预训练假设。AI方法与评测展开标注
#P38225 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

这项工作研究利用时间差分学习视觉表示,重新审视常见预训练假设。

本篇研究的问题

时间差分能否在较弱假设下提供有用的视觉学习信号?

适用条件

本轮只核对摘要层的问题定位;具体目标与理论条件仍需方法复核。

方法与训练

这项工作研究利用时间差分学习视觉表示,重新审视常见预训练假设。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】本轮只核对摘要层的问题定位;具体目标与理论条件仍需方法复核。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 2becb6e3a77c05861ed1b1179c8443fc717dc166cbc0b90f54256a07a2117dba

返回筛选与清单
P381 / 2026研究者收藏Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic TasksRaktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad KhorramiWorldDP 在运行时提出可行的子目标,由低层 diffusion policy 执行,连接世界预测与多阶段机器人任务。世界机制与演化展开标注
#P38120 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

WorldDP 在运行时提出可行的子目标,由低层 diffusion policy 执行,连接世界预测与多阶段机器人任务。

本篇研究的问题

对象级世界模型能否为长任务提供可执行的中间目标?

适用条件

高层目标有效性与生成视频中的细粒度物理正确性属于不同评价。

方法与训练

WorldDP 在运行时提出可行的子目标,由低层 diffusion policy 执行,连接世界预测与多阶段机器人任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】高层目标有效性与生成视频中的细粒度物理正确性属于不同评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f0ea19498d3df994d42b4229e76ad5c84df85cb2c98a25d565542740da6520e9

返回筛选与清单
P380 / 2026研究者收藏Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?Rui Zhao; Kaiming Yang; Jifeng Zhu; Siyang Chen; Ziqi Wang; Weijia Wu; Kevin Qinghong Lin; Heng Wang; Mike Zheng ShouDream.exe 以视频到执行管线,分别评估视觉质量、轨迹保真和执行成功。世界机制与演化展开标注
#P38018 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Dream.exe 以视频到执行管线,分别评估视觉质量、轨迹保真和执行成功。

本篇研究的问题

视频中看似合理的机器人操作是否真的可执行?

适用条件

执行评价也受运动恢复与控制管线影响,需与视频生成错误分开归因。

方法与训练

主要贡献是评价框架;包含通用闭源、开源及机器人专用模型,并另测在测试集外数据微调的 Wan。

验证范围

约 101 个经过视角、遮挡与轨迹可辨性筛选的任务,分原子动作、多对象交互、多阶段任务;视觉质量、轨迹保真与执行成功分开。

边界与待核查事项

【资料库适用范围判断】执行评价也受运动恢复与控制管线影响,需与视频生成错误分开归因。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.3–4 §3.1–3.3:任务筛选、难度层级、模型类别与执行评价管线。方法已核查,未重新跑执行实验。

版本指纹 94482eb28e5379a842f0d0172f75faea766f4457ca268924da6a5eceb0e741be

返回筛选与清单
P379 / 2026研究者收藏Demo2Tutorial: From Human Experience to Multimodal Software TutorialsZechen Bai; Zhiheng Chen; Yiqi Lin; Kevin Qinghong Lin; Difei Gao; Xiangwu Guo; Xin Wang; Mike Zheng ShouDemo2Tutorial 将录屏和交互日志解析为动作与意图,再形成层级任务图及图文教程,评估人和 GUI agent 的使用效果。AI方法与评测XR与人机协作展开标注
#P37922 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Demo2Tutorial 将录屏和交互日志解析为动作与意图,再形成层级任务图及图文教程,评估人和 GUI agent 的使用效果。

本篇研究的问题

人类的软件操作记录怎样转成可学习的多模态教程?

适用条件

生成的是软件操作教程,不能等同于预测物理干预后果的视频。

方法与训练

GPT-4o 解析状态变化和意图,Step Planner 组成层级图;不是训练视频扩散模型来预测下一操作后果。

验证范围

TutorialBench 的教程质量比较、教程作为 Agent-S3 外部知识时的 OSWorld 完成率,以及用户完成时间和形式偏好。

边界与待核查事项

【资料库适用范围判断】生成的是软件操作教程,不能等同于预测物理干预后果的视频。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.4–5 §3.2–5:动作解析、任务图、选帧、TutorialBench 与三类评价。方法已核查,未复现实验。

版本指纹 c57408b0f7544f983611881c86ea19f6c78250860d64739139782db5c44aa957

返回筛选与清单
P378 / 2026研究者收藏VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time OptimizationJunhao Cheng; Liang Hou; Tianxiong Zhong; Xin Tao; Pengfei Wan; Kun Gai; Jing LiaoVLM 作为教师构造可微奖励,在测试时优化视频模型的轻量 LoRA,并在 VBVR 与 RULER 上评价。创作与规则补全展开标注
#P37814 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VLM 作为教师构造可微奖励,在测试时优化视频模型的轻量 LoRA,并在 VBVR 与 RULER 上评价。

本篇研究的问题

外部视觉语言模型能否通过过程奖励提升视频生成模型的规则执行?

适用条件

推理阶段仍需要外部教师及在线优化,不能当作无需外部帮助的视频内生推理。

方法与训练

测试时冻结教师与视频骨干,只更新 rank-16 LoRA,最多 40 步;通过轻量 VAE 与可微 VLM 奖励反传。

验证范围

VBVR-Bench 与 RULER-Bench 分开报告;在所述 89 帧设置下比较推理预算。另人工检查每个基准 100 个生成案例,定义过程或最终目标违反为失败。

边界与待核查事项

【作者观察】教师有时漏掉细粒度视觉错误或生成不完整目标;pp.11 的两组 100 案例中剩余失败为 18%/29%。这是该人工子集的比例,不是总榜失败率。优化还有轻微画质损失。

证据定位

PDF p.4 Algorithm 1 与 §B:教师查询和更新流程;p.6 Tables I–II 与参数;p.11 Fig.7、Table V:人工失败归因。方法已核查,未复现实验。

版本指纹 86dca8dff75c7f64442b97ab627e32bf7625261174e6cea7b0f667f3997a05b6

返回筛选与清单
P377 / 2026研究者收藏PAI-Studio: Cinematic Video Background Replacement with Camera-Aware MotionHeyuan Gao; Bangxun Tang; Yiren Song; Guian Fang; Zijian He; Jie Yang; Mike Zheng ShouPAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观,并构建电影来源训练数据。创作与规则补全展开标注
#P37726 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

PAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观,并构建电影来源训练数据。

本篇研究的问题

更换动态背景时怎样保持前景运动、身份和光照协调?

适用条件

背景一致与重光照不直接验证接触、受力或反事实后果。

方法与训练

PAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观,并构建电影来源训练数据。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】背景一致与重光照不直接验证接触、受力或反事实后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0e6849ccc5158041ce5e1a045157e355e52ddecd28e1f5cc218b33f7c76cd2ea

返回筛选与清单
P376 / 2026研究者收藏Planning with the ViewsKangrui Wang; Linjie Li; Zhengyuan Yang; Shiqi Chen; Zihan Wang; Li Fei-Fei; Jiajun Wu; Leonidas Guibas; Lijuan Wang; Manling LiPlanning with the Views 在 ViewSuite 中评估视角变换,通过自探索和视图图蒸馏改善规划。AI方法与评测展开标注
#P37639 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Planning with the Views 在 ViewSuite 中评估视角变换,通过自探索和视图图蒸馏改善规划。

本篇研究的问题

智能体能否预测视角改变并组合多步观察计划?

适用条件

对象是主动观察与空间推理,不直接生成物理交互后果。

方法与训练

Planning with the Views 在 ViewSuite 中评估视角变换,通过自探索和视图图蒸馏改善规划。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】对象是主动观察与空间推理,不直接生成物理交互后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f0a1bb9724940a2d3b876b8368e5e22c748c4e43ec1e01e66bc0e21dbc38589e

返回筛选与清单
P375 / 2026研究者收藏When Does LeJEPA Learn a World Model?David Klindt; Yann LeCun; Randall Balestriero作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。世界机制与演化展开标注
#P37548 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。

本篇研究的问题

在什么条件下,JEPA 学到的表示可辨识为世界状态?

适用条件

结论依赖所给生成过程和分布假设,不能外推为真实世界因果机制的普遍可辨识性。

方法与训练

作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】结论依赖所给生成过程和分布假设,不能外推为真实世界因果机制的普遍可辨识性。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 912f41e8c3fe5389f2136362533e4c7fc3695df8ad1b796adb285a49bb11f676

返回筛选与清单
P374 / 2026研究者收藏stable-worldmodel: A Platform for Reproducible World Modeling Research and EvaluationLucas Maes; Quentin Le Lidec; Luiz Facury; Nassim Massaudi; Ayush Chaurasia; Francesco Capuano; Richard Gao; Taj Gillin; Dan Haramati; Damien Scieur; Yann LeCun; Randall Balestrierostable-worldmodel 提供数据、模型和规划器接口,以及视觉、几何和物理变化的统一实验平台。世界机制与演化展开标注
#P37436 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

stable-worldmodel 提供数据、模型和规划器接口,以及视觉、几何和物理变化的统一实验平台。

本篇研究的问题

怎样使世界模型在受控环境变化下的比较可复现?

适用条件

这是比较基础设施;具体模型是否解决某类变化仍须查看实验结果。

方法与训练

stable-worldmodel 提供数据、模型和规划器接口,以及视觉、几何和物理变化的统一实验平台。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这是比较基础设施;具体模型是否解决某类变化仍须查看实验结果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d9b1ea1261c7aea9f0a382c1992073b62e6f713553533557a24b71f3b498b666

返回筛选与清单
P373 / 2026研究者收藏SWEET: Sparse World Modeling with Image Editing for Embodied Task ExecutionYiren Song; Yihan Wang; Xiyao Deng; Zhuoran Yan; Mike Zheng ShouSWEET 在相同机器人数据设置下比较视频生成和图像编辑,再用逐次编辑产生任务关键帧。世界机制与演化展开标注
#P37313 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

SWEET 在相同机器人数据设置下比较视频生成和图像编辑,再用逐次编辑产生任务关键帧。

本篇研究的问题

机器人任务是否可以用稀疏关键状态替代密集视频规划?

适用条件

稀疏目标的执行收益不表示帧间动态正确;对 Foresee 是预览预算的对照方法。

方法与训练

SWEET 在相同机器人数据设置下比较视频生成和图像编辑,再用逐次编辑产生任务关键帧。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】稀疏目标的执行收益不表示帧间动态正确;对 Foresee 是预览预算的对照方法。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7b278a04c9b23b87d7df2c3d8fbba39c440375cd0dd37d4d23f1cdf1d89e0694

返回筛选与清单
P372 / 2026研究者收藏ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action LoopYining Hong; Jiageng Liu; Han Yin; Manling Li; Leonidas Guibas; Li Fei-Fei; Jiajun Wu; Yejin ChoiESI-Bench 在 OmniGibson 中让观察者执行动作取证,比较主动探索、被动观察与三维辅助。创作与规则补全展开标注
#P37238 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ESI-Bench 在 OmniGibson 中让观察者执行动作取证,比较主动探索、被动观察与三维辅助。

本篇研究的问题

空间理解从固定观察转为主动探索后会发生什么?

适用条件

显式三维表示错误也可能损害推理;不能预设 3D 辅助必然更可靠。

方法与训练

ESI-Bench 在 OmniGibson 中让观察者执行动作取证,比较主动探索、被动观察与三维辅助。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】显式三维表示错误也可能损害推理;不能预设 3D 辅助必然更可靠。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bf5f11b8ffc8a3ce3add08ad4f833ffcec6ceab47e2cbed8e8a24a7f8a9469f9

返回筛选与清单
P371 / 2026研究者收藏VISTA: Triplet-Supervised Video Style Transfer with Diffusion TransformersYiren Song; Wangzi Yao; Haofan Wang; Mike Zheng ShouVISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。创作与规则补全展开标注
#P37113 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。

本篇研究的问题

视频风格迁移怎样解耦风格、内容和运动?

适用条件

风格和时间一致性的结果不能证明物理规则遵循。

方法与训练

VISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】风格和时间一致性的结果不能证明物理规则遵循。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 adf1173982c0327c98dad41bc46679f22e1957b8d6b9e28fba664d27369f7a6f

返回筛选与清单
P370 / 2026研究者收藏StreamingEffect: Real-Time Human-Centric Video Effect GenerationYiren Song; Cheng Liu; Yuxin Jiang; Mike Zheng ShouStreamingEffect 将双向教师蒸馏为因果学生并减少采样步数,支持在线注入关键帧特效。创作与规则补全XR与人机协作展开标注
#P37015 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

StreamingEffect 将双向教师蒸馏为因果学生并减少采样步数,支持在线注入关键帧特效。

本篇研究的问题

交互式人物视频特效怎样做到因果流式生成?

适用条件

论文的实时设置使用 H200;不能直接承诺 A10 上同等分辨率和延迟。

方法与训练

StreamingEffect 将双向教师蒸馏为因果学生并减少采样步数,支持在线注入关键帧特效。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】论文的实时设置使用 H200;不能直接承诺 A10 上同等分辨率和延迟。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bcd9ea701f726ec4ff2941bebbb4b757775362e9a7d432b69d52f5da73204d5d

返回筛选与清单
P369 / 2026研究者收藏AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map DistillationYuchao Gu; Guian Fang; Yuxin Jiang; Weijia Mao; Song Han; Han Cai; Mike Zheng ShouAnyFlow 学习任意时间区间的 flow map,并通过在策略分布上的模拟蒸馏改善少步采样。创作与规则补全展开标注
#P36919 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AnyFlow 学习任意时间区间的 flow map,并通过在策略分布上的模拟蒸馏改善少步采样。

本篇研究的问题

视频扩散怎样同时适应不同采样预算并减少因果滚动误差?

适用条件

速度与质量需按模型、帧数、硬件共同报告;蒸馏本身不保证物理推理保留。

方法与训练

AnyFlow 学习任意时间区间的 flow map,并通过在策略分布上的模拟蒸馏改善少步采样。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】速度与质量需按模型、帧数、硬件共同报告;蒸馏本身不保证物理推理保留。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5c868d02d9b1885516efea37413c48fecbffc5231aaad458c506c542756e39a1

返回筛选与清单
P368 / 2026研究者收藏World Action Models: The Next Frontier in Embodied AISiyin Wang; Junhao Shi; Zhaoyang Fu; Xinzhe He; Feihong Liu; Chenchen Yang; Yikang Zhou; Zhaoye Fei; Jingjing Gong; Jinlan Fu; Mike Zheng Shou; Xuanjing Huang; Xipeng Qiu; Yu-Gang JiangWorld Action Models 综述区分级联和联合建模,梳理数据、条件和动作解码方式。世界机制与演化展开标注
#P36869 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

World Action Models 综述区分级联和联合建模,梳理数据、条件和动作解码方式。

本篇研究的问题

怎样统一描述未来状态预测和动作生成的结合方式?

适用条件

综述中的研究议程不是新模型能力已被验证的证据。

方法与训练

World Action Models 综述区分级联和联合建模,梳理数据、条件和动作解码方式。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】综述中的研究议程不是新模型能力已被验证的证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 4b729cae694621b327156c6cd75778764664a6a3a8cebce7637162d89d544b6b

返回筛选与清单
P367 / 2026研究者收藏OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free AdaptationYiren Song; Xiyao Deng; Pei Yang; Yihan Wang; Mike Zheng ShouOmniHumanoid 将共享运动迁移与外形适配器分开,并支持流式人形视频生成。创作与规则补全展开标注
#P36715 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

OmniHumanoid 将共享运动迁移与外形适配器分开,并支持流式人形视频生成。

本篇研究的问题

跨机器人外形的视频动作迁移能否减少新外形配对数据需求?

适用条件

保持动作外观与真实机器人可执行性需要不同测试。

方法与训练

OmniHumanoid 将共享运动迁移与外形适配器分开,并支持流式人形视频生成。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】保持动作外观与真实机器人可执行性需要不同测试。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9e4860b1b4d0508780804c6c4a37abd23653a92720c48c9fc8fd35308806a0e2

返回筛选与清单
P366 / 2026研究者收藏On Training in ImaginationNadav Timor; Ravid Shwartz-Ziv; Micah Goldblum; Yann LeCun; David Harel作者分析动力学和奖励误差对策略学习的影响,讨论噪声、方差与计算预算之间的关系。世界机制与演化展开标注
#P36628 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者分析动力学和奖励误差对策略学习的影响,讨论噪声、方差与计算预算之间的关系。

本篇研究的问题

在想象轨迹上训练策略时,模型误差怎样影响策略回报?

适用条件

理论中的误差与平滑性假设需要对应到实际模型;不能以视频观感代替回报验证。

方法与训练

作者分析动力学和奖励误差对策略学习的影响,讨论噪声、方差与计算预算之间的关系。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】理论中的误差与平滑性假设需要对应到实际模型;不能以视频观感代替回报验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d5090958c236509a195949febba05be65e00413a54c92dffe616f812f1e02d00

返回筛选与清单
P365 / 2026研究者收藏Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled GuidanceZiyun Zeng; Yiqi Lin; Guoqiang Liang; Mike Zheng ShouSparkle 构建解耦引导和质量筛选的数据管线,并发布背景替换数据与基准。创作与规则补全展开标注
#P36528 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Sparkle 构建解耦引导和质量筛选的数据管线,并发布背景替换数据与基准。

本篇研究的问题

怎样为背景替换生成更准确的前景和背景监督?

适用条件

已知原视频内容的编辑,不等同于预测新动作的后果。

方法与训练

Sparkle 构建解耦引导和质量筛选的数据管线,并发布背景替换数据与基准。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】已知原视频内容的编辑,不等同于预测新动作的后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0f6e44f8bdf1460ffb1639861f2bce47ea8c392d7bad7fd845eb0a03aca89295

返回筛选与清单
P364 / 2026研究者收藏Agentic World Modeling: Foundations, Capabilities, Laws, and BeyondMeng Chu; Xuan Billy Zhang; Kevin Qinghong Lin; Lingdong Kong; Jize Zhang; Teng Tu; Weijian Ma; Ziqi Huang; Senqiao Yang; Wei Huang; Yeying Jin; Zhefan Rao; Jinhui Ye; Xinyu Lin; Xichen Zhang; Qisheng Hu; Shuai Yang; Leyang Shen; Wei Chow; Yifei Dong; Fengyi Wu; Quanyu Long; Bin Xia; Shaozuo Yu; Mingkang Zhu; Wenhu Zhang; Jiehui Huang; Haokun Gui; Runyi Li; Chenyu Tang; Dong Huang; Xuhang Chen; Rui Liu; Chengzu Li; Shiyi Du; Xu Huang; Haoxuan Che; Long Chen; Qifeng Chen; Wenya Wang; Wenxuan Zhang; Xiaojuan Qi; Yang Deng; Yanwei Li; Mike Zheng Shou; Zhi-Qi Cheng; See-Kiong Ng; Ziwei Liu; Philip Torr; Jiaya JiaAgentic World Modeling 以能力层级和规律类型整理文献,并提出面向决策的评价原则。世界机制与演化展开标注
#P36492 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Agentic World Modeling 以能力层级和规律类型整理文献,并提出面向决策的评价原则。

本篇研究的问题

跨不同环境和规则类型,怎样比较 agent 的世界建模能力?

适用条件

分类框架用于组织证据,不能把所有子领域的进展当成同一种能力。

方法与训练

Agentic World Modeling 以能力层级和规律类型整理文献,并提出面向决策的评价原则。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】分类框架用于组织证据,不能把所有子领域的进展当成同一种能力。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bcbdd805f4f00d7c84b9fb673af01e5ac42cd1cfe11b35db00bdcc96ce4357db

返回筛选与清单
P363 / 2026研究者收藏Image Generators are Generalist Vision LearnersValentin Gabeur; Shangbang Long; Songyou Peng; Paul Voigtlaender; Shuyang Sun; Yanan Bao; Karen Truong; Zhicheng Wang; Wenlei Zhou; Jonathan T. Barron; Kyle Genova; Nithish Kannen; Sherry Ben; Yandong Li; Mandy Guo; Suhas Yogin; Yiming Gu; Huizhong Chen; Oliver Wang; Saining Xie; Howard Zhou; Kaiming He; Thomas Funkhouser; Jean-Baptiste Alayrac; Radu SoricutVision Banana 将多种感知任务的输出编码成 RGB 图像,以图像生成骨干进行统一指令微调。创作与规则补全展开标注
#P36330 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Vision Banana 将多种感知任务的输出编码成 RGB 图像,以图像生成骨干进行统一指令微调。

本篇研究的问题

图像生成模型能否通过少量指令微调成为通用视觉模型?

适用条件

任务涉及二维和三维感知;视频动力学与反事实后果需要独立评价。

方法与训练

Vision Banana 将多种感知任务的输出编码成 RGB 图像,以图像生成骨干进行统一指令微调。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】任务涉及二维和三维感知;视频动力学与反事实后果需要独立评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 088b078cbc2b6183ec50fc95910c1daf6e29f7e4928ed17dda6d978a82204dc6

返回筛选与清单
P362 / 2026研究者收藏HumanScore: Benchmarking Human Motions in Generated VideosYusu Fang; Tiange Xiang; Tian Tan; Narayan Schuetz; Scott Delp; Li Fei-Fei; Ehsan AdeliHumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。世界机制与演化展开标注
#P36250 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。

本篇研究的问题

生成的人体动作是否符合身体结构和生物力学约束?

适用条件

人体运动评价不直接覆盖液体、接触物体或任意自定义规律。

方法与训练

HumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】人体运动评价不直接覆盖液体、接触物体或任意自定义规律。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d59f84b262a81d4065149f7810b9d4a164c9f093eaf059e8e726518ec969d9f6

返回筛选与清单
P361 / 2026研究者收藏GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game AgentsMingyu Ouyang; Siyuan Hu; Kevin Qinghong Lin; Hwee Tou Ng; Mike Zheng ShouGameWorld 统一浏览器游戏动作接口,并用可检验状态度量任务结果。AI方法与评测展开标注
#P36152 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GameWorld 统一浏览器游戏动作接口,并用可检验状态度量任务结果。

本篇研究的问题

多模态游戏 agent 能否用状态真值进行可复现评价?

适用条件

游戏执行成功不同于生成的视频是否遵循同一规则。

方法与训练

GameWorld 统一浏览器游戏动作接口,并用可检验状态度量任务结果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】游戏执行成功不同于生成的视频是否遵循同一规则。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5966ec57c1ef2f7efff58859a8948e1c3288451241c696241c0af4b85412eb73

返回筛选与清单
P360 / 2026研究者收藏RAGEN-2: Reasoning Collapse in Agentic RLZihan Wang; Chi Gui; Xing Jin; Qineng Wang; Licheng Liu; Kangrui Wang; Shiqi Chen; Linjie Li; Zhengyuan Yang; Pingyue Zhang; Yiping Lu; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling LiRAGEN-2 区分输出多样性与跨输入可辨别性,提出互信息代理诊断和信噪比筛选。AI方法与评测展开标注
#P36044 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

RAGEN-2 区分输出多样性与跨输入可辨别性,提出互信息代理诊断和信噪比筛选。

本篇研究的问题

强化学习中的推理是否依赖当前输入,而非套用模板?

适用条件

agent 文本推理的模板坍塌与视频生成的推理能力须分别测量。

方法与训练

RAGEN-2 区分输出多样性与跨输入可辨别性,提出互信息代理诊断和信噪比筛选。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】agent 文本推理的模板坍塌与视频生成的推理能力须分别测量。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ef9b6f06768f39cc6d41d6ca909f1c23b51873eef3ed668c249e6553240c85ed

返回筛选与清单
P359 / 2026研究者收藏OpenWorldLib: A Unified Codebase and Definition of Advanced World ModelsDataFlow Team; Bohan Zeng; Daili Hua; Kaixin Zhu; Yifan Dai; Bozhou Li; Yuran Wang; Chengzhuo Tong; Yifan Yang; Mingkun Chang; Jianbin Zhao; Zhou Liu; Hao Liang; Xiaochen Ma; Ruichuan An; Junbo Niu; Zimo Meng; Tianyi Bai; Meiyi Qiang; Huanyao Zhang; Zhiyou Xiao; Tianyu Guo; Qinhan Yu; Runhao Zhao; Zhengpin Li; Xinyi Huang; Yisheng Pan; Yiwen Tang; Juanxi Tian; Yang Shi; Yue Ding; Xinlong Chen; Hongcheng Gao; Minglei Shi; Jialong Wu; Zekun Wang; Yuanxing Zhang; Xintao Wang; Pengfei Wan; Yiren Song; Mike Zheng Shou; Wentao ZhangOpenWorldLib 提供多任务推理框架和能力分类,连接感知、交互与长期记忆模块。世界机制与演化展开标注
#P35928 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

OpenWorldLib 提供多任务推理框架和能力分类,连接感知、交互与长期记忆模块。

本篇研究的问题

异构世界模型如何通过统一接口复用和比较?

适用条件

统一代码接口不意味着模型在全部能力上均已达标。

方法与训练

OpenWorldLib 提供多任务推理框架和能力分类,连接感知、交互与长期记忆模块。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】统一代码接口不意味着模型在全部能力上均已达标。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3cc9a8f0540d484d3572c669f0dca62330c92604d8892104e0724c94f3e5fe2b

返回筛选与清单
P358 / 2026研究者收藏Hierarchical Planning with Latent World ModelsWancong Zhang; Basile Terver; Artem Zholus; Soham Chitnis; Harsh Sutaria; Mido Assran; Randall Balestriero; Amir Bar; Adrien Bardes; Yann LeCun; Nicolas BallasHWM 使用分层世界模型与模型预测控制,在不同层级组织目标和动作搜索。世界机制与演化展开标注
#P35829 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HWM 使用分层世界模型与模型预测控制,在不同层级组织目标和动作搜索。

本篇研究的问题

视觉潜空间规划怎样扩展到更长时间尺度?

适用条件

层级规划成功不自动保证像素生成长期一致。

方法与训练

HWM 使用分层世界模型与模型预测控制,在不同层级组织目标和动作搜索。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】层级规划成功不自动保证像素生成长期一致。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a3217f9fa8806a9d1b01f03bf2005de4a85e1d9bbe2312c39fd993ceaf233b9d

返回筛选与清单
P357 / 2026研究者收藏IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting ReproductionYingke Wang; Hao Li; Yifeng Zhu; Hong-Xing Yu; Ken Goldberg; Li Fei-Fei; Jiajun Wu; Yunzhu Li; Ruohan ZhangIMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。世界机制与演化展开标注
#P35714 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

IMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。

本篇研究的问题

学习的像素动力学怎样用于真实油画笔触规划?

适用条件

与绘画任务直接相邻;需要细读画材、笔触参数及预测误差的具体范围。

方法与训练

IMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】与绘画任务直接相邻;需要细读画材、笔触参数及预测误差的具体范围。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0d90acc934d92a4b360cbe903eddbfa5045b1a47e469bd3f5ddc31008de12062

返回筛选与清单
P356 / 2026研究者收藏CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot ManipulationLetian Fu; Justin Yu; Karim El-Refai; Ethan Kou; Haoru Xue; Huang Huang; Wenli Xiao; Guanzhi Wang; Dantong Niu; Fei-Fei Li; Guanya Shi; Jiajun Wu; Shankar Sastry; Yuke Zhu; Ken Goldberg; Linxi "Jim" FanCaP-X 统一代码策略评价,并研究多轮反馈、技能合成和强化学习改进。AI方法与评测展开标注
#P35658 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

CaP-X 统一代码策略评价,并研究多轮反馈、技能合成和强化学习改进。

本篇研究的问题

代码作为机器人策略时,抽象层级与执行反馈怎样影响可靠性?

适用条件

显式代码策略与可执行环境动力学模型不同,也非视频生成器推理。

方法与训练

CaP-X 统一代码策略评价,并研究多轮反馈、技能合成和强化学习改进。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】显式代码策略与可执行环境动力学模型不同,也非视频生成器推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fe177f46cdbfd7fdd605aacfaea8399269cd7a9075b6425e9d0257620ee2baa6

返回筛选与清单
P355 / 2026研究者收藏P-Flow: Prompting Visual Effects GenerationRui Zhao; Mike Zheng ShouP-Flow 探索免训练的动态特效定制,在文本和图像条件视频任务中评估效果。创作与规则补全展开标注
#P35517 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

P-Flow 探索免训练的动态特效定制,在文本和图像条件视频任务中评估效果。

本篇研究的问题

不更新模型参数能否按提示定制动态视觉特效?

适用条件

特效生成可以违背现实物理,但不因此证明用户指定机制被系统性执行。

方法与训练

P-Flow 探索免训练的动态特效定制,在文本和图像条件视频任务中评估效果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】特效生成可以违背现实物理,但不因此证明用户指定机制被系统性执行。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 29a4df888f3bd28ca6c4fa5f10faf525f5aebe459a6315b0de264d60c86b5e3c

返回筛选与清单
P354 / 2026研究者收藏MIRAGE: The Illusion of Visual UnderstandingMohammad Asadi; Jack W. O'Sullivan; Fang Cao; Tahoura Nedaee; Kamyar Rajabalifardi; Fei-Fei Li; Ehsan Adeli; Euan AshleyMIRAGE 检查缺失图像时仍产生详细描述和高分的现象,并提出减少文本泄漏的评价方法。AI方法与评测展开标注
#P35429 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MIRAGE 检查缺失图像时仍产生详细描述和高分的现象,并提出减少文本泄漏的评价方法。

本篇研究的问题

多模态模型的正确回答是否真正使用了图像?

适用条件

主要实验涉及图像问答;作为视觉依赖测试的设计参照,不能直接外推视频生成失败率。

方法与训练

MIRAGE 检查缺失图像时仍产生详细描述和高分的现象,并提出减少文本泄漏的评价方法。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要实验涉及图像问答;作为视觉依赖测试的设计参照,不能直接外推视频生成失败率。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 56fe2e64fd295dd0ab9eb820e0f89e701e180aa01795716104acbfca26f0b4dc

返回筛选与清单
P353 / 2026研究者收藏LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from PixelsLucas Maes; Quentin Le Lidec; Damien Scieur; Yann LeCun; Randall BalestrieroLeWorldModel 联合学习编码与未来潜状态预测,并以高斯正则约束表示分布,考察规划和物理异常信号。世界机制与演化展开标注
#P35328 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LeWorldModel 联合学习编码与未来潜状态预测,并以高斯正则约束表示分布,考察规划和物理异常信号。

本篇研究的问题

能否以简洁的端到端目标从像素学习可用于规划的世界模型?

适用条件

物理异常可检测不等于已识别具体因果规律,也不直接提供人可观看的后果视频。

方法与训练

LeWorldModel 联合学习编码与未来潜状态预测,并以高斯正则约束表示分布,考察规划和物理异常信号。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】物理异常可检测不等于已识别具体因果规律,也不直接提供人可观看的后果视频。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 553a01501ac74ec56721cfdb936d3825ac941734133a1fd761f614c01b6887e9

返回筛选与清单
P352 / 2026研究者收藏V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised LearningLorenzo Mur-Labadia; Matthew Muckley; Amir Bar; Mido Assran; Koustuv Sinha; Mike Rabbat; Yann LeCun; Nicolas Ballas; Adrien BardesV-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。世界机制与演化展开标注
#P35237 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

V-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。

本篇研究的问题

怎样获得空间与时间上更稠密、稳定的视频表征?

适用条件

重点是表示学习;应与动作条件世界模型和视频生成模块区分。

方法与训练

V-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】重点是表示学习;应与动作条件世界模型和视频生成模块区分。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b40580916242ade00e2ac177cb01473d511f021d5a25f7552fd17512b3a72bbb

返回筛选与清单
P351 / 2026研究者收藏Representation Learning for Spatiotemporal Physical SystemsHelen Qu; Rudy Morel; Michael McCabe; Alberto Bietti; François Lanusse; Shirley Ho; Yann LeCun作者用物理参数估计等下游任务评估时空物理系统的表示,比较预测式与通用自监督学习。世界机制与演化展开标注
#P3519 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者用物理参数估计等下游任务评估时空物理系统的表示,比较预测式与通用自监督学习。

本篇研究的问题

物理系统表征的质量是否能由下一帧预测准确率代表?

适用条件

评价强调任务差别;不能把一个下游任务的优势泛化到全部物理推理。

方法与训练

作者用物理参数估计等下游任务评估时空物理系统的表示,比较预测式与通用自监督学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】评价强调任务差别;不能把一个下游任务的优势泛化到全部物理推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 72431d26489450db993513a92320d0f73180b66c9e155ea7efc8e140bb834ba3

返回筛选与清单
P350 / 2026研究者收藏Temporal Straightening for Latent PlanningYing Wang; Oumayma Bounou; Gaoyue Zhou; Randall Balestriero; Tim G. J. Rudner; Yann LeCun; Mengye RenTemporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。世界机制与演化展开标注
#P35029 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Temporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。

本篇研究的问题

怎样使潜空间轨迹更利于梯度规划?

适用条件

更易优化的潜空间不必等同于真实世界的线性动力学或显式机制。

方法与训练

Temporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】更易优化的潜空间不必等同于真实世界的线性动力学或显式机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 832ded537e06439556493d215e22568fc6d530d252b13b0d5895417ff25e4a3b

返回筛选与清单
P349 / 2026研究者收藏EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect CreationShiyuan Yang; Ruihuang Li; Jiale Tao; Shuai Shao; Qinglin Lu; Jing LiaoEffectMaker 将推理和特效生成连接,构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。创作与规则补全展开标注
#P34922 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

EffectMaker 将推理和特效生成连接,构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。

本篇研究的问题

如何从参考效果中推断并生成可定制的视频特效?

适用条件

特效可以刻意违背真实物理;应分别核对参考一致性、可控性与推理承担者。

方法与训练

EffectMaker 将推理和特效生成连接,构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】特效可以刻意违背真实物理;应分别核对参考一致性、可控性与推理承担者。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6f5c7200c87c1527aff00a1382e8b2101e51006a94d8a1fe0d291aefb60bdd3e

返回筛选与清单
P348 / 2026研究者收藏Kiwi-Edit: Versatile Video Editing via Instruction and Reference GuidanceYiqi Lin; Guoqiang Liang; Ziyun Zeng; Zechen Bai; Yanzhe Chen; Mike Zheng ShouKiwi-Edit 构建参考图引导的编辑四元组数据,并以多阶段训练融合语义查询和视觉特征。创作与规则补全展开标注
#P34818 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Kiwi-Edit 构建参考图引导的编辑四元组数据,并以多阶段训练融合语义查询和视觉特征。

本篇研究的问题

视频编辑能否同时精确遵循语言与视觉参考?

适用条件

参考遵循和编辑保持与干预后果的因果正确性不同。

方法与训练

Kiwi-Edit 构建参考图引导的编辑四元组数据,并以多阶段训练融合语义查询和视觉特征。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】参考遵循和编辑保持与干预后果的因果正确性不同。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9dff3f5ac153e0195fad13ac26e82825238bbe2c60206fb50c4718b61755191d

返回筛选与清单
P347 / 2026研究者收藏Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMsYining Hong; Huang Huang; Manling Li; Li Fei-Fei; Leonidas Guibas; Jiajun Wu; Yejin ChoiReflective Test-Time Planning 在行动前评分候选,行动后以外部反馈更新模型,并追溯早期决策。世界机制与演化展开标注
#P34733 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Reflective Test-Time Planning 在行动前评分候选,行动后以外部反馈更新模型,并追溯早期决策。

本篇研究的问题

执行前后反思怎样共同改善长程具身规划?

适用条件

推理和更新主要由具身语言 agent 承担,不能作为视频生成模型内生推理证据。

方法与训练

Reflective Test-Time Planning 在行动前评分候选,行动后以外部反馈更新模型,并追溯早期决策。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】推理和更新主要由具身语言 agent 承担,不能作为视频生成模型内生推理证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 04876b8eb9758dad5fbe793b5fa2b603974674cca46e2e7fbf3cd55d8552e28f

返回筛选与清单
P346 / 2026研究者收藏GeoPT: Scaling Physics Simulation via Lifted Geometric Pre-TrainingHaixu Wu; Minghao Guo; Zongyi Li; Zhiyang Dou; Mingsheng Long; Kaiming He; Wojciech MatusikGeoPT 用合成动态信息扩展静态几何上的自监督任务,再适配流体、固体等神经仿真任务。世界机制与演化展开标注
#P34628 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GeoPT 用合成动态信息扩展静态几何上的自监督任务,再适配流体、固体等神经仿真任务。

本篇研究的问题

静态几何预训练怎样为物理仿真提供有用的动态表征?

适用条件

这是神经仿真器预训练,输出与评价并非写实视频生成。

方法与训练

GeoPT 用随机速度、粒子和动态距离等构造预训练信号,把静态几何数据扩展为动态表征学习。

验证范围

下游神经仿真任务评估;本轮未把仿真误差转写为视频生成质量结论。

边界与待核查事项

【资料库适用范围判断】这是神经仿真器预训练,输出与评价并非写实视频生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF pp.3–6:预训练任务、合成动态与下游适配。方法已核查,未复现实验。

版本指纹 9c8ce699ca8c5006f19728962f66b2b042000d8b1665c1544ddc6c45a4be1428

返回筛选与清单
P345 / 2026研究者收藏Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic SamplingQi Sun; Can Wang; Jiaxiang Shang; Yingchun Liu; Jing LiaoAni3DHuman 将刚性骨架运动与残余非刚性运动分层,由粗渲染引导视频扩散,再通过自引导随机采样兼顾外观质量和身份保持。创作与规则补全展开标注
#P34526 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Ani3DHuman 将刚性骨架运动与残余非刚性运动分层,由粗渲染引导视频扩散,再通过自引导随机采样兼顾外观质量和身份保持。

本篇研究的问题

如何同时保持三维人体身份、关节运动和非刚性细节?

适用条件

刚性动作由运动学方法提供;衣物等细节的视觉合理性不等于完整物理仿真。

方法与训练

Ani3DHuman 将刚性骨架运动与残余非刚性运动分层,由粗渲染引导视频扩散,再通过自引导随机采样兼顾外观质量和身份保持。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】刚性动作由运动学方法提供;衣物等细节的视觉合理性不等于完整物理仿真。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 20408cdc9dd8ba4ca8e71b2a20175b61923cbbf72d33e9a6ee75c2a3ab6d917e

返回筛选与清单
P344 / 2026研究者收藏Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art ActivityLe Lin; Zihao Zhu; Rainbow Tin Hung Ho; Jing Liao; Yuhan Luo系统分析创作画面并与创作者对话,报告五位相关专家的初步评价和后续设计问题。AI方法与评测XR与人机协作展开标注
#P3446 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

系统分析创作画面并与创作者对话,报告五位相关专家的初步评价和后续设计问题。

本篇研究的问题

多模态聊天机器人如何支持艺术创作中的反思交流?

适用条件

属于进行中的探索性研究;专家意见不能替代临床疗效或长期用户收益验证。

方法与训练

系统分析创作画面并与创作者对话,报告五位相关专家的初步评价和后续设计问题。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】属于进行中的探索性研究;专家意见不能替代临床疗效或长期用户收益验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 51a00643aded9a127f34619f307ed8a9496e334b839b63d09b2a82f506e8798b

返回筛选与清单
P343 / 2026研究者收藏stable-worldmodel-v1: Reproducible World Modeling Research and EvaluationLucas Maes; Quentin Le Lidec; Dan Haramati; Nassim Massaudi; Damien Scieur; Yann LeCun; Randall Balestrierostable-worldmodel-v1 提供统一模型与规划评测,讨论 DINO-WM 等方法对分布变化的表现。世界机制与演化展开标注
#P34310 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

stable-worldmodel-v1 提供统一模型与规划评测,讨论 DINO-WM 等方法对分布变化的表现。

本篇研究的问题

怎样系统比较潜空间世界模型在环境变化下的规划稳健性?

适用条件

与后续 stable-worldmodel 报告属于同一项目脉络,保留独立预印本记录而不视作独立复现实验。

方法与训练

stable-worldmodel-v1 提供统一模型与规划评测,讨论 DINO-WM 等方法对分布变化的表现。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】与后续 stable-worldmodel 报告属于同一项目脉络,保留独立预印本记录而不视作独立复现实验。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 52bd6b3194034879efad3e2a8e3154aaf7abb07640c5b78e9fe743fed7cebeb2

返回筛选与清单
P342 / 2026研究者收藏Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?Pingyue Zhang; Zihan Huang; Yue Wang; Jieyu Zhang; Letian Xue; Zihan Wang; Qineng Wang; Keshigeyan Chandrasegaran; Ruohan Zhang; Yejin Choi; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Manling LiTheory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。世界机制与演化展开标注
#P34234 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Theory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。

本篇研究的问题

智能体怎样从主动探索的部分观察建立和修正空间信念?

适用条件

显式报告的信念是探针输出,不应默认忠实等同于全部内部状态。

方法与训练

Theory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】显式报告的信念是探针输出,不应默认忠实等同于全部内部状态。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 79bf433cd80d17b97f971eaffec019517c1b12bd1775268f4e1d887ef3abfc01

返回筛选与清单
P341 / 2026研究者收藏World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA PolicyXiaokang Liu; Zechen Bai; Hai Ci; Kevin Yuchen Ma; Mike Zheng ShouWorld-VLA-Loop 以状态感知视频模型预测帧和二元奖励,形成世界模型与 VLA 的闭环训练。世界机制与演化展开标注
#P34116 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

World-VLA-Loop 以状态感知视频模型预测帧和二元奖励,形成世界模型与 VLA 的闭环训练。

本篇研究的问题

视频世界模型与动作策略能否通过成功及近成功轨迹共同改进?

适用条件

策略收益需与模型误差区分;闭环改进不自动解决新规律或反常识机制。

方法与训练

World-VLA-Loop 以状态感知视频模型预测帧和二元奖励,形成世界模型与 VLA 的闭环训练。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】策略收益需与模型误差区分;闭环改进不自动解决新规律或反常识机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7fec3ba10f703027ea302f8a9752d398d6f562cbb0e99c0161d0044a8621ccc0

返回筛选与清单
P340 / 2026研究者收藏Generative Modeling via DriftingMingyang Deng; He Li; Tianhong Li; Yilun Du; Kaiming HeDrifting Models 通过漂移场推动生成样本分布与数据分布匹配,形成单步推理的生成器。AI方法与评测展开标注
#P34028 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Drifting Models 通过漂移场推动生成样本分布与数据分布匹配,形成单步推理的生成器。

本篇研究的问题

能否在训练阶段演化生成分布,从而只用一步采样?

适用条件

ImageNet 图像结果不能直接作为视频时序质量或小显存实时性的证据。

方法与训练

Drifting Models 通过漂移场推动生成样本分布与数据分布匹配,形成单步推理的生成器。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】ImageNet 图像结果不能直接作为视频时序质量或小显存实时性的证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 4c6de150102edf01fdde787a2bc6d20962cd2021769db09e41c4ac7fb4ab852f

返回筛选与清单
P339 / 2026研究者收藏A Lightweight Library for Energy-Based Joint-Embedding Predictive ArchitecturesBasile Terver; Randall Balestriero; Megi Dervishi; David Fan; Quentin Garrido; Tushar Nagarajan; Koustuv Sinha; Wancong Zhang; Mike Rabbat; Yann LeCun; Amir BarEB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。世界机制与演化展开标注
#P33917 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

EB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。

本篇研究的问题

怎样以统一组件实现图像、视频和动作条件 JEPA?

适用条件

软件框架的覆盖范围不是每类下游能力已验证的证据。

方法与训练

EB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】软件框架的覆盖范围不是每类下游能力已验证的证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 45cab1dc74600314965a5bd18a9fc89afb722a5a53f99e37a30c07daf6a6ec0f

返回筛选与清单
P338 / 2026研究者收藏Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy RepresentationsYilun Kuang; Yash Dagade; Tim G. J. Rudner; Randall Balestriero; Yann LeCunRectified LpJEPA 以整流广义高斯分布约束表示,研究稀疏性与视觉表征学习。AI方法与评测展开标注
#P33850 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Rectified LpJEPA 以整流广义高斯分布约束表示,研究稀疏性与视觉表征学习。

本篇研究的问题

能否用稀疏非负表征的分布匹配目标改善自监督学习?

适用条件

主要是表征基础方法;视频后果预测与规划需要另外验证。

方法与训练

Rectified LpJEPA 以整流广义高斯分布约束表示,研究稀疏性与视觉表征学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要是表征基础方法;视频后果预测与规划需要另外验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7533200d7ce5e32d4e9a50b31e3dcf0bbea9befaed5b56cbc44e15fac27e54da

返回筛选与清单
P337 / 2026研究者收藏Parallel Stochastic Gradient-Based Planning for World ModelsMichael Psenka; Michael Rabbat; Aditi Krishnapriyan; Yann LeCun; Amir BarGRASP 引入并行优化的虚拟状态和软动力学约束,缓解逐步展开的规划成本。世界机制与演化展开标注
#P33723 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GRASP 引入并行优化的虚拟状态和软动力学约束,缓解逐步展开的规划成本。

本篇研究的问题

怎样加速通过可微世界模型进行动作规划?

适用条件

收益依赖已学习的世界模型及优化条件,不直接解决视频生成显存占用。

方法与训练

GRASP 引入并行优化的虚拟状态和软动力学约束,缓解逐步展开的规划成本。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】收益依赖已学习的世界模型及优化条件,不直接解决视频生成显存占用。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 633bff79e5913401f578d4f13cbee65526221fef859d865cdaab6cfc0fa802a8

返回筛选与清单
P336 / 2026研究者收藏One-step Latent-free Image Generation with Pixel Mean FlowsYiyang Lu; Susie Lu; Qiao Sun; Hanhong Zhao; Zhicheng Jiang; Xianbang Wang; Tianhong Li; Zhengyang Geng; Kaiming HePixel MeanFlow 区分网络输出空间和损失空间,在图像流形与平均速度之间建立转换。AI方法与评测展开标注
#P33613 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Pixel MeanFlow 区分网络输出空间和损失空间,在图像流形与平均速度之间建立转换。

本篇研究的问题

如何实现无需潜空间编码器的单步像素图像生成?

适用条件

评价主要为静态图像生成;直接迁移到视频仍需处理时间维度与资源需求。

方法与训练

Pixel MeanFlow 区分网络输出空间和损失空间,在图像流形与平均速度之间建立转换。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】评价主要为静态图像生成;直接迁移到视频仍需处理时间维度与资源需求。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 eeb12d58cad222029d10c2549e68cb68de890dae84dcf1b1692c4368e47004a0

返回筛选与清单
P335 / 2026研究者收藏ShowUI-Aloha: Human-Taught GUI AgentYichun Zhang; Xiangwu Guo; Yauhong Goh; Jessica Hu; Zhiheng Chen; Xin Wang; Difei Gao; Mike Zheng ShouShowUI-Aloha 结合录屏和精确交互记录,整理可执行任务与示范数据。AI方法与评测XR与人机协作展开标注
#P33516 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ShowUI-Aloha 结合录屏和精确交互记录,整理可执行任务与示范数据。

本篇研究的问题

怎样把非结构化人类录屏转成 GUI agent 可学习的任务?

适用条件

软件界面操作与物理 AR 任务存在状态和动作接口差别。

方法与训练

ShowUI-Aloha 结合录屏和精确交互记录,整理可执行任务与示范数据。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】软件界面操作与物理 AR 任务存在状态和动作接口差别。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b3904c9a6bb4a90932307a97dba7f34754a6b29a7027d4fd1753aa700d82e83c

返回筛选与清单
P334 / 2026研究者收藏Learning Latent Action World Models In The WildQuentin Garrido; Tushar Nagarajan; Basile Terver; Nicolas Ballas; Yann LeCun; Michael Rabbat作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模,减少对离散动作码的依赖。世界机制与演化展开标注
#P33437 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模,减少对离散动作码的依赖。

本篇研究的问题

无动作标注的真实视频能否提供可迁移的连续潜动作?

适用条件

潜动作的控制效果不代表动作语义具有唯一的因果解释。

方法与训练

作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模,减少对离散动作码的依赖。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】潜动作的控制效果不代表动作语义具有唯一的因果解释。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b005b53ccba93bcc68471d7c9fb88b1504849b8e63f11395d18d6535fec2bca4

返回筛选与清单
P333 / 2026研究者收藏PointWorld: Scaling 3D World Models for In-The-Wild Robotic ManipulationWenlong Huang; Yu-Wei Chao; Arsalan Mousavian; Ming-Yu Liu; Dieter Fox; Kaichun Mo; Li Fei-FeiPointWorld 从 RGB-D 与动作预测逐像素三维位移,并以真实、合成轨迹研究跨本体规模化训练。世界机制与演化展开标注
#P33338 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

PointWorld 从 RGB-D 与动作预测逐像素三维位移,并以真实、合成轨迹研究跨本体规模化训练。

本篇研究的问题

不同机器人能否在统一三维点流中表达动作和状态变化?

适用条件

三维位移预测与写实视频渲染是不同输出;动作和深度是额外条件。

方法与训练

PointWorld 从 RGB-D 与动作预测逐像素三维位移,并以真实、合成轨迹研究跨本体规模化训练。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】三维位移预测与写实视频渲染是不同输出;动作和深度是额外条件。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 368ee87a0aeb2b784026d4eb0bd47e38937759473a2762f0ac338f9ad06a4b08

返回筛选与清单
P332 / 2025研究者收藏Value-guided action planning with JEPA world modelsMatthieu Destrade; Oumayma Bounou; Quentin Le Lidec; Jean Ponce; Yann LeCunValue-guided action planning 使表示距离近似目标条件价值,从而为动作优化提供更有用的信号。世界机制与演化展开标注
#P3327 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Value-guided action planning 使表示距离近似目标条件价值,从而为动作优化提供更有用的信号。

本篇研究的问题

如何让潜空间距离更接近任务价值而改善动作规划?

适用条件

引入任务价值改变了监督条件,不能直接与纯无奖励表示学习等同。

方法与训练

Value-guided action planning 使表示距离近似目标条件价值,从而为动作优化提供更有用的信号。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】引入任务价值改变了监督条件,不能直接与纯无奖励表示学习等同。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ba1c5eb85c58ac4d1ab81b707019751689b2a7dc10f4d3f5db9ceb8d3ada35e3

返回筛选与清单
P331 / 2025研究者收藏ShowUI-$π$: Flow-based Generative Models as GUI Dexterous HandsSiyuan Hu; Kevin Qinghong Lin; Mike Zheng ShouShowUI-π 用 flow 模型生成连续鼠标调整,并构建拖拽数据与 ScreenDrag 基准。AI方法与评测XR与人机协作展开标注
#P33117 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ShowUI-π 用 flow 模型生成连续鼠标调整,并构建拖拽数据与 ScreenDrag 基准。

本篇研究的问题

GUI agent 怎样同时生成点击与连续拖拽动作?

适用条件

输出是界面动作轨迹,不能当作像素视频生成模型的推理结果。

方法与训练

ShowUI-π 用 flow 模型生成连续鼠标调整,并构建拖拽数据与 ScreenDrag 基准。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】输出是界面动作轨迹,不能当作像素视频生成模型的推理结果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 15c655e464f2f9ed719c6cdc796777658952cff8b4529c14f337373fa1e0d8c7

返回筛选与清单
P330 / 2025研究者收藏Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object FlowKarthik Dharmarajan; Wenlong Huang; Jiajun Wu; Li Fei-Fei; Ruohan ZhangDream2Flow 从生成视频恢复三维物体流,再以轨迹跟踪连接操作控制。创作与规则补全展开标注
#P33013 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Dream2Flow 从生成视频恢复三维物体流,再以轨迹跟踪连接操作控制。

本篇研究的问题

生成视频中的物体运动怎样转成机器人可追踪的任务?

适用条件

真实执行还依赖三维恢复与控制器;必须区分生成和下游转换的误差。

方法与训练

Dream2Flow 从生成视频恢复三维物体流,再以轨迹跟踪连接操作控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】真实执行还依赖三维恢复与控制器;必须区分生成和下游转换的误差。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 873040c1844b4e34f493b1dff8ac4eb16948b23b2fd220adfba2f5dfcb05daad

返回筛选与清单
P329 / 2025研究者收藏What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?Basile Terver; Tsung-Yen Yang; Jean Ponce; Adrien Bardes; Yann LeCun作者系统比较表示、训练目标和规划器配置,并在仿真和真实任务中检查效果。世界机制与演化展开标注
#P32955 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者系统比较表示、训练目标和规划器配置,并在仿真和真实任务中检查效果。

本篇研究的问题

JEPA 世界模型的物理规划成功主要受哪些设计影响?

适用条件

需要按统一数据和预算读比较结果;规划成功不能替代视频真实性评价。

方法与训练

作者系统比较表示、训练目标和规划器配置,并在仿真和真实任务中检查效果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】需要按统一数据和预算读比较结果;规划成功不能替代视频真实性评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d2dd4364de28d0b41f7001d26fd8d43487c31a9df5a5759ef319f89adad39a18

返回筛选与清单
P328 / 2025研究者收藏QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language ModelsLi Puyin; Tiange Xiang; Ella Mao; Shirley Wei; Xinye Chen; Adnan Masood; Li Fei-fei; Ehsan AdeliQuantiPhy 以数值真值评价尺寸、速度和加速度估计,并改变背景和反事实先验。世界机制与演化展开标注
#P32850 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

QuantiPhy 以数值真值评价尺寸、速度和加速度估计,并改变背景和反事实先验。

本篇研究的问题

模型能否从视频和给定量纲先验准确估计运动物理量?

适用条件

主要测试 VLM 数值推理,不是生成未来视频的物理正确率。

方法与训练

QuantiPhy 以数值真值评价尺寸、速度和加速度估计,并改变背景和反事实先验。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要测试 VLM 数值推理,不是生成未来视频的物理正确率。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bf80d110c59702360c656cdb49eb1ab5e6993125e9a9842d7c1c11de33c58786

返回筛选与清单
P327 / 2025研究者收藏Mitty: Diffusion-based Human-to-Robot Video GenerationYiren Song; Cheng Liu; Weijia Mao; Mike Zheng ShouMitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。创作与规则补全展开标注
#P32717 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Mitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。

本篇研究的问题

人类操作视频怎样端到端转成机器人外形的视频?

适用条件

动作来源视频已知;外形迁移质量与真实操作成功需要分开验证。

方法与训练

Mitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动作来源视频已知;外形迁移质量与真实操作成功需要分开验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a883300a26ac1469f6e06dc131df89cb2478ec3ac62eb8c1ad10b2ec5ae9d695

返回筛选与清单
P326 / 2025研究者收藏World Models for Learning Dexterous Hand-Object Interactions from Human VideosRaktim Gautam Goswami; Amir Bar; David Fan; Tsung-Yen Yang; Gaoyue Zhou; Prashanth Krishnamurthy; Michael Rabbat; Farshad Khorrami; Yann LeCunDexWM 使用手指关键点动作表示与潜状态、手部一致性目标,学习可用于灵巧规划的动态表示。世界机制与演化展开标注
#P32623 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DexWM 使用手指关键点动作表示与潜状态、手部一致性目标,学习可用于灵巧规划的动态表示。

本篇研究的问题

人类第一人称手部视频能否支持灵巧操作世界模型?

适用条件

主要预测潜状态;人到机器人动作映射与写实后果生成是另外的环节。

方法与训练

DexWM 使用手指关键点动作表示与潜状态、手部一致性目标,学习可用于灵巧规划的动态表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要预测潜状态;人到机器人动作映射与写实后果生成是另外的环节。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 caa494829e49b893346ae4fcedbe462e99f197192c7e84d27405a2776723a390

返回筛选与清单
P325 / 2025研究者收藏Animus3D: Text-driven 3D Animation via Motion Score DistillationQi Sun; Can Wang; Jiaxiang Shang; Wensen Feng; Jing LiaoAnimus3D 以运动分数蒸馏优化运动场,利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。创作与规则补全展开标注
#P32511 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Animus3D 以运动分数蒸馏优化运动场,利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。

本篇研究的问题

如何从文本和静态三维资产生成稳定且明显的运动?

适用条件

由视频先验蒸馏出的运动仍需单独检验物理参数和干预后果。

方法与训练

Animus3D 以运动分数蒸馏优化运动场,利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】由视频先验蒸馏出的运动仍需单独检验物理参数和干预后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c9e3d50c33c9c3b9bd088293d01d2f953c69787bd24db4a9259627d7262581d6

返回筛选与清单
P324 / 2025研究者收藏Bidirectional Normalizing Flow: From Data to Noise and BackYiyang Lu; Qiao Sun; Xianbang Wang; Zhicheng Jiang; Hanhong Zhao; Kaiming HeBiFlow 放宽精确解析逆的要求,通过双向归一化流改进生成质量和采样效率。AI方法与评测展开标注
#P32418 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

BiFlow 放宽精确解析逆的要求,通过双向归一化流改进生成质量和采样效率。

本篇研究的问题

归一化流怎样避免因果解码带来的采样瓶颈?

适用条件

单次函数评估及图像采样速度不等于完整视频管线的端到端延迟。

方法与训练

BiFlow 放宽精确解析逆的要求,通过双向归一化流改进生成质量和采样效率。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】单次函数评估及图像采样速度不等于完整视频管线的端到端延迟。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c1de5fd627ede22ecfb4abdb7f24118656a3194fbce9fe8994162926835a8c9d

返回筛选与清单
P323 / 2025研究者收藏VL-JEPA: Joint Embedding Predictive Architecture for Vision-languageDelong Chen; Mustafa Shukor; Theo Moutakanni; Willy Chung; Jade Yu; Tejaswi Kasarla; Yejin Bang; Allen Bolourchi; Yann LeCun; Pascale FungVL-JEPA 将视觉语言预测放在语义嵌入空间,研究选择性解码与视频理解。AI方法与评测展开标注
#P32315 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VL-JEPA 将视觉语言预测放在语义嵌入空间,研究选择性解码与视频理解。

本篇研究的问题

视觉语言系统能否预测语义表示并按需解码文本?

适用条件

这是视觉语言理解架构,不是直接生成未来视频的世界模型。

方法与训练

VL-JEPA 将视觉语言预测放在语义嵌入空间,研究选择性解码与视频理解。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这是视觉语言理解架构,不是直接生成未来视频的世界模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f3218282df13e288d07056e05a50e1306e4cb2b87cd7292538c9da9daf3d7439

返回筛选与清单
P322 / 2025研究者收藏Closing the Train-Test Gap in World Models for Gradient-Based PlanningArjun Parthasarathy; Nimit Kalra; Rohun Agrawal; Yann LeCun; Oumayma Bounou; Pavel Izmailov; Micah Goldblum作者以面向规划的数据合成和训练设计,改善 JEPA 在梯度动作规划中的使用效果。世界机制与演化展开标注
#P32225 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者以面向规划的数据合成和训练设计,改善 JEPA 在梯度动作规划中的使用效果。

本篇研究的问题

训练时预测转移与测试时优化动作之间的差别如何缩小?

适用条件

规划适配的收益需在一致预算下比较,不代表所有长程后果都可信。

方法与训练

作者以面向规划的数据合成和训练设计,改善 JEPA 在梯度动作规划中的使用效果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】规划适配的收益需在一致预算下比较,不代表所有长程后果都可信。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f09aa7c2cd408d3fd5abbb964652cc14261d53aa2e00abc582eba3ed4dbbffad

返回筛选与清单
P321 / 2025研究者收藏H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot VideosHai Ci; Xiaokang Liu; Pei Yang; Yiren Song; Mike Zheng ShouH2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频,并微调 Wan 模型。创作与规则补全展开标注
#P32113 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

H2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频,并微调 Wan 模型。

本篇研究的问题

没有人机配对视频时如何生成保持动作的机器人视频?

适用条件

运动提示提供额外轨迹信息;视觉上的物理贴合不等于低层控制可执行。

方法与训练

H2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频,并微调 Wan 模型。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】运动提示提供额外轨迹信息;视觉上的物理贴合不等于低层控制可执行。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 38d17367bcbdb98b124fd00d14ff3bd0ac717312079b92e00a6b12d4adcfbff4

返回筛选与清单
P320 / 2025研究者收藏From Generated Human Videos to Physically Plausible Robot TrajectoriesJames Ni; Zekai Wang; Wei Lin; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra Malik; Roei HerzigGenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来,并构建动作基准。世界机制与演化展开标注
#P32018 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来,并构建动作基准。

本篇研究的问题

生成的人类动作视频怎样转换成真实机器人能执行的全身行为?

适用条件

物理可行性依赖重建和控制器修正,不能归因于视频生成器独立掌握物理规律。

方法与训练

GenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来,并构建动作基准。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】物理可行性依赖重建和控制器修正,不能归因于视频生成器独立掌握物理规律。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b793c2e15b842ad5982cb1fc21b70b264e2c419e928ae11ebe09e9f657581736

返回筛选与清单
P319 / 2025研究者收藏X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at ScalePei Yang; Hai Ci; Yiren Song; Mike Zheng ShouX-Humanoid 使用合成配对数据适配 Wan 2.2,再将真实人类视频机器人化。创作与规则补全展开标注
#P31916 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

X-Humanoid 使用合成配对数据适配 Wan 2.2,再将真实人类视频机器人化。

本篇研究的问题

能否规模化把人类活动视频转换为人形机器人数据?

适用条件

本体替换保留既有动作,不直接预测新干预的未知后果。

方法与训练

X-Humanoid 使用合成配对数据适配 Wan 2.2,再将真实人类视频机器人化。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】本体替换保留既有动作,不直接预测新干预的未知后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f183f801907c2cb7d624414c1ca781aac086f13dd396a140976feb68fd9e8cc3

返回筛选与清单
P318 / 2025研究者收藏Improved Mean Flows: On the Challenges of Fastforward Generative ModelsZhengyang Geng; Yiyang Lu; Zongze Wu; Eli Shechtman; J. Zico Kolter; Kaiming HeImproved MeanFlow 用平均速度参数化瞬时速度回归,并把引导作为显式条件,改善从零训练的一步生成。AI方法与评测展开标注
#P31813 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Improved MeanFlow 用平均速度参数化瞬时速度回归,并把引导作为显式条件,改善从零训练的一步生成。

本篇研究的问题

平均流的训练目标和引导方式怎样改善单步生成?

适用条件

属于生成模型基础方法;在目标视频骨干上的训练成本和后果保持尚未由该摘要验证。

方法与训练

Improved MeanFlow 用平均速度参数化瞬时速度回归,并把引导作为显式条件,改善从零训练的一步生成。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】属于生成模型基础方法;在目标视频骨干上的训练成本和后果保持尚未由该摘要验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 19a2a27ed86cc813bb0943ab43e80f4a80cf725aa692bb2f7d8c33cbbc8e12b7

返回筛选与清单
P317 / 2025研究者收藏WorldWander: Bridging Egocentric and Exocentric Worlds in Video GenerationQuanjian Song; Yiren Song; Kelly Peng; Yuan Gao; Mike Zheng ShouWorldWander 以同步三元组数据训练上下文视角转换,并构建 EgoExo-8K。创作与规则补全展开标注
#P31723 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

WorldWander 以同步三元组数据训练上下文视角转换,并构建 EgoExo-8K。

本篇研究的问题

第一和第三人称视频之间怎样保持同步运动和主体身份?

适用条件

视角翻译的时间对应来自输入视频;不等同于未来世界演化。

方法与训练

WorldWander 以同步三元组数据训练上下文视角转换,并构建 EgoExo-8K。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视角翻译的时间对应来自输入视频;不等同于未来世界演化。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ef48456975ba7bc3747fb8e8bb42d644c6386af538e05ebe720cab374db4e7d2

返回筛选与清单
P316 / 2025研究者收藏ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric InteractionQineng Wang; Wenlong Huang; Yu Zhou; Hang Yin; Tianwei Bao; Jianwen Lyu; Weiyu Liu; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Manling LiENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答,测试具身认知与世界建模。世界机制与演化展开标注
#P31660 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答,测试具身认知与世界建模。

本篇研究的问题

第一视角长交互中的动作效果和记忆怎样排除画质干扰地评价?

适用条件

采用 VQA 而非像素生成;可作语义后果指标,不能独立评估视频真实性。

方法与训练

ENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答,测试具身认知与世界建模。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】采用 VQA 而非像素生成;可作语义后果指标,不能独立评估视频真实性。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fa243a0e57530b77198d33de536c651ca336843fc3703b91dab45c0fae88e1a7

返回筛选与清单
P315 / 2025研究者收藏Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPOJunhao Cheng; Liang Hou; Xin Tao; Jing LiaoVANS 将视频下一事件预测定义为任务,通过 Joint-GRPO 联合优化 VLM 的事件描述和视频扩散模型的可视化,并构建任务数据。创作与规则补全展开标注
#P31516 页 · 方法条件已核查 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VANS 将视频下一事件预测定义为任务,通过 Joint-GRPO 联合优化 VLM 的事件描述和视频扩散模型的可视化,并构建任务数据。

本篇研究的问题

如何用连续视频回答给定上下文中的下一事件问题?

适用条件

事件推断与视频生成由两个模型协作;不能仅凭视频回答就认定推理全部发生在视频模型内部。

方法与训练

Qwen2.5-VL-3B + Wan-2.1-1.3B;VANS-Data-100K 含程序与预测样本。先分别监督训练,再用 Joint-GRPO 联合对齐;不是只微调一个视频 LoRA。

验证范围

统一输出 352×640、33 帧;比较文本、FVD、CLIP 指标及人工评价。多未来展示位于附录;不等于配对干预的物理真值验证。

边界与待核查事项

【资料库适用范围判断】事件推断与视频生成由两个模型协作;不能仅凭视频回答就认定推理全部发生在视频模型内部。 此处不将未测条件标成作者已观察到的失败。

证据定位

PDF p.4 §3–4:数据与双模型接口;p.12 Appendix C、D.1:训练、统一输出与时延;pp.13–14:多未来及人工评价。方法已核查,未复现实验。

版本指纹 2328c283a20c8a8e5914843cca13237ed7bd500249d06f742408bdfcef3dae18

返回筛选与清单
P314 / 2025研究者收藏Computer-Use Agents as Judges for Generative User InterfaceKevin Qinghong Lin; Siyuan Hu; Linjie Li; Zhengyuan Yang; Lijuan Wang; Philip Torr; Mike Zheng Shou作者提出 AUI-Gym,以 Coder 与计算机使用 agent 协作,通过可执行任务和可视化反馈改进界面。AI方法与评测XR与人机协作展开标注
#P31422 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者提出 AUI-Gym,以 Coder 与计算机使用 agent 协作,通过可执行任务和可视化反馈改进界面。

本篇研究的问题

界面生成能否用实际操作 agent 检查功能并指导修改?

适用条件

agent 评价不替代真实用户体验,需要区分功能可达与人的使用效用。

方法与训练

作者提出 AUI-Gym,以 Coder 与计算机使用 agent 协作,通过可执行任务和可视化反馈改进界面。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】agent 评价不替代真实用户体验,需要区分功能可达与人的使用效用。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ad59baf14a2e90fce2641e795e20abb005a84120dbeb70bae304c5ac37b93a20

返回筛选与清单
P313 / 2025研究者收藏ARC Is a Vision Problem!Keya Hu; Ali Cy; Linlu Qiu; Xiaoman Delores Ding; Runqian Wang; Yeyin Eva Zhu; Jacob Andreas; Kaiming HeVision ARC 把 ARC 网格任务改写为画布上的图像到图像映射,从 ARC 数据训练,并通过测试时训练适应新任务。AI方法与评测展开标注
#P31317 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Vision ARC 把 ARC 网格任务改写为画布上的图像到图像映射,从 ARC 数据训练,并通过测试时训练适应新任务。

本篇研究的问题

抽象规则任务能否用纯视觉表示和测试时训练来求解?

适用条件

视觉推理不等于视频推理;测试时适配成本与任务限定的数据范围需保留。

方法与训练

Vision ARC 把 ARC 网格任务改写为画布上的图像到图像映射,从 ARC 数据训练,并通过测试时训练适应新任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视觉推理不等于视频推理;测试时适配成本与任务限定的数据范围需保留。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0f7c95b5243039fb95827b1f440fd548a96431fb79db551dadf9ebb53e9cb1e0

返回筛选与清单
P312 / 2025研究者收藏Back to Basics: Let Denoising Generative Models DenoiseTianhong Li; Kaiming HeJiT 以大块像素 Transformer 直接预测干净数据,研究去噪目标与流形假设,避免依赖额外 tokenizer。AI方法与评测展开标注
#P31218 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

JiT 以大块像素 Transformer 直接预测干净数据,研究去噪目标与流形假设,避免依赖额外 tokenizer。

本篇研究的问题

直接预测干净像素能否简化高维扩散模型?

适用条件

主要验证图像生成,尚需实测其设计在视频时间一致性上的效果。

方法与训练

JiT 以大块像素 Transformer 直接预测干净数据,研究去噪目标与流形假设,避免依赖额外 tokenizer。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要验证图像生成,尚需实测其设计在视频时间一致性上的效果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8c265e4adfd488ccbce035a53ad9055edddd02f5c0393738f54da583ee832b8f

返回筛选与清单
P311 / 2025研究者收藏LeJEPA: Provable and Scalable Self-Supervised Learning Without the HeuristicsRandall Balestriero; Yann LeCunLeJEPA 提出 Sketched Isotropic Gaussian Regularization,研究表示分布与下游预测风险的联系。世界机制与演化展开标注
#P31150 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LeJEPA 提出 Sketched Isotropic Gaussian Regularization,研究表示分布与下游预测风险的联系。

本篇研究的问题

怎样简化并理论化 JEPA 的防坍塌表征学习目标?

适用条件

表示学习理论不是任意环境机制可辨识或长期规划可靠性的证明。

方法与训练

LeJEPA 提出 Sketched Isotropic Gaussian Regularization,研究表示分布与下游预测风险的联系。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】表示学习理论不是任意环境机制可辨识或长期规划可靠性的证明。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fe06b5488907f56aa9682e2e2febc552d85fe761fda43f2727e65d60fbeb6485

返回筛选与清单
P310 / 2025研究者收藏Cambrian-S: Towards Spatial Supersensing in VideoShusheng Yang; Jihan Yang; Pinzhi Huang; Ellis Brown; Zihao Yang; Yue Yu; Shengbang Tong; Zihan Zheng; Yifan Xu; Muhan Wang; Daohan Lu; Rob Fergus; Yann LeCun; Li Fei-Fei; Saining XieCambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据,考察持续空间回忆和计数。世界机制与演化展开标注
#P31049 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Cambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据,考察持续空间回忆和计数。

本篇研究的问题

视频系统怎样持续记忆并推断画面背后的空间状态?

适用条件

主要证据来自理解和空间记忆任务;不能直接视为可控像素世界生成。

方法与训练

Cambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据,考察持续空间回忆和计数。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要证据来自理解和空间记忆任务;不能直接视为可控像素世界生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 37f622010a463203ac1d8e10fa5d83a3660892366cc9bb71d24a726dabd7bd3b

返回筛选与清单
P309 / 2025研究者收藏MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile ManipulationChengshu Li; Mengdi Xu; Arpit Bahety; Hang Yin; Yunfan Jiang; Huang Huang; Josiah Wong; Sujay Garlanka; Cem Gokmen; Ruohan Zhang; Weiyu Liu; Jiajun Wu; Roberto Martín-Martín; Li Fei-FeiMoMaGen 在软硬约束下扩展示范,综合安排底座、相机和多步操作。世界机制与演化展开标注
#P30922 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MoMaGen 在软硬约束下扩展示范,综合安排底座、相机和多步操作。

本篇研究的问题

移动双臂任务的数据生成怎样同时满足可达性和可见性?

适用条件

仿真中的可行示范生成不是任意视频生成的物理推理。

方法与训练

MoMaGen 在软硬约束下扩展示范,综合安排底座、相机和多步操作。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】仿真中的可行示范生成不是任意视频生成的物理推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f028b76f73150897cecae764d82b9984536e2100d1b9e65bedf301b21adaa99a

返回筛选与清单
P308 / 2025研究者收藏VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM AgentsKangrui Wang; Pingyue Zhang; Zihan Wang; Yaning Gao; Linjie Li; Qineng Wang; Hanyang Chen; Chi Wan; Yiping Lu; Zhengyuan Yang; Lijuan Wang; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Yejin Choi; Manling LiVAGEN 用强化学习约束视觉状态推理,并提供逐轮状态预测奖励。世界机制与演化展开标注
#P30855 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VAGEN 用强化学习约束视觉状态推理,并提供逐轮状态预测奖励。

本篇研究的问题

显式状态估计和转移预测怎样帮助多轮 VLM agent?

适用条件

world model reasoning 由 VLM 的状态推理实现,不能与视频扩散内生推理混用。

方法与训练

VAGEN 用强化学习约束视觉状态推理,并提供逐轮状态预测奖励。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】world model reasoning 由 VLM 的状态推理实现,不能与视频扩散内生推理混用。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 584f18e662f1a22a2c98ceb379a03016b65c5c26f132d93664e11da3b3f871c3

返回筛选与清单
P307 / 2025研究者收藏X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video RenderingZhitong Huang; Mohan Zhang; Renhan Wang; Rui Tang; Hao Zhu; Jing LiaoX2Video 用固有属性通道引导视频扩散,通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。创作与规则补全展开标注
#P30712 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

X2Video 用固有属性通道引导视频扩散,通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。

本篇研究的问题

多种材质、几何和语言条件怎样共同控制长视频渲染?

适用条件

大量几何和渲染条件已由输入提供;应按条件渲染评价,而非自动归为未来机制预测。

方法与训练

X2Video 用固有属性通道引导视频扩散,通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】大量几何和渲染条件已由输入提供;应按条件渲染评价,而非自动归为未来机制预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 52e44b138725e833182d705781e7ce7cfd428353ba771876ebeb9d8844d05b85

返回筛选与清单
P306 / 2025研究者收藏Paper2Video: Automatic Video Generation from Scientific PapersZeyu Zhu; Kevin Qinghong Lin; Mike Zheng ShouPaper2Video 构建论文展示基准,PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。创作与规则补全XR与人机协作展开标注
#P30619 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Paper2Video 构建论文展示基准,PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。

本篇研究的问题

论文怎样自动转为信息协调的讲解视频?

适用条件

这是内容编排式生成;讲解质量不属于物理世界预测。

方法与训练

Paper2Video 构建论文展示基准,PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这是内容编排式生成;讲解质量不属于物理世界预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 22183644f460b10e7e798d9e102f83956c6d393530c0989e6d3021e2bd650364

返回筛选与清单
P305 / 2025研究者收藏Code2Video: A Code-centric Paradigm for Educational Video GenerationYanzhe Chen; Kevin Qinghong Lin; Mike Zheng ShouCode2Video 组合规划、代码生成与视觉检查,并用学科视频和知识测验代理指标评价。创作与规则补全XR与人机协作展开标注
#P30526 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Code2Video 组合规划、代码生成与视觉检查,并用学科视频和知识测验代理指标评价。

本篇研究的问题

教育视频能否用可执行代码实现可修改的内容规划?

适用条件

视频由代码与 agent 组织;VLM 测验也不能直接代表真实人的学习增益。

方法与训练

Code2Video 组合规划、代码生成与视觉检查,并用学科视频和知识测验代理指标评价。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视频由代码与 agent 组织;VLM 测验也不能直接代表真实人的学习增益。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d60affc90d10732718de8fec8203aa480f54d63729e08946a7e895d8b9565fca

返回筛选与清单
P304 / 2025研究者收藏Back to the Features: DINO as a Foundation for Video World ModelsFederico Baldassarre; Marc Szafraniec; Basile Terver; Vasil Khalidov; Francisco Massa; Yann LeCun; Patrick Labatut; Maximilian Seitzer; Piotr BojanowskiDINO-world 在 DINOv2 潜空间预测未来,并考察视频预测与观测—动作轨迹适配。世界机制与演化展开标注
#P30424 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DINO-world 在 DINOv2 潜空间预测未来,并考察视频预测与观测—动作轨迹适配。

本篇研究的问题

预训练 DINO 表征能否支撑通用视频世界预测?

适用条件

潜空间预测和视频解码质量须分别衡量;动作适配有额外交互数据条件。

方法与训练

DINO-world 在 DINOv2 潜空间预测未来,并考察视频预测与观测—动作轨迹适配。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】潜空间预测和视频解码质量须分别衡量;动作适配有额外交互数据条件。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 91c0e4f12ff5e7b097d6ec345c32dd147dfc7b659a408fcec58aa510ed22c4d4

返回筛选与清单
P303 / 2025研究者收藏Whole-Body Conditioned Egocentric Video PredictionYutong Bai; Danny Tran; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra MalikPEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型,并在 Nymeria 上设计分层预测与控制评价。世界机制与演化展开标注
#P30330 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

PEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型,并在 Nymeria 上设计分层预测与控制评价。

本篇研究的问题

给定全身动作轨迹,能否预测第一人称未来视频?

适用条件

输入已包含未来身体运动;它预测观察后果,不能与无动作输入的开放未来预测直接比较。

方法与训练

PEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型,并在 Nymeria 上设计分层预测与控制评价。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】输入已包含未来身体运动;它预测观察后果,不能与无动作输入的开放未来预测直接比较。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a3a22db87578cc786f9140c9e3b87ff2cc67ca02f3bb26dad55387a1aa48b71b

返回筛选与清单
P302 / 2025研究者收藏MindCube: Spatial Mental Modeling from Limited ViewsQineng Wang; Baiqiao Yin; Pingyue Zhang; Jianshu Zhang; Kangrui Wang; Zihan Wang; Jieyu Zhang; Keshigeyan Chandrasegaran; Han Liu; Ranjay Krishna; Saining Xie; Jiajun Wu; Li Fei-Fei; Manling LiMindCube 设计空间问答,并通过先生成认知地图再推理的训练改善空间理解。创作与规则补全展开标注
#P30274 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MindCube 设计空间问答,并通过先生成认知地图再推理的训练改善空间理解。

本篇研究的问题

有限视角下的空间心智模型怎样支持位置、视角和假设运动推理?

适用条件

认知地图上的假设推演不同于物理视频后果生成。

方法与训练

MindCube 设计空间问答,并通过先生成认知地图再推理的训练改善空间理解。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】认知地图上的假设推演不同于物理视频后果生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c9fc97691a917ce4c56024121ff76a57f10788f211329ae44a89f927c2d66a7e

返回筛选与清单
P301 / 2025研究者收藏FramePrompt: In-context Controllable Animation with Zero Structural ChangesGuian Fang; Yuchao Gu; Mike Zheng ShouFramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列,减少专用结构修改。创作与规则补全展开标注
#P30117 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

FramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列,减少专用结构修改。

本篇研究的问题

参考图与骨架动作能否直接作为视频序列条件实现动画控制?

适用条件

未来骨架已给定;主要验证动作控制而非自主预测动作或物理规律。

方法与训练

FramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列,减少专用结构修改。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】未来骨架已给定;主要验证动作控制而非自主预测动作或物理规律。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9963c3af5eeeeab5c754e9bf00cf00aae49d10aa44e74155de37efc9041396bc

返回筛选与清单
P300 / 2025研究者收藏Show-o2: Improved Native Unified Multimodal ModelsJinheng Xie; Zhenheng Yang; Mike Zheng ShouShow-o2 结合自回归与 flow matching,并在因果三维 VAE 空间融合视觉表示。创作与规则补全展开标注
#P30022 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Show-o2 结合自回归与 flow matching,并在因果三维 VAE 空间融合视觉表示。

本篇研究的问题

理解与图像、视频生成能否使用统一的原生模型?

适用条件

统一架构不自动证明理解能力会转移为可靠物理后果生成。

方法与训练

Show-o2 结合自回归与 flow matching,并在因果三维 VAE 空间融合视觉表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】统一架构不自动证明理解能力会转移为可靠物理后果生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 081494e8e7aea985cf943c04f46ae2405eec16acfe15ef7e89b95f346a43ccc4

返回筛选与清单
P299 / 2025研究者收藏V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and PlanningMido Assran; Adrien Bardes; David Fan; Quentin Garrido; Russell Howes; Mojtaba; Komeili; Matthew Muckley; Ammar Rizvi; Claire Roberts; Koustuv Sinha; Artem Zholus; Sergio Arnaud; Abha Gejji; Ada Martin; Francois Robert Hogan; Daniel Dugas; Piotr Bojanowski; Vasil Khalidov; Patrick Labatut; Francisco Massa; Marc Szafraniec; Kapil Krishnakumar; Yong Li; Xiaodong Ma; Sarath Chandar; Franziska Meier; Yann LeCun; Michael Rabbat; Nicolas BallasV-JEPA 2 先学习视频潜表征,再以机器人数据训练动作条件预测器;语言对齐与机器人规划分别评价。世界机制与演化展开标注
#P29948 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

V-JEPA 2 先学习视频潜表征,再以机器人数据训练动作条件预测器;语言对齐与机器人规划分别评价。

本篇研究的问题

大规模无动作视频预训练怎样支持理解与少量交互数据下的机器人规划?

适用条件

V-JEPA 2-AC 是潜空间规划模型;语言问答结果与机器人控制结果不能互作证明。

方法与训练

V-JEPA 2 先学习视频潜表征,再以机器人数据训练动作条件预测器;语言对齐与机器人规划分别评价。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】V-JEPA 2-AC 是潜空间规划模型;语言问答结果与机器人控制结果不能互作证明。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9cfcfde5fb0d9730637da5b9e7317825c3f3d09e91f3553e22eeba42c74d2226

返回筛选与清单
P298 / 2025研究者收藏Diffuse and Disperse: Image Generation with Representation RegularizationRunqian Wang; Kaiming HeDispersive Loss 鼓励隐藏表征分散,不要求正样本配对或外部表征教师,作为生成训练的附加正则。AI方法与评测展开标注
#P29814 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Dispersive Loss 鼓励隐藏表征分散,不要求正样本配对或外部表征教师,作为生成训练的附加正则。

本篇研究的问题

扩散模型的内部表征分散正则能否改善生成?

适用条件

改善图像分布指标不能直接证明物理规律或操作后果更正确。

方法与训练

Dispersive Loss 鼓励隐藏表征分散,不要求正样本配对或外部表征教师,作为生成训练的附加正则。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】改善图像分布指标不能直接证明物理规律或操作后果更正确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 714146a8feba5f50e70d77b878c5ac5bec01d7f492c879cb25acda788d717a16

返回筛选与清单
P297 / 2025研究者收藏macOSWorld: A Multilingual Interactive Benchmark for GUI AgentsPei Yang; Hai Ci; Mike Zheng ShoumacOSWorld 提供可交互软件任务,比较多类 GUI agent 的完成情况。AI方法与评测展开标注
#P29743 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

macOSWorld 提供可交互软件任务,比较多类 GUI agent 的完成情况。

本篇研究的问题

GUI agent 在 macOS 和多语言任务中的执行能力如何?

适用条件

这是相邻交互基准,不能直接支持视频世界模型结论。

方法与训练

macOSWorld 提供可交互软件任务,比较多类 GUI agent 的完成情况。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这是相邻交互基准,不能直接支持视频世界模型结论。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f083d77d05c7ef05e8e240c5279784f4d1ed7549c789ef35bbdbd45149ceceaa

返回筛选与清单
P296 / 2025研究者收藏UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement LearningWeijia Mao; Zhenheng Yang; Mike Zheng ShouUniRL 以模型合成图像形成迭代数据,比较监督微调和 GRPO。AI方法与评测展开标注
#P29616 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

UniRL 以模型合成图像形成迭代数据,比较监督微调和 GRPO。

本篇研究的问题

统一多模态模型能否利用自身生成图像进行后训练?

适用条件

自改进主要在所测图像任务中验证;不能推断自进化会顺带解决世界机制问题。

方法与训练

UniRL 以模型合成图像形成迭代数据,比较监督微调和 GRPO。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】自改进主要在所测图像任务中验证;不能推断自进化会顺带解决世界机制问题。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 52b9dd4a2d3faaac73b44249dcd77a396e9cccd4a9dcfb7e1c39197cc631cdab

返回筛选与清单
P295 / 2025研究者收藏Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?Junhao Cheng; Yuying Ge; Teng Wang; Yixiao Ge; Jing Liao; Ying ShanVideo-Holmes 构建需要跨线索整合的视频推理评测,分析 MLLM 在关键证据利用上的不足。AI方法与评测展开标注
#P29524 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Video-Holmes 构建需要跨线索整合的视频推理评测,分析 MLLM 在关键证据利用上的不足。

本篇研究的问题

视频理解模型能否组合分散线索完成复杂推断?

适用条件

评价对象为视频理解模型,不能将得分直接解释为视频生成模型的推演能力。

方法与训练

Video-Holmes 构建需要跨线索整合的视频推理评测,分析 MLLM 在关键证据利用上的不足。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】评价对象为视频理解模型,不能将得分直接解释为视频生成模型的推演能力。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 4ea036188bc2df822d897d90067b8f494b84ed99f44514ad8c9e8409dbe2dd3f

返回筛选与清单
P294 / 2025研究者收藏OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory GenerationRaktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad KhorramiOSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹,以世界模型指导视觉模仿。世界机制与演化展开标注
#P29424 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

OSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹,以世界模型指导视觉模仿。

本篇研究的问题

单次示范如何迁移到训练中未见过的任务结构?

适用条件

示范提供额外目标信息;未见任务泛化与改变物理规律是不同设置。

方法与训练

OSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹,以世界模型指导视觉模仿。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】示范提供额外目标信息;未见任务泛化与改变物理规律是不同设置。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9c003e2154fa9eded6615fb9d76f9e383b03cd0aabb1d063c676d3af1c763040

返回筛选与清单
P293 / 2025研究者收藏Mean Flows for One-step Generative ModelingZhengyang Geng; Mingyang Deng; Xingjian Bai; J. Zico Kolter; Kaiming HeMeanFlow 以区间平均速度代替仅建模瞬时速度,构建不依赖预训练蒸馏的一步生成框架。AI方法与评测展开标注
#P29316 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MeanFlow 以区间平均速度代替仅建模瞬时速度,构建不依赖预训练蒸馏的一步生成框架。

本篇研究的问题

平均速度场能否支持从零训练的单步生成模型?

适用条件

研究给定图像任务上的采样效率;不是现成视频模型的即插即用加速保证。

方法与训练

MeanFlow 以区间平均速度代替仅建模瞬时速度,构建不依赖预训练蒸馏的一步生成框架。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】研究给定图像任务上的采样效率;不是现成视频模型的即插即用加速保证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 322ba9244ad2c72382038e421fe0ffa92510c51d4f9c740bd7282b36bfc25206

返回筛选与清单
P292 / 2025研究者收藏RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement LearningZihan Wang; Kangrui Wang; Qineng Wang; Pingyue Zhang; Linjie Li; Zhengyuan Yang; Xing Jin; Kefan Yu; Minh Nhat Nguyen; Licheng Liu; Eli Gottlieb; Yiping Lu; Kyunghyun Cho; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling LiRAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。AI方法与评测展开标注
#P29239 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

RAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。

本篇研究的问题

多轮强化学习怎样稳定改善交互 agent 的推理?

适用条件

自进化是训练过程;不能由此推断世界机制的识别、执行和修订已自动解决。

方法与训练

RAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】自进化是训练过程;不能由此推断世界机制的识别、执行和修订已自动解决。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 41d89d5e5466c13bdeda57c78e2b6f1a510fb12b9d4931203979b7af07ff1485

返回筛选与清单
P291 / 2025研究者收藏CasaGPT: Cuboid Arrangement and Scene Assembly for Interior DesignWeitao Feng; Hang Zhou; Jing Liao; Li Cheng; Wenbo ZhouCasaGPT 自回归排列长方体原语,使用拒绝采样降低对象碰撞,并整理场景布局数据。创作与规则补全展开标注
#P29119 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

CasaGPT 自回归排列长方体原语,使用拒绝采样降低对象碰撞,并整理场景布局数据。

本篇研究的问题

用分解的长方体原语能否改进室内场景的构成与放置?

适用条件

静态布局碰撞约束与动态物理演化不同;依赖所定义的几何原语和数据范围。

方法与训练

CasaGPT 自回归排列长方体原语,使用拒绝采样降低对象碰撞,并整理场景布局数据。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】静态布局碰撞约束与动态物理演化不同;依赖所定义的几何原语和数据范围。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f61e00ffc04e5f8fc71a8dc4942cb815031326b1c41b7c3ecb0d354b9bb8ea87

返回筛选与清单
P290 / 2025研究者收藏LiveCC: Learning Video LLM with Streaming Speech Transcription at ScaleJoya Chen; Ziyun Zeng; Yiqi Lin; Wei Li; Zejun Ma; Mike Zheng ShouLiveCC 将词语和视频帧按时间交错训练,建立直播描述数据与体育评论评价。AI方法与评测展开标注
#P29020 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LiveCC 将词语和视频帧按时间交错训练,建立直播描述数据与体育评论评价。

本篇研究的问题

廉价语音转写能否支撑实时视频语言学习?

适用条件

语音是额外监督;评论正确性不同于未来后果预测。

方法与训练

LiveCC 将词语和视频帧按时间交错训练,建立直播描述数据与体育评论评价。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】语音是额外监督;评论正确性不同于未来后果预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 9f341454b0b34e76032b7a5b45675ce2101c175833c37084203bad6eaea7e7ce

返回筛选与清单
P289 / 2025研究者收藏Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-ModelsChen Wang; Fei Xia; Wenhao Yu; Tingnan Zhang; Ruohan Zhang; C. Karen Liu; Li Fei-Fei; Jie Tan; Jacky LiangChain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。AI方法与评测展开标注
#P2899 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Chain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。

本篇研究的问题

视频中难以看见的控制参数能否通过声音和肌肉信号补足?

适用条件

额外声音、肌肉传感与语言推理改变输入条件,不属于仅视频生成器推理。

方法与训练

Chain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】额外声音、肌肉传感与语言推理改变输入条件,不属于仅视频生成器推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 2df31f796ae54ba6140f9efb4716dc7ec6c3ec8c1f11a08d031c2929e2c0d7fe

返回筛选与清单
P288 / 2025研究者收藏AnimeGamer: Infinite Anime Life Simulation with Next Game State PredictionJunhao Cheng; Yuying Ge; Yixiao Ge; Jing Liao; Ying ShanAnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示,再由视频扩散模型解码动画镜头。世界机制与演化展开标注
#P28817 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示,再由视频扩散模型解码动画镜头。

本篇研究的问题

互动动画如何在多轮游戏中更新角色状态和动态镜头?

适用条件

状态推断由 MLLM 承担;语境一致和游戏体验不能替代可执行物理规则检查。

方法与训练

AnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示,再由视频扩散模型解码动画镜头。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】状态推断由 MLLM 承担;语境一致和游戏体验不能替代可执行物理规则检查。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 95f1dfccd3984f72a262720f095302a561fee9048ca0782cfd987a61cb4c5a5c

返回筛选与清单
P287 / 2025研究者收藏WorldScore: A Unified Evaluation Benchmark for World GenerationHaoyi Duan; Hong-Xing Yu; Sirui Chen; Li Fei-Fei; Jiajun WuWorldScore 以明确相机轨迹组织下一场景生成,分开评价控制、质量和动态。世界机制与演化展开标注
#P28721 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

WorldScore 以明确相机轨迹组织下一场景生成,分开评价控制、质量和动态。

本篇研究的问题

不同三维、四维和视频生成方法怎样在统一世界生成任务上比较?

适用条件

相机驱动的世界生成不涵盖全部动作干预和物理机制验证。

方法与训练

WorldScore 以明确相机轨迹组织下一场景生成,分开评价控制、质量和动态。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】相机驱动的世界生成不涵盖全部动作干预和物理机制验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7ddf259570f4b302f44650329fd24ab331a19e218adf538b47019218fb235d06

返回筛选与清单
P286 / 2025研究者收藏Long-Context Autoregressive Video Modeling with Next-Frame PredictionYuchao Gu; Weijia Mao; Mike Zheng ShouFAR 使用远近不同的 patch 粒度组织历史帧,提高长视频建模效率。创作与规则补全展开标注
#P28612 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

FAR 使用远近不同的 patch 粒度组织历史帧,提高长视频建模效率。

本篇研究的问题

长上下文视频自回归怎样减少历史冗余又保留近期细节?

适用条件

长视频质量不必然意味着长期状态与规则始终正确。

方法与训练

FAR 使用远近不同的 patch 粒度组织历史帧,提高长视频建模效率。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】长视频质量不必然意味着长期状态与规则始终正确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ab386437bb41f1ee752bf0f3985fa5bff8a107df1d11437d87af27e0a7df0fe7

返回筛选与清单
P285 / 2025研究者收藏Repurposing 2D Diffusion Models with Gaussian Atlas for 3D GenerationTiange Xiang; Kai Li; Chengjiang Long; Christian Häne; Peihong Guo; Scott Delp; Ehsan Adeli; Li Fei-FeiGaussian Atlas 将三维结构展开到稠密二维网格,构建 GaussianVerse 数据进行微调。创作与规则补全展开标注
#P28516 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Gaussian Atlas 将三维结构展开到稠密二维网格,构建 GaussianVerse 数据进行微调。

本篇研究的问题

二维扩散预训练怎样迁移到三维 Gaussian 生成?

适用条件

主要是静态三维对象,尚不直接预测时空交互。

方法与训练

Gaussian Atlas 将三维结构展开到稠密二维网格,构建 GaussianVerse 数据进行微调。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要是静态三维对象,尚不直接预测时空交互。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cc35db5b3a717c9462509e7e6b45ee12acd952a020860113fb2f7401059d6668

返回筛选与清单
P284 / 2025研究者收藏MTV-Inpaint: Multi-Task Long Video InpaintingShiyuan Yang; Zheng Gu; Liang Hou; Xin Tao; Pengfei Wan; Xiaodong Chen; Jing LiaoMTV-Inpaint 以双分支空间注意力统一补全和插入,通过关键帧处理与中间帧传播扩展序列长度。创作与规则补全展开标注
#P28414 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MTV-Inpaint 以双分支空间注意力统一补全和插入,通过关键帧处理与中间帧传播扩展序列长度。

本篇研究的问题

长视频如何兼顾区域补全与可控对象插入?

适用条件

长序列补全强调外观和时序一致,尚需另测编辑引发的真实因果后果。

方法与训练

MTV-Inpaint 以双分支空间注意力统一补全和插入,通过关键帧处理与中间帧传播扩展序列长度。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】长序列补全强调外观和时序一致,尚需另测编辑引发的真实因果后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 10a152c6f7523fa79fa491ac85abc78fcdbf395039c2ef0746d803d07337cd35

返回筛选与清单
P283 / 2025研究者收藏I2V3D: Controllable image-to-video generation with 3D guidanceZhiyuan Zhang; Dongdong Chen; Jing LiaoI2V3D 先用三维引导生成高质量关键帧,再采用双向引导的视频插值,支持相机、物体和角色动画控制。创作与规则补全展开标注
#P28311 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

I2V3D 先用三维引导生成高质量关键帧,再采用双向引导的视频插值,支持相机、物体和角色动画控制。

本篇研究的问题

如何把粗糙三维渲染转换成可控且连贯的视频?

适用条件

动作与几何由图形管线提供,属于三维条件生成;插值无训练不表示整条管线无训练。

方法与训练

I2V3D 先用三维引导生成高质量关键帧,再采用双向引导的视频插值,支持相机、物体和角色动画控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动作与几何由图形管线提供,属于三维条件生成;插值无训练不表示整条管线无训练。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 56633ccc753cd20c03df705b067edc9ce82af3b97821d2a0141dbd0bad255dff

返回筛选与清单
P282 / 2025研究者收藏Denoising Hamiltonian Network for Physical ReasoningCongyue Deng; Brandon Y. Feng; Cecilia Garraffo; Alan Garbarz; Robin Walters; William T. Freeman; Leonidas Guibas; Kaiming HeDenoising Hamiltonian Network 将物理算子推广成可学习的神经算子,覆盖前向模拟之外的物理推理任务。世界机制与演化展开标注
#P28212 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Denoising Hamiltonian Network 将物理算子推广成可学习的神经算子,覆盖前向模拟之外的物理推理任务。

本篇研究的问题

如何把哈密顿结构扩展到多种物理推理输入输出?

适用条件

需要核对变量表示、训练分布与物理约束;不能把算子任务直接视为写实视频推理。

方法与训练

Denoising Hamiltonian Network 将物理算子推广成可学习的神经算子,覆盖前向模拟之外的物理推理任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】需要核对变量表示、训练分布与物理约束;不能把算子任务直接视为写实视频推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b7248e4bf8cf2a4cfa5c3f614d524079ee11442aaf4c33cfd4a6bddaeb916faf

返回筛选与清单
P281 / 2025研究者收藏Automated Movie Generation via Multi-Agent CoT PlanningWeijia Wu; Zeyu Zhu; Mike Zheng ShouMovieAgent 用层级多智能体思维链组织场景、镜头与角色,并调用视频生成。创作与规则补全展开标注
#P28115 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MovieAgent 用层级多智能体思维链组织场景、镜头与角色,并调用视频生成。

本篇研究的问题

如何从剧本自动规划多场景、多镜头影片?

适用条件

叙事推理由 agent 提供,不能视为生成器自身的长程机制推理。

方法与训练

MovieAgent 用层级多智能体思维链组织场景、镜头与角色,并调用视频生成。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】叙事推理由 agent 提供,不能视为生成器自身的长程机制推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ecf4e084096c19acc40492d502b61982b5c264f4bb2dc8fe35d42790857a604c

返回筛选与清单
P280 / 2025研究者收藏BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household ActivitiesYunfan Jiang; Ruohan Zhang; Josiah Wong; Chen Wang; Yanjie Ze; Hang Yin; Cem Gokmen; Shuran Song; Jiajun Wu; Li Fei-FeiBEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案,覆盖多种困难家庭活动。AI方法与评测XR与人机协作展开标注
#P28036 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

BEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案,覆盖多种困难家庭活动。

本篇研究的问题

家庭任务的全身机器人学习怎样整合本体、采集和训练?

适用条件

是具身执行基础设施;人机协作与视频预览收益需独立评价。

方法与训练

BEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案,覆盖多种困难家庭活动。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】是具身执行基础设施;人机协作与视频预览收益需独立评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 828e65325dc70850f10e52c39abd0676e3432dd73c90e4fcfaa80151b729fe4f

返回筛选与清单
P279 / 2025研究者收藏DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal CyclesRui Zhao; Weijia Mao; Mike Zheng ShouDoraCycle 通过图文双向循环利用单模态数据进行领域适配。AI方法与评测展开标注
#P27917 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DoraCycle 通过图文双向循环利用单模态数据进行领域适配。

本篇研究的问题

没有配对图文时如何把统一模型适配到新风格领域?

适用条件

主要适用于不依赖精确配对知识的任务;视频动力学需要额外条件。

方法与训练

DoraCycle 通过图文双向循环利用单模态数据进行领域适配。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要适用于不依赖精确配对知识的任务;视频动力学需要额外条件。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3fc8dbf9a85a9f829c36b4ca257e71855370b7e368256254f79412e28397b83a

返回筛选与清单
P278 / 2025研究者收藏Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion ModelsJay Zhangjie Wu; Yuxuan Zhang; Haithem Turki; Xuanchi Ren; Jun Gao; Mike Zheng Shou; Sanja Fidler; Zan Gojcic; Huan LingDifix3D+ 用单步图像扩散修复渲染结果,并将修复信号反馈到三维表示。创作与规则补全展开标注
#P27815 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Difix3D+ 用单步图像扩散修复渲染结果,并将修复信号反馈到三维表示。

本篇研究的问题

少步扩散怎样修复三维重建的新视角伪影?

适用条件

新视角补全并不证明补出的隐藏几何是真实测量结果。

方法与训练

Difix3D+ 用单步图像扩散修复渲染结果,并将修复信号反馈到三维表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】新视角补全并不证明补出的隐藏几何是真实测量结果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 aeb3665d5f65e8c66f38f325c0d2cceb9c8fe3726ed8757632b660075f6a8ac8

返回筛选与清单
P277 / 2025研究者收藏Fractal Generative ModelsTianhong Li; Qinyi Sun; Lijie Fan; Kaiming HeFractal Generative Models 通过递归调用生成模块形成自相似结构,并以逐像素自回归图像生成进行验证。AI方法与评测展开标注
#P27713 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Fractal Generative Models 通过递归调用生成模块形成自相似结构,并以逐像素自回归图像生成进行验证。

本篇研究的问题

递归组合原子生成模块能否形成有效的生成架构?

适用条件

模块递归结构本身不提供多步物理或跨分支一致性保证。

方法与训练

Fractal Generative Models 通过递归调用生成模块形成自相似结构,并以逐像素自回归图像生成进行验证。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】模块递归结构本身不提供多步物理或跨分支一致性保证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 91ce21363a7b3c6f0376a9a2be8739ad63a038752699229d2ebe226c7b0f7ac2

返回筛选与清单
P276 / 2025研究者收藏Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics ModelsVlad Sobal; Wancong Zhang; Kyunghyun Cho; Randall Balestriero; Tim G. J. Rudner; Yann LeCun作者在导航任务中系统改变数据质量、多样性和环境布局,比较 JEPA 动力学规划与强化学习。世界机制与演化展开标注
#P27630 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者在导航任务中系统改变数据质量、多样性和环境布局,比较 JEPA 动力学规划与强化学习。

本篇研究的问题

没有奖励标注的离线数据何时更适合模型规划而非无模型强化学习?

适用条件

结论依赖所测任务与数据分布,不是所有机器人场景的普遍排序。

方法与训练

作者在导航任务中系统改变数据质量、多样性和环境布局,比较 JEPA 动力学规划与强化学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】结论依赖所测任务与数据分布,不是所有机器人场景的普遍排序。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5491927bbbc966953cfa17ff24e1208349c8e344921aa0dad2363b16d8456ccf

返回筛选与清单
P275 / 2025研究者收藏Is Noise Conditioning Necessary for Denoising Generative Models?Qiao Sun; Zhicheng Jiang; Hanhong Zhao; Kaiming He研究去除噪声条件后的生成性能与误差,并给出理论和图像实验分析。AI方法与评测展开标注
#P27534 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

研究去除噪声条件后的生成性能与误差,并给出理论和图像实验分析。

本篇研究的问题

去噪生成模型是否必须显式输入噪声等级?

适用条件

结论与噪声分布、模型和数据设置有关;视频模型迁移需单独测试。

方法与训练

研究去除噪声条件后的生成性能与误差,并给出理论和图像实验分析。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】结论与噪声分布、模型和数据设置有关;视频模型迁移需单独测试。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6d5da1a7224e06598da2ea727af0e6fa4f4a962312837f235fc4c14d0b03be95

返回筛选与清单
P274 / 2025研究者收藏PhysReason: A Comprehensive Benchmark towards Physics-Based ReasoningXinyu Zhang; Yuxuan Dong; Yanrui Wu; Jiaxing Huang; Chengyou Jia; Basura Fernando; Mike Zheng Shou; Lingling Zhang; Jun LiuPhysReason 构建物理题及答案、步骤级评分,分析定理使用、条件判断与计算问题。世界机制与演化展开标注
#P27423 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

PhysReason 构建物理题及答案、步骤级评分,分析定理使用、条件判断与计算问题。

本篇研究的问题

模型在哪些物理知识和推导步骤上出错?

适用条件

物理题推理主要由语言模型完成,不能等同于视频生成中的物理行为。

方法与训练

PhysReason 构建物理题及答案、步骤级评分,分析定理使用、条件判断与计算问题。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】物理题推理主要由语言模型完成,不能等同于视频生成中的物理行为。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a795b09bd77707f852435768e35c8f5af6b95637656ef6548e2c556f1371f88d

返回筛选与清单
P273 / 2025研究者收藏Intuitive physics understanding emerges from self-supervised pretraining on natural videosQuentin Garrido; Nicolas Ballas; Mahmoud Assran; Adrien Bardes; Laurent Najman; Michael Rabbat; Emmanuel Dupoux; Yann LeCun作者使用预期违背实验,测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。世界机制与演化展开标注
#P27324 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者使用预期违背实验,测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。

本篇研究的问题

自然视频中的自监督预测是否学到直觉物理?

适用条件

识别异常的惊讶度不等于生成正确干预结果,也不证明规则可编辑。

方法与训练

作者使用预期违背实验,测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】识别异常的惊讶度不等于生成正确干预结果,也不证明规则可编辑。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8ec7320af6b22e8bf91dae7372a6c1c567f217f23debaf4459cbe8d39b9f620d

返回筛选与清单
P272 / 2025研究者收藏A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint RewardsShivansh Patel; Xinchen Yin; Wenlong Huang; Shubham Garg; Hooshang Nayyeri; Li Fei-Fei; Svetlana Lazebnik; Yunzhu LiIKER 用 VLM 生成和修改 Python 奖励,在重建仿真中训练策略,再部署到真实环境。世界机制与演化展开标注
#P27212 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

IKER 用 VLM 生成和修改 Python 奖励,在重建仿真中训练策略,再部署到真实环境。

本篇研究的问题

语言任务怎样变成可迭代的视觉关键点奖励?

适用条件

可执行奖励约束的是目标,不等于学到了可执行世界转移规律。

方法与训练

IKER 用 VLM 生成和修改 Python 奖励,在重建仿真中训练策略,再部署到真实环境。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】可执行奖励约束的是目标,不等于学到了可执行世界转移规律。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7f6fe2f87f3d71b1469cc000f8074b2a28537d544ba4fc5bcd0cfc41ad106b51

返回筛选与清单
P271 / 2025研究者收藏WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting PointHenry Hengyuan Zhao; Kaiming Yang; Wendi Yu; Difei Gao; Mike Zheng ShouWorldGUI 系统改变软件任务初始状态,用批评式执行框架比较恢复与适应能力。AI方法与评测展开标注
#P27128 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

WorldGUI 系统改变软件任务初始状态,用批评式执行框架比较恢复与适应能力。

本篇研究的问题

GUI agent 能否从非默认状态恢复并调整计划?

适用条件

界面状态变化与环境因果规律变化需要区分。

方法与训练

WorldGUI 系统改变软件任务初始状态,用批评式执行框架比较恢复与适应能力。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】界面状态变化与环境因果规律变化需要区分。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0f8c34845dca2eda17d89b448d93a031eac034256cd017cea63f3429a019fb23

返回筛选与清单
P270 / 2025研究者收藏UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-DepthsWeijia Mao; Zhenheng Yang; Mike Zheng ShouUniMoD 用任务感知路由选择跳过计算的 token,比较训练成本和多模态任务表现。AI方法与评测展开标注
#P27017 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

UniMoD 用任务感知路由选择跳过计算的 token,比较训练成本和多模态任务表现。

本篇研究的问题

统一多模态模型怎样按任务和层减少冗余 token 计算?

适用条件

计算减少不自动等于视频生成延迟或显存同比减少。

方法与训练

UniMoD 用任务感知路由选择跳过计算的 token,比较训练成本和多模态任务表现。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】计算减少不自动等于视频生成延迟或显存同比减少。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 08c9afeb14ec4b6b384bc7234b6681f3bff882af3bd290f9687cc1badb1e8b6c

返回筛选与清单
P269 / 2025研究者收藏MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence GenerationYiren Song; Cheng Liu; Mike Zheng ShouMakeAnything 以多领域过程序列微调 DiT,并用非对称 LoRA 和时空约束生成或反推制作过程。创作与规则补全XR与人机协作展开标注
#P26916 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MakeAnything 以多领域过程序列微调 DiT,并用非对称 LoRA 和时空约束生成或反推制作过程。

本篇研究的问题

不同制作任务的中间步骤如何保持一致地生成?

适用条件

合理制作序列未必是给定真实动作的可核验物理后果。

方法与训练

MakeAnything 以多领域过程序列微调 DiT,并用非对称 LoRA 和时空约束生成或反推制作过程。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】合理制作序列未必是给定真实动作的可核验物理后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ff5ab777ebb7db25ca8bf2eb2d358a488b28600f2bdc8361b5a4ccf0b4f5b07c

返回筛选与清单
P268 / 2025研究者收藏TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze AnimationYixiang Zhuang; Chunshan Ma; Yao Cheng; Xuan Cheng; Jing Liao; Juncong LinTalkingEyes 使用音频与三维运动配对数据,在分开的潜空间中生成头部和视线,并与面部动画整合。创作与规则补全展开标注
#P26813 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

TalkingEyes 使用音频与三维运动配对数据,在分开的潜空间中生成头部和视线,并与面部动画整合。

本篇研究的问题

语音如何驱动多样且协调的眼神和头部运动?

适用条件

关注角色表现与语音运动协调,非动作干预下的环境后果模型。

方法与训练

TalkingEyes 使用音频与三维运动配对数据,在分开的潜空间中生成头部和视线,并与面部动画整合。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】关注角色表现与语音运动协调,非动作干预下的环境后果模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d920bbb14308a0490173af5cef08a35d1d5cdcdb8488e8926a73fcce01924b47

返回筛选与清单
P267 / 2025研究者收藏Why Automate This? Exploring Correlations Between Desire for Robotic Automation, Invested Time and Well-BeingRuchira Ray; Leona Pang; Sanjana Srivastava; Li Fei-Fei; Samantha Shorey; Roberto Martín-Martín作者结合日常活动与福祉调查,分析自动化偏好和时间、情绪的关联。AI方法与评测XR与人机协作展开标注
#P26726 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者结合日常活动与福祉调查,分析自动化偏好和时间、情绪的关联。

本篇研究的问题

人希望自动化什么活动,是否能用耗时直接预测?

适用条件

相关性研究不证明机器人介入的因果收益,可为选任务提供人本动机。

方法与训练

作者结合日常活动与福祉调查,分析自动化偏好和时间、情绪的关联。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】相关性研究不证明机器人介入的因果收益,可为选任务提供人本动机。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d73535139d4f711a275d5c83bd0eda1a964d3aeb24c6409878abe585ec9a7681

返回筛选与清单
P266 / 2024研究者收藏Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall SpacesJihan Yang; Shusheng Yang; Anjali W. Gupta; Rilyn Han; Li Fei-Fei; Saining XieThinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。AI方法与评测展开标注
#P26628 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Thinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。

本篇研究的问题

视频语言模型如何看见、记忆并回忆空间?

适用条件

空间问答表现不能等同于完整三维状态恢复或可控未来生成。

方法与训练

Thinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】空间问答表现不能等同于完整三维状态恢复或可控未来生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5ee4d9c16392ccb64929b4aad437e0472c16b8e2b190de9a05e1c0b3e44335d6

返回筛选与清单
P265 / 2024研究者收藏MetaMorph: Multimodal Understanding and Generation via Instruction TuningShengbang Tong; David Fan; Jiachen Zhu; Yunyang Xiong; Xinlei Chen; Koustuv Sinha; Michael Rabbat; Yann LeCun; Saining Xie; Zhuang LiuMetaMorph 在语言模型中加入视觉 token 预测,研究理解数据与生成能力的相互作用。AI方法与评测展开标注
#P26525 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MetaMorph 在语言模型中加入视觉 token 预测,研究理解数据与生成能力的相互作用。

本篇研究的问题

视觉预测式指令微调能否统一理解与生成?

适用条件

以图像和多模态任务为主;不能直接当作视频世界推理的实验依据。

方法与训练

MetaMorph 在语言模型中加入视觉 token 预测,研究理解数据与生成能力的相互作用。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】以图像和多模态任务为主;不能直接当作视频世界推理的实验依据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 32db2000e915374c84bfea4411daffa12003618907a7640263e2c29e02a48500

返回筛选与清单
P264 / 2024研究者收藏Video Representation Learning with Joint-Embedding Predictive ArchitecturesKatrina Drozdov; Ravid Shwartz-Ziv; Yann LeCunVJ-VCR 以方差协方差正则学习视频表征,并探索潜变量对不确定未来的表达。世界机制与演化展开标注
#P26418 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VJ-VCR 以方差协方差正则学习视频表征,并探索潜变量对不确定未来的表达。

本篇研究的问题

如何防止视频 JEPA 坍塌并表示多种可能未来?

适用条件

多未来潜表示并不直接验证人可观看的视频分支或反事实因果正确性。

方法与训练

VJ-VCR 以方差协方差正则学习视频表征,并探索潜变量对不确定未来的表达。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】多未来潜表示并不直接验证人可观看的视频分支或反事实因果正确性。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 eb7e4642dc0a8e6c7a6d162a550c58300de026ef7e86c9f197a76286f5e00767

返回筛选与清单
P263 / 2024研究者收藏The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human MotionChangan Chen; Juze Zhang; Shrinidhi K. Lakshmikanth; Yusu Fang; Ruizhi Shao; Gordon Wetzstein; Li Fei-Fei; Ehsan AdeliThe Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。创作与规则补全XR与人机协作展开标注
#P26317 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

The Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。

本篇研究的问题

言语与三维非言语动作怎样统一理解和生成?

适用条件

动作表达生成不同于人物和物体接触的物理仿真。

方法与训练

The Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动作表达生成不同于人物和物体接触的物理仿真。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b912628d29b0f191be9f09a5e254758aa7ec4f46284424f8044201e4f4c870b1

返回筛选与清单
P262 / 2024研究者收藏Navigation World ModelsAmir Bar; Gaoyue Zhou; Danny Tran; Trevor Darrell; Yann LeCunNavigation World Models 预测给定导航动作后的观察,再生成或排序抵达目标的候选轨迹。世界机制与演化展开标注
#P26217 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Navigation World Models 预测给定导航动作后的观察,再生成或排序抵达目标的候选轨迹。

本篇研究的问题

动作条件视频预测能否用于视觉导航规划?

适用条件

陌生环境生成与熟悉环境规划的条件不同;不能用视觉合理性代替到达成功率。

方法与训练

Navigation World Models 预测给定导航动作后的观察,再生成或排序抵达目标的候选轨迹。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】陌生环境生成与熟悉环境规划的条件不同;不能用视觉合理性代替到达成功率。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 33b6532143148b60d991f7cfc0c6ff2c168a54c8dcd285e4dbee5eec84c51a5e

返回筛选与清单
P261 / 2024研究者收藏Distractor-free Generalizable 3D Gaussian SplattingYanqi Bao; Jing Liao; Jing Huo; Yang GaoDGGS 在训练中预测并修整干扰掩码,在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。创作与规则补全展开标注
#P26122 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DGGS 在训练中预测并修整干扰掩码,在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。

本篇研究的问题

带有动态干扰的多视图输入如何支持泛化三维重建?

适用条件

新视角重建的抗干扰性能不等于长期动态状态记忆。

方法与训练

DGGS 在训练中预测并修整干扰掩码,在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】新视角重建的抗干扰性能不等于长期动态状态记忆。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 4620e20ddaf179120dc987f9f102e82b4f2366859ed40d9fdba1f31891bd0ac6

返回筛选与清单
P260 / 2024研究者收藏ShowUI: One Vision-Language-Action Model for GUI Visual AgentKevin Qinghong Lin; Linjie Li; Difei Gao; Zhengyuan Yang; Shiwei Wu; Zechen Bai; Weixian Lei; Lijuan Wang; Mike Zheng ShouShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。AI方法与评测展开标注
#P26016 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。

本篇研究的问题

轻量视觉语言动作模型怎样处理 GUI 状态和历史?

适用条件

面向软件操作的动作模型,不是像素世界生成器。

方法与训练

ShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】面向软件操作的动作模型,不是像素世界生成器。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8bc023be285e71dab992fb5aeffc2bcbcefe155a67b6ce5e6e7e3a3499bb5db5

返回筛选与清单
P259 / 2024研究者收藏MovieBench: A Hierarchical Movie Level Dataset for Long Video GenerationWeijia Wu; Mingyu Liu; Zeyu Zhu; Xi Xia; Haoen Feng; Wen Wang; Kevin Qinghong Lin; Chunhua Shen; Mike Zheng ShouMovieBench 以电影和镜头层级组织视频、角色、音频与描述。创作与规则补全展开标注
#P25916 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MovieBench 以电影和镜头层级组织视频、角色、音频与描述。

本篇研究的问题

长视频训练和评价如何覆盖跨镜头角色与叙事?

适用条件

角色和故事连续性指标不足以验证动态物理机制。

方法与训练

MovieBench 以电影和镜头层级组织视频、角色、音频与描述。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】角色和故事连续性指标不足以验证动态物理机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 262f73c56f748f0d0175e4d5e69efcd7ebbc7c07dd49f478cc79c521cedd438c

返回筛选与清单
P258 / 2024研究者收藏ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-TuningDavid Junhao Zhang; Roni Paiss; Shiran Zada; Nikhil Karnad; David E. Jacobs; Yael Pritch; Inbar Mosseri; Mike Zheng Shou; Neal Wadhwa; Nataniel RuizReCapture 先构造新视角的带噪锚定视频,再以掩码视频微调修复。创作与规则补全展开标注
#P25814 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ReCapture 先构造新视角的带噪锚定视频,再以掩码视频微调修复。

本篇研究的问题

怎样为用户已有视频生成新的相机轨迹?

适用条件

保留的动态来自输入视频;不可见部分是生成假设而非新增观测。

方法与训练

ReCapture 先构造新视角的带噪锚定视频,再以掩码视频微调修复。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】保留的动态来自输入视频;不可见部分是生成假设而非新增观测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cc97f87aff76e2b97a80b5c2d6a58bdefe4dc59b54ac2a453d4b4a7b1fbd29d0

返回筛选与清单
P257 / 2024研究者收藏HourVideo: 1-Hour Video-Language UnderstandingKeshigeyan Chandrasegaran; Agrim Gupta; Lea M. Hadzic; Taran Kota; Jimming He; Cristóbal Eyzaguirre; Zane Durante; Manling Li; Jiajun Wu; Li Fei-FeiHourVideo 包含总结、回忆、追踪、推理和导航任务,提供长视频问答评价。AI方法与评测展开标注
#P25728 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HourVideo 包含总结、回忆、追踪、推理和导航任务,提供长视频问答评价。

本篇研究的问题

一小时视频中的事件和空间信息怎样持续理解?

适用条件

问答中的预测或反事实标签不表示模型会生成可验证的未来像素。

方法与训练

HourVideo 包含总结、回忆、追踪、推理和导航任务,提供长视频问答评价。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】问答中的预测或反事实标签不表示模型会生成可验证的未来像素。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 61cf706fe65bf6ce03a23f90d203a76c2ea2fceee51cd52f7b68b67cacd023c0

返回筛选与清单
P256 / 2024研究者收藏DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot PlanningGaoyue Zhou; Hengkai Pan; Yann LeCun; Lerrel PintoDINO-WM 在预训练视觉特征空间学习动力学,以目标条件搜索完成多类环境中的零样本规划。世界机制与演化展开标注
#P25621 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DINO-WM 在预训练视觉特征空间学习动力学,以目标条件搜索完成多类环境中的零样本规划。

本篇研究的问题

离线视觉轨迹能否支持不依赖专家策略的测试时规划?

适用条件

不重建像素世界;其规划优势不能直接转化为 Foresee 的视频观看质量。

方法与训练

DINO-WM 在预训练视觉特征空间学习动力学,以目标条件搜索完成多类环境中的零样本规划。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】不重建像素世界;其规划优势不能直接转化为 Foresee 的视频观看质量。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 7683c366109c091a47b7ae8a3d6520131edd3db1a5aa594d74c7636d2f9745d6

返回筛选与清单
P255 / 2024研究者收藏Skinned Motion Retargeting with Dense Geometric Interaction PerceptionZijie Ye; Jia-Wei Liu; Jia Jia; Shikun Sun; Mike Zheng ShouMeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。世界机制与演化展开标注
#P25521 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。

本篇研究的问题

跨角色动作迁移怎样考虑身体几何接触?

适用条件

几何交互保持与完整受力模拟不同,也不是未来视频预测。

方法与训练

MeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】几何交互保持与完整受力模拟不同,也不是未来视频预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cb37c559faae2f74a59f109291149d12bbeda8149e171b43fca9d3564033c172

返回筛选与清单
P254 / 2024研究者收藏Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous TokensLijie Fan; Tianhong Li; Siyang Qin; Yuanzhen Li; Chen Sun; Michael Rubinstein; Deqing Sun; Kaiming He; Yonglong TianFluid 对比离散或连续 token、固定或随机顺序,并采用连续 token 的随机顺序自回归生成。AI方法与评测展开标注
#P25422 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Fluid 对比离散或连续 token、固定或随机顺序,并采用连续 token 的随机顺序自回归生成。

本篇研究的问题

连续 token 与生成顺序怎样影响文本到图像模型的扩展?

适用条件

验证损失、生成指标与视觉质量可能呈现不同趋势,不能只靠损失判断应用能力。

方法与训练

Fluid 对比离散或连续 token、固定或随机顺序,并采用连续 token 的随机顺序自回归生成。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】验证损失、生成指标与视觉质量可能呈现不同趋势,不能只靠损失判断应用能力。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b347a4f8187b30308730982f37206d9c68089201e7910ddfb9ee1ed6cbd1b93f

返回筛选与清单
P253 / 2024研究者收藏SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image EditingZhiyuan Zhang; DongDong Chen; Jing LiaoSGEdit 将 LLM 与文本到图像模型通过场景图连接,支持结构化的对象及关系编辑。创作与规则补全展开标注
#P25315 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

SGEdit 将 LLM 与文本到图像模型通过场景图连接,支持结构化的对象及关系编辑。

本篇研究的问题

场景图怎样连接语言指令与可控图像编辑?

适用条件

属于外部语言模型与生成器协作的编辑管线;具体关系约束和执行范围待正文核查。

方法与训练

SGEdit 将 LLM 与文本到图像模型通过场景图连接,支持结构化的对象及关系编辑。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】属于外部语言模型与生成器协作的编辑管线;具体关系约束和执行范围待正文核查。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 93edb53517b804670145b519928498859899ccb5efef6e755888c85bbf76415b

返回筛选与清单
P252 / 2024研究者收藏ControLRM: Fast and Controllable 3D Generation via Large Reconstruction ModelHongbin Xu; Weitao Chen; Zhipeng Zhou; Feng Xiao; Baigui Sun; Mike Zheng Shou; Wenxiong KangControLRM 通过条件分支和图像分支联合训练,连接二维控制与三维表示。创作与规则补全展开标注
#P25218 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ControLRM 通过条件分支和图像分支联合训练,连接二维控制与三维表示。

本篇研究的问题

大重建模型怎样实现快速且可控的三维生成?

适用条件

主要生成静态三维内容,尚不能直接证明四维动力学正确。

方法与训练

ControLRM 通过条件分支和图像分支联合训练,连接二维控制与三维表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要生成静态三维内容,尚不能直接证明四维动力学正确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5e54d96d119e4a31e08eaa4161a3a75e9a1a6d704e127fd55649d76f856550a8

返回筛选与清单
P251 / 2024研究者收藏ARCap: Collecting High-quality Human Demonstrations for Robot Learning with Augmented Reality FeedbackSirui Chen; Chen Wang; Kaden Nguyen; Li Fei-Fei; C. Karen LiuARCap 通过增强现实视觉反馈和触觉警告,帮助用户避免碰撞并匹配机器人运动学。创作与规则补全XR与人机协作展开标注
#P2518 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ARCap 通过增强现实视觉反馈和触觉警告,帮助用户避免碰撞并匹配机器人运动学。

本篇研究的问题

AR 反馈能否帮助非专家采集机器人可执行的示范?

适用条件

与 AR tutorial 直接相邻,但目标是示范采集;不是多分支未来视频探索。

方法与训练

ARCap 通过增强现实视觉反馈和触觉警告,帮助用户避免碰撞并匹配机器人运动学。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】与 AR tutorial 直接相邻,但目标是示范采集;不是多分支未来视频探索。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cf8e335b8a117330dcc438ae587553f5e3b933b3fc1ddb85e2854f07ed5dafe8

返回筛选与清单
P250 / 2024研究者收藏Automated Creation of Digital Cousins for Robust Policy LearningTianyuan Dai; Josiah Wong; Yunfan Jiang; Chen Wang; Cem Gokmen; Ruohan Zhang; Jiajun Wu; Li Fei-FeiDigital Cousins 自动生成保留几何与语义可供性的相近场景,组成 real-to-sim-to-real 训练。世界机制与演化展开标注
#P25032 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Digital Cousins 自动生成保留几何与语义可供性的相近场景,组成 real-to-sim-to-real 训练。

本篇研究的问题

不精确复制真实场景的数字近似能否仍支持策略迁移?

适用条件

可供性保持与精确物理孪生不同,不能据此验证某个具体反事实后果。

方法与训练

Digital Cousins 自动生成保留几何与语义可供性的相近场景,组成 real-to-sim-to-real 训练。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】可供性保持与精确物理孪生不同,不能据此验证某个具体反事实后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ba42fcdafd3acf588600bc2ddbe26c7edd1e347adb201eb2d9443e30f30096a0

返回筛选与清单
P249 / 2024研究者收藏Embodied Agent Interface: Benchmarking LLMs for Embodied Decision MakingManling Li; Shiyu Zhao; Qineng Wang; Kangrui Wang; Yu Zhou; Sanjana Srivastava; Cem Gokmen; Tony Lee; Li Erran Li; Ruohan Zhang; Weiyu Liu; Percy Liang; Li Fei-Fei; Jiayuan Mao; Jiajun WuEmbodied Agent Interface 形式化任务和模块接口,超越单一终局成功率分析。AI方法与评测展开标注
#P249107 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Embodied Agent Interface 形式化任务和模块接口,超越单一终局成功率分析。

本篇研究的问题

具身决策的不同语言模块怎样用统一输入输出定位错误?

适用条件

语言模块诊断与视频生成正确性需要分别评价。

方法与训练

Embodied Agent Interface 形式化任务和模块接口,超越单一终局成功率分析。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】语言模块诊断与视频生成正确性需要分别评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d10c7fee3594c88ff9f6a061a68b64a380a82d36c6652f3b08c42179044e2a9f

返回筛选与清单
P248 / 2024研究者收藏Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained TransformersLirui Wang; Xinlei Chen; Jialiang Zhao; Kaiming HeHPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据,研究异构预训练的扩展规律。AI方法与评测展开标注
#P24824 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据,研究异构预训练的扩展规律。

本篇研究的问题

跨机器人、任务和传感器的预训练怎样共享策略表征?

适用条件

学习对象为控制策略表征,不是可独立检验所有动作后果的世界模型。

方法与训练

HPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据,研究异构预训练的扩展规律。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】学习对象为控制策略表征,不是可独立检验所有动作后果的世界模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 e4cee3f35f6d2bd03ecc1d114809794042f2aa17a2f48304b0d7a90c094e48ba

返回筛选与清单
P247 / 2024研究者收藏High Quality Human Image Animation using Regional Supervision and Motion Blur ConditionZhongcong Xu; Chaoyue Song; Guoxian Song; Jianfeng Zhang; Jun Hao Liew; Hongyi Xu; You Xie; Linjie Luo; Guosheng Lin; Jiashi Feng; Mike Zheng Shou作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。创作与规则补全展开标注
#P24715 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。

本篇研究的问题

人物动画怎样改善脸、手与运动模糊细节?

适用条件

局部外观真实度不能替代动作的物理可行性验证。

方法与训练

作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】局部外观真实度不能替代动作的物理可行性验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 121b806aa34bc3e1ae96b925fd28d01342d3ccfe054ebfa6ce78db14e6c09c44

返回筛选与清单
P246 / 2024研究者收藏Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion ModelHongliang Zhong; Can Wang; Jingbo Zhang; Jing Liao通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。创作与规则补全展开标注
#P24615 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。

本篇研究的问题

如何把生成对象以多视图一致的方式插入 Gaussian 场景?

适用条件

对象插入和多视图一致性不直接验证插入后接触、碰撞等动态后果。

方法与训练

通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】对象插入和多视图一致性不直接验证插入后接触、碰撞等动态后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 874b2489740d5d336f997ac24b50863575b89cec07a7933fcb22af3e8cedd385

返回筛选与清单
P245 / 2024研究者收藏LVCD: Reference-based Lineart Video Colorization with Diffusion ModelsZhitong Huang; Mohan Zhang; Jing LiaoLVCD 使用扩散模型和参考条件处理线稿视频上色,关注颜色与时序一致。创作与规则补全展开标注
#P24511 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

LVCD 使用扩散模型和参考条件处理线稿视频上色,关注颜色与时序一致。

本篇研究的问题

参考图引导的线稿视频上色如何保持长序列一致性?

适用条件

目标是上色和身份保持;不是下一事件预测或物理机制推断。

方法与训练

LVCD 使用扩散模型和参考条件处理线稿视频上色,关注颜色与时序一致。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】目标是上色和身份保持;不是下一事件预测或物理机制推断。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 63d2ad1434fc5b8971204292f14821abc8f75de11169bf253d27dd0394c3f641

返回筛选与清单
P244 / 2024研究者收藏ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic ManipulationWenlong Huang; Chen Wang; Yunzhu Li; Ruohan Zhang; Li Fei-FeiReKep 自动生成视觉关键点约束,并通过分层优化求解末端位姿序列。创作与规则补全展开标注
#P24430 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ReKep 自动生成视觉关键点约束,并通过分层优化求解末端位姿序列。

本篇研究的问题

关系关键点约束能否把自然语言转成实时操作计划?

适用条件

显式任务约束不等于环境动力学模型;关键点与感知是重要条件。

方法与训练

ReKep 自动生成视觉关键点约束,并通过分层优化求解末端位姿序列。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】显式任务约束不等于环境动力学模型;关键点与感知是重要条件。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6820e718a66f3c52f27996d3ee2623260dd442eddeab2df098212eb6eb769334

返回筛选与清单
P243 / 2024研究者收藏VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision ComputationShiwei Wu; Joya Chen; Kevin Qinghong Lin; Qimeng Wang; Yan Gao; Qianli Xu; Tong Xu; Yao Hu; Enhong Chen; Mike Zheng ShouVideoLLM-MoD 让部分视觉 token 跳过若干层,减少长视频处理计算。AI方法与评测展开标注
#P24316 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VideoLLM-MoD 让部分视觉 token 跳过若干层,减少长视频处理计算。

本篇研究的问题

视频语言流式计算能否在保留视觉 token 的同时降成本?

适用条件

面向视频语言模型;不能直接推断视频扩散骨干有同样收益。

方法与训练

VideoLLM-MoD 让部分视觉 token 跳过若干层,减少长视频处理计算。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】面向视频语言模型;不能直接推断视频扩散骨干有同样收益。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6f2f515f032d0183f91cec7d6a9e6285c2a744a5ea3df4a683ff0a97bd684305

返回筛选与清单
P242 / 2024研究者收藏Show-o: One Single Transformer to Unify Multimodal Understanding and GenerationJinheng Xie; Weijia Mao; Zechen Bai; David Junhao Zhang; Weihao Wang; Kevin Qinghong Lin; Yuchao Gu; Zhijie Chen; Zhenheng Yang; Mike Zheng ShouShow-o 在共享模型内结合文本建模与视觉生成,研究统一多模态能力。AI方法与评测展开标注
#P24225 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Show-o 在共享模型内结合文本建模与视觉生成,研究统一多模态能力。

本篇研究的问题

一个 Transformer 能否统一多模态理解和生成?

适用条件

共享参数并不直接证明物理推理或干预预测。

方法与训练

Show-o 在共享模型内结合文本建模与视觉生成,研究统一多模态能力。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】共享参数并不直接证明物理推理或干预预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b4d94e69c904e408ee2597c9adad047a3f038be855690b6389375d4c7af9306c

返回筛选与清单
P241 / 2024研究者收藏PooDLe: Pooled and dense self-supervised learning from naturalistic videosAlex N. Wang; Christopher Hoang; Yuwen Xiong; Yann LeCun; Mengye RenPooDLe 结合全局不变表征与光流变换下的稠密等变目标,评估驾驶和行走视频中的特征。AI方法与评测展开标注
#P24123 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

PooDLe 结合全局不变表征与光流变换下的稠密等变目标,评估驾驶和行走视频中的特征。

本篇研究的问题

如何在自然视频中同时学习语义和空间对应?

适用条件

表征学习提供基础,不直接预测动作后果或处理规则突变。

方法与训练

PooDLe 结合全局不变表征与光流变换下的稠密等变目标,评估驾驶和行走视频中的特征。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】表征学习提供基础,不直接预测动作后果或处理规则突变。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 88f837652f601a950c4b5d41efb7b426cbd3ad42e8e4baaa6c212bbd65687192

返回筛选与清单
P240 / 2024研究者收藏Learning Video Context as Interleaved Multimodal SequencesKevin Qinghong Lin; Pengchuan Zhang; Difei Gao; Xide Xia; Joya Chen; Ziteng Gao; Jinheng Xie; Xuhong Xiao; Mike Zheng ShouMovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。AI方法与评测展开标注
#P24021 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。

本篇研究的问题

长视频上下文如何与角色、字幕和外部知识一起组织?

适用条件

外部人物信息与字幕改变输入条件;不是仅凭视频生成器完成推理。

方法与训练

MovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】外部人物信息与字幕改变输入条件;不是仅凭视频生成器完成推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 01871b1b7ab1f4b8f1cb8a97ec2540b7f38d3f1c1672719866a7f0a0fbac5967

返回筛选与清单
P239 / 2024研究者收藏Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLMCan Wang; Hongliang Zhong; Menglei Chai; Mingming He; Dongdong Chen; Jing LiaoChat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM,利用反馈改善交互式家具布局,摘要声明无需修改模型权重。创作与规则补全XR与人机协作展开标注
#P23917 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Chat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM,利用反馈改善交互式家具布局,摘要声明无需修改模型权重。

本篇研究的问题

用户如何通过多模态对话迭代修改三维家具布局?

适用条件

推理与布局决策位于外部 MLLM;应另查真实用户负担和布局约束的评价。

方法与训练

Chat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM,利用反馈改善交互式家具布局,摘要声明无需修改模型权重。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】推理与布局决策位于外部 MLLM;应另查真实用户负担和布局约束的评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f786bcb836fb3c498f76d1c9e0ba15aa106c04d94f08639e5fb1a0ed5029208d

返回筛选与清单
P238 / 2024研究者收藏OccFusion: Rendering Occluded Humans with Generative Diffusion PriorsAdam Sun; Tiange Xiang; Scott Delp; Li Fei-Fei; Ehsan AdeliOccFusion 将三维 Gaussian 表示与二维扩散监督结合,改善遮挡条件的人体重建。创作与规则补全展开标注
#P23816 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

OccFusion 将三维 Gaussian 表示与二维扩散监督结合,改善遮挡条件的人体重建。

本篇研究的问题

遮挡人体的自由视角渲染怎样利用扩散先验补全?

适用条件

生成补全部分未必是真实观测,不能直接用于物理后果真值。

方法与训练

OccFusion 将三维 Gaussian 表示与二维扩散监督结合,改善遮挡条件的人体重建。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】生成补全部分未必是真实观测,不能直接用于物理后果真值。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b85f0bd2401222a83d6851caa71d85f1c93be473af0e22eb1a6691dbb3e6ffe4

返回筛选与清单
P237 / 2024研究者收藏Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMsShengbang Tong; Ellis Brown; Penghao Wu; Sanghyun Woo; Manoj Middepogu; Sai Charitha Akula; Jihan Yang; Shusheng Yang; Adithya Iyer; Xichen Pan; Ziteng Wang; Rob Fergus; Yann LeCun; Saining XieCambrian-1 系统比较视觉编码器,引入 CV-Bench 与空间视觉聚合器,研究视觉中心的多模态学习。AI方法与评测展开标注
#P23751 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Cambrian-1 系统比较视觉编码器,引入 CV-Bench 与空间视觉聚合器,研究视觉中心的多模态学习。

本篇研究的问题

视觉编码和连接器如何影响多模态模型的视觉依据?

适用条件

视觉问答和图像空间任务不等同于视频动态推理。

方法与训练

Cambrian-1 系统比较视觉编码器,引入 CV-Bench 与空间视觉聚合器,研究视觉中心的多模态学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】视觉问答和图像空间任务不等同于视频动态推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c0ad715235f0c57a04fdb5d39cc8a4be27281cd46586601caa0f074c334f4264

返回筛选与清单
P236 / 2024研究者收藏Autoregressive Image Generation without Vector QuantizationTianhong Li; Yonglong Tian; He Li; Mingyang Deng; Kaiming He通过扩散过程建模连续 token 的条件分布,将 Diffusion Loss 与自回归或掩码自回归架构结合。AI方法与评测展开标注
#P23616 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

通过扩散过程建模连续 token 的条件分布,将 Diffusion Loss 与自回归或掩码自回归架构结合。

本篇研究的问题

自回归生成是否一定需要离散量化 token?

适用条件

图像生成的连续表示基础可以提供方法参照,但未直接验证视频机制执行。

方法与训练

通过扩散过程建模连续 token 的条件分布,将 Diffusion Loss 与自回归或掩码自回归架构结合。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】图像生成的连续表示基础可以提供方法参照,但未直接验证视频机制执行。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a8be10e56ed49f798d155795bc6090d8aa954ed1f6ce43f75e348d451ab7925a

返回筛选与清单
P235 / 2024研究者收藏VideoLLM-online: Online Video Large Language Model for Streaming VideoJoya Chen; Zhaoyang Lv; Shiwei Wu; Kevin Qinghong Lin; Chenan Song; Difei Gao; Jia-Wei Liu; Ziteng Gao; Dongxing Mao; Mike Zheng ShouVideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。AI方法与评测展开标注
#P23519 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。

本篇研究的问题

模型怎样在连续视频流中及时回答和描述?

适用条件

在线响应与预测尚未发生的后果是不同能力。

方法与训练

VideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】在线响应与预测尚未发生的后果是不同能力。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d3076aef869cc468c15f606a554b2908daf873e9793bc9799f4a5eeb7ca471dd

返回筛选与清单
P234 / 2024研究者收藏VideoGUI: A Benchmark for GUI Automation from Instructional VideosKevin Qinghong Lin; Linjie Li; Difei Gao; Qinchen WU; Mingyi Yan; Zhengyuan Yang; Lijuan Wang; Mike Zheng ShouVideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。AI方法与评测XR与人机协作展开标注
#P23424 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。

本篇研究的问题

agent 能否从教学视频中重建并执行软件步骤?

适用条件

主要是 GUI 示范理解,不能直接评估物理 AR 教程效果。

方法与训练

VideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要是 GUI 示范理解,不能直接评估物理 AR 教程效果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 de827d04512c3f4dd97b76c92e90675be8d5694f6a5a97c8c4f7bc9343da8355

返回筛选与清单
P233 / 2024研究者收藏Physically Compatible 3D Object Modeling from a Single ImageMinghao Guo; Bohan Wang; Pingchuan Ma; Tianyuan Zhang; Crystal Elaine Owens; Chuang Gan; Joshua B. Tenenbaum; Kaiming He; Wojciech Matusik把静态平衡作为约束,将物理属性分解并连接到三维重建优化中,使模型更适合仿真和制造。世界机制与演化展开标注
#P23317 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

把静态平衡作为约束,将物理属性分解并连接到三维重建优化中,使模型更适合仿真和制造。

本篇研究的问题

单图重建怎样同时考虑形状、物理属性与外力的相容性?

适用条件

单图中的物理属性可能不唯一;静态相容性需要与真实参数识别和长期动态准确性区分。

方法与训练

把静态平衡作为约束,将物理属性分解并连接到三维重建优化中,使模型更适合仿真和制造。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】单图中的物理属性可能不唯一;静态相容性需要与真实参数识别和长期动态准确性区分。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3046b361c4e4ec64a88dae07509a6c66a35ec6df85c602968e7a05104c5633cf

返回筛选与清单
P232 / 2024研究者收藏TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric MeshesMinghao Guo; Bohan Wang; Kaiming He; Wojciech MatusikTetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格,评价单视图和多视图重建。世界机制与演化展开标注
#P23225 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

TetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格,评价单视图和多视图重建。

本篇研究的问题

拉格朗日体网格表示怎样提高三维形状质量和可用性?

适用条件

几何表示适合后续物理应用,不表示论文已经学习完整动力学。

方法与训练

TetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格,评价单视图和多视图重建。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】几何表示适合后续物理应用,不表示论文已经学习完整动力学。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f9a1657b722bb2a208634977e7d34d77a16db3700f6ad9a2064a3f4cf368a9f9

返回筛选与清单
P231 / 2024研究者收藏Hierarchical World Models as Visual Whole-Body Humanoid ControllersNicklas Hansen; Jyothir S; Vlad Sobal; Yann LeCun; Xiaolong Wang; Hao Su作者让高层视觉策略产生指令、低层控制器执行,并以奖励联合训练模拟人形机器人的多个任务。世界机制与演化展开标注
#P23121 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者让高层视觉策略产生指令、低层控制器执行,并以奖励联合训练模拟人形机器人的多个任务。

本篇研究的问题

分层世界模型能否从视觉输入学习复杂全身控制?

适用条件

依赖模拟环境和奖励;动作偏好与物理控制不能替代像素生成评价。

方法与训练

作者让高层视觉策略产生指令、低层控制器执行,并以奖励联合训练模拟人形机器人的多个任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】依赖模拟环境和奖励;动作偏好与物理控制不能替代像素生成评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 546d2bf73c4594a627685600bb9058ac9bd5426b917bbfbfb4cc0beac646f36f

返回筛选与清单
P230 / 2024研究者收藏EG4D: Explicit Generation of 4D Object without Score DistillationQi Sun; Zhiyang Guo; Ziyu Wan; Jing Nathan Yan; Shengming Yin; Wengang Zhou; Jing Liao; Houqiang Li利用视频扩散生成多视图视频,再进行动态 Gaussian 重建与细节修整,减少对分数蒸馏的依赖。创作与规则补全展开标注
#P23020 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

利用视频扩散生成多视图视频,再进行动态 Gaussian 重建与细节修整,减少对分数蒸馏的依赖。

本篇研究的问题

如何从单图获得时空一致的显式四维对象?

适用条件

显式四维表示在此指动态外观与几何;不能由此推出对象动力学机制可识别或可编辑。

方法与训练

利用视频扩散生成多视图视频,再进行动态 Gaussian 重建与细节修整,减少对分数蒸馏的依赖。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】显式四维表示在此指动态外观与几何;不能由此推出对象动力学机制可识别或可编辑。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f69fec672a1eed5ecc403ca93483811fcf6fb2393227c0aaff645f40f8b2152c

返回筛选与清单
P229 / 2024研究者收藏TRANSIC: Sim-to-Real Policy Transfer by Learning from Online CorrectionYunfan Jiang; Chen Wang; Ruohan Zhang; Jiajun Wu; Li Fei-FeiTRANSIC 将仿真策略与真实执行时的人类辅助结合,学习应对接触复杂任务中的迁移误差。AI方法与评测XR与人机协作展开标注
#P22939 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

TRANSIC 将仿真策略与真实执行时的人类辅助结合,学习应对接触复杂任务中的迁移误差。

本篇研究的问题

人的在线纠正怎样帮助策略跨越仿真到真实的差别?

适用条件

人的介入提供额外信息与成本,不能与完全自主系统忽略条件地比较。

方法与训练

TRANSIC 将仿真策略与真实执行时的人类辅助结合,学习应对接触复杂任务中的迁移误差。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】人的介入提供额外信息与成本,不能与完全自主系统忽略条件地比较。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b445a54c4e6ce51af8a3552c22db90c44c3808332ea321388e5659b5a6149c1d

返回筛选与清单
P228 / 2024研究者收藏Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement LearningYuexiang Zhai; Hao Bai; Zipeng Lin; Jiayi Pan; Shengbang Tong; Yifei Zhou; Alane Suhr; Saining Xie; Yann LeCun; Yi Ma; Sergey Levine作者将任务描述、语言思维链和文本动作接入强化学习,通过任务奖励优化视觉语言决策。AI方法与评测展开标注
#P22830 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者将任务描述、语言思维链和文本动作接入强化学习,通过任务奖励优化视觉语言决策。

本篇研究的问题

强化学习能否把视觉语言模型训练成更有效的决策智能体?

适用条件

推理由 VLM 承担,不属于视频生成模型本身涌现的推理证据。

方法与训练

作者将任务描述、语言思维链和文本动作接入强化学习,通过任务奖励优化视觉语言决策。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】推理由 VLM 承担,不属于视频生成模型本身涌现的推理证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d0aa2cca69f98ca66273f5d7d77389ba363acf1525e5302813aff989a01e6664

返回筛选与清单
P227 / 2024研究者收藏BEHAVIOR Vision Suite: Customizable Dataset Generation via SimulationYunhao Ge; Yihe Tang; Jiashu Xu; Cem Gokmen; Chengshu Li; Wensi Ai; Benjamin Jose Martinez; Arman Aydin; Mona Anvari; Ayush K Chakravarthy; Hong-Xing Yu; Josiah Wong; Sanjana Srivastava; Sharon Lee; Shengxin Zha; Laurent Itti; Yunzhu Li; Roberto Martín-Martín; Miao Liu; Pengchuan Zhang; Ruohan Zhang; Li Fei-Fei; Jiajun WuBEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数,生成带定制标注的合成数据。创作与规则补全展开标注
#P22719 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

BEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数,生成带定制标注的合成数据。

本篇研究的问题

怎样生成可控制环境变量的视觉训练与评价数据?

适用条件

可控仿真便于因子实验,但需另外检查仿真到真实的差别。

方法与训练

BEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数,生成带定制标注的合成数据。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】可控仿真便于因子实验,但需另外检查仿真到真实的差别。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 317df78c127f63e4d1ca4825c9ca6b3a618230fa3385bda14c61aa63ac486393

返回筛选与清单
P226 / 2024研究者收藏Learn2Talk: 3D Talking Face Learns from 2D Talking FaceYixiang Zhuang; Baoping Cheng; Yao Cheng; Yuntao Jin; Renshuai Liu; Chengyang Li; Xuan Cheng; Jing Liao; Juncong LinLearn2Talk 从二维说话人方法获得唇音同步和教师监督,改进语音到三维面部运动的学习。创作与规则补全展开标注
#P22612 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Learn2Talk 从二维说话人方法获得唇音同步和教师监督,改进语音到三维面部运动的学习。

本篇研究的问题

二维说话人模型怎样监督三维语音面部动画?

适用条件

研究特定人体动画子任务,泛化到手部操作或环境后果需要新证据。

方法与训练

Learn2Talk 从二维说话人方法获得唇音同步和教师监督,改进语音到三维面部运动的学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】研究特定人体动画子任务,泛化到手部操作或环境后果需要新证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8be26b4b0abb2481bc95e01956112affc32af2ba0fce98363f5f927bcf2d94b5

返回筛选与清单
P225 / 2024研究者收藏AniClipart: Clipart Animation with Text-to-Video PriorsRonghuan Wu; Wanchao Su; Kede Ma; Jing LiaoAniClipart 用贝塞尔曲线参数化关键点轨迹,并结合视频分数蒸馏与骨架保持损失优化动画。创作与规则补全展开标注
#P22518 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AniClipart 用贝塞尔曲线参数化关键点轨迹,并结合视频分数蒸馏与骨架保持损失优化动画。

本篇研究的问题

如何用视频扩散先验让静态剪贴画形成可控动画?

适用条件

轨迹优化以视频先验和骨架约束为依据,非物理仿真保证。

方法与训练

AniClipart 用贝塞尔曲线参数化关键点轨迹,并结合视频分数蒸馏与骨架保持损失优化动画。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】轨迹优化以视频先验和骨架约束为依据,非物理仿真保证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8b5b637fe3ff58ab32105baf94d0362fb9cc4aedfbf3cd9a147c8ba392876cd8

返回筛选与清单
P224 / 2024研究者收藏EgoPet: Egomotion and Interaction Data from an Animal's PerspectiveAmir Bar; Arya Bakhtiar; Danny Tran; Antonio Loquercio; Jathushan Rajasegaran; Yann LeCun; Amir Globerson; Trevor DarrellEgoPet 收集宠物运动与交互视频,设计动物行为任务并评估其对四足机器人预训练的帮助。AI方法与评测展开标注
#P22417 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

EgoPet 收集宠物运动与交互视频,设计动物行为任务并评估其对四足机器人预训练的帮助。

本篇研究的问题

动物第一视角数据能为运动和交互学习提供什么信号?

适用条件

数据迁移收益不表示人类教程或可控未来视频生成已解决。

方法与训练

EgoPet 收集宠物运动与交互视频,设计动物行为任务并评估其对四足机器人预训练的帮助。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】数据迁移收益不表示人类教程或可控未来视频生成已解决。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8be645841806230228c292995eb6538540f9be6d228b916b37e53fefeeca59ca

返回筛选与清单
P223 / 2024研究者收藏Revisiting Feature Prediction for Learning Visual Representations from VideoAdrien Bardes; Quentin Garrido; Jean Ponce; Xinlei Chen; Michael Rabbat; Yann LeCun; Mahmoud Assran; Nicolas BallasV-JEPA 从视频特征预测学习表征,以冻结骨干评估运动、外观和图像任务。世界机制与演化展开标注
#P22323 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

V-JEPA 从视频特征预测学习表征,以冻结骨干评估运动、外观和图像任务。

本篇研究的问题

不重建像素,仅预测视频特征能否获得通用视觉表示?

适用条件

下游理解准确率不是动作条件后果预测或视频生成的直接验证。

方法与训练

V-JEPA 从视频特征预测学习表征,以冻结骨干评估运动、外观和图像任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】下游理解准确率不是动作条件后果预测或视频生成的直接验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fb84f79be128e7425263e8674fbc3f2ec991575c4b5880556cfb8f5fa9fd91ba

返回筛选与清单
P222 / 2024研究者收藏RaFE: Generative Radiance Fields RestorationZhongkai Wu; Ziyu Wan; Jing Zhang; Jing Liao; Dong XuRaFE 先修复多视图图像,再通过生成式辐射场处理各视角修复结果的不一致。创作与规则补全展开标注
#P22223 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

RaFE 先修复多视图图像,再通过生成式辐射场处理各视角修复结果的不一致。

本篇研究的问题

如何利用二维生成先验修复不同退化类型的辐射场?

适用条件

针对场景恢复与新视角合成,不检验动作条件的未来演化。

方法与训练

RaFE 先修复多视图图像,再通过生成式辐射场处理各视角修复结果的不一致。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】针对场景恢复与新视角合成,不检验动作条件的未来演化。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 440576c5ed9357fa89873e256a1aaee962ad8be50cd6630a651c3065030cbda4

返回筛选与清单
P221 / 2024研究者收藏BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic SimulationChengshu Li; Ruohan Zhang; Josiah Wong; Cem Gokmen; Sanjana Srivastava; Roberto Martín-Martín; Chen Wang; Gabrael Levine; Wensi Ai; Benjamin Martinez; Hang Yin; Michael Lingelbach; Minjune Hwang; Ayano Hiranaka; Sujay Garlanka; Arman Aydin; Sharon Lee; Jiankai Sun; Mona Anvari; Manasi Sharma; Dhruva Bansal; Samuel Hunter; Kyu-Young Kim; Alan Lou; Caleb R Matthews; Ivan Villa-Renteria; Jerry Huayang Tang; Claire Tang; Fei Xia; Yunzhu Li; Silvio Savarese; Hyowon Gweon; C. Karen Liu; Jiajun Wu; Li Fei-FeiBEHAVIOR-1K 提供大量人本活动与交互仿真,测试复杂操作及迁移。世界机制与演化展开标注
#P22143 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

BEHAVIOR-1K 提供大量人本活动与交互仿真,测试复杂操作及迁移。

本篇研究的问题

贴近日常需要的长程家庭任务怎样被模拟并评价?

适用条件

模拟任务成功与生成视频对人类探索的价值仍是不同结果。

方法与训练

BEHAVIOR-1K 提供大量人本活动与交互仿真,测试复杂操作及迁移。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】模拟任务成功与生成视频对人类探索的价值仍是不同结果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ab4033f3e8a8187ad2cfdf11f1979d33996ecce1e81fa3d62af33a92bbb17a2b

返回筛选与清单
P220 / 2024研究者收藏DexCap: Scalable and Portable Mocap Data Collection System for Dexterous ManipulationChen Wang; Haochen Shi; Weizhuo Wang; Ruohan Zhang; Li Fei-Fei; C. Karen LiuDexCap 提供手部捕捉系统,DexIL 将人类动作数据用于机器人技能学习。AI方法与评测XR与人机协作展开标注
#P22020 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DexCap 提供手部捕捉系统,DexIL 将人类动作数据用于机器人技能学习。

本篇研究的问题

便携人手动作捕捉怎样支持灵巧机器人模仿?

适用条件

捕捉和策略迁移不直接预测未知物体后果。

方法与训练

DexCap 提供手部捕捉系统,DexIL 将人类动作数据用于机器人技能学习。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】捕捉和策略迁移不直接预测未知物体后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ad87015fd70061e5d0b6d4b21c22411c8071328766892a55f133b652d16de87a

返回筛选与清单
P219 / 2024研究者收藏DragAnything: Motion Control for Anything using Entity RepresentationWeijia Wu; Zhuang Li; Yuchao Gu; Rui Zhao; Yefei He; David Junhao Zhang; Mike Zheng Shou; Yan Li; Tingting Gao; Di ZhangDragAnything 将实体表征与运动引导结合,支持对象和背景的轨迹控制。创作与规则补全XR与人机协作展开标注
#P21920 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DragAnything 将实体表征与运动引导结合,支持对象和背景的轨迹控制。

本篇研究的问题

怎样通过实体表示分别控制多个对象的运动?

适用条件

输入轨迹已指定;控制跟随不能直接证明模型自主预测因果后果。

方法与训练

DragAnything 将实体表征与运动引导结合,支持对象和背景的轨迹控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】输入轨迹已指定;控制跟随不能直接证明模型自主预测因果后果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 893aa9bae332bc9d7c807751c9453404e93adb50ede2b5394f7ca0dcfc90d692

返回筛选与清单
P218 / 2024研究者收藏Position Paper: Agent AI Towards a Holistic IntelligenceQiuyuan Huang; Naoki Wake; Bidipta Sarkar; Zane Durante; Ran Gong; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Noboru Kuno; Ade Famoti; Ashley Llorens; John Langford; Hoi Vo; Li Fei-Fei; Katsu Ikeuchi; Jianfeng GaoAgent AI 立场论文讨论感知、基础模型与行动模型的整合路线。AI方法与评测展开标注
#P21822 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Agent AI 立场论文讨论感知、基础模型与行动模型的整合路线。

本篇研究的问题

基础模型如何与行动结合形成通用具身智能?

适用条件

研究主张和跨域展望不应当作统一系统已经实现的实验证据。

方法与训练

Agent AI 立场论文讨论感知、基础模型与行动模型的整合路线。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】研究主张和跨域展望不应当作统一系统已经实现的实验证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 4f2426d32f4cd0a8a40929d64524c80bc64d3491dcd5df383adef53c76cf3b34

返回筛选与清单
P217 / 2024研究者收藏Learning and Leveraging World Models in Visual Representation LearningQuentin Garrido; Mahmoud Assran; Nicolas Ballas; Adrien Bardes; Laurent Najman; Yann LeCunImage World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测,并研究条件和容量的影响。世界机制与演化展开标注
#P21723 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Image World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测,并研究条件和容量的影响。

本篇研究的问题

预测已知图像变换的作用能否学习更可控的视觉表征?

适用条件

这里的 world model 主要针对图像变换,不能泛化为任意物理环境模型。

方法与训练

Image World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测,并研究条件和容量的影响。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】这里的 world model 主要针对图像变换,不能泛化为任意物理环境模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fa435ab0b2219bdaaca9693b7dccf6ab285300a970b6001fe5476ac89ae80972

返回筛选与清单
P216 / 2024研究者收藏Bring Your Own Character: A Holistic Solution for Automatic Facial Animation Generation of Customized CharactersZechen Bai; Peng Chen; Xiaolan Peng; Lu Liu; Hui Chen; Mike Zheng Shou; Feng TianBring Your Own Character 预测表情系数进行面部重定向,并通过人在环反馈改进定制。创作与规则补全XR与人机协作展开标注
#P21610 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Bring Your Own Character 预测表情系数进行面部重定向,并通过人在环反馈改进定制。

本篇研究的问题

不同虚拟角色的面部动画怎样适配并纳入用户反馈?

适用条件

角色表情编辑不是开放世界物理交互预测。

方法与训练

Bring Your Own Character 预测表情系数进行面部重定向,并通过人在环反馈改进定制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】角色表情编辑不是开放世界物理交互预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 080c079c721dbcf1494bc4f2cf74c18a1e5397576cb8ce2aa808b58e64d5f171

返回筛选与清单
P215 / 2024研究者收藏An Interactive Agent Foundation ModelZane Durante; Bidipta Sarkar; Ran Gong; Rohan Taori; Yusuke Noda; Paul Tang; Ehsan Adeli; Shrinidhi Kowshika Lakshmikanth; Kevin Schulman; Arnold Milstein; Demetri Terzopoulos; Ade Famoti; Noboru Kuno; Ashley Llorens; Hoi Vo; Katsu Ikeuchi; Li Fei-Fei; Jianfeng Gao; Naoki Wake; Qiuyuan HuangInteractive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测,研究机器人及游戏等任务。AI方法与评测展开标注
#P21522 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Interactive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测,研究机器人及游戏等任务。

本篇研究的问题

多域多任务预训练能否形成通用交互动作模型?

适用条件

动作泛化与像素世界建模、物理机制可解释性需独立验证。

方法与训练

Interactive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测,研究机器人及游戏等任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动作泛化与像素世界建模、物理机制可解释性需独立验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d395efa3fc2f525e405438530c2469cb58aba746a30e0cad80f78ac940caa7a1

返回筛选与清单
P214 / 2024研究者收藏Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object MotionShiyuan Yang; Liang Hou; Haibin Huang; Chongyang Ma; Pengfei Wan; Di Zhang; Xiaodong Chen; Jing LiaoDirect-a-Video 分别建模相机参数和对象运动,以新增时间交叉注意力和数据增强训练相机控制。创作与规则补全展开标注
#P21415 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Direct-a-Video 分别建模相机参数和对象运动,以新增时间交叉注意力和数据增强训练相机控制。

本篇研究的问题

如何解耦控制相机运动与多个对象的运动?

适用条件

用户已指定运动条件;控制准确性需要与自主预测后果区分。

方法与训练

Direct-a-Video 分别建模相机参数和对象运动,以新增时间交叉注意力和数据增强训练相机控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】用户已指定运动条件;控制准确性需要与自主预测后果区分。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b628509aebbd3c80da6a30c32512c31025064674be11937682a2c79964ccaf0a

返回筛选与清单
P213 / 2024研究者收藏Advances in 3D Generation: A SurveyXiaoyu Li; Qi Zhang; Di Kang; Weihao Cheng; Yiming Gao; Jingbo Zhang; Zhihao Liang; Jing Liao; Yan-Pei Cao; Ying Shan综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。创作与规则补全展开标注
#P21333 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。

本篇研究的问题

三维生成有哪些表示、算法、数据与应用路线?

适用条件

综述用于寻找来源与建立分类,本身不提供各能力的统一实证验证。

方法与训练

综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】综述用于寻找来源与建立分类,本身不提供各能力的统一实证验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 851cba448332cf58493102c17e2470108b6c0dc933fb2a8c06fa5262be402b49

返回筛选与清单
P212 / 2024研究者收藏Deconstructing Denoising Diffusion Models for Self-Supervised LearningXinlei Chen; Zhuang Liu; Saining Xie; Kaiming He逐项拆解去噪扩散模型并向去噪自编码器简化,对比其表征学习表现。AI方法与评测展开标注
#P21210 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

逐项拆解去噪扩散模型并向去噪自编码器简化,对比其表征学习表现。

本篇研究的问题

扩散模型的哪些组成部分对自监督表征学习真正必要?

适用条件

感知表征质量与生成后果正确性使用不同任务和评价。

方法与训练

逐项拆解去噪扩散模型并向去噪自编码器简化,对比其表征学习表现。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】感知表征质量与生成后果正确性使用不同任务和评价。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 de3995aa8e3602297a718c1dbf251051a2c4563924d3e921fd334a13a686fd79

返回筛选与清单
P211 / 2024研究者收藏Towards A Better Metric for Text-to-Video GenerationJay Zhangjie Wu; Guian Fang; Haoning Wu; Xintao Wang; Yixiao Ge; Xiaodong Cun; David Junhao Zhang; Jia-Wei Liu; Yuchao Gu; Rui Zhao; Weisi Lin; Wynne Hsu; Ying Shan; Mike Zheng ShouT2VScore 分开建模文本视频对齐与视频质量,并用人工判断数据检验指标。创作与规则补全展开标注
#P21116 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

T2VScore 分开建模文本视频对齐与视频质量,并用人工判断数据检验指标。

本篇研究的问题

文本到视频怎样同时评估提示对齐与视觉质量?

适用条件

两类观感指标仍不足以证明物理机制和干预结果正确。

方法与训练

T2VScore 分开建模文本视频对齐与视频质量,并用人工判断数据检验指标。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】两类观感指标仍不足以证明物理机制和干预结果正确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c55bf36b6f20cd4787f079367c7e27c1d5c7b46cc57396b4482f0c15e8b7655c

返回筛选与清单
P210 / 2024研究者收藏Agent AI: Surveying the Horizons of Multimodal InteractionZane Durante; Qiuyuan Huang; Naoki Wake; Ran Gong; Jae Sung Park; Bidipta Sarkar; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Yejin Choi; Katsushi Ikeuchi; Hoi Vo; Li Fei-Fei; Jianfeng GaoAgent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。AI方法与评测XR与人机协作展开标注
#P21080 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Agent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。

本篇研究的问题

多模态 agent 如何整合感知、外部知识与人类反馈?

适用条件

综述提供概念脉络,不能替代具体实验边界。

方法与训练

Agent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】综述提供概念脉络,不能替代具体实验边界。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 62fa6655a8eecfef68bd5ae7965a84726457488b37b29a169397e85c9c0eea6e

返回筛选与清单
P209 / 2024研究者收藏Moonshot: Towards Controllable Video Generation and Editing with Multimodal ConditionsDavid Junhao Zhang; Dongxu Li; Hung Le; Mike Zheng Shou; Caiming Xiong; Doyen SahooMoonshot 用多模态视频模块与解耦交叉注意力整合条件,并接入预训练 ControlNet。创作与规则补全展开标注
#P20912 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Moonshot 用多模态视频模块与解耦交叉注意力整合条件,并接入预训练 ControlNet。

本篇研究的问题

图像、文字和几何条件怎样共同控制视频?

适用条件

多条件可控性与未知后果预测是不同问题。

方法与训练

Moonshot 用多模态视频模块与解耦交叉注意力整合条件,并接入预训练 ControlNet。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】多条件可控性与未知后果预测是不同问题。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8d588c27ffefee636222553882b971cb5e02acf3a25b2985bf7b4a4eebf84456

返回筛选与清单
P208 / 2023研究者收藏Gradient-based Planning with World ModelsJyothir S; Siddhartha Jalagam; Yann LeCun; Vlad Sobal作者比较梯度优化、其他模型预测控制和策略方法,考察样本效率与规划效果。世界机制与演化展开标注
#P20812 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者比较梯度优化、其他模型预测控制和策略方法,考察样本效率与规划效果。

本篇研究的问题

可微世界模型中的梯度规划能否替代采样式动作搜索?

适用条件

优化器能找到低模型损失的动作,不代表模型误差或真实执行风险已消除。

方法与训练

作者比较梯度优化、其他模型预测控制和策略方法,考察样本效率与规划效果。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】优化器能找到低模型损失的动作,不代表模型误差或真实执行风险已消除。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 64926bc0b300f8419953bfd4aec777a96c959b015abad487a0a9eb8acfdb07c4

返回筛选与清单
P207 / 2023研究者收藏ShowRoom3D: Text to High-Quality 3D Room Generation Using 3D PriorsWeijia Mao; Yan-Pei Cao; Jia-Wei Liu; Zhongcong Xu; Mike Zheng ShouShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。创作与规则补全展开标注
#P20715 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。

本篇研究的问题

三维先验怎样改善文本生成的房间场景?

适用条件

生成静态场景不直接提供随时间演化的物理状态。

方法与训练

ShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】生成静态场景不直接提供随时间演化的物理状态。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 e3457f5a42baf95ccda334fcfe67e08ea00ed461a2a9149cc3a237e9a950f95b

返回筛选与清单
P206 / 2023研究者收藏ASSISTGUI: Task-Oriented Desktop Graphical User Interface AutomationDifei Gao; Lei Ji; Zechen Bai; Mingyu Ouyang; Peiran Li; Dongxing Mao; Qinchen Wu; Weichen Zhang; Peiyi Wang; Xiangwu Guo; Hengxu Wang; Luowei Zhou; Mike Zheng ShouAssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。AI方法与评测XR与人机协作展开标注
#P20614 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。

本篇研究的问题

桌面 agent 能否完成真实软件中的长步骤任务?

适用条件

执行基准与人机协作效用不同,用户负担需额外实验。

方法与训练

AssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】执行基准与人机协作效用不同,用户负担需额外实验。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bd4f1fcdaff8be73eb40b024c934ee2bbe2d62e12926fc66561f51387cdb4fb3

返回筛选与清单
P205 / 2023研究者收藏Model-Based Control with Sparse Neural DynamicsZiang Liu; Genggeng Zhou; Jeff He; Tobia Marcucci; Li Fei-Fei; Jiajun Wu; Yunzhu Li作者剪除冗余 ReLU 神经元,再用混合整数规划和分支定界求解动作。世界机制与演化展开标注
#P20521 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者剪除冗余 ReLU 神经元,再用混合整数规划和分支定界求解动作。

本篇研究的问题

稀疏神经动力学能否更适合可优化的预测控制?

适用条件

结构可优化不等于语义规则可解释;优化保证也受模型误差限制。

方法与训练

作者剪除冗余 ReLU 神经元,再用混合整数规划和分支定界求解动作。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】结构可优化不等于语义规则可解释;优化保证也受模型误差限制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 fa982f779e80a0f5dec14ffcf5dbef702dedc605182595bbdbf9d75a886988df

返回筛选与清单
P204 / 2023研究者收藏HeadArtist: Text-conditioned 3D Head Generation with Self Score DistillationHongyu Liu; Xuan Wang; Ziyu Wan; Yujun Shen; Yibing Song; Jing Liao; Qifeng ChenHeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。创作与规则补全展开标注
#P20417 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。

本篇研究的问题

文本怎样生成可进一步编辑的三维头部?

适用条件

研究人体局部几何与外观生成;不涉及通用世界动力学。

方法与训练

HeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】研究人体局部几何与外观生成;不涉及通用世界动力学。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3d22c1642606fc1c4f2d2d246f162b370803deafcaa2e6438d7a5acbe6ef679e

返回筛选与清单
P203 / 2023研究者收藏CAD: Photorealistic 3D Generation via Adversarial DistillationZiyu Wan; Despoina Paschalidou; Ian Huang; Hongyu Liu; Bokui Shen; Xiaoyu Xiang; Jing Liao; Leonidas GuibasCAD 比较多视图渲染与扩散先验的分布差异,以对抗学习支持单图条件三维合成与插值。创作与规则补全展开标注
#P20316 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

CAD 比较多视图渲染与扩散先验的分布差异,以对抗学习支持单图条件三维合成与插值。

本篇研究的问题

对抗蒸馏能否改善扩散先验引导的三维生成质量和多样性?

适用条件

质量和多样性评价不能替代几何或物理约束的完整验证。

方法与训练

CAD 比较多视图渲染与扩散先验的分布差异,以对抗学习支持单图条件三维合成与插值。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】质量和多样性评价不能替代几何或物理约束的完整验证。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bbdc77f7c59d2fe8824cc79a87ae685ca5704e97e48267ea72409b44d23d6fab

返回筛选与清单
P202 / 2023研究者收藏Photorealistic Video Generation with Diffusion ModelsAgrim Gupta; Lijun Yu; Kihyuk Sohn; Xiuye Gu; Meera Hahn; Li Fei-Fei; Irfan Essa; Lu Jiang; José LezamaW.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。创作与规则补全展开标注
#P20213 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

W.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。

本篇研究的问题

视频扩散怎样联合利用图像数据并减少注意力成本?

适用条件

主要验证通用视频生成,不直接验证行动后果或新规则推理。

方法与训练

W.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要验证通用视频生成,不直接验证行动后果或新规则推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 2371878e441f215e1a9eae4511a3bc36c8113a54c1039e7d47eb4adcc4504c13

返回筛选与清单
P201 / 2023研究者收藏Chain of Code: Reasoning with a Language Model-Augmented Code EmulatorChengshu Li; Jacky Liang; Andy Zeng; Xinyun Chen; Karol Hausman; Dorsa Sadigh; Sergey Levine; Li Fei-Fei; Fei Xia; Brian IchterChain of Code 用代码结构组织推理,并让语言模型模拟不易直接执行的语义步骤。AI方法与评测展开标注
#P20119 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Chain of Code 用代码结构组织推理,并让语言模型模拟不易直接执行的语义步骤。

本篇研究的问题

代码与语言仿真能否组合精确计算和语义推理?

适用条件

部分步骤由语言模型近似,不能将整条链默认视为可验证程序执行。

方法与训练

Chain of Code 用代码结构组织推理,并让语言模型模拟不易直接执行的语义步骤。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】部分步骤由语言模型近似,不能将整条链默认视为可验证程序执行。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 3ea67386c3612262130b284f4f74c6c2fc6e137fa3f6b375f34182aa18a72e3b

返回筛选与清单
P200 / 2023研究者收藏Return of Unconditional Generation: A Self-supervised Representation Generation MethodTianhong Li; Dina Katabi; Kaiming HeRCG 先在自监督编码器的表征空间生成条件,再让图像生成器利用这些条件,降低无条件与有条件生成的差距。AI方法与评测展开标注
#P20028 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

RCG 先在自监督编码器的表征空间生成条件,再让图像生成器利用这些条件,降低无条件与有条件生成的差距。

本篇研究的问题

无条件生成能否通过先生成自监督语义表征来改善?

适用条件

无标签图像生成并不意味着无需数据先验,也没有直接验证世界动力学。

方法与训练

RCG 先在自监督编码器的表征空间生成条件,再让图像生成器利用这些条件,降低无条件与有条件生成的差距。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】无标签图像生成并不意味着无需数据先验,也没有直接验证世界动力学。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f19b71decae5e4165f3036f78ae0e0b8ff6527670e324df9fb2c46162d3a4609

返回筛选与清单
P199 / 2023研究者收藏Mesh-Guided Neural Implicit Field EditingCan Wang; Mingming He; Menglei Chai; Dongdong Chen; Jing Liao以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场,支持不同粒度的局部编辑。创作与规则补全XR与人机协作展开标注
#P19913 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场,支持不同粒度的局部编辑。

本篇研究的问题

显式网格如何帮助编辑隐式神经场?

适用条件

局部几何编辑与局部机制修订不同;动态后果不在摘要任务范围内。

方法与训练

以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场,支持不同粒度的局部编辑。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】局部几何编辑与局部机制修订不同;动态后果不在摘要任务范围内。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 74f3a3aa9892834f94d57322f9d24fc747050094e92ada91018c753dfd29a9e1

返回筛选与清单
P198 / 2023研究者收藏VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point CorrespondenceYuchao Gu; Yipin Zhou; Bichen Wu; Licheng Yu; Jia-Wei Liu; Rui Zhao; Jay Zhangjie Wu; David Junhao Zhang; Mike Zheng Shou; Kevin TangVideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。创作与规则补全XR与人机协作展开标注
#P19816 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。

本篇研究的问题

交互式语义点怎样支持形状改变的视频主体替换?

适用条件

源动作已给定;编辑保持不代表新动作后果可预测。

方法与训练

VideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】源动作已给定;编辑保持不代表新动作后果可预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 26096cae389c90d848d56454d277cdb9bf7b82b7c06225d0b72be2afd9203988

返回筛选与清单
P197 / 2023研究者收藏Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesKristen Grauman; Andrew Westbury; Lorenzo Torresani; Kris Kitani; Jitendra Malik; Triantafyllos Afouras; Kumar Ashutosh; Vijay Baiyya; Siddhant Bansal; Bikram Boote; Eugene Byrne; Zach Chavis; Joya Chen; Feng Cheng; Fu-Jen Chu; Sean Crane; Avijit Dasgupta; Jing Dong; Maria Escobar; Cristhian Forigua; Abrham Gebreselasie; Sanjay Haresh; Jing Huang; Md Mohaiminul Islam; Suyog Jain; Rawal Khirodkar; Devansh Kukreja; Kevin J Liang; Jia-Wei Liu; Sagnik Majumder; Yongsen Mao; Miguel Martin; Effrosyni Mavroudi; Tushar Nagarajan; Francesco Ragusa; Santhosh Kumar Ramakrishnan; Luigi Seminara; Arjun Somayazulu; Yale Song; Shan Su; Zihui Xue; Edward Zhang; Jinxu Zhang; Angela Castillo; Changan Chen; Xinzhu Fu; Ryosuke Furuta; Cristina Gonzalez; Prince Gupta; Jiabo Hu; Yifei Huang; Yiming Huang; Weslie Khoo; Anush Kumar; Robert Kuo; Sach Lakhavani; Miao Liu; Mi Luo; Zhengyi Luo; Brighid Meredith; Austin Miller; Oluwatumininu Oguntola; Xiaqing Pan; Penny Peng; Shraman Pramanick; Merey Ramazanova; Fiona Ryan; Wei Shan; Kiran Somasundaram; Chenan Song; Audrey Southerland; Masatoshi Tateno; Huiyu Wang; Yuchen Wang; Takuma Yagi; Mingfei Yan; Xitong Yang; Zecheng Yu; Shengxin Cindy Zha; Chen Zhao; Ziwei Zhao; Zhifan Zhu; Jeff Zhuo; Pablo Arbelaez; Gedas Bertasius; David Crandall; Dima Damen; Jakob Engel; Giovanni Maria Farinella; Antonino Furnari; Bernard Ghanem; Judy Hoffman; C. V. Jawahar; Richard Newcombe; Hyun Soo Park; James M. Rehg; Yoichi Sato; Manolis Savva; Jianbo Shi; Mike Zheng Shou; Michael WrayEgo-Exo4D 提供第一/第三视角活动数据及技能、姿态和视角转换任务。创作与规则补全展开标注
#P19799 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Ego-Exo4D 提供第一/第三视角活动数据及技能、姿态和视角转换任务。

本篇研究的问题

多视角数据怎样支持技能理解和跨视角人体分析?

适用条件

观测数据与姿态任务本身不提供干预后果真值。

方法与训练

Ego-Exo4D 提供第一/第三视角活动数据及技能、姿态和视角转换任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】观测数据与姿态任务本身不提供干预后果真值。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 15e31586e111eb32fe54131840b7733b095fb3b20bebb14be9610d11967e26a8

返回筛选与清单
P196 / 2023研究者收藏HumanRef: Single Image to 3D Human Generation via Reference-Guided DiffusionJingbo Zhang; Xiaoyu Li; Qi Zhang; Yanpei Cao; Ying Shan; Jing LiaoHumanRef 采用参考引导的分数蒸馏和区域注意力,让生成的人体与输入外观对应。创作与规则补全展开标注
#P19611 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HumanRef 采用参考引导的分数蒸馏和区域注意力,让生成的人体与输入外观对应。

本篇研究的问题

单张参考图如何约束三维人体的几何、纹理和跨视角身份?

适用条件

主要目标是静态三维人体生成,不能直接证明运动或接触物理正确。

方法与训练

HumanRef 采用参考引导的分数蒸馏和区域注意力,让生成的人体与输入外观对应。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】主要目标是静态三维人体生成,不能直接证明运动或接触物理正确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 aeeeb93da8df3e5cf86952c1dc8b3818959acfec9b65c989996d9e4bd04a7fdb

返回筛选与清单
P195 / 2023研究者收藏XAGen: 3D Expressive Human Avatars GenerationZhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Jiashi Feng; Mike Zheng ShouXAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。创作与规则补全展开标注
#P19514 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

XAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。

本篇研究的问题

三维人体生成怎样细粒度控制脸、手和身体?

适用条件

人体表示可控不等同于物理运动或多对象交互建模。

方法与训练

XAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】人体表示可控不等同于物理运动或多对象交互建模。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 dc7d97561315665ee49faf83ef9df7a2631491d6276bd85e0b4f8d192a6b13eb

返回筛选与清单
P194 / 2023研究者收藏GAIA: a benchmark for General AI AssistantsGrégoire Mialon; Clémentine Fourrier; Craig Swift; Thomas Wolf; Yann LeCun; Thomas ScialomGAIA 以需要检索、工具和综合推理的现实问题构建助手评测。AI方法与评测展开标注
#P19424 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

GAIA 以需要检索、工具和综合推理的现实问题构建助手评测。

本篇研究的问题

怎样用真实问题评估通用助手的工具、推理和多模态能力?

适用条件

属于相邻 agent 基准,不直接测世界动力学或视频生成。

方法与训练

GAIA 以需要检索、工具和综合推理的现实问题构建助手评测。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】属于相邻 agent 基准,不直接测世界动力学或视频生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 5bf6f968d4f5cd20acdfca6e81e3c9f5277bb66061fad7a02e35442dff812ba0

返回筛选与清单
P193 / 2023研究者收藏NOIR: Neural Signal Operated Intelligent Robots for Everyday ActivitiesRuohan Zhang; Sharon Lee; Minjune Hwang; Ayano Hiranaka; Chen Wang; Wensi Ai; Jin Jie Ryan Tan; Shreya Gupta; Yilun Hao; Gabrael Levine; Ruohan Gao; Anthony Norcia; Li Fei-Fei; Jiajun WuNOIR 将脑信号接口与智能机器人技能组合,研究多类家庭活动控制。AI方法与评测XR与人机协作展开标注
#P19324 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

NOIR 将脑信号接口与智能机器人技能组合,研究多类家庭活动控制。

本篇研究的问题

人能否通过脑信号指挥机器人完成日常活动?

适用条件

交互通道和执行系统与视频预览不同;对 Foresee 更适合作为控制权设计参照。

方法与训练

NOIR 将脑信号接口与智能机器人技能组合,研究多类家庭活动控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】交互通道和执行系统与视频预览不同;对 Foresee 更适合作为控制权设计参照。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 134774852738bc88082376b49eb3aefe596d3b95320847a75bf0ff2991cb0e7e

返回筛选与清单
P192 / 2023研究者收藏ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single ImageKyle Sargent; Zizhang Li; Tanmay Shah; Charles Herrmann; Hong-Xing Yu; Yunzhi Zhang; Eric Ryan Chan; Dmitry Lagun; Li Fei-Fei; Deqing Sun; Jiajun WuZeroNVS 训练三维感知扩散先验,处理场景数据混合与尺度模糊,并改善完整视角生成。创作与规则补全展开标注
#P19212 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ZeroNVS 训练三维感知扩散先验,处理场景数据混合与尺度模糊,并改善完整视角生成。

本篇研究的问题

单张自然图像怎样支持更广视角的场景生成?

适用条件

单图隐藏内容是生成推测,尚非经观测验证的环境真值。

方法与训练

ZeroNVS 训练三维感知扩散先验,处理场景数据混合与尺度模糊,并改善完整视角生成。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】单图隐藏内容是生成推测,尚非经观测验证的环境真值。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 bec24cb4db6191dc3607ca1bc79b8eaf640e4c1c0f256ca09661087d03156ba0

返回筛选与清单
P191 / 2023研究者收藏VQ-NeRF: Neural Reflectance Decomposition and Editing with Vector QuantizationHongliang Zhong; Jingbo Zhang; Jing LiaoVQ-NeRF 将连续分支与离散材料码结合,并提供材质编辑界面。创作与规则补全XR与人机协作展开标注
#P19117 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VQ-NeRF 将连续分支与离散材料码结合,并提供材质编辑界面。

本篇研究的问题

离散材质表示能否改善三维反射分解和交互编辑?

适用条件

材质可编辑性与由材质决定的动力学后果属于不同建模目标。

方法与训练

VQ-NeRF 将连续分支与离散材料码结合,并提供材质编辑界面。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】材质可编辑性与由材质决定的动力学后果属于不同建模目标。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 dbc3457a09b27a3c5137949ce600f28352bd809e583b6b906ff850c75373eb3f

返回筛选与清单
P190 / 2023研究者收藏DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video EditingJia-Wei Liu; Yan-Pei Cao; Jay Zhangjie Wu; Weijia Mao; Yuchao Gu; Rui Zhao; Jussi Keppo; Ying Shan; Mike Zheng ShouDynVideo-E 在动态 NeRF 中编辑,并通过形变场传播,结合多视角多姿态扩散先验。创作与规则补全展开标注
#P19015 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

DynVideo-E 在动态 NeRF 中编辑,并通过形变场传播,结合多视角多姿态扩散先验。

本篇研究的问题

大动作和视角变化下的视频编辑怎样保持一致?

适用条件

动态来自已观测视频;三维编辑一致性与未来预测分开判断。

方法与训练

DynVideo-E 在动态 NeRF 中编辑,并通过形变场传播,结合多视角多姿态扩散先验。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动态来自已观测视频;三维编辑一致性与未来预测分开判断。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 b86f6a0949f7613e73744327cf9a9bab79ab738a7d38e0af072a013758f36676

返回筛选与清单
P189 / 2023研究者收藏Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AIEmily Jin; Jiaheng Hu; Zhuoyi Huang; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Roberto Martín-MartínMini-BEHAVIOR 以程序化环境提供日常活动式规划问题,便于扩大任务变化。AI方法与评测展开标注
#P18913 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Mini-BEHAVIOR 以程序化环境提供日常活动式规划问题,便于扩大任务变化。

本篇研究的问题

如何低成本生成多变的长程具身任务?

适用条件

简化环境中的规划能力不能直接外推到写实视频或真实接触动力学。

方法与训练

Mini-BEHAVIOR 以程序化环境提供日常活动式规划问题,便于扩大任务变化。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】简化环境中的规划能力不能直接外推到写实视频或真实接触动力学。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 e333f9ebf0b31acd933099daf04712319d1f957b38d788b81884dab0ec251062

返回筛选与清单
P188 / 2023研究者收藏D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable RearrangementYixuan Wang; Mingtong Zhang; Zhuoran Li; Tarik Kelestemur; Katherine Driggs-Campbell; Jiajun Wu; Li Fei-Fei; Yunzhu LiD3Fields 将多视角视觉特征投影到三维描述场,用于零样本重排。创作与规则补全展开标注
#P18812 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

D3Fields 将多视角视觉特征投影到三维描述场,用于零样本重排。

本篇研究的问题

动态语义三维描述怎样支持跨物体的重排任务?

适用条件

动态描述场主要组织观测,未自动提供未知未来动力学。

方法与训练

D3Fields 将多视角视觉特征投影到三维描述场,用于零样本重排。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】动态描述场主要组织观测,未自动提供未知未来动力学。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d6714ba076b3bc453cf4bdf8a0f95a84937362fdcbe88463b8e90e218760cbcc

返回筛选与清单
P187 / 2023研究者收藏Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video GenerationDavid Junhao Zhang; Jay Zhangjie Wu; Jia-Wei Liu; Rui Zhao; Lingmin Ran; Yuchao Gu; Difei Gao; Mike Zheng ShouShow-1 先生成低分辨率像素视频,再以潜扩散放大并修复。创作与规则补全展开标注
#P18716 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Show-1 先生成低分辨率像素视频,再以潜扩散放大并修复。

本篇研究的问题

像素和潜空间扩散怎样结合以兼顾对齐和生成成本?

适用条件

通用视频基准主要度量生成质量,不证明物理推理。

方法与训练

Show-1 先生成低分辨率像素视频,再以潜扩散放大并修复。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】通用视频基准主要度量生成质量,不证明物理推理。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f10566e39aeaece2275387acf23a58d1815fa6f4da64242c8f8ab2978e672c55

返回筛选与清单
P186 / 2023研究者收藏MindAgent: Emergent Gaming InteractionRan Gong; Qiuyuan Huang; Xiaojian Ma; Hoi Vo; Zane Durante; Yusuke Noda; Zilong Zheng; Song-Chun Zhu; Demetri Terzopoulos; Li Fei-Fei; Jianfeng GaoMindAgent 提供 CUISINEWORLD 和协作效率评价,通过反馈进行上下文协调。AI方法与评测XR与人机协作展开标注
#P18628 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MindAgent 提供 CUISINEWORLD 和协作效率评价,通过反馈进行上下文协调。

本篇研究的问题

语言模型怎样协调多个游戏角色并与人合作?

适用条件

多人协作基准与视频生成中的多主体动力学不能互相代替。

方法与训练

MindAgent 提供 CUISINEWORLD 和协作效率评价,通过反馈进行上下文协调。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】多人协作基准与视频生成中的多主体动力学不能互相代替。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8f1be26ef2b9b0e0309d93cd23bdc6e1d82b5f78b8ab983d0caefdc239c2cf85

返回筛选与清单
P185 / 2023研究者收藏Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon ManipulationYuanpei Chen; Chen Wang; Li Fei-Fei; C. Karen LiuSequential Dexterity 通过强化学习衔接多个策略,并研究新物体与真实机器人的迁移。世界机制与演化展开标注
#P18521 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Sequential Dexterity 通过强化学习衔接多个策略,并研究新物体与真实机器人的迁移。

本篇研究的问题

多个灵巧技能怎样串接为长程操作?

适用条件

技能链可执行不意味着可生成供人观看的可信后果视频。

方法与训练

Sequential Dexterity 通过强化学习衔接多个策略,并研究新物体与真实机器人的迁移。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】技能链可执行不意味着可生成供人观看的可信后果视频。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c796afe6242efc255c3cff03a2897414188372bd30550b751c35ab8886e60b4d

返回筛选与清单
P184 / 2023研究者收藏Primitive Skill-based Robot Learning from Human Evaluative FeedbackAyano Hiranaka; Minjune Hwang; Sharon Lee; Chen Wang; Li Fei-Fei; Jiajun Wu; Ruohan ZhangSEED 将参数化基础技能与人类评价强化学习结合,研究样本效率与人类负担。AI方法与评测XR与人机协作展开标注
#P1849 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

SEED 将参数化基础技能与人类评价强化学习结合,研究样本效率与人类负担。

本篇研究的问题

人能否在技能执行前评价高层意图以减少反馈成本?

适用条件

前瞻性的技能评价与视觉后果预览相邻,但并未直接验证视频分支界面。

方法与训练

SEED 将参数化基础技能与人类评价强化学习结合,研究样本效率与人类负担。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】前瞻性的技能评价与视觉后果预览相邻,但并未直接验证视频分支界面。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 342be141eb8391458740ccd308bd9997b00a65eb2c5a826bb37e6d0e68db1fba

返回筛选与清单
P183 / 2023研究者收藏MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content FeaturesAdrien Bardes; Jean Ponce; Yann LeCunMC-JEPA 将光流估计与内容表征目标联合训练,评估运动和分割任务。AI方法与评测展开标注
#P18320 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MC-JEPA 将光流估计与内容表征目标联合训练,评估运动和分割任务。

本篇研究的问题

运动和内容特征能否在同一自监督编码器中相互促进?

适用条件

光流与内容表征不直接验证多步物理预测。

方法与训练

MC-JEPA 将光流估计与内容表征目标联合训练,评估运动和分割任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】光流与内容表征不直接验证多步物理预测。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 a14993bb03f7aff73ba3bb26fd3090a0aef3154eb63b78903452919f916dd10a

返回筛选与清单
P182 / 2023研究者收藏VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language ModelsWenlong Huang; Chen Wang; Ruohan Zhang; Yunzhu Li; Jiajun Wu; Li Fei-FeiVoxPoser 组合三维价值图进行闭环轨迹规划,并可从在线接触经验学习动力学。创作与规则补全展开标注
#P18223 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VoxPoser 组合三维价值图进行闭环轨迹规划,并可从在线接触经验学习动力学。

本篇研究的问题

自然语言中的可供性和约束怎样变成三维动作计划?

适用条件

语言推理、视觉检测和规划器共同产生结果,不能归因于视频模型。

方法与训练

VoxPoser 组合三维价值图进行闭环轨迹规划,并可从在线接触经验学习动力学。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】语言推理、视觉检测和规划器共同产生结果,不能归因于视频模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cf1cadcf7a1ee44979908c07698f87755c9b5340a79420db509a92d6d2533d42

返回筛选与清单
P181 / 2023研究者收藏EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the BackboneShraman Pramanick; Yale Song; Sayan Nag; Kevin Qinghong Lin; Hardik Shah; Mike Zheng Shou; Rama Chellappa; Pengchuan ZhangEgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。AI方法与评测展开标注
#P18122 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

EgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。

本篇研究的问题

第一人称视频语言预训练怎样更早融合跨模态信息?

适用条件

理解表征是相邻基础,不能直接作为后果视频生成结果。

方法与训练

EgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】理解表征是相邻基础,不能直接作为后果视频生成结果。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 1208aa31cceaa1e5f9f92539236311fdae3beed0e70dd399cfa90d69f77fd201

返回筛选与清单
P180 / 2023研究者收藏Self-Supervised Learning with Lie Symmetries for Partial Differential EquationsGrégoire Mialon; Quentin Garrido; Hannah Lawrence; Danyal Rehman; Yann LeCun; Bobak T. Kiani作者利用 Lie 对称性构造联合嵌入自监督任务,评估方程参数回归与神经求解器时间步推进。世界机制与演化展开标注
#P18032 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者利用 Lie 对称性构造联合嵌入自监督任务,评估方程参数回归与神经求解器时间步推进。

本篇研究的问题

偏微分方程的对称性怎样用于学习可迁移物理表示?

适用条件

已知 PDE 结构和数据条件与从真实视频发现未知规律不同。

方法与训练

作者利用 Lie 对称性构造联合嵌入自监督任务,评估方程参数回归与神经求解器时间步推进。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】已知 PDE 结构和数据条件与从真实视频发现未知规律不同。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 10a161ad3c09b4050275f1f1e2fdc97fc5cf057fb05d0d2e951d9fad66b86bec

返回筛选与清单
P179 / 2023研究者收藏Dynamic-Resolution Model Learning for Object Pile ManipulationYixuan Wang; Yunzhu Li; Katherine Driggs-Campbell; Li Fei-Fei; Jiajun Wu作者以动态粒子分辨率和图神经网络,在效率与操作精度间选择抽象层级。世界机制与演化展开标注
#P17911 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

作者以动态粒子分辨率和图神经网络,在效率与操作精度间选择抽象层级。

本篇研究的问题

物体堆动力学的表示分辨率怎样按任务调节?

适用条件

粒状物模型有特定状态和任务条件,不是通用像素视频模型。

方法与训练

作者以动态粒子分辨率和图神经网络,在效率与操作精度间选择抽象层级。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】粒状物模型有特定状态和任务条件,不是通用像素视频模型。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 819257248da8260d8f28e8b84fbe26342fc10737ad6a9878c4359b435826a5da

返回筛选与清单
P178 / 2023研究者收藏Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine IntelligenceAnna Dawid; Yann LeCun这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系,提供架构层面的研究动机。世界机制与演化展开标注
#P17829 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系,提供架构层面的研究动机。

本篇研究的问题

潜变量能量模型怎样组成自主智能的预测与规划架构?

适用条件

概念和教程性质的论述不能当成所有模块已经联合实现的实验证据。

方法与训练

这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系,提供架构层面的研究动机。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】概念和教程性质的论述不能当成所有模块已经联合实现的实验证据。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 1f5ad87c7da931599dca22ee60612f396e8ac22306876d0a2800ced47a2f1a92

返回筛选与清单
P177 / 2023研究者收藏The ObjectFolder Benchmark: Multisensory Learning with Neural and Real ObjectsRuohan Gao; Yiming Dou; Hao Li; Tanmay Agarwal; Jeannette Bohg; Yunzhu Li; Li Fei-Fei; Jiajun WuObjectFolder Benchmark 结合神经对象及真实多感官对象数据,比较识别、重建和操作任务。世界机制与演化展开标注
#P17722 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

ObjectFolder Benchmark 结合神经对象及真实多感官对象数据,比较识别、重建和操作任务。

本篇研究的问题

视觉、声音与触觉分别怎样帮助对象理解和操作?

适用条件

多感官数据提供额外物理证据,不能与单目视频输入忽略条件地比较。

方法与训练

ObjectFolder Benchmark 结合神经对象及真实多感官对象数据,比较识别、重建和操作任务。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】多感官数据提供额外物理证据,不能与单目视频输入忽略条件地比较。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c66e9cb8dac08a4f3546aa248e63f160ee0969037a34c1980017724357e6c5a4

返回筛选与清单
P176 / 2023研究者收藏Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and HearRuohan Gao; Hao Li; Gokul Dharan; Zhuzhu Wang; Chengshu Li; Fei Xia; Silvio Savarese; Li Fei-Fei; Jiajun WuSonicverse 将音视频模拟结合,研究多感官导航与仿真到真实迁移。世界机制与演化展开标注
#P1768 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Sonicverse 将音视频模拟结合,研究多感官导航与仿真到真实迁移。

本篇研究的问题

听觉和视觉如何在家庭导航仿真中共同作用?

适用条件

导航和声音条件有专门目标,不直接评估可控视频后果生成。

方法与训练

Sonicverse 将音视频模拟结合,研究多感官导航与仿真到真实迁移。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】导航和声音条件有专门目标,不直接评估可控视频后果生成。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 6e4d3e4ff8bd1c37c0cff3471efb422e61dd6bd2eda0a0d771f4a47bd9695968

返回筛选与清单
P175 / 2023研究者收藏Modeling Dynamic Environments with Scene Graph MemoryAndrey Kurenkov; Michael Lingelbach; Tanmay Agarwal; Emily Jin; Chengshu Li; Ruohan Zhang; Li Fei-Fei; Jiajun Wu; Silvio Savarese; Roberto Martín-MartínScene Graph Memory 累积对象和房间关系,以节点边预测指导动态家庭环境中的搜索。世界机制与演化展开标注
#P17518 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Scene Graph Memory 累积对象和房间关系,以节点边预测指导动态家庭环境中的搜索。

本篇研究的问题

物体会移动且只能部分观察时,场景记忆怎样更新?

适用条件

图中的位置预测与持续生成动态视频不同,但可作为显式记忆对照。

方法与训练

Scene Graph Memory 累积对象和房间关系,以节点边预测指导动态家庭环境中的搜索。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】图中的位置预测与持续生成动态视频不同,但可作为显式记忆对照。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 2d53eeceeb1f428adea377f985bb2769c1195956e5491806b0844d75962234f6

返回筛选与清单
P174 / 2023研究者收藏Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance FieldsJingbo Zhang; Xiaoyu Li; Ziyu Wan; Can Wang; Jing LiaoText2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新,优化场景辐射场。创作与规则补全展开标注
#P17414 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Text2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新,优化场景辐射场。

本篇研究的问题

文本生成的三维场景如何保持跨视图几何与纹理一致?

适用条件

依赖图像与深度先验的静态场景构建,没有由摘要证明可执行动态机制。

方法与训练

Text2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新,优化场景辐射场。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】依赖图像与深度先验的静态场景构建,没有由摘要证明可执行动态机制。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 d58578f128b09a740cc3c2b866d993d17dcbb9330ee188b54f6132f508fcc872

返回筛选与清单
P173 / 2023研究者收藏HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single VideoJia-Wei Liu; Yan-Pei Cao; Tianyuan Yang; Eric Zhongcong Xu; Jussi Keppo; Ying Shan; Xiaohu Qie; Mike Zheng ShouHOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。创作与规则补全展开标注
#P17315 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

HOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。

本篇研究的问题

单目视频怎样重建动态人、物和场景以自由视角观看?

适用条件

重建既有轨迹与生成新干预下的动力学不同。

方法与训练

HOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】重建既有轨迹与生成新干预下的动力学不同。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 48b71f8a7aa88e352bdcd93366a0b68be290d007e661734e1445b3e8eff02a8e

返回筛选与清单
P172 / 2023研究者收藏Learning Neural Duplex Radiance Fields for Real-Time View SynthesisZiyu Wan; Christian Richardt; Aljaž Božič; Chao Li; Vijay Rengarajan; Seonghyeon Nam; Xiaoyu Xiang; Tuotuo Li; Bo Zhu; Rakesh Ranjan; Jing Liao将 NeRF 蒸馏到双层网格上的神经特征,结合屏幕空间卷积和多视图优化提升渲染效率。创作与规则补全展开标注
#P17210 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

将 NeRF 蒸馏到双层网格上的神经特征,结合屏幕空间卷积和多视图优化提升渲染效率。

本篇研究的问题

如何将辐射场转成适合实时渲染的网格特征表示?

适用条件

加速的是给定场景的新视角渲染,不能套用为视频生成模型的推理延迟。

方法与训练

将 NeRF 蒸馏到双层网格上的神经特征,结合屏幕空间卷积和多视图优化提升渲染效率。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】加速的是给定场景的新视角渲染,不能套用为视频生成模型的推理延迟。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 c20cacb54144fe0da28372500b6d48be5cdb926546eaa3419bf1f03e5000e881

返回筛选与清单
P171 / 2023研究者收藏AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose ControlRuixiang Jiang; Can Wang; Jingbo Zhang; Menglei Chai; Mingming He; Dongdong Chen; Jing LiaoAvatarCraft 用扩散先验优化人体几何和纹理,再通过参数化人体间的显式变形支持动画。创作与规则补全展开标注
#P17116 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

AvatarCraft 用扩散先验优化人体几何和纹理,再通过参数化人体间的显式变形支持动画。

本篇研究的问题

文本生成的神经人体如何同时支持身份与形状姿态控制?

适用条件

姿态可控与模型自行预测人体运动或对象互动的能力不同。

方法与训练

AvatarCraft 用扩散先验优化人体几何和纹理,再通过参数化人体间的显式变形支持动画。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】姿态可控与模型自行预测人体运动或对象互动的能力不同。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 8f142c6c12c531d3f30b68000b140d8f0e5fd1a154ec8f9c5f9d9323a9dd9f88

返回筛选与清单
P170 / 2023研究者收藏Affordance Grounding from Demonstration Video to Target ImageJoya Chen; Difei Gao; Kevin Qinghong Lin; Mike Zheng ShouAfformer 逐步细化 affordance 定位,并用 MaskAHand 自监督预训练模拟上下文变化。AI方法与评测展开标注
#P17013 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Afformer 逐步细化 affordance 定位,并用 MaskAHand 自监督预训练模拟上下文变化。

本篇研究的问题

演示视频中的可操作部位怎样迁移定位到目标图像?

适用条件

可操作部位定位不能直接说明动作执行或后果预测准确。

方法与训练

Afformer 逐步细化 affordance 定位,并用 MaskAHand 自监督预训练模拟上下文变化。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】可操作部位定位不能直接说明动作执行或后果预测准确。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 0a5dfa0c93ba2bb32bbb64498eaf3b5bd342d7c5e608aa22ebb8ce628066bb48

返回筛选与清单
P169 / 2023研究者收藏3D Video Loops from Asynchronous InputLi Ma; Xiaoyu Li; Jing Liao; Pedro V. SanderMulti-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。创作与规则补全展开标注
#P16911 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Multi-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。

本篇研究的问题

异步多视图视频如何重建可实时浏览的循环动态场景?

适用条件

针对周期重放与视角变化,不能视为开放式未来预测或无限演化。

方法与训练

Multi-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】针对周期重放与视角变化,不能视为开放式未来预测或无限演化。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 65a84920eb0ccbc107fcc4c6f457c4c658fafdebf70084bac7fc72ffedb78304

返回筛选与清单
P168 / 2023研究者收藏MimicPlay: Long-Horizon Imitation Learning by Watching Human PlayChen Wang; Linxi Fan; Jiankai Sun; Ruohan Zhang; Li Fei-Fei; Danfei Xu; Yuke Zhu; Anima AnandkumarMimicPlay 从人类视频学习潜计划,指导少量遥操作数据训练的低层控制。世界机制与演化展开标注
#P16821 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

MimicPlay 从人类视频学习潜计划,指导少量遥操作数据训练的低层控制。

本篇研究的问题

人类自由玩耍视频怎样降低长程机器人模仿的数据需求?

适用条件

潜计划与真实动作仍由不同数据和模块连接,不是纯视频生成策略。

方法与训练

MimicPlay 从人类视频学习潜计划,指导少量遥操作数据训练的低层控制。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】潜计划与真实动作仍由不同数据和模块连接,不是纯视频生成策略。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 ba6056f66abae90f12c95cc44f9b6714cf6766a6ed7eec6f19766aa0f2685ee5

返回筛选与清单
P167 / 2023研究者收藏Self-Supervised Learning from Images with a Joint-Embedding Predictive ArchitectureMahmoud Assran; Quentin Duval; Ishan Misra; Piotr Bojanowski; Pascal Vincent; Michael Rabbat; Yann LeCun; Nicolas BallasI-JEPA 用上下文预测多个目标区域的表示,研究掩码规模和上下文信息对语义学习的影响。世界机制与演化展开标注
#P16717 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

I-JEPA 用上下文预测多个目标区域的表示,研究掩码规模和上下文信息对语义学习的影响。

本篇研究的问题

能否通过预测图像块的语义表征获得高效自监督学习?

适用条件

静态图像表征是后续视频 JEPA 的基础,不直接处理时间演化。

方法与训练

I-JEPA 用上下文预测多个目标区域的表示,研究掩码规模和上下文信息对语义学习的影响。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】静态图像表征是后续视频 JEPA 的基础,不直接处理时间演化。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 eddbdc093eb4d48662bcf4fbd1c6735ccd606205cc9070977ce317d68aff3941

返回筛选与清单
P166 / 2023研究者收藏Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video GenerationJay Zhangjie Wu; Yixiao Ge; Xintao Wang; Weixian Lei; Yuchao Gu; Yufei Shi; Wynne Hsu; Ying Shan; Xiaohu Qie; Mike Zheng ShouTune-A-Video 通过时间注意力和单样本微调学习运动,使用反演提供结构条件。创作与规则补全展开标注
#P16616 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

Tune-A-Video 通过时间注意力和单样本微调学习运动,使用反演提供结构条件。

本篇研究的问题

只有一个文本视频样本时怎样适配图像扩散生成视频?

适用条件

正式发表于 2023;单样本外观运动适配不等于可泛化的物理机制学习。

方法与训练

Tune-A-Video 通过时间注意力和单样本微调学习运动,使用反演提供结构条件。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】正式发表于 2023;单样本外观运动适配不等于可泛化的物理机制学习。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 f6ccfdfda431c9df30b46b12cf3a37b998963f0bfe95c546cef8d57d172f9031

返回筛选与清单
P165 / 2023研究者收藏VIMA: General Robot Manipulation with Multimodal PromptsYunfan Jiang; Agrim Gupta; Zichen Zhang; Guanzhi Wang; Yongqiang Dou; Yanjun Chen; Li Fei-Fei; Anima Anandkumar; Yuke Zhu; Linxi FanVIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。AI方法与评测展开标注
#P16548 页 · 摘要初读;全文已提取 · 2026-09-19

查看 RQ、训练与推理条件 ↗

内容摘要

VIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。

本篇研究的问题

图文交错提示能否统一多种机器人操作任务?

适用条件

正式发表于 2023;动作预测基准不直接评价世界视频或物理机制修订。

方法与训练

VIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。 本条方法定位来自摘要,训练细节待核。

验证范围

本轮未独立核对定量表格;不依据摘要中的领先表述填写未经核查的提升数值。

边界与待核查事项

【资料库适用范围判断】正式发表于 2023;动作预测基准不直接评价世界视频或物理机制修订。 此处不将未测条件标成作者已观察到的失败。

证据定位

依据作者提交的 arXiv 摘要与元数据进行首轮标注;全文已逐页提取,但未逐项复核方法、指标和图表。

版本指纹 cf849f80368749b0310b43117519ce0abff3e8ae49744e78c4a29b9d17f0695f

返回筛选与清单
P164 2025新增 Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control Zekai Gu; Rui Yan; Jiahao Lu; Peng Li; Zhiyang Dou; Chenyang Si; Zhen Dong; Qifeng Liu; Cheng Lin; Ziwei Liu; Wenping Wang; Yuan Liu DaS把具有跨帧固定颜色标识的3D点轨迹渲染成控制视频,注入CogVideoX图生视频模型,在一个架构中支持相机控制、动作迁移、网格动画转视频及物体操纵。3D轨迹既提供几何运动控制,也提供跨帧对应关系。 创作与规则补全世界机制与演化AI方法与评测展开笔记
#P16412页 · 核对于 2026-09-17

中文摘要

DaS把具有跨帧固定颜色标识的3D点轨迹渲染成控制视频,注入CogVideoX图生视频模型,在一个架构中支持相机控制、动作迁移、网格动画转视频及物体操纵。3D轨迹既提供几何运动控制,也提供跨帧对应关系。

核心贡献

以首帧相机坐标归一化后的RGB为3D点编码,保持点的颜色跨时间不变,使同一控制表示适配多类视频编辑。冻结基础去噪DiT,仅训练复制的条件分支和零初始化线性注入层。

实现边界

输出仍是条件生成的2D视频,不是可执行的三维场景或物理世界模拟器。用户需提供与输入图像兼容的轨迹、网格动画或源视频;精细控制受深度估计、分割、跟踪及点覆盖范围限制。

Method · 方法

从CogVideoX的42个DiT块复制前18块作为条件分支,VAE编码3D跟踪视频,逐块注入控制特征。使用MiraData真实视频和Mixamo渲染视频;真实视频用SpatialTracker跟踪4,900个点,合成视频用真值几何。训练视频为49帧720×480,2,000步、有效batch size 64;论文报告少于1万视频,在8张H800上训练3天。推理50步DDIM,生成49帧约2.5分钟/张H800。

Results · 主要结果

PDF p.6 Table 1:小幅相机运动的平移/旋转角误差为27.85/5.97度,CameraCtrl为42.31/7.82度;大幅运动为37.17/10.40度,对照66.76/29.70度。p.7 Table 2:动作迁移文本CLIP分数32.6、相邻帧CLIP一致性0.971,TokenFlow为31.9/0.956。Table 3中4,900点控制的FVD为551.3,深度图控制为645.1,基于50个验证视频的再生成比较。网格动画和物体操纵主要展示定性结果。

Shortcomings · 局限

【作者】控制视频与输入结构不兼容会导致不合理的场景切换;没有轨迹点覆盖的区域可能生成失控内容;高质量控制仍依赖已有动画或源视频。【解读】3D-aware不保证物理正确或任意长程一致性;相机估计误差及CLIP分数属于代理指标。49帧设置和少量验证视频不能支持长电影可靠控制的结论,也未评估创作者真实工作流中的交互成本。

证据定位

PDF p.1:作者、v2日期、训练规模;pp.4–5 §3:点编码、18块条件DiT、训练和四类控制;p.6 Table 1及p.7 Tables 2–3:定量结果;p.10 §4.5:50视频验证、推理速度;p.10 §5/Fig.11:结构不兼容和无轨迹覆盖的失败模式。

Abstract · 英文原摘要

Diffusion models have demonstrated impressive performance in generating high-quality videos from text prompts or images. However, precise control over the video generation process—such as camera manipulation or content editing—remains a significant challenge. Existing methods for controlled video generation are typically limited to a single control type, lacking the flexibility to handle diverse control demands. In this paper, we introduce Diffusion as Shader (DaS), a novel approach that supports multiple video control tasks within a unified architecture. Our key insight is that achiev- ing versatile video control necessitates leveraging 3D control signals, as videos are fundamentally 2D renderings of dynamic 3D content. Unlike prior methods limited to 2D control signals, DaS leverages 3D tracking videos as control inputs, making the video diffusion process inherently 3D-aware. This innovation allows DaS to achieve a wide range of video controls by simply manipulating the 3D tracking videos. A further advantage of using 3D tracking videos is their ability to effectively link frames, significantly en- hancing the temporal consistency of the generated videos. With just 3 days of fine-tuning on 8 H800 GPUs using less than 10k videos, DaS demonstrates strong control capabilities across diverse tasks, including mesh-to-video generation, camera control, motion transfer, and object manipulation. Codes and more results are available at https://igl-hkust.github.io/das/.

版本指纹 3fe084c39a33c92f39ca27646baea338690ea65f2299ba600fd62458f5a4b71a

返回筛选与清单
P163 2025新增 Automating the Search for Artificial Life with Foundation Models Akarsh Kumar; Chris Lu; Louis Kirsch; Yujin Tang; Kenneth O. Stanley; Phillip Isola; David Ha ASAL利用基础视觉模型的表示空间,自动搜索能产生指定现象、持续新颖行为或多样行为集合的人工生命仿真。优化的是预先定义仿真族的参数、规则或初始状态,而不是直接生成看似生命的视频像素。 世界机制与演化创作与规则补全AI方法与评测展开笔记
#P16330页 · 核对于 2026-09-17

中文摘要

ASAL利用基础视觉模型的表示空间,自动搜索能产生指定现象、持续新颖行为或多样行为集合的人工生命仿真。优化的是预先定义仿真族的参数、规则或初始状态,而不是直接生成看似生命的视频像素。

核心贡献

统一三类搜索:以文本对齐为目标的现象搜索、与历史状态保持新颖性的开放性搜索、不同仿真之间的多样性搜索。覆盖Boids、Particle Life、Life-like CA、Lenia及NCA,并用CLIP表示量化参数敏感性、非线性和仿真停滞等现象。

实现边界

必须先指定可执行、可渲染且参数化的仿真基底。主要使用CLIP图像嵌入评估渲染帧;模型不直接推断任意现实世界规则,也不证明搜索到真实生物机制或无限持续的开放式进化。

Method · 方法

将初始状态、动力学和渲染器表示为参数theta。单目标搜索最大化渲染图像与文本的CLIP相似度,使用Sep-CMA-ES;NCA的时序目标用截断时间反向传播和Adam。开放性目标降低当前帧与历史最近邻的相似度,对2^18=262,144种Life-like CA穷举。多样性搜索用遗传算法维护8,192个解,通过最近邻表示距离淘汰最不新颖的解。以DINOv2和像素表示做表示空间消融。

Results · 主要结果

在多个基底展示匹配文本、按时序变化和多样化的仿真;Conway's Game of Life按所定义开放性分数位于Life-like CA前5%。附录说明穷举每个CA使用256个随机初态、运行2,048步,并抽取32个时刻计算开放性;多样性搜索运行100,000次迭代。CLIP和DINOv2相较像素表示的优势主要通过定性图集展示。这些结果不等于独立人评确认的通用开放性准确率。

Shortcomings · 局限

【作者】基底表达能力决定可发现的现象;初步实验中Lenia/Boids难持续产生新颖性,NCA可能过度灵活,开放性搜索因此只在Life-like CA展示。视频语言模型和3D基底仍是拓展方向。【解读】CLIP新颖性是观察者相关的代理目标,不是生命、因果正确性或永续新颖性的充分条件。单目标搜索每次评估仅一个初态种子,需区分漂亮示例与跨初态稳健性;广泛的人类对齐结论缺少系统人评支持。

证据定位

PDF pp.4–6 §3和Eqs.2–4:三个搜索目标;pp.7–9 §4.1–4.3:基底、搜索和前5%结果;pp.10–13 Figs.5–8:开放性、图集和表示消融;p.14讨论;pp.20–22附录A/B:仿真步数、种群、初态数量和迭代配置。

Abstract · 英文原摘要

With the recent Nobel Prize awarded for radical advances in protein discovery, foundation models (FMs) for exploring large combinatorial spaces promise to revolutionize many scientific fields. Artificial Life (ALife) has not yet integrated FMs, thus presenting a major opportunity for the field to alleviate the historical burden of relying chiefly on manual design and trial-and-error to discover the configurations of lifelike simulations. This paper presents, for the first time, a successful realization of this opportunity using vision-language FMs. The proposed approach, called Automated Search for Artificial Life (ASAL), (1) finds simulations that produce target phenomena, (2) discovers simulations that generate temporally open-ended novelty, and (3) illuminates an entire space of interestingly diverse simulations. Because of the generality of FMs, ASAL works effectively across a diverse range of ALife substrates including Boids, Particle Life, Game of Life, Lenia, and Neural Cellular Automata. A major result highlighting the potential of this technique is the discovery of previously unseen Lenia and Boids lifeforms, as well as cellular automata that are open-ended like Conway’s Game of Life. Additionally, the use of FMs allows for the quantification of previously qualitative phenomena in a human-aligned way. This new paradigm promises to accelerate ALife research beyond what is possible through human ingenuity alone.

版本指纹 e5178f7c213c7b2b0b22b5fc550b5410a67e908df74cbb81b3e22db17046d549

返回筛选与清单
P162 2025新增 Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model Feng Liu; Shiwei Zhang; Xiaofeng Wang; Yujie Wei; Haonan Qiu; Yuzhong Zhao; Yingya Zhang; Qixiang Ye; Fang Wan TeaCache是一种无需更新视频扩散模型权重的推理加速方法。利用时间步嵌入调制后的输入变化估计模型输出变化,按累计差异阈值决定何时重新计算、何时复用缓存的Transformer残差,以适应去噪过程中的非均匀冗余。 AI方法与评测创作与规则补全展开笔记
#P16211页 · 核对于 2026-09-17

中文摘要

TeaCache是一种无需更新视频扩散模型权重的推理加速方法。利用时间步嵌入调制后的输入变化估计模型输出变化,按累计差异阈值决定何时重新计算、何时复用缓存的Transformer残差,以适应去噪过程中的非均匀冗余。

核心贡献

把固定间隔缓存改为随输入变化的自适应缓存;用时间步调制输入的相对L1距离作代理,再经多项式校准估计输出变化。无需微调基础模型,但仍需校准样本和模型相关的阈值、拟合参数。

实现边界

研究的是既有DiT视频生成器的去噪计算复用,不是长期记忆、世界状态建模或跨镜头剧情推理。缓存的是扩散Transformer的残差信号,不能理解为直接复用整帧视频或学习新的因果规律。

Method · 方法

计算相邻时间步的调制输入相对L1距离,以多项式拟合输入差异到输出差异的尺度关系;累计估计差异未过阈值时复用残差,超过阈值则重算并清零累计值。用T2V-CompBench的70个提示、覆盖7类属性作拟合;slow/fast阈值分别为0.1/0.2。在Latte、Open-Sora 1.2、Open-Sora-Plan及A800 80GB GPU上评估速度和VBench、LPIPS、SSIM、PSNR。

Results · 主要结果

PDF p.7 Table 1:Open-Sora-Plan的65帧512×512设置,原始延迟99.65秒、VBench 80.39%;TeaCache-slow为22.62秒(4.41倍)、80.32%,下降0.07个百分点;fast为14.60秒(6.83倍)、79.72%,下降0.67个百分点。Latte-fast加速3.28倍,VBench由77.40%降至76.69%;Open-Sora 1.2-fast加速2.25倍,79.22%降至78.48%。这是各自基础模型和指定硬件设置下的速度/质量权衡,不是通用无损加速保证。

Shortcomings · 局限

【作者】增大阈值可能损害视觉质量;极端加速时PSNR/SSIM等参考指标下降,缓存收益受模型、采样器、分辨率和帧数影响。【解读】所谓training-free不等于无需校准;70个提示和经验多项式不构成跨模型误差上界。VBench整体分数接近不能证明每个视频的语义、物理或时序行为不变。未验证创作者工作流收益或长叙事规则一致性。

证据定位

PDF p.1:题名、作者、v2日期和摘要;pp.4–5 §3:输入/输出差异及多项式校准;p.6 §3.4和§4.1:残差缓存、70提示校准和硬件;p.7 Table 1:延迟及VBench;pp.7–8 Tables 2–4:消融和多GPU结果。

Abstract · 英文原摘要

As a fundamental backbone for video generation, diffusion models are challenged by low inference speed due to the se- quential nature of denoising. Previous methods speed up the models by caching and reusing model outputs at uniformly selected timesteps. However, such a strategy neglects the fact that differences among model outputs are not uniform across timesteps, which hinders selecting the appropriate model outputs to cache, leading to a poor balance between inference efficiency and visual quality. In this study, we introduce Timestep Embedding Aware Cache (TeaCache), a training-free caching approach that estimates and lever- ages the fluctuating differences among model outputs across timesteps. Rather than directly using the time-consuming model outputs, TeaCache focuses on model inputs, which have a strong correlation with the modeloutputs while in- curring negligible computational cost. TeaCache first mod- ulates the noisy inputs using the timestep embeddings to en- sure their differences better approximating those of model outputs. TeaCache then introduces a rescaling strategy to refine the estimated differences and utilizes them to indicate output caching. Experiments show that TeaCache achieves up to 4.41 × acceleration over Open-Sora-Plan with negligible (-0.07% Vbench score) degradation of visual quality.

版本指纹 e297f8becb2879b4a3611fa5877532a7e2db314af7e208127d6754dfc2741212

返回筛选与清单
P161 2026新增 Learning Long-form Movie Prior via Large Language Models Jinheng Xie; Jiajun Feng; Mike Zheng Shou 将电影中的剧本、人物身份、站位、动作和场景物体表示为可离散化的文本与空间坐标序列,使用LLaMA的下一token预测学习联合分镜先验,再通过指令微调从简短创意生成分镜。提出Storyboard20K,为跨镜头身份、边界框与全身关键点提供细粒度标注;生成结果可作为可控图像模型的布局条件,辅助视觉叙事创作。 创作与规则补全AI方法与评测展开笔记
#P1618页 · 核对于 2026-09-16

中文摘要

将电影中的剧本、人物身份、站位、动作和场景物体表示为可离散化的文本与空间坐标序列,使用LLaMA的下一token预测学习联合分镜先验,再通过指令微调从简短创意生成分镜。提出Storyboard20K,为跨镜头身份、边界框与全身关键点提供细粒度标注;生成结果可作为可控图像模型的布局条件,辅助视觉叙事创作。

核心贡献

构建来自MovieNet与LSMDC的20,310个分镜、149,528个关键帧,覆盖约400部电影;标注约319K人物框、180K场景物体框、跨帧一致身份及全身关键点,并提供GPT-4生成的标题、类型、情绪、场景和短摘要。将script、objects、main characters统一编码为JSON形式的token序列,以LLaMA-3/3.2的1B、3B、8B模型学习结构化电影先验。

实现边界

核心输出是剧本文本、边界框和关键点组成的稀疏分镜,不是直接生成连续像素视频。数据通常每个分镜3–10个关键帧,源片段平均33.9秒;不能据此声称已验证整部长电影的长期一致性。ROICtrl等现成图像模型用于可视化。人物身份与布局连贯不等于已学得可执行的因果世界模型;论文没有验证世界规则编辑、物理干预或规则修改后的依赖更新。

Method · 方法

先用检测、姿态估计和人脸识别自动标注,再由7名标注者校准人物身份、框、关键点及开放类别场景物体,并进行多轮复核。将连续坐标量化到m个整数区间,与文本共同tokenize;大于96×96像素面积的人物用98个全身关键点,否则用17个关键点或边界框。预训练时随机交换script、objects、main characters的顺序,以最大似然学习联合分布;随后把概括性标注作为指令、剧本和空间标注作为回答进行微调。训练/testA/testB分别为18,207/905/1,198个分镜,testA使用概括描述,testB使用逐镜头描述。对照商业模型获得2个上下文示例。

Results · 主要结果

Table 3中8B模型在testA/testB的布局FID为4.05/17.72,3B为4.35/16.86,对照Gemini-Pro为8.53/22.30、GPT-3.5-turbo为23.08/35.14;FID由训练的布局分类器特征计算,且这里只评估边界框,不是生成图像/视频的画质FID,也不是关键点精度。Table 2中8B的ROUGE-L为19.1/19.6,GPT-3.5为20.4/17.6,说明文本指标并非全面领先。Table 4中8B的指令遵循/关键帧变化/时间连贯评分为7.27/7.68/7.83(0–10分),GPT-4o为7.91/6.06/6.42;8B获得68%的首选比例,Gemini-Pro/GPT-4/GPT-4o分别为7%/13%/12%。68%是该人工比较中的偏好比例,不是任务准确率。

Shortcomings · 局限

【作者说明的评估边界】商业对照在该设置下无法生成98个全身关键点,因此FID比较仅限边界框;训练实现细节与更多评估样例指向附录,但所给8页PDF未包含附录。【解读】微调模型与仅2-shot的商业模型存在训练数据暴露差异,不能把优势全部归因于模型结构。文本相似度、布局分布和偏好评分不能证明动作物理正确、因果合理或长视频连续性;下游图像渲染质量也可能影响主观评价。本地正文未交代人工评估人数、样本数、置信区间或显著性检验,也未明确说明按电影隔离训练与测试集,因而跨电影泛化与结果稳健性仍需补充核查。未提供创作者实际工作流中的效率或可控性用户研究。

证据定位

PDF p.1:题名、3位作者、DOI和已接收作者稿声明;pp.3–4 §3及Table 1:20,310分镜、149,528帧、约400电影、平均33.9秒、标注流程;p.5 §4:坐标离散化、98/17关键点与两阶段学习;p.6 Fig.5、§5.1及Tables 2–3:数据划分、两示例对照、文本指标与布局FID;pp.6–7 §5.3及Table 4:人工评价和68%偏好率;p.8 Fig.6:ROICtrl可视化。资源状态另核对作者主页、官方仓库及arXiv旧版记录(2026-09-16)。

Abstract · 英文原摘要

Concepts in movies like characters, objects, and their positions and interactions, can be viewed as following an implicit prior. They are notably too complex to be comprehensively learned. Recent large language models have exhibited capacities in modeling text content even visual locations. Can these models work for learning movie prior? Instead of operating on pixel space, it is possible to represent movie prior using texts and visual locations like object bounding boxes and keypoints, which can be tokenized for consumption by language models. Due to the scarcity of suitable data, we curate the Storyboard20K from movies to serve as a representative. It includes scripts, shot-by-shot keyframes, and fine-grained annotations of film sets and characters with consistent IDs, bounding boxes, and whole body keypoints. Hence, movies can be represented by a set of tokens and learned via next-token prediction. We validate that our approach can learn movie prior and sample professional storyboards, serving as guidance for visual story generation and even inspiration for movie creation.

版本指纹 5a757c4328c5277e646eb67a770d5f4e10998a3aa4469c5e04d38d6573a202eb

返回筛选与清单 ↑
P160 2026新增 Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review Jingbo Chen; He Wang; Wei Yuan et al. AutoWorldBuilder从一两句世界设定生成地理、社会、资源与文化等概念。系统以多智能体分工、任务依赖调度、分层上下文预算和迭代审核控制规模与内部一致性;在20个设定任务、两种LLM后端上报告运行及内部评审结果。 创作与规则补全世界机制与演化展开笔记
#P16036页 · 核对于 2026-09-15

中文摘要

AutoWorldBuilder从一两句世界设定生成地理、社会、资源与文化等概念。系统以多智能体分工、任务依赖调度、分层上下文预算和迭代审核控制规模与内部一致性;在20个设定任务、两种LLM后端上报告运行及内部评审结果。

核心贡献

整合概念存储、DAG与语义分组调度、FAISS检索和四层上下文、专门Auditor与可配置角色。是架空世界概念扩展系统的直接前作,但其提出的数据结构与实际启用功能必须区分。

实现边界

作者在§6.4明确:16种概念关系只完成定义,关系解析模块未实现,实验关系类型覆盖率为0%;不能称已验证完整知识图谱推理。输出是概念设定集合,未实现可执行世界演化、因果干预或规则修改后的依赖更新;接受/拒绝设定等实时人机协作列为未来工作。质量来自系统内部LLM评审,无独立外部正确性基准。

Method · 方法

将输入拆成有依赖的任务,拓扑排序后按语义与批大小分组;从已完成批次检索相关概念,按Essential/Relevant/Summary/Collaboration四层分配上下文。21种专门角色按技能配置加载,8种Auditor参与评分、修订和筛选;主要测试中文输入。20个案例覆盖5类世界,每种后端各运行20次,共40次。

Results · 主要结果

Table 8中GPT-OSS 120B和DeepSeek v3.2均19/20次完成(95%);成功世界平均56.2/103.4个概念,平均18/31分钟,内部最终通过率85.5/99.2%。作者称初轮42%经审核到85%以上,但Table 14中DeepSeek平均评分从8.40降至8.21。所谓89.9/90.7%压缩对应平均304.3/278.4 token相对3,000-token预算的未用比例,不能当作相对未压缩完整上下文的受控节省率。Auditor全部通过只说明未检出问题,不代表零冲突。

Shortcomings · 局限

【作者】关系解析未启用、Auditor零检出值得怀疑、缺外部标准化评估、任务分解会产生环或解析错误、主要支持中文。§5.4明确模块分析是理论预期而非受控消融,因此+10–15百分点审核收益及50–70%时间缩减等预测不能记为实验测得。表2预算比例与各层token数亦不一致。【解读】两后端批大小下限略有不同,且内部判分、少量任务、无创作者研究限制关于一致性和效率的强结论。

证据定位

PDF pp.12–20:概念/调度/压缩/审核;pp.21–25 Tables 6–14:20×2实验及压缩分母;pp.27–28 §5.4:非受控消融声明;p.30 §6.4:关系模块未实现及质量评估局限;p.31:人机协作列为未来工作。

Abstract · 英文原摘要

Worldbuilding, the construction of coherent fictional worlds, is a foundational task in game design and literary creation. Large Language Models (LLMs) offer new possibilities for automated content generation, but their application to worldbuilding faces three challenges: context explosion that grows linearly with the building process, the tension between creative diversity and content consistency, and the absence of automated quality assurance. This paper presents AutoWorldBuilder, a multi-agent collaborative system that addresses these challenges through five integrated components: a structured concept network with conflict detection; a DAG-based hybrid batch scheduler that groups tasks by semantic locality; a four-layer context compression mechanism achieving approximately 90% token reduction; an iterative review system with specialized Auditor agents that improves proposal pass rates from 42% to over 85%; and a skill-driven agent architecture supporting zero-code extension with differentiated temperature configuration. Two experiments across 20 diverse worldbuilding tasks, using GPT-OSS 120B and DeepSeek v3.2 as LLM backends, demonstrate a 95.0% success rate. The system generated 56–103 self-consistent concepts per world in 18–31 minutes, with no conflicts detected by the review pipeline. The architectural patterns validated here, including layer-as-budget compression, semantic-locality scheduling, and separation of generation and review, may transfer to the broader class of knowledge-intensive, multi-agent LLM applications.

版本指纹 e116379992778595245b5564198d216a171c7b88850d71d691789788ed2f450b

返回筛选与清单 ↑
P159 2026新增 GPS: Graph-guided Proactive Information Seeking in Large Language Models Ruiqing Li; Yifeng Xu; Xinke Jiang et al. 面向检索增强问答中缺少用户条件的问题,将文档中的条件规则组织为有向无环图,沿图主动澄清缺失变量,并根据回答裁剪无关分支。通过条件路径合成训练数据和面向澄清结果的强化学习,同时改善回答正确性和提问效率。 XR与人机协作创作与规则补全AI方法与评测展开笔记
#P15925页 · 核对于 2026-09-15

中文摘要

面向检索增强问答中缺少用户条件的问题,将文档中的条件规则组织为有向无环图,沿图主动澄清缺失变量,并根据回答裁剪无关分支。通过条件路径合成训练数据和面向澄清结果的强化学习,同时改善回答正确性和提问效率。

核心贡献

把条件逻辑表示、主动澄清与训练目标结合:DAG为提问提供结构,动态遍历降低冗余,混合奖励共同考虑最终正确性、交互轮数和图质量。

实现边界

理论的逻辑完备性针对有限取值函数可被DAG表示,不保证LLM会从真实文档正确抽取全部规则。实验的用户模拟器回答已有条件事实;没有通过物理行动创造新证据。世界规则已给定,未知的是用户条件,并非从观察发现未知环境机制。

Method · 方法

Reasoner输出条件变量、值分支与答案叶节点;Clarifier按可达路径代价选择问题,收到回答后剪枝。用ConditionalQA中的欠明确样本及DeepSeek-R1合成条件路径,筛选完整输入可答而缺失输入不可答的数据。GRPO训练Reasoner,结合正确性、轮数惩罚与结构质量奖励;在Qwen2.5-7B和Llama3-8B骨干上验证。

Results · 主要结果

Table 1中Qwen-GPS在Synthetic/ConditionalQA/ShARC的成功率为60.2/73.4/79.3%,WCT为4.59/2.91/2.41;对应Clarify-DPO成功率59.2/72.0/78.5%,WCT 4.67/3.52/2.93。WCT把失败样本按最大10轮计罚,不等于原始平均提问次数;另列F1衡量是否需要澄清,不是答案F1。Llama-GPS在ShARC为75.8%,低于Clarify-DPO的82.7%,并非所有设置均最佳。Qwen在ConditionalQA移除RL后成功率73.4→67.7%。

Shortcomings · 局限

【解读】有限离散条件、相对固定规则库及模拟用户限制复杂开放场景;图抽取错误可系统性排除正确路径。LLM判分和模拟用户偏差仍在;轮数成本没有表达用户动作风险、注意力中断及不同取证行动对后续观察的影响。

证据定位

PDF pp.3–7:DAG、算法、数据合成与奖励;p.8:SR/WCT/澄清需要F1定义;pp.9–10 Tables 1–2:主结果和消融;附录A/B:理论。

Abstract · 英文原摘要

Equipping Large Language Models (LLMs) with the ability to proactively ask clarifying questions is essential to mitigate ambiguity when faced with underspecified user queries in retrieval-augmented generation (RAG) systems. However, existing methods often neglect the rule-based reasoning structures embedded in the retrieved knowledge that are central to ambiguity, making it challenging to learn an effective and efficient question-asking strategy. To address these issues, we introduce GPS, a two-stage framework for enhancing proactive information seeking abilities of LLMs in RAG systems. In the reasoning stage, we propose a Directed Acyclic Graph (DAG) reasoning structure with theoretical guarantees of logical completeness, which facilitates capturing all conditional logic in the retrieved knowledge and supports effective clarification. In the clarification stage, we design a traversal-based algorithm that dynamically prunes the DAG based on user responses, enabling efficient clarification. To further enhance DAG construction, we first propose a conditional paths guided data synthesis method to address data scarcity challenge, then we apply a clarification-oriented reinforcement learning method with a hybrid reward that jointly considers effectiveness and efficiency to optimize the LLM. Experiments on three benchmarks demonstrate that GPS outperforms baseline methods in both success rate and clarification efficiency.

版本指纹 59c114d720cc8d31d8c53fede1b4298921279d14a9bc5a59d93dfdd3b0f4c314

返回筛选与清单 ↑
P158 2025新增 RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence Xuming He; Zehao Fan; Hengjia Li et al. 为视频生成模型建立规则推理基准,要求生成的过程在科学、视觉、假设、游戏、语义与人文任务中体现隐含规则。通过人工核验的规则解释和逐项问题,将指令遵循、视觉一致性、视觉保真度与规则连贯性分开评价。 世界机制与演化展开笔记
#P15830页 · 核对于 2026-09-15

中文摘要

为视频生成模型建立规则推理基准,要求生成的过程在科学、视觉、假设、游戏、语义与人文任务中体现隐含规则。通过人工核验的规则解释和逐项问题,将指令遵循、视觉一致性、视觉保真度与规则连贯性分开评价。

核心贡献

提供622个样本、40种任务、6个大类和约6,500条核查问题,分别测试文本到视频及图像到视频模型;揭示视觉质量较高仍可能缺少正确规则后果的现象。

实现边界

评价短视频生成是否符合给定场景/隐含规则,包含假设性世界条件,但没有交互式创作者规则编辑或同一规则下多条演化的覆盖实验。o3按good/medium/bad映射100/50/0做问题级评分,RC是归一化评分,不是整段视频严格满足规则的比例。

Method · 方法

人工与GPT-5构造任务、隐含解释和核查表并复核;评测10个视频模型(6闭源、4开源),由o3逐项评分。另比较加入规则/预期结果解释的增强提示,并以80个视频、813个问题的人类标注核对自动评审。

Results · 主要结果

Table 2中Veo 3.1的RC为48.87、IF 68.70、VC 76.68、VF 86.72;Sora 2的RC为41.23,体现画面质量与规则得分的差距。游戏类Sora 2为19.97、Veo 3.1为17.70;正文‘全部低于15’与表格不一致,本条依表格记录。o3与人工判断一致率85.12%,Spearman 0.8011。增强提示下Veo假设类RC由46.79到58.12;该提示包含额外规则/结果信息。

Shortcomings · 局限

【解读】自动评审仍会误判,逐条平均分不能证明长时间轨迹的逻辑有效性;感知与渲染质量可能混入推理指标。提供预期后果的提示不能单独证明模型本身学会了推导。另Table 4科学类50.97→62.62的实际增量为11.65,表内印成+9.65;记录数据时需复算。

证据定位

PDF p.3:分类;p.5:指标与问题构建;p.6 Tables 2–3:主结果;p.7 Table 4:提示实验;p.8:人工一致性研究。

Abstract · 英文原摘要

Recent advances in video generation have enabled the synthesis of videos with strong temporal consistency and impressive visual quality, marking a crucial step toward vision foundation models. To evaluate these video generation models, existing benchmarks primarily focus on factors related to visual perception and understanding, like visual aesthetics, instruction adherence, and temporal coherence. However, the rule-based reasoning capabilities of video generation models remain largely unexplored. Although recent studies have carried out preliminary explorations into whether video models can serve as zero-shot learners, they still lack a fine-grained decomposition of reasoning capabilities and a comprehensive evaluation protocol. To address this gap, we introduce RULER-Bench, a benchmark designed to evaluate the reasoning ability of video generation models from the perspective of cognitive rules. Built upon two fundamental paradigms: text-to-video and image-to-video, RULER-Bench covers 40 representative tasks spanning six rule categories with 622 high-quality annotated instances. For the evaluation of each generated video, we construct a checklist covering four metrics and leverage GPT-o3 to assign scores to each question, achieving 85% alignment with human judgements. Extensive experiments show that the state-of-the-art model achieves only 48.87% on the rule coherence metric, highlighting significant room for improvement in the reasoning capability of next-level video models. We expect that the insight obtained from RULER-Bench will facilitate further development of reasoning-aware video generation, advancing video generation models toward vision foundation intelligence.

版本指纹 fab16d768eec43e7f891e6e6993e0bd77ca4f4fdffd675d5e978c408dcd9e90b

返回筛选与清单 ↑
P157 2025 / 2024新增 Exploring Exploration with Foundation Agents in Interactive Environments Daniel P. Sawyer; Nan Rosemary Ke; Hubert Soyer et al. 考查基础模型能否在交互环境中主动收集信息、检验假设并适应隐藏机制。以文本/三维Feature World和更复杂的Alchemy实验,分析模型、先验说明及周期总结对探索质量、跨试次学习和机制突变后适应的作用。 XR与人机协作世界机制与演化AI方法与评测展开笔记
#P15730页 · 核对于 2026-09-15

中文摘要

考查基础模型能否在交互环境中主动收集信息、检验假设并适应隐藏机制。以文本/三维Feature World和更复杂的Alchemy实验,分析模型、先验说明及周期总结对探索质量、跨试次学习和机制突变后适应的作用。

核心贡献

区分探索动作是否提供足够信息与模型是否正确利用信息;从简单特征发现扩展到跨试次隐藏动力学学习,并测试不预告的规则改变。包含模型从视频读取状态、提出行动指令、由人类执行的三维概念验证。

实现边界

无需微调的模型能力研究,非新训练算法。三维试验用Gemini 1.5 Pro,由人类执行移动/放置指令;这一设置已经覆盖‘新证据需要请求人类行动’的基本形态。每个三维条件15个episode,任务结构简单,未优化人类注意力、行动可接受性或XR空间提示。

Method · 方法

Feature World中寻找产生奖励的颜色/形状属性或属性组合,比较模型探索与随机及理想策略;将Gemini扩展到三维视频输入和人类执行。TextAlchemy比较GPT-4o、o4-mini、Claude 3.7与Gemini 2.5 Pro,控制是否给结构先验、是否每轮自总结,并在后续试次静默更换环境机制。

Results · 主要结果

三维Gemini行动条件的15个episode有8个出现视觉错误;保留这些错误时,奖励属性识别相对随机行动者的提升不显著(p=0.13),去除视觉错误后才显示优势。Alchemy在无先验且不总结时,没有模型显示显著的跨试次提升;增加总结后,除o4-mini外模型在无先验设置也能改善。机制改变后,Gemini 2.5 Pro和Claude 3.7在相应增强条件下能恢复表现,GPT-4o/o4-mini适应较弱。

Shortcomings · 局限

【解读】固定合成环境族及Alchemy每条件10次随机重复限制统计与开放世界结论;人类承担底层动作控制,掩盖真实部署的行动落地问题。论文没有处理取证与用户当前任务的注意力冲突、请求被拒绝、提示污染观察及人机私有信息差异。作者关于能力上限的推测不应当作无内在障碍的证明。

证据定位

PDF pp.5–7:Feature World与三维人类执行,p.7 Figure 3及视觉错误;pp.8–11:Alchemy、总结/先验和机制突变;p.12:局限。

Abstract · 英文原摘要

Foundation models excel at single-turn reasoning, but many real-world challenges, from scientific research to technology development, require multi-turn exploration in dynamic interactive environments. Crucial components of learning from experience in these settings, such as efficiently gathering information to test hypotheses, meta-learning a model of the world’s dynamics, and adapting to unexpected changes, remain largely unexplored for these models. We first evaluate foundation models in Feature World, a setting that primarily tests information gathering about a static hidden reward function. In this initial setting, we show that state-of-the-art foundation models come close to optimal efficiency in selecting maximally informative actions in tasks with simple reward functions. As a proof of concept, we also show a model can gather information efficiently in a 3D embodied version of this task, though errors in vision limit some aspects of performance. In order to test exploration across multiple dependent turns and trials, we implement a custom, text-based version of the Alchemy environment, a benchmark designed for meta-learning. Here, agents must deduce a latent causal structure by integrating information across multiple state-dependent trials. In this more complex setting, we find that recent foundation models struggle to meta-learn strategies that enable improved performance over time. However, prompting the models to summarize their observations at regular intervals enables an emergent meta-learning process, allowing them to improve across trials. Notably, in some models, summarization also enabled adaptive re-learning of this information when the environment’s rules change unexpectedly. While most models performed reasonably well on simple Feature World tasks, evaluations in Alchemy reveal stark differences in robustness among the models, with Gemini 2.5 performing best, followed by Claude 3.7, and ChatGPT-4o and o4-mini struggling the most. These results underscore Alchemy’s value as a benchmark for meta-learning and strategy adaptation in foundation models. By moving beyond simple discovery to complex, stateful environments, we demonstrate that the most significant challenge for foundation agents is not selecting informative actions in the moment, but rather seeking and integrating knowledge through adaptive strategies over time. Intriguingly, we find there is likely no intrinsic barrier to future generations of foundation agents more fully mastering these abilities.

版本指纹 18991b9ca070b5bc1ca4355db21012d97ce34c4715cf6d16d738eab85b96125c

返回筛选与清单 ↑
P156 2025新增 PoE-World: Compositional World Modeling with Products of Programmatic Experts Wasu Top Piriyakulkij; Yichao Liang; Hao Tang et al. 将环境动力学表示为多个小型程序专家组成的加权乘积模型,支持随机性、部分可观测性和较复杂的对象交互。LLM从少量轨迹编写与修订专家程序,优化其权重后形成可规划或用于训练策略的世界模型。 世界机制与演化AI方法与评测展开笔记
#P15630页 · 核对于 2026-09-15

中文摘要

将环境动力学表示为多个小型程序专家组成的加权乘积模型,支持随机性、部分可观测性和较复杂的对象交互。LLM从少量轨迹编写与修订专家程序,优化其权重后形成可规划或用于训练策略的世界模型。

核心贡献

用可组合的概率程序专家替代单一庞大确定性模拟器;把局部机制知识、轨迹拟合与在线修订结合起来,并在原版和修改后的Atari环境中考查少样本适应。

实现边界

使用OCAtari提取的结构化对象/属性,作者还按游戏修补对象检测,非从原始像素端到端学得全部机制。模型以完整历史为条件,并假设下一状态对象属性条件独立以便归一化。实验集中在Pong、Montezuma’s Revenge及其改版;没有解决通用探索、奖励学习或任意创作者世界。

Method · 方法

LLM合成短Python程序,其确定性属性预测转换为带噪专家分布,未规定属性采用均匀分布;按加权乘积组合。L-BFGS最大似然拟合权重并删去弱专家,新轨迹触发补充/修正。使用对象接触关系的高层图和低层动作搜索做分层规划,也用世界模型训练RL策略。

Results · 主要结果

少于1,000帧初始示范加最多3,000步额外交互条件下,Table 1的PoE-World+planner在原版/改版Montezuma均得100±0,WorldCoder和100k步PPO均为0;此处100分对应拿到钥匙,非通关。原版/改版Pong分别为−12.33±0.88、−13.67±0.67,虽优于相应少样本基线但仍是负分;20M步PPO在原版Pong为17±0.58,不能笼统声称超越长期训练的RL。

Shortcomings · 局限

【作者】未学习像素感知,也没有通用解决探索及奖励学习。【解读】条件独立、人工对象接口与两类游戏限制外推;交互样本节省不等于LLM合成及规划计算成本低。没有独立评测规则编辑后的因果影响定位、无关内容保持或多种合法世界的覆盖。

证据定位

PDF pp.3–6:专家分布、权重学习、规划和对象输入;p.7 Table 1:交互预算与游戏结果;pp.8–10:预测实验和局限。

Abstract · 英文原摘要

Learning how the world works is central to building AI agents that can adapt to complex environments. Traditional world models based on deep learning demand vast amounts of training data, and do not flexibly update their knowledge from sparse observations. Recent advances in program synthesis using Large Language Models (LLMs) give an alternate approach which learns world models represented as source code, supporting strong generalization from little data. To date, application of program-structured world models remains limited to natural language and grid-world domains. We introduce a novel program synthesis method for effectively modeling complex, non-gridworld domains by representing a world model as an exponentially-weighted product of programmatic experts (PoE-World) synthesized by LLMs. We show that this approach can learn complex, stochastic world models from just a few observations. We evaluate the learned world models by embedding them in a model-based planning agent, demonstrating efficient performance and generalization to unseen levels on Atari’s Pong and Montezuma’s Revenge. We release our code and display the learned world models and videos of the agent’s gameplay at https://topwasu.github.io/poe-world.

版本指纹 71cf49e51a7705bb24fc0812ec7f33871ae4dfd5871021b5c954d720ad440814

返回筛选与清单 ↑
P155 2026 / 2025 / 2024新增 EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios Lu Qiu; Yi Chen; Yuying Ge et al. 以真实第一人称活动视频考查多模态LLM能否结合当前视觉状态、此前任务进度与目标选择下一步行动。构建涵盖4个领域、24种场景的1,321个问题,并用多模态CoT和自一致性改善模型的历史理解、对象定位与下一步决策。 XR与人机协作展开笔记
#P15518页 · 核对于 2026-09-15

中文摘要

以真实第一人称活动视频考查多模态LLM能否结合当前视觉状态、此前任务进度与目标选择下一步行动。构建涵盖4个领域、24种场景的1,321个问题,并用多模态CoT和自一致性改善模型的历史理解、对象定位与下一步决策。

核心贡献

从1,113段Ego4D视频建立依赖视觉信息和活动进度的规划问答,刻意剔除仅靠文字即可回答、或当前帧已经泄露下一动作的问题;分析模型对时间、对象和目标的联合理解错误。

实现边界

任务是离线四选一下一动作预测,不是执行计划的闭环智能体成功率。输入包含任务目标、历史视频与当前帧;视频时长为数秒至5分钟。筛选条件要求相关对象可见,未评测用户按请求主动改变视角来补充证据。

Method · 方法

GPT-4辅助清理动作叙述、推断目标及生成问答;InternVL1.5与GPT-4帮助自适应选择时间点,再做循环评测与人工核查。训练自由的增强流程结合动作历史摘要、GroundingDINO对象边界框、CoT及自一致性投票。

Results · 主要结果

本地Table I中GPT-4V最高准确率32.63%,随机为25%,多数模型约23–27%。Table II是另一提示实验:基线32.80%,加入多模态CoT和自一致性达到43.04%,提升10.24个百分点;不能把这个增量加到Table I的32.63%。使用真实标注动作历史可到51.67%,属于特权输入条件。

Shortcomings · 局限

【作者/实验分析】动作进度、当前环境、领域知识与空间定位仍会混淆。【解读】四选一正确不等于可执行规划;模型参与筛选可能带来分布偏差,抽帧可错过短暂事件。没有测量用户注意力、取证动作代价、计划执行失败后的恢复或XR提示改变后续观察的问题。

证据定位

PDF pp.5–7:数据构建与Table I;pp.7–12:错误分析;p.14 Table II:提示与特权输入条件;正式期刊信息见Springer页面。

Abstract · 英文原摘要

The advent of Multimodal Large Language Models (MLLMs), leveraging the power of Large Language Models, has recently demonstrated superior multimodal understanding and reasoning abilities, heralding a new era for artificial general intelligence (AGI). However, achieving AGI necessitates more than just comprehension and reasoning. A crucial capability required is effective planning in diverse scenarios, which involves making reasonable decisions based on complex environments to solve real-world problems. Despite its importance, the planning abilities of current MLLMs in varied scenarios remain underexplored, leaving a significant gap in our understanding of their full potential. In this paper, we introduce EgoPlan-Bench2, a rigorous and comprehensive benchmark designed to assess the planning capabilities of MLLMs across a wide range of real-world scenarios. EgoPlan-Bench2 encompasses everyday tasks spanning 4 major domains and 24 detailed scenarios, closely aligned with human daily life. EgoPlan-Bench2 is constructed through a semiautomatic process utilizing egocentric videos, complemented by manual verification. Grounded in a first-person perspective, it mirrors the way humans approach problem-solving in everyday life. We evaluate 21 competitive MLLMs and provide an in-depth analysis of their limitations, revealing that they face significant challenges in real-world planning. To further improve the planning proficiency of current MLLMs, we propose a training-free approach using multimodal Chain-of-Thought (CoT) prompting through investigating the effectiveness of various multimodal prompts in complex planning. Our approach enhances the performance of GPT-4V by 10.24% on EgoPlan-Bench2 without additional training. Our work not only sheds light on the current limitations of MLLMs in planning, but also provides insights for future enhancements in this critical area. We have made data and code available at https://qiulu66.github.io/egoplanbench2/.

版本指纹 86d13b4d204df0eee1eec14c5a5dde9f3cdc465b7e5b96009d4d8b7f4c48f353

返回筛选与清单 ↑
P154 2025新增 Text2World: Benchmarking Large Language Models for Symbolic World Model Generation Mengkang Hu; Tianxing Chen; Yude Zou et al. 研究模型能否将自然语言世界描述转成可供符号规划器使用的PDDL世界模型。通过多阶段数据筛选、人工核验及解析执行和结构指标,评价16个LLM,并比较报错修正、上下文示例、合成数据微调及智能体训练对建模能力的作用。 创作与规则补全世界机制与演化AI方法与评测展开笔记
#P15424页 · 核对于 2026-09-15

中文摘要

研究模型能否将自然语言世界描述转成可供符号规划器使用的PDDL世界模型。通过多阶段数据筛选、人工核验及解析执行和结构指标,评价16个LLM,并比较报错修正、上下文示例、合成数据微调及智能体训练对建模能力的作用。

核心贡献

建立自然语言→符号状态/动作规则的基准和评测流程;将谓词、参数、前置条件与动作效果分开测量,暴露仅生成可解析代码与正确建模之间的差距。

实现边界

输入已提供谓词/动作名称、类型或签名和高层描述;主设置刻意省略明确前置条件和效果,让模型补足。初始1,801个域经筛选剩264个,人工终检得到103个,分为2个训练示例和101个测试域;不能把中间264个当成最终测试数。EXEC主要检查解析/验证器可执行性,SIM和F1基于参考PDDL结构,不是所有轨迹的行为等价证明。

Method · 方法

从已有PDDL域构造自然语言描述,多阶段自动过滤后由6位计算机背景标注者及2位复核者做质量控制。评价9个系列的16个LLM;比较零样本CoT、不做修正EC0与最多3次解析报错反馈EC3、两样本提示、601个合成域上的SFT及智能体轨迹训练。

Results · 主要结果

Table 1中DeepSeek-R1从EC0到EC3:EXEC 72.3→89.1,谓词F1 71.7→86.7、参数F1 64.0→76.3、前置条件F1 57.6→65.0、效果F1 58.8→67.3;结构SIM反而84.3→84.0。两样本提示能明显改善部分模型,但gpt-4o-mini部分指标退步。合成数据SFT使原本EXEC为0的Llama3.1模型获得可解析建模能力;不同干预没有一致改善所有指标。

Shortcomings · 局限

【解读】有限域规模及对单一参考实现的结构匹配,无法覆盖所有同样有效的建模选择;高层描述本身可能不完整,不能将创作补全一概判为与唯一参考不一致。没有评测交互式规则修改、影响范围内的最小更新,或同一规则下多种合理演化的覆盖度。

证据定位

PDF pp.2–5:任务、指标、数据过滤与103/101计数;pp.6–9:错误类型、Table 1主结果及Table 2示例实验。

Abstract · 英文原摘要

Recently, there has been growing interest in leveraging large language models (LLMs) to generate symbolic world models from textual descriptions. Although LLMs have been extensively explored in the context of world modeling, prior studies encountered several challenges, including evaluation randomness, dependence on indirect metrics, and a limited domain scope. To address these limitations, we introduce a novel benchmark, TEXT2WORLD , based on planning domain definition language (PDDL), featuring hundreds of diverse domains and employing multi-criteria, execution-based metrics for a more robust evaluation. We benchmark current LLMs using TEXT2WORLD and find that reasoning models trained with largescale reinforcement learning outperform others. However, even the best-performing model still demonstrates limited capabilities in world modeling. Building on these insights, we examine several promising strategies to enhance the world modeling capabilities of LLMs, including test-time scaling, agent training, and more. We hope that TEXT2WORLD can serve as a crucial resource, laying the groundwork for future research in leveraging LLMs as world models.

版本指纹 516fd70c100750ff006a62c75aa772ac08bcf91cf4de4e3cbc41ff00c405e319

返回筛选与清单 ↑
P153 2024新增 Internal Consistency and Self-Feedback in Large Language Models: A Survey Xun Liang; Shichao Song; Zifan Zheng et al. 从模型内部一致性出发,统一整理置信度估计、幻觉检测、推理、自我修正与自训练等工作。将一致性分成文本响应、token解码和潜在张量三个层次,并用自我评价—反馈—自我更新框架解释现有方法之间的关系与争议。 AI方法与评测展开笔记
#P15320页 · 核对于 2026-09-15

中文摘要

从模型内部一致性出发,统一整理置信度估计、幻觉检测、推理、自我修正与自训练等工作。将一致性分成文本响应、token解码和潜在张量三个层次,并用自我评价—反馈—自我更新框架解释现有方法之间的关系与争议。

核心贡献

给出跨响应、解码和潜在表示的一致性分类,以及Self-Evaluate→反馈信号→Self-Update的统一组织框架;把推理时的回答修改与训练时的参数/学生模型更新放在同一研究地图中。

实现边界

属于综述和概念框架,没有提出并统一验证一个新的通用自我修正算法。文中的‘Consistency Is (Almost) Correctness’是有前提的假设,不是模型答案正确性的定理;当稳定错误来自训练知识或共享偏差时,多次一致仍可能出错。

Method · 方法

按黑箱/灰箱/白箱访问条件,梳理不确定性、置信度、幻觉、语言批评及对比等反馈;归纳推理拓扑、迭代修改、多智能体、偏好学习、蒸馏和数据增广。以Llama3-8B-Instruct的标点计数展示三个一致性层次的区别,并讨论hourglass假说。

Results · 主要结果

主要结果是文献分类与相互矛盾发现的综合解释。p.5的示例中,同一标点计数问题5次文本回答为{5,3,3,3,3},多数一致但错误;不同解码策略输出为{4,4,3,4,4}。这是小型说明性实验,不能外推为总体性能提升或正式基准结果。

Shortcomings · 局限

【作者】讨论内在反馈能否可靠纠错的争议及一致性假设的适用条件。【解读】没有统一控制模型、任务、采样预算的定量元分析;潜表示例不足以建立一般规律。架空世界的规则若与训练语料中的常识冲突,‘训练知识多数正确’这一推理前提尤其需要重新检验。

证据定位

PDF pp.4–7:分类、标点示例与统一框架;pp.8–14:方法组织;pp.15–16:争议与一致性假设。

Abstract · 英文原摘要

Large language models (LLMs) often exhibit deficient reasoning or generate hallucinations. To address these, studies prefixed with “Self-” such as Self-Consistency, Self-Improve, and Self-Refine have been initiated. They share a commonality: involving LLMs evaluating and updating themselves. Nonetheless, these efforts lack a unified perspective on summarization, as existing surveys predominantly focus on categorization. In this paper, we use a unified perspective of internal consistency, offering explanations for reasoning deficiencies and hallucinations. Internal consistency refers to the consistency in expressions among LLMs’ latent, decoding, or response layers based on sampling methodologies. Then, we introduce an effective theoretical framework capable of mining internal consistency, named Self-Feedback. This framework consists of two modules: Self-Evaluation and Self-Update. The former captures internal consistency signals, while the latter leverages the signals to enhance either the model’s response or the model itself. This framework has been employed in numerous studies. We systematically classify these studies by tasks and lines of work; summarize relevant evaluation methods and benchmarks; and delve into the concern, “Does Self-Feedback Really Work?” We also propose several critical viewpoints, including the “Hourglass Evolution of Internal Consistency”, “Consistency Is (Almost) Correctness” hypothesis, and “The Paradox of Latent and Explicit Reasoning”. The relevant resources are open-sourced at https://github.com/IAAR-Shanghai/ICSFSurvey.

版本指纹 41fc06755fbf77dde907801588d81aa96e0c54191ce4afe3af6e277e0be6decd

返回筛选与清单 ↑
P152 2024新增 DiscoveryWorld: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents Peter Jansen; Marc-Alexandre Côté; Tushar Khot et al. 提出低成本虚拟科学发现环境,要求智能体完整经历提出假设、设计与执行实验、分析结果、得出解释并完成任务。涵盖蛋白质组、化学、考古、反应堆、植物营养、太空疾病、火箭科学和语言发现,用任务完成、过程与解释知识三类指标区分会操作和真正形成发现。 世界机制与演化AI方法与评测展开笔记
#P15229页 · 核对于 2026-09-15

中文摘要

提出低成本虚拟科学发现环境,要求智能体完整经历提出假设、设计与执行实验、分析结果、得出解释并完成任务。涵盖蛋白质组、化学、考古、反应堆、植物营养、太空疾病、火箭科学和语言发现,用任务完成、过程与解释知识三类指标区分会操作和真正形成发现。

核心贡献

为端到端科学发现提供可复现、可控参数的互动基准;加入组件级unit tasks和人类科学家参照,避免只用最终成功掩盖不完整推理过程。

实现边界

8主题×3难度×5参数seed=120个发现任务实例(24个主题—难度组合),另有10类基础unit tasks。环境为抽象文本/2D模拟而非真实实验;任务机制已定义但对agent未知,适合机制发现研究,不替代创作者规则补全任务。

Method · 方法

提供物体、仪器、移动/读写/操作等动作及结构化记分卡;GPT-4o实现ReAct、Plan+Execute、维护实验假设与测量记录的Hypothesizer。简单任务最多100步,普通/挑战任务1,000步;知识按预设解释要求评价。另招募11名自然科学硕士/博士背景参与者。

Results · 主要结果

表4:ReAct的简单/挑战任务平均完成率38%/18%;Hypothesizer对应解释知识得分34%/8%。机器在基础unit tasks可达到60%左右完成率,仍难完成发现全流程。人类所测16个普通/挑战组合平均完成率66%、知识得分55%;人类评测的任务与seed配置不同,不能与120实例机器均值无条件直接比较。

Shortcomings · 局限

作者强调低保真模拟不保证真实发现迁移;完整120任务的API实验成本约3,000–10,000美元,为论文实验时期成本。空间操作、长上下文和知识评分均可能混入其他能力;研究判断:需分离找出机制、执行实验和最终动作成功,且解释评分不能当作形式化因果证明。

证据定位

PDF pp.4–6:环境、规模与指标;p.7表4/5:机器;pp.8–9表6:人类与分析;p.15附录B/C:局限、成本和动作空间。

Abstract · 英文原摘要

Automated scientific discovery promises to accelerate progress across scientific domains. However, developing and evaluating an AI agent’s capacity for endto-end scientific reasoning is challenging as running real-world experiments is often prohibitively expensive or infeasible. In this work we introduce DISCOVERYWORLD , the first virtual environment for developing and benchmarking an agent’s ability to perform complete cycles of novel scientific discovery. DISCOVERYWORLD contains a variety of different challenges, covering topics as diverse as radioisotope dating, rocket science, and proteomics, to encourage development of general discovery skills rather than task-specific solutions. DISCOVERYWORLD itself is an inexpensive, simulated, text-based environment (with optional 2D visual overlay). It includes 120 different challenge tasks, spanning eight topics each with three levels of difficulty and several parametric variations. Each task requires an agent to form hypotheses, design and run experiments, analyze results, and act on conclusions. DISCOVERYWORLD further provides three automatic metrics for evaluating performance, based on (a) task completion, (b) task-relevant actions taken, and (c) the discovered explanatory knowledge. We find that strong baseline agents, that perform well in prior published environments, struggle on most DISCOVERYWORLD tasks, suggesting that DISCOVERYWORLD captures some of the novel challenges of discovery, and thus that DISCOVERYWORLD may help accelerate near-term development and assessment of scientific discovery competency in agents. Code available at github.com/allenai/discoveryworld.

版本指纹 28793ae05bbb22ed6e02fbdceb697a2b9ea8ebff6932c4dd8fb5b70bba5dde91

返回筛选与清单 ↑
P151 2025 / 2024新增 COMBO: Compositional World Models for Embodied Multi-Agent Cooperation Hongxin Zhang; Zeyuan Wang; Qiushi Lyu et al. 在各智能体只有第一人称局部观察的条件下,通过可组合视频世界模型预测联合动作后果,并配合他者意图估计与树搜索实现协作。先补全全局俯视状态,再将多智能体动作条件组合起来模拟未来,支持不同合作伙伴和人数。 XR与人机协作世界机制与演化展开笔记
#P15124页 · 核对于 2026-09-15

中文摘要

在各智能体只有第一人称局部观察的条件下,通过可组合视频世界模型预测联合动作后果,并配合他者意图估计与树搜索实现协作。先补全全局俯视状态,再将多智能体动作条件组合起来模拟未来,支持不同合作伙伴和人数。

核心贡献

组合式联合动作建模、针对智能体可达区域的损失加权,以及世界状态补全—意图预测—搜索规划的模块化系统;包含仿真基准和小规模真实人机协作。

实现边界

主要评估2–4个智能体的桌面拼图、食物组合、按钮取物任务;输入RGBD和相机矩阵,动作采用环境定义的操作。所谓任意人数的实验支持是4-agent训练向2/3-agent迁移,不是无限人数保证。真实机器人实验另用真实数据微调世界模型,仅5次试验。

Method · 方法

融合历次局部RGBD为俯视点云投影并用扩散补全;通过组合各智能体动作条件的扩散预测,并按其可达区域加权学习。VLM负责动作提议、意图跟踪和结果评分,再用树搜索选择计划。对异常高预测收益设置阈值以抑制利用世界模型幻觉。

Results · 主要结果

表1在每设置20个episode上,COMBO于TDW-Game两合作伙伴成功率均1.00,TDW-Cook为0.90/1.00;移除意图跟踪后分别0.65/0.60及0.80/0.80。2D-FetchQ的60次replay评价成功率81.3%,Co-GAIL为53.3%。真实人类—XArm拼图成功4/5,成功trial平均8.4步。表4预算扩大可改善表现,但该消融样本更小。

Shortcomings · 局限

作者指出多次大模型推理使响应慢;状态补全、动作误解和视觉生成错误会影响规划。研究判断:共享真实空间的人机案例存在,但尚未检验头显视角、用户拒绝/延迟执行、提示改变证据分布或取证与主任务的注意力竞争。

证据定位

PDF pp.4–7:组合模型、区域损失及规划;pp.8–10表1–5:仿真结果与计算预算;pp.23–24附录D/表8:真实人机实验。

Abstract · 英文原摘要

In this paper, we investigate the problem of embodied multi-agent cooperation, where decentralized agents must cooperate given only egocentric views of the world. To effectively plan in this setting, in contrast to learning world dynamics in a single-agent scenario, we must simulate world dynamics conditioned on an arbitrary number of agents’ actions given only partial egocentric visual observations of the world. To address this issue of partial observability, we first train generative models to estimate the overall world state given partial egocentric observations. To enable accurate simulation of multiple sets of actions on this world state, we then propose to learn a compositional world model for multiagent cooperation by factorizing the naturally composable joint actions of multiple agents and compositionally generating the video conditioned on the world state. By leveraging this compositional world model, in combination with Vision Language Models to infer the actions of other agents, we can use a tree search procedure to integrate these modules and facilitate online cooperative planning. We evaluate our methods on three challenging benchmarks with 24 agents. The results show our compositional world model is effective and the framework enables the embodied agents to cooperate efficiently with different agents across various tasks and an arbitrary number of agents, showing the promising future of our proposed methods. More videos can be found at https://umass-embodied-agi.github.io/COMBO/.

版本指纹 3fb20948b81c1acfd733970019c5bd101909824fd9d24193dbfd96ec4c2209bc

返回筛选与清单 ↑
P150 2024新增 WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment Hao Tang; Darren Key; Kevin Ellis 让LLM根据与环境的少量交互,编写可执行Python转移与奖励函数作为世界模型,再由规划器选择行动。模型既要解释已有经历,也应允许找到正收益计划;新证据揭示错误时修改代码,支持环境和目标迁移。 世界机制与演化AI方法与评测展开笔记
#P15065页 · 核对于 2026-09-15

中文摘要

让LLM根据与环境的少量交互,编写可执行Python转移与奖励函数作为世界模型,再由规划器选择行动。模型既要解释已有经历,也应允许找到正收益计划;新证据揭示错误时修改代码,支持环境和目标迁移。

核心贡献

将环境知识显式表示成程序;把optimism under uncertainty写为程序与规划器之间的逻辑约束,以引导探索和修正奖励理解;展示可编辑程序模型的样本效率与迁移优势。

实现边界

确定性、符号离散状态;Sokoban/MiniGrid及转成符号MDP的ALFWorld。是从既有环境的观测学习模型,不是从任意创作者规则生成完整世界;代码可编辑不意味着已经评测规则编辑的局部保持、合法多样性或全部反事实后果。

Method · 方法

分离Python转移函数与目标条件奖励函数。模型需满足对所有已收集transition的拟合约束,以及存在可达正奖励轨迹的乐观约束。GPT-4根据不一致样本修补代码,REx决定优先改哪个候选;配合有限深度值迭代/MCTS规划、经验回放和少量随机探索。

Results · 主要结果

Sokoban约前50个动作即可建立基本世界模型;ReAct在基础关卡仅15%±8%成功。示例模型前置约40万LLM token后可用程序规划继续行动;预训练知识贡献被作者明确承认。加入传送门规则后仍能学习阻塞行为;MiniGrid迁移及稀疏奖励任务受益于乐观约束。ALFWorld可合成250余行模型,代表任务通常首个episode约20步探索后获得奖励(3 seeds),不是完整ALFWorld榜单成功率。

Shortcomings · 局限

作者明确限制为确定性、符号离散环境;长程困难还受规划器限制(例如更难的5箱以上Sokoban)。程序合成和前置LLM计算成本较高,依赖预训练程序/游戏先验;拟合已见数据只验证样本覆盖部分,不能保证全状态正确。

证据定位

PDF pp.2–5:表示、约束与算法;pp.6–8图3–5:Sokoban、MiniGrid、ALFWorld结果;pp.9–10:局限;附录D/E:生成代码。

Abstract · 英文原摘要

We give a model-based agent that builds a Python program representing its knowledge of the world based on its interactions with the environment. The world model tries to explain its interactions, while also being optimistic about what reward it can achieve. We define this optimism as a logical constraint between a program and a planner. We study our agent on gridworlds, and on task planning, finding our approach is more sample-efficient compared to deep RL, more compute-efficient compared to ReAct-style agents, and that it can transfer its knowledge across environments by editing its code.

版本指纹 55c47b1df146967ecab1933518783059885b693460d3ebbc7554aaec0eeb101f

返回筛选与清单 ↑
P149 2025 / 2024新增 Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training Maximillian Chen; Ruoxi Sun; Tomas Pfister et al. 针对LLM在歧义请求中直接猜测或含糊回答的问题,提出ACT,用询问澄清与直接回答等不同对话动作构造偏好对,再结合当前策略采样和多轮用户模拟训练,使少量对话数据也能教会模型何时澄清及如何完成任务。 XR与人机协作AI方法与评测展开笔记
#P14945页 · 核对于 2026-09-15

中文摘要

针对LLM在歧义请求中直接猜测或含糊回答的问题,提出ACT,用询问澄清与直接回答等不同对话动作构造偏好对,再结合当前策略采样和多轮用户模拟训练,使少量对话数据也能教会模型何时澄清及如何完成任务。

核心贡献

把偏好学习从回答表面质量推进到动作选择及多轮任务后果;提出quasi-online DPO训练流程和AmbigSQL歧义SQL任务,并评估缺少人工动作标签的设置。

实现边界

实验为PACIFIC表格QA、Abg-CoQA阅读QA、AmbigSQL;澄清依赖文本用户模拟器、动作分类器和任务结果判据。无动作标签版本仍使用伪标签及任务数据,不是无需监督。用户回答主要提供信息,不涉及执行物理动作以生成新证据。

Method · 方法

先根据正确/错误对话动作产生winning/losing响应;训练中从当前模型采样,识别动作是否正确。对正确动作继续模拟用户和助手对话,按最终语义/SQL执行结果更新偏好对,再进行DPO式优化。主模型Zephyr-7B,比较50/100/250条对话下的SFT、IRPO及提示基线。

Results · 主要结果

PACIFIC 50对话、相同Zephyr模型:动作Macro-F1从SFT 69.0升至ACT 82.2,澄清后F1从43.5升至57.2,trajectory F1从61.3升至61.9。AmbigSQL相同50对话设置,execution match由21.9升至43.6,澄清后由13.9升至38.1;但50对话的动作准确率仍低于IRPO(80.8 vs 91.0)。消融支持on-policy采样与多轮模拟的作用,不能概括为所有指标全面最佳。

Shortcomings · 局限

研究判断:效果依赖模拟用户、动作伪标签及任务启发式的质量;对话数据效率不能等同于总体训练计算效率。未验证真实用户多轮体验、错误/拒答用户、行动代价与后续感知反馈;跨任务泛化应进一步检验。

证据定位

PDF pp.4–7:设定和ACT算法;p.8表1:PACIFIC;p.10表3:AmbigSQL;pp.11–12表4/5:无标签设置与消融;附录:模拟器和提示。

Abstract · 英文原摘要

Large language models (LLMs), optimized through human feedback, have rapidly emerged as a leading paradigm for developing intelligent conversational assistants. However, despite their strong performance across many benchmarks, LLM-based agents might still lack conversational skills such as disambiguation – when they are faced with ambiguity, they often overhedge or implicitly guess users’ true intents rather than asking clarification questions. Under task-specific settings, high-quality conversation samples are often limited, constituting a bottleneck for LLMs’ ability to learn optimal dialogue action policies. We propose Action-Based Contrastive Self-Training (ACT), a quasi-online preference optimization algorithm based on Direct Preference Optimization (DPO), that enables data-efficient dialogue policy learning in multi-turn conversation modeling. We demonstrate ACT’s efficacy under in data-efficient tuning scenarios, even when there is no action label available, using multiple real-world conversational tasks: tabular-grounded question-answering, machine reading comprehension, and AmbigSQL, a novel task for disambiguating information-seeking requests for complex SQL generation towards data analysis agents. Additionally, we propose evaluating LLMs’ ability to function as conversational agents by examining whether they can implicitly recognize and reason about ambiguity in conversation. ACT demonstrates substantial conversation modeling improvements over standard tuning approaches like supervised fine-tuning and DPO.

版本指纹 22efec0f1c73fc160254b68a9119b9cbfeee39649e6ed035f38fc7530a10da82

返回筛选与清单 ↑
P148 2024新增 Detecting Hallucinations in Large Language Models Using Semantic Entropy Sebastian Farquhar; Jannik Kossen; Lorenz Kuhn et al. 研究幻觉中的一种特定机制:同一提示下随机产生不同且错误的事实性回答。通过聚合同义表达后的语义熵识别这种confabulation,并设计不依赖输出概率的离散版本和长段落事实拆分流程,支持跨任务判断何时不宜直接信任回答。 AI方法与评测展开笔记
#P14812页 · 核对于 2026-09-15

中文摘要

研究幻觉中的一种特定机制:同一提示下随机产生不同且错误的事实性回答。通过聚合同义表达后的语义熵识别这种confabulation,并设计不依赖输出概率的离散版本和长段落事实拆分流程,支持跨任务判断何时不宜直接信任回答。

核心贡献

明确区分随机编造与稳定的系统性错误;将语义不确定性扩展到不同模型、QA/数学任务及GPT-4传记段落,并支持只有文本输出的黑箱接口。

实现边界

定位的是随采样变化的confabulations,不能保证事实正确,也不处理所有训练错误、欺骗或系统性推理失误。方法为生成后的检测/选择性回答;没有自动获取新环境证据或学习交互式取证策略。

Method · 方法

对同一问题多次采样,用双向蕴含判断将回答按含义聚类;有概率时聚合语义概率,无概率时用簇的样本频率估计离散语义熵。长文本先拆分事实陈述,再围绕陈述生成问题、重采样回答并汇总不确定性;以AUROC和拒答—准确率曲线等评估。

Results · 主要结果

30个模型×任务组合的平均AUROC:语义熵0.790,naive entropy 0.691,P(True) 0.698,embedding regression 0.687。离散版本总体接近有概率版本;GPT-4长篇传记实验的错误检测AUROC/AURAC也优于比较基线,但拒绝20%以上高风险回答后,P(True)在剩余回答准确率上略占优。上述指标不是模型本身的QA准确率。

Shortcomings · 局限

作者明确不保证系统性错误的事实性;需要多次采样与语义判定,有推理成本及判定误差。研究判断:对于架空创作,多个合法结局的语义分歧应作为设计多样性,不应直接标记为幻觉;需区分规则违反和合法分支。

证据定位

PDF p.1:confabulation定义、发表日期与边界;pp.2–5:实验、30组合均值及长文本结果;pp.7–10:方法细节;p.11:代码地址。

Abstract · 英文原摘要

Large language model (LLM) systems, such as ChatGPT1 or Gemini2, can show impressive reasoning and question-answering capabilities but often ‘hallucinate’ false outputs and unsubstantiated answers3,4. Answering unreliably or without the necessary information prevents adoption in diverse fields, with problems including fabrication of legal precedents5 or untrue facts in news articles6 and even posing a risk to human life in medical domains such as radiology7. Encouraging truthfulness through supervision or reinforcement has been only partially successful8. Researchers need a general method for detecting hallucinations in LLMs that works even with new and unseen questions to which humans might not know the answer. Here we develop new methods grounded in statistics, proposing entropy-based uncertainty estimators for LLMs to detect a subset of hallucinations—confabulations—which are arbitrary and incorrect generations. Our method addresses the fact that one idea can be expressed in many ways by computing uncertainty at the level of meaning rather than specific sequences of words. Our method works across datasets and tasks without a priori knowledge of the task, requires no task-specific data and robustly generalizes to new tasks not seen before. By detecting when a prompt is likely to produce a confabulation, our method helps users understand when they must take extra care with LLMs and opens up new possibilities for using LLMs that are otherwise prevented by their unreliability.

版本指纹 52e7ad2740b25cc7697b69e12d69ca0dde844eca9f79dfa304a79be5b0e99c1a

返回筛选与清单 ↑
P147 2025 / 2024新增 DreamGarden: A Designer Assistant for Growing Games from a Single Prompt Sam Earle; Samyak Parajuli; Andrzej Banburski-Fahey 从一个开放的梦境、场景或游戏构想出发,LLM规划器逐层分解任务,调用代码和素材子模块在Unreal Engine内构建环境。用户通过可视化计划树扩展、剪枝、查看中间产物及编辑反馈,与自主生成过程协作。 创作与规则补全世界机制与演化展开笔记
#P14730页 · 核对于 2026-09-15

中文摘要

从一个开放的梦境、场景或游戏构想出发,LLM规划器逐层分解任务,调用代码和素材子模块在Unreal Engine内构建环境。用户通过可视化计划树扩展、剪枝、查看中间产物及编辑反馈,与自主生成过程协作。

核心贡献

将分层计划、可编辑游戏引擎资产、编译/运行/视觉反馈和节点界面整合为创作助手,研究用户在主动编辑与旁观生成之间切换的交互方式。

实现边界

实现C++ Actor、场景布局、素材生成/检索与UE内运行;实验主要限制为无需玩家的0-player模拟。修改节点会撤回相关实现及顺序上后续任务,并重新执行;不是精确因果依赖分析,也没有证明任意规则编辑后的最小后果更新。视觉自动评估只看启动后前6秒的6张截图。

Method · 方法

GPT-4o将seed prompt递归展开为计划树,叶节点分派给代码/素材模块;代码经历编译、布局加载、运行、截图评价的反复修正。GUI允许变更叶节点状态、直接改代码或反馈,再继续生成。N=10、每次最多45分钟的形成性可用性研究记录访谈、操作与系统日志。

Results · 主要结果

研究参与者认可规划和原型用途,部分人认为计划树本身就有价值;观察到剪枝、扩展与自定义反馈能够改变后续产物。但对复杂游戏机制的能力仍持保留态度。默认超参数下完整流程约1小时,情绪体验有正负两面。论文以定性系统观察和小样本可用性研究为主,没有受控比较的规则正确率或开发效率增益。

Shortcomings · 局限

作者报告过度分解、请求超出模块能力的任务、代码/素材失败、等待长以及中间结果难以消化等问题;骨骼动画不在当前能力范围。研究判断:这已覆盖创作计划补全、可视化与人工修改,后续AI贡献需要独立评测约束满足、改动传播或有用多样性。

证据定位

PDF pp.6–10:模块、代码循环、剪枝与实验设计;p.8:6秒视觉评价边界;pp.11–15:系统结果、用户主题与耗时;pp.15–16:讨论。

Abstract · 英文原摘要

Coding assistants are increasingly leveraged in game design, both generating code and making high-level plans. To what degree can these tools align with developer workflows, and what new modes of human-computer interaction can emerge from their use? We present DreamGarden, an AI system capable of assisting with the development of diverse game environments in Unreal Engine. At the core of our method is an LLM-driven planner, capable of breaking down a single, high-level prompt—a dream, memory, or imagined scenario provided by a human user—into a hierarchical action plan, which is then distributed across specialized submodules facilitating concrete implementation. This system is presented to the user as a garden of plans and actions, both growing independently and responding to user intervention via seed prompts, pruning, and feedback. Through a user study, we explore design implications of this system, charting courses for future work in semi-autonomous assistants and open-ended simulation design.

版本指纹 e1a2ce4f52bc1ddbb0c9a63c70c4e9fd95901acae67ae9ffe86f4ae447e0e8a6

返回筛选与清单 ↑
P146 2025 / 2024新增 ExpertAF: Expert Actionable Feedback from Video Kumar Ashutosh; Tushar Nagarajan; Georgios Pavlakos et al. 从学习者执行体育动作的视频和3D姿态生成可操作的指导,包括指出优缺点的专家式文字反馈、检索正确示范,以及生成修正后的3D姿态。利用Ego-Exo4D专家评论构建弱监督错误—正确动作配对,训练统一视频、姿态与文本模型。 XR与人机协作展开笔记
#P14618页 · 核对于 2026-09-15

中文摘要

从学习者执行体育动作的视频和3D姿态生成可操作的指导,包括指出优缺点的专家式文字反馈、检索正确示范,以及生成修正后的3D姿态。利用Ego-Exo4D专家评论构建弱监督错误—正确动作配对,训练统一视频、姿态与文本模型。

核心贡献

将技能评价从单一分数推进到具体纠正建议与示范;贡献弱监督配对数据和支持三类输出的多模态自回归模型。

实现边界

实际评估篮球、足球、攀岩三类身体技能;主设置输入包含ego/exo视频与3D姿态,假定一个主要动作执行者。输出视频是检索已有示范,生成的是姿态序列;新专家视频生成留作未来。没有进行长期训练者技能提升或实时XR闭环试验。

Method · 方法

Llama3-70B压缩专家评论并标注身体部位/正确性;按技能等级匹配错误与正确演示,用PA-MPJPE对齐时间并过滤。InternVideo2视频特征、姿态codebook和文本映射至Llama3-8B,联合学习评论、示范检索与姿态token生成。训练25,505个tuple,人工核验测试1,272个。

Results · 主要结果

表1:ExpertAF的BLEU-4/METEOR/ROUGE-L为44.9/49.6/54.6;示范检索recall@50为19.1%、median rank 158,优于LLaVA-FT w/pose的18.0%/172;姿态误差PA-MPJPE由该基线150mm降至135mm。每场景5名评价者的1–4分质量评分也优于基线。带正确示范等特权输入的full-sup行不可与主设置混用。

Shortcomings · 局限

作者指出对疲劳等不可直接见到的状态较弱,自动提取姿态有噪声;配对真值只覆盖可能错误中的一部分。研究判断:质量偏好与姿态距离未证明建议能在实际交互中改善技能,也未评估提示导致的注意分配或后续观察变化。

证据定位

PDF pp.3–6:任务、配对数据、编码器及训练;p.7表1:三类输出结果及特权输入说明;p.8:人评和失败案例。

Abstract · 英文原摘要

Feedback is essential for learning a new skill or improving one’s current skill-level. However, current methods for skill-assessment from video only provide scores or compare demonstrations, leaving the burden of knowing what to do differently on the user. We introduce a novel method to generate actionable feedback (AF) from video of a person doing a physical activity, such as basketball or soccer. Our method takes a video demonstration and its accompanying 3D body pose and generates (1) free-form expert commentary describing what the person is doing well and what they could improve, and (2) a visual expert demonstration that incorporates the required corrections. We show how to leverage Ego-Exo4D’s [29] videos of skilled activity and expert commentary together with a strong language model to create a weakly-supervised training dataset for this task, and we devise a multimodal video-language model to infer coaching feedback. Our method is able to reason across multi-modal input combinations to output fullspectrum, actionable coaching—expert commentary, expert video retrieval, and expert pose generation—outperforming strong vision-language models on both established metrics and human preference studies.

版本指纹 cf0af650338c144587b2147b95007535684c74908d1499a87c87f67266954b56

返回筛选与清单 ↑
P145 2023新增 Generative Agent-Based Modeling with Actions Grounded in Physical, Social, or Digital Space Using Concordia Alexander Sasha Vezhnevets; John P. Agapiou; Avia Aharon et al. Concordia是构建生成式多智能体模拟的框架。智能体以组件和关联记忆组织行为,由Game Master维护环境并将自然语言动作转为情境后果或结构化/API操作,从而连接社会互动、模拟物理状态和数字服务。论文讨论应用场景及验证模拟可信度的方法。 世界机制与演化展开笔记
#P14532页 · 核对于 2026-09-15

中文摘要

Concordia是构建生成式多智能体模拟的框架。智能体以组件和关联记忆组织行为,由Game Master维护环境并将自然语言动作转为情境后果或结构化/API操作,从而连接社会互动、模拟物理状态和数字服务。论文讨论应用场景及验证模拟可信度的方法。

核心贡献

以可组合组件统一LLM调用、记忆检索、角色行为和Game Master环境更新;支持将自然语言社会行为接到明确的外部状态变量与数字操作,提供开放实现与建模讨论。

实现边界

自然语言GM对物理合理性的判断属于语言模型模拟;只有明确接入程序/状态变量的部分拥有相应执行语义。论文包含已实现案例与潜在应用设想,不能把法律/规范涌现、真实用户预测、所有外部应用接入都视为已验证功能。

Method · 方法

每个智能体用长期关联记忆与工作记忆组件回答身份、情境、适当行动等问题;GM解析尝试动作、更新状态并向不同角色发送其可见观察。数字案例通过嵌套PhoneGameMaster和PhoneUniverse选择app、函数和参数,再更新应用状态及通知。

Results · 主要结果

主要结果为框架与定性案例:展示多智能体叙事、数字手机/日历操作的调用流程,以及可接入确定性状态更新的模拟方式。本地报告未提供统一任务集上的成功率、基线消融或真实人类行为预测误差,不能据此声称社会模拟已达真实预测精度。

Shortcomings · 局限

作者强调必须针对具体研究问题检验泛化和algorithmic fidelity,LLM可能呈现刻板印象;用同一模型生成并解释模拟亦不能替代外部验证。研究判断:语言层一致性不保证长期因果正确性或改规则后的局部更新,开放动作解析也可能产生累积状态错误。

证据定位

PDF pp.5–10:组件、GM及实验设计;pp.10–11:模拟验证边界;pp.16–19:数字服务实例与明确标为潜在的应用;后续章节:讨论。

Abstract · 英文原摘要

Agent-based modeling has been around for decades, and applied widely across the social and natural sciences. The scope of this research method is now poised to grow dramatically as it absorbs the new affordances provided by Large Language Models (LLM)s. Generative Agent-Based Models (GABM) are not just classic Agent-Based Models (ABM)s where the agents talk to one another. Rather, GABMs are constructed using an LLM to apply common sense to situations, act “reasonably”, recall common semantic knowledge, produce API calls to control digital technologies like apps, and communicate both within the simulation and to researchers viewing it from the outside. Here we present Concordia, a library to facilitate constructing and working with GABMs. Concordia makes it easy to construct language-mediated simulations of physically- or digitally-grounded environments. Concordia agents produce their behavior using a flexible component system which mediates between two fundamental operations: LLM calls and associative memory retrieval. A special agent called the Game Master (GM), which was inspired by tabletop role-playing games, is responsible for simulating the environment where the agents interact. Agents take actions by describing what they want to do in natural language. The GM then translates their actions into appropriate implementations. In a simulated physical world, the GM checks the physical plausibility of agent actions and describes their effects. In digital environments simulating technologies such as apps and services, the GM may handle API calls to integrate with external tools such as general AI assistants (e.g., Bard, ChatGPT), and digital apps (e.g., Calendar, Email, Search, etc.). Concordia was designed to support a wide array of applications both in scientific research and for evaluating performance of real digital services by simulating users and/or generating synthetic data.

版本指纹 ac0a23ef187ebef1820b8aebc19d2610035b1f234527b9f854151cb77ad966fb

返回筛选与清单 ↑
P144 2023新增 Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation Lorenz Kuhn; Yarin Gal; Sebastian Farquhar 针对同一含义可有多种语言表达的问题,将LLM输出不确定性从token序列层提升到语义层:采样多个答案,将语义等价答案聚类,再对含义的概率分布计算熵。无需重新训练被测生成模型,在自由回答QA上更有效预测答案是否可靠。 AI方法与评测展开笔记
#P14419页 · 核对于 2026-09-15

中文摘要

针对同一含义可有多种语言表达的问题,将LLM输出不确定性从token序列层提升到语义层:采样多个答案,将语义等价答案聚类,再对含义的概率分布计算熵。无需重新训练被测生成模型,在自由回答QA上更有效预测答案是否可靠。

核心贡献

提出semantic entropy及基于双向蕴含的语义聚类;分析采样温度、表达长度、样本数如何影响语言不确定性估计,避免把措辞差异误当作事实分歧。

实现边界

实验以OPT 2.7B–30B、CoQA开放书QA和TriviaQA闭卷QA为主;需要多次生成、序列概率以及用于双向蕴含判断的DeBERTa模型。无监督指无需该任务的正确性标签训练不确定性估计器,不表示系统完全没有经过监督训练的组件。

Method · 方法

对同一问题采样M个答案;将问题与答案一起输入NLI模型,在两个方向均为entailment时聚为同一含义;聚合簇内序列概率并估计语义熵。对照普通/长度归一化预测熵、词面相似度和p(True),用错误检测AUROC评价。

Results · 主要结果

表2中30B设置:CoQA语义熵AUROC 0.77,单纯不同含义数量为0.66;TriviaQA分别0.83/0.79。人工核对聚类等价判断准确率为CoQA 95.5%、TriviaQA 92.7%。更多样本和合适的中间温度通常有利,文中主要采样温度0.5;AUROC衡量排序辨别能力,不能当作答案正确率。

Shortcomings · 局限

语义聚类会出错,最坏情况下需要O(M²)对比较;多次生成增加推理成本。作者指出不防止模型欺骗,长篇摘要等任务还需更强语义等价判断。研究判断:稳定重复的错误可能低熵;创作中多个均合规则的答案也可能高熵,不能直接等同于需要纠错。

证据定位

PDF pp.4–6:语义熵与双向蕴含;p.7:模型、数据及评价;p.8表2及p.9:结果、采样敏感性与讨论。

Abstract · 英文原摘要

We introduce a method to measure uncertainty in large language models. For tasks like question answering, it is essential to know when we can trust the natural language outputs of foundation models. We show that measuring uncertainty in natural language is challenging because of ‘semantic equivalence’—different sentences can mean the same thing. To overcome these challenges we introduce semantic entropy—an entropy which incorporates linguistic invariances created by shared meanings. Our method is unsupervised, uses only a single model, and requires no modifications to ‘off-the-shelf’ language models. In comprehensive ablation studies we show that the semantic entropy is more predictive of model accuracy on question answering data sets than comparable baselines.

版本指纹 0cc1c0b189dbe6ccdf12deb2f11761ff183ee4813a04f7add8b28ec35375f330

返回筛选与清单 ↑
P143 2023 / 2022新增 Interactive Visual Reasoning under Uncertainty Manjie Xu; Guangyuan Jiang; Wei Liang et al. IVRE把Blicket检测变成主动视觉推理任务:仅凭初始场景不能知道所有物体是否会使机器激活,智能体必须提出新实验、根据结果更新belief,并在有限次数内解除不确定性。对符号、像素、LLM和人类基线的比较显示,实验选择和证据整合均构成明显瓶颈。 XR与人机协作AI方法与评测展开笔记
#P14324页 · 核对于 2026-09-15

中文摘要

IVRE把Blicket检测变成主动视觉推理任务:仅凭初始场景不能知道所有物体是否会使机器激活,智能体必须提出新实验、根据结果更新belief,并在有限次数内解除不确定性。对符号、像素、LLM和人类基线的比较显示,实验选择和证据整合均构成明显瓶颈。

核心贡献

提供可干预、可反馈的视觉推理环境,联合评估假设更新与实验效率;用共享底层机制的符号/像素版本区分推理难度与感知难度。

实现边界

9个物体、其中1–4个Blicket,4个初始context面板,总时步上限T=10;机制为至少一个Blicket出现即激活的OR规则,且告知Blicket总数。行动简化为选取物体集合,不含机器人运动控制、用户代执行、空间提示或注意力中断。

Method · 方法

智能体同时输出下一实验的物体选择与各物体Blicketness belief;观测为二进制向量或160×120合成图。奖励联合全体识别成功、每步成本及与搜索oracle belief的Jensen–Shannon距离。对比随机/Bayes/逐个测试/NOTEARS/搜索组合、actor-critic RL与GPT-3.5/4。

Results · 主要结果

PDF表2的episode全物体识别准确率:人类98.15%,Search-Naive 83.80%,符号DDPG-Re 46.03%,GPT-4 26%,GPT-3.5 11%;像素DDPG与TD3仅0.72%/0.31%。机器基线通常评估10,000个随机episode,LLM评估100个,不能把这些值视作等样本量对照;人类为单独实验。

Shortcomings · 局限

作者明确指出合成场景和简单因果结构的限制;最佳启发式依赖OR机制先验及逐个实验策略。研究判断:该基准已经覆盖主动取证,XR研究需进一步处理行动由用户执行、观察受到提示影响与任务成本,不能只把同一任务搬进头显。

证据定位

PDF pp.4–5:环境及奖励;pp.6–7:基线和人类设置;p.8表2:结果;pp.9–10:分析与明确局限。

Abstract · 英文原摘要

One of the fundamental cognitive abilities of humans is to quickly resolve uncertainty by generating hypotheses and testing them via active trials. Encountering a novel phenomenon accompanied by ambiguous cause-effect relationships, humans make hypotheses against data, conduct inferences from observation, test their theory via experimentation, and correct the proposition if inconsistency arises. These iterative processes persist until the underlying mechanism becomes clear. In this work, we devise the IVRE (pronounced as ivory) environment for evaluating artificial agents’ reasoning ability under uncertainty. IVRE is an interactive environment featuring rich scenarios centered around Blicket detection. Agents in IVRE are placed into environments with various ambiguous action-effect pairs and asked to determine each object’s role. They are encouraged to propose effective and efficient experiments to validate their hypotheses based on observations and actively gather new information. The game ends when all uncertainties are resolved or the maximum number of trials is consumed. By evaluating modern artificial agents in IVRE, we notice a clear failure of today’s learning methods compared to humans. Such inefficacy in interactive reasoning ability under uncertainty calls for future research in building human-like intelligence.

版本指纹 033de0d7f6d538c695e793bd8cf3786452225117d3899019655999dc8a7ea5cc

返回筛选与清单 ↑
P142 2021新增 Alchemy: A Benchmark and Analysis Toolkit for Meta-Reinforcement Learning Agents Jane X. Wang; Michael King; Nicolas Porcel et al. 提出具有可分析潜在因果结构的元强化学习环境Alchemy。智能体通过试用药水、改变石头属性来发现每个episode的化学规则,并利用跨trial知识提高收益;同时提供符号版本、理想观察者和行为诊断工具,定位强化学习未能学会哪些抽象规律。 世界机制与演化AI方法与评测展开笔记
#P14224页 · 核对于 2026-09-15

中文摘要

提出具有可分析潜在因果结构的元强化学习环境Alchemy。智能体通过试用药水、改变石头属性来发现每个episode的化学规则,并利用跨trial知识提高收益;同时提供符号版本、理想观察者和行为诊断工具,定位强化学习未能学会哪些抽象规律。

核心贡献

兼顾组合任务丰富度和机制透明性,使环境机制、belief与参考策略可计算;把总体分数拆解为结构发现、信息利用和动作执行的能力诊断。

实现边界

每个episode包含10个trial;机制在episode内固定,跨episode重新采样,共167,424种预设化学配置。它研究已有真值机制的发现,不是创作者尚未定义规则的开放补全。理想观察者仅对当前trial做精确前瞻,并非对整个10-trial episode进行全局最优规划。

Method · 方法

Unity第一人称3D环境与共享机制的符号环境;药水在三维属性立方体上改变石头状态,目标是提高投入坩埚的石头价值。训练IMPALA/LSTM与VMPO/Transformer-XL基线,另实现维护可能机制集合并搜索动作的理想观察者。通过额外提供真值机制或Bayesian belief、增加预测辅助损失,诊断感知与推断瓶颈。

Results · 主要结果

表1在1,000个测试episode上报告均值±标准误:IMPALA 140.2±1.5,VMPO 156.2±1.6,符号VMPO 155.4±1.6,随机启发式145.7±1.5,理想观察者284.4±1.6,oracle 288.5±1.5。基线虽训练2×10^10步仍远低于参考策略;提供显式belief/机制显著改善表现,说明困难不只来自视觉控制。

Shortcomings · 局限

机制族人为设计,主要强调深入诊断而非跨领域覆盖;理想观察者的搜索复杂度限制更大环境。基线使用特权信息的增强实验仅用于诊断,不算解决原任务;也未证明对自然科学开放发现或用户改写规则的泛化。

证据定位

PDF pp.4–5:任务机制、规模与表1;p.5脚注6:理想观察者的trial内边界;pp.6–10:训练、诊断和讨论。

Abstract · 英文原摘要

There has been rapidly growing interest in meta-learning as a method for increasing the flexibility and sample efficiency of reinforcement learning. One problem in this area of research, however, has been a scarcity of adequate benchmark tasks. In general, the structure underlying past benchmarks has either been too simple to be inherently interesting, or too ill-defined to support principled analysis. In the present work, we introduce a new benchmark for meta-RL research, emphasizing transparency and potential for in-depth analysis as well as structural richness. Alchemy is a 3D video game, implemented in Unity, which involves a latent causal structure that is resampled procedurally from episode to episode, affording structure learning, online inference, hypothesis testing and action sequencing based on abstract domain knowledge. We evaluate a pair of powerful RL agents on Alchemy and present an in-depth analysis of one of these agents. Results clearly indicate a frank and specific failure of meta-learning, providing validation for Alchemy as a challenging benchmark for meta-RL. Concurrent with this report, we are releasing Alchemy as public resource, together with a suite of analysis tools and sample agent trajectories.

版本指纹 af6e9cd02d6a8d10c3a76e30b09c56e39b10fc4f265338f8e3b7142a15dedf9d

返回筛选与清单 ↑
P141 2021 / 2020新增 Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration Xavier Puig; Tianmin Shu; Shuang Li et al. 提出先观察、后协助的两阶段家庭任务:助手从另一智能体的一次示范中推断目标,再在不同房间配置中协助完成同一目标。VirtualHome-Social支持多智能体互动,并以规划、学习基线和真人实验评估社会感知与协作效率。 XR与人机协作展开笔记
#P14123页 · 核对于 2026-09-15

中文摘要

提出先观察、后协助的两阶段家庭任务:助手从另一智能体的一次示范中推断目标,再在不同房间配置中协助完成同一目标。VirtualHome-Social支持多智能体互动,并以规划、学习基线和真人实验评估社会感知与协作效率。

核心贡献

将目标推断与跨场景协作联合纳入可复现基准;提供多智能体家庭仿真、任务划分、成功率/加速比指标,并检验仿真人类与真实参与者配合时的结论是否一致。

实现边界

Watch阶段学习目标,Help阶段执行;本文基线使用视野内物体的真值符号状态,并非端到端像素感知。目标以预设谓词组合表示,低层动作受模拟器限制;未实现在线澄清对话、XR头显取证或持续更新目标推断。

Method · 方法

Transformer编码示范中的物体状态,再经LSTM与时间聚合预测目标谓词;对比层次规划HP、层次RL及学习高层策略与规划低层动作的Hybrid。规划器考虑Alice的未来计划,降低重复劳动与动作冲突。训练1,011个任务;两个测试集各100个任务,保留未见公寓及谓词组合,单轮最多250步。

Results · 主要结果

Test-1目标识别precision/recall为0.85/0.96;仅看最终观察为0.79/0.75;输入Alice动作则为0.99/0.99,说明结果明显依赖输入条件。Test-2组合任务降至0.68/0.64。HP和Hybrid能提供帮助,随机目标HP在40%的回合产生目标冲突。真人单人实验6人,协作实验12人、90次试验:三种助手的总体排序与仿真评估一致。

Shortcomings · 局限

作者指出在线目标推断和智能体通信仍是后续方向;错误目标可能使强规划器帮倒忙。研究判断:符号真值感知、较小真人样本和有限家庭谓词空间限制向真实XR迁移,成功率不能直接代表人类注意力成本或请求行动的可接受性。

证据定位

PDF pp.3–5:任务、输入条件与基线;pp.6–7:目标识别和协作结果;pp.8–9及附录D:真人实验与边界。

Abstract · 英文原摘要

In this paper, we introduce Watch-And-Help (WAH), a challenge for testing social intelligence in agents. In WAH, an AI agent needs to help a human-like agent perform a complex household task efficiently. To succeed, the AI agent needs to i) understand the underlying goal of the task by watching a single demonstration of the human-like agent performing the same task (social perception), and ii) coordinate with the human-like agent to solve the task in an unseen environment as fast as possible (human-AI collaboration). For this challenge, we build VirtualHomeSocial, a multi-agent household environment, and provide a benchmark including both planning and learning based baselines. We evaluate the performance of AI agents with the human-like agent as well as with real humans using objective metrics and subjective user ratings. Experimental results demonstrate that the proposed challenge and virtual environment enable a systematic evaluation on the important aspects of machine social intelligence at scale.

版本指纹 35fd46183bb785e6f8eb0303083ca59036322f09fc4b20bea243bfc52d84486f

返回筛选与清单 ↑
P140 2025 VideoAuteur: Towards Long Narrative Video Generation Junfei Xiao; Feng Cheng; Lu Qi et al. 面向烹饪长叙事视频构建数据和分层生成流程,交错语言/视觉导演规划步骤,滚动关键帧渲染再生成视频。 创作与规则补全世界机制与演化展开笔记
#P14011页 · 核对于 2026-09-15

中文摘要

面向烹饪长叙事视频构建数据和分层生成流程,交错语言/视觉导演规划步骤,滚动关键帧渲染再生成视频。

核心贡献

烹饪数据整理、Long Narrative Video Director、滚动历史条件渲染及视觉embedding对齐。

实现边界

实证集中烹饪域;自动VLM检查和人评不保证食谱正确/操作安全;不是任意电影场景通用导演。

Method · 方法

导演交替生成语言状态与视觉embedding,以滚动参考图条件DiT渲染关键帧,正则化视觉embedding驱动视频模型。

Results · 主要结果

表3 YouCook2 CLIP-T25.9→26.4、FVD557.7→512.6;HowTo100M26.6→27.3、541.1→520.7;去掉embedding正则反而更差,说明对齐是必要因素。

Shortcomings · 局限

【解读】域特定数据、阶段间误差累积、角色/步骤的长程一致仍受基础生成器限制,需更广题材和事件完成验证。

证据定位

PDF §3–5、表3 pp.6–7、§6。

Abstract · 英文原摘要

Recent video generation models have shown promising results in producing high-quality video clips lasting several seconds. However, these models face challenges in generating long sequences that convey clear and informative events, limiting their ability to support coherent narrations. In this paper, we present a large-scale cooking video dataset designed to advance long-form narrative generation in the cooking domain. We validate the quality of our proposed dataset in terms of visual fidelity and textual caption accuracy using state-of-the-art Vision-Language Models (VLMs) and video generation models, respectively. We further introduce a Long Narrative Video Director to enhance both visual and semantic coherence in generated videos and emphasize the role of aligning visual embeddings to achieve improved overall video quality. Our method demonstrates substantial improvements in generating visually detailed and semantically aligned keyframes, supported by finetuning techniques that integrate text and image embeddings within the video generation process.

版本指纹 e4087daed3ec8e414c07c7654a84cad474d99d436bbe67eaa7f5e1ae5f857671

返回筛选与清单 ↑
P139 2025 Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation Yiping Wang; Xuehai He; Kuan Wang et al. 用2–4个连续事件的短故事提示测量视频模型是否完成所要求事件,补充审美与时空一致性等细节指标。 创作与规则补全世界机制与演化展开笔记
#P13910页 · 核对于 2026-09-15

中文摘要

用2–4个连续事件的短故事提示测量视频模型是否完成所要求事件,补充审美与时空一致性等细节指标。

核心贡献

StoryEval423提示、7类场景,逐事件自动核验与一致投票。

实现边界

completion rate是已完成事件比例,不是全故事全对比例;视频时长有限,不能直接代表分钟级长叙事表现。

Method · 方法

检索真实视频/人工构思提示,VLM如GPT4o和LLaVAOV72B核验每一事件并投票,与人工评价检查一致性。

Results · 主要结果

11模型无一平均事件完成率超过50%,hard类无一超过20%;Kling1.5总体40.1%,Pika1.5为19.4%;高传统时间一致性分数仍可伴随低事件完成。

Shortcomings · 局限

【解读】VLM评分存在误判,一致投票也可能共同偏差;可生成时长/动作复杂度、提示类别和模型版本影响排名。

证据定位

PDF §2–3、表1–2、§3.1 pp.7–8。

Abstract · 英文原摘要

The current state-of-the-art video generative models can produce commercial-grade videos with highly realistic details. However, they still struggle to coherently present multiple sequential events in the stories specified by the prompts, which is foreseeable an essential capability for future long video generation scenarios. For example, top T2V generative models still fail to generate a video of the short simple story ”how to put an elephant into a refrigerator. ” While existing detail-oriented benchmarks primarily focus on fine-grained metrics like aesthetic quality and spatial-temporal consistency, they fall short of evaluating models’ abilities to handle event-level story presentation. To address this gap, we introduce StoryEval, a story-oriented benchmark specifically designed to assess text-to-video (T2V) models’ story-completion capabilities. StoryEval features 423 prompts spanning 7 classes, each representing short stories composed of 2–4 consecutive events. We employ Vision-Language Models, such as GPT-4o and LLaVA-OV-Chat-72B, to verify the completion of each event in the generated videos, applying a unanimous voting method to enhance reliability. Our methods ensure high alignment with human evaluations, and the evaluation of 11 models reveals its challenge, with none exceeding an average story-completion rate of 50%. StoryEval provides a new benchmark for advancing T2V models and highlights the challenges and opportunities in developing next-generation solutions for coherent storydriven video generation. Project website is available at https://ypwang61.github.io/project/StoryEval.

版本指纹 cba490f9ce2d4f8ebd0372826b3fcca803dbd37770ce22a2f3df199f55bac24b

返回筛选与清单 ↑
P138 2019 StoryGAN: A Sequential Conditional GAN for Story Visualization Yitong Li, Zhe Gan, Yelong Shen, Jingjing Liu, Yu Cheng, Yuexin Wu, Lawrence Carin, David Carlson, Jianfeng Gao 每句话生成一张图,把故事可视化为有角色和场景一致性的图片序列。 创作与规则补全世界机制与演化展开笔记
#P13810页 · 核对于 2026-09-15

中文摘要

每句话生成一张图,把故事可视化为有角色和场景一致性的图片序列。

核心贡献

StoryGAN顺序条件GAN、动态Context Encoder/Text2Gist、图像级与故事级判别器,以及CLEVR-SV/Pororo-SV数据。

实现边界

是句子到图片序列,不是连续视频生成;重点为全局一致而非帧间运动平滑;主要合成/动画小域。

Method · 方法

故事编码初始化状态,Text2Gist融合当前句与历史,逐图生成;两级对抗损失约束单图和全序列。

Results · 主要结果

CLEVR-SV SSIM0.672,ImageGAN0.596、SVC0.641、SVFN0.654;用户排序平均名次1.94优于ImageGAN2.91(越低越好)。

Shortcomings · 局限

【解读】低分辨率、数据域窄,角色细节和长故事能力有限;SSIM仅在该合成布局约束下具可比性,非通用故事质量指标。

证据定位

PDF §3–4、表1 p.6、表3–4 p.8。

Abstract · 英文原摘要

In this work, we propose a new task called Story Visualization. Given a multi-sentence paragraph, the story is visualized by generating a sequence of images, one for each sentence. In contrast to video generation, story visualization focuses less on the continuity in generated images (frames), but more on the global consistency across dynamic scenes and characters – a challenge that has not been addressed by any single-image or video generation methods. Therefore, we propose a new story-to-image-sequence generation model, StoryGAN, based on the sequential conditional GAN framework. Our model is unique in that it consists of a deep Context Encoder that dynamically tracks the story flow, and two discriminators at the story and image levels, to enhance the image quality and the consistency of the generated sequences. To evaluate the model, we modified existing datasets to create the CLEVR-SV and Pororo- SV datasets. Empirically, StoryGAN outperformed stateof-the-art models in image quality, contextual consistency metrics, and human evaluation.

版本指纹 f81df8beff3dd5f58ca33af45475b7e70b19fff4e47d9c08a4b3016e5e2f32bc

返回筛选与清单 ↑
P137 2025 Long-Context State-Space Video World Models Ryan Po; Yotam Nitzan; Richard Zhang; Berlin Chen; Tri Dao; Eli Shechtman; Gordon Wetzstein; Xun Huang 以块级SSM扫描存储较长视频历史,结合局部注意力维持局部连贯,降低动作条件世界模型长上下文计算。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P13712页 · 核对于 2026-09-15

中文摘要

以块级SSM扫描存储较长视频历史,结合局部注意力维持局部连贯,降低动作条件世界模型长上下文计算。

核心贡献

因果视频SSM架构、训练策略及长时空间记忆测试。

实现边界

每帧推理成本不随历史增长,但作者明确尚不支持交互帧率,无法有效超训练长度记忆;仅低分辨率合成环境。

Method · 方法

Mamba状态压缩长历史,block-wise扫描与frame-local attention结合,逐帧扩散生成。

Results · 主要结果

576历史帧/224预测帧任务PSNR28.2、LPIPS0.099、SSIM0.855;接近全历史Transformer28.8/0.089/0.860并优于较低复杂度比较方法。

Shortcomings · 局限

【作者】速度、长度外推和高分辨率真实视频扩展待解决;【解读】压缩状态对长期精细记忆仍有容量约束。

证据定位

PDF §4–5、表3 p.6、§6 p.8。

Abstract · 英文原摘要

Video diffusion models have recently shown promise for world modeling through autoregressive frame prediction conditioned on actions. However , they struggle to maintain long-term memory due to the high computational cost associated with processing extended sequences in attention layers. To overcome this limitation, we propose a novel architecture leveraging state-space models (SSMs) to extend temporal memory without compromising computational efficiency. Unlike previous approaches that retrofit SSMs for non-causal vision tasks, our method fully exploits the inherent advantages of SSMs in causal sequence modeling. Central to our design is a block-wise SSM scanning scheme, which strategically trades off spatial consistency for extended temporal memory, combined with dense local attention to ensure coherence between consecutive frames. We evaluate the long-term memory capabilities of our model through spatial retrieval and reasoning tasks over extended horizons. Experiments on Memory Maze and Minecraft datasets demonstrate that our approach surpasses baselines in preserving long-range memory, while maintaining practical inference speeds suitable for interactive applications.

版本指纹 fe20255bf4824c5ed9d408c9963ac7efce53b1f043971ba20e541fd658969a2c

返回筛选与清单
P136 2023 StoryBench: A Multifaceted Benchmark for Continuous Story Visualization Emanuele Bugliarello; Hernan Moraldo; Ruben Villegas et al. 在三个既有视频数据集上增加带时间戳的多句故事标注,评估动作执行、故事续写和纯文本故事视频生成。 创作与规则补全世界机制与演化展开笔记
#P13631页 · 核对于 2026-09-15

中文摘要

在三个既有视频数据集上增加带时间戳的多句故事标注,评估动作执行、故事续写和纯文本故事视频生成。

核心贡献

Oops/UVO/DiDeMo的连续故事基准、不同训练设置及视频人评指南。

实现边界

多数为较短、单镜头用户视频,不能代表长电影多镜头;虽为“continuous story”不意味着无限时长评测。

Method · 方法

人工标注时间段/动作及诊断标签;用小型Phenaki基线进行零样本、单任务、多任务微调;比较自动指标与人类评价。

Results · 主要结果

续写专门微调改善动作与上下文一致;Oops动作执行FVD:GEN-ZS416、CONT-ST350;但自动分数与人评存在偏离,作者强调仍需人工核查。

Shortcomings · 局限

【作者】视频不长、以单镜头非专业内容为主、自动指标不足;【解读】少数小基线不能穷尽所有生成模型能力。

证据定位

PDF §3–6、表4–7、§7–8。

Abstract · 英文原摘要

Generating video stories from text prompts is a complex task. In addition to having high visual quality, videos need to realistically adhere to a sequence of text prompts whilst being consistent throughout the frames. Creating a benchmark for video generation requires data annotated over time, which contrasts with the single caption used often in video datasets. To fill this gap, we collect comprehensive human annotations on three existing datasets, and introduce StoryBench: a new, challenging multi-task benchmark to reliably evaluate forthcoming text-to-video models. Our benchmark includes three video generation tasks of increasing difficulty: action execution, where the next action must be generated starting from a conditioning video; story continuation, where a sequence of actions must be executed starting from a conditioning video; and story generation, where a video must be generated from only text prompts. We evaluate small yet strong text-to-video baselines, and show the benefits of training on story-like data algorithmically generated from existing video captions. Finally, we establish guidelines for human evaluation of video stories, and reaffirm the need of better automatic metrics for video generation. StoryBench aims at encouraging future research efforts in this exciting new area.

版本指纹 1d7fde670c781d256bb4a41b4ad1375c75af97ae3941b4fa447725078a20c2f5

返回筛选与清单 ↑
P135 2025 WorldMem: Long-term Consistent World Simulation with Memory Zeqi Xiao; Yushi Lan; Yifan Zhou et al. 以过去帧、位姿和时间戳组成记忆库,通过状态相关的memory attention重建之前去过的地方并表达世界随时间演化。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P13514页 · 核对于 2026-09-15

中文摘要

以过去帧、位姿和时间戳组成记忆库,通过状态相关的memory attention重建之前去过的地方并表达世界随时间演化。

核心贡献

显式状态帧记忆与检索式世界生成,扩展有限上下文的视频模拟。

实现边界

Minecraft主要实验使用模拟器提供的真值位姿;现实只给动作时位姿需预测,误差条件不同;记忆增强并不证明完整3D世界模型。

Method · 方法

为帧存姿态/时间,按当前目标状态检索并注意历史视图;扩散模型结合当前上下文与记忆生成。

Results · 主要结果

超上下文Minecraft PSNR25.32对DiffusionForcing18.04,LPIPS0.1429对0.4376;RealEstate10K回访PSNR20.19对DFoT8.396。主要是回到已见视角的重建任务。

Shortcomings · 局限

【解读】真值位姿和已访问参考带来条件优势,未知位姿、动态遮挡和记忆容量扩张仍有风险;回访重建好不等于开放新场景因果预测准确。

证据定位

PDF §3–4、§4.1 pp.6–7、表1–2。

Abstract · 英文原摘要

World simulation has gained increasing popularity due to its ability to model virtual environments and predict the consequences of actions. However, the limited temporal context window often leads to failures in maintaining longterm consistency, particularly in preserving 3D spatial consistency. In this work, we present WorldMem, a framework that enhances scene generation with a memory bank consisting of memory units that store memory frames and states (e.g., poses and timestamps). By employing a memory attention mechanism that effectively extracts relevant information from these memory frames based on their states, our method is capable of accurately reconstructing previously observed scenes, even under significant viewpoint or temporal gaps. Furthermore, by incorporating timestamps into the states, our framework not only models a static world but also captures its dynamic evolution over time, enabling both perception and interaction within the simulated world. Extensive experiments in both virtual and real scenarios validate the effectiveness of our approach.

版本指纹 f1c77acf725e4d4c657bb11fa04abd75c418854abb04e6d8a7b2477c6c0ead78

返回筛选与清单 ↑
P133 2025 OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory Zhaochong An; Menglin Jia; Haonan Qiu et al. OneStory把多镜头生成视为下一镜头预测,从全局历史挑选相关帧并自适应压缩为紧凑条件,保持角色/环境一致。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P13317页 · 核对于 2026-09-15

中文摘要

OneStory把多镜头生成视为下一镜头预测,从全局历史挑选相关帧并自适应压缩为紧凑条件,保持角色/环境一致。

核心贡献

Frame Selection、Adaptive Conditioner、带指代字幕的多镜头数据及shot inflation/解耦条件训练。

实现边界

历史经选择压缩,不能保留所有事件状态;依赖预训练I2V模型和相应训练,并非无需训练的记忆外挂。

Method · 方法

按当前镜头字幕检索历史信息帧,重要性引导patchification压缩上下文,直接条件注入下一镜头视频生成器。

Results · 主要结果

表2无AC/FS时角色/环境一致0.5153/0.5112,完整0.5874/0.5752;语义对齐0.1814→0.2389。增加至3帧等价上下文后角色/环境0.5926/0.5863,说明预算仍有影响。

Shortcomings · 局限

【解读】历史选择失误、对象混淆和累积漂移仍可能发生;指标主要衡量视觉/语义一致,不能保证复杂故事事件因果完整。

证据定位

PDF §3–5、表2 p.8、§6。

Abstract · 英文原摘要

Storytelling in real-world videos often unfolds through multiple shots—discontinuous yet semantically connected clips that together convey a coherent narrative. However, existing multi-shot video generation (MSV) methods struggle to effectively model long-range cross-shot context, as they rely on limited temporal windows or single keyframe conditioning, leading to degraded performance under complex narratives. In this work, we propose OneStory, enabling global yet compact cross-shot context modeling for consistent and scalable narrative generation. OneStory reformulates MSV as a next-shot generation task, enabling autoregressive shot synthesis while leveraging pretrained image-to-video (I2V) models for strong visual conditioning. We introduce two key modules: a Frame Selection module that constructs a semantically-relevant global memory based on informative frames from prior shots, and an Adaptive Conditioner that performs importance-guided patchification to generate compact context for direct conditioning. We further curate a high-quality multi-shot dataset with referential captions to mirror real-world storytelling patterns, and design effective training strategies under the next-shot paradigm. Finetuned from a pretrained I2V model on our curated 60K dataset, OneStory achieves state-of-the-art narrative coherence across diverse and complex scenes in both text- and image-conditioned settings, enabling controllable and immersive long-form video storytelling.

版本指纹 31338f0d7ecd2fa06661eb61cdcf6e0c6af71ad9266062b66478796afd0ce453

返回筛选与清单 ↑
P132 2025 Pre-trained Video Generative Models as World Simulators Haoran He; Yang Zhang; Liang Lin et al. DWS在预训练视频生成器上添加动作条件模块和运动强化损失,获得可按动作轨迹生成的动态模型,再通过优先想象改进模型式RL。 世界机制与演化展开笔记
#P13217页 · 核对于 2026-09-15

中文摘要

DWS在预训练视频生成器上添加动作条件模块和运动强化损失,获得可按动作轨迹生成的动态模型,再通过优先想象改进模型式RL。

核心贡献

适配扩散/自回归骨干的动作接口、动态转移训练与prioritized imagination。

实现边界

需要任务动作数据和微调;“任何模型通用”仅在所测架构证实,主要游戏/机器人域,非现实通用仿真。

Method · 方法

轻量动作模块对齐动作与视觉变化,以运动损失强化动态;按价值选想象轨迹供PPO/离线策略训练。

Results · 主要结果

Procgen/Atari展示较PPO及部分模型式RL的样本效率收益;Breakout报告约7倍分数提升,限定具体预算/基线;另用合成经验增强离线策略。

Shortcomings · 局限

【解读】模型动态误差、动作覆盖和想象优先级可造成偏差;Procgen策略训练中世界模型仍需继续微调,不能当作一次预训练后通吃。

证据定位

PDF §3–5、§5.2图6–7、§5.3。

Abstract · 英文原摘要

Video generative models pre-trained on large-scale internet datasets have achieved remarkable success, excelling at producing realistic synthetic videos. However, they often generate clips based on static prompts (e.g., text or images), limiting their ability to model interactive and dynamic scenarios. In this paper, we propose Dynamic World Simulation (DWS), a novel approach to transform pre-trained video generative models into controllable world simulators capable of executing specified action trajectories. To achieve precise alignment between conditioned actions and generated visual changes, we introduce a lightweight, universal actionconditioned module that seamlessly integrates into any existing model. Instead of focusing on complex visual details, we demonstrate that consistent dynamic transition modeling is the key to building powerful world simulators. Building upon this insight, we further introduce a motion-reinforced loss that enhances action controllability by compelling the model to capture dynamic changes more effectively. Experiments demonstrate that DWS can be versatilely applied to both diffusion and autoregressive transformer models, achieving significant improvements in generating action-controllable, dynamically consistent videos across games and robotics domains. Moreover, to facilitate the applications of the learned world simulator in downstream tasks such as model-based reinforcement learning, we propose prioritized imagination to improve sample efficiency, demonstrating competitive performance compared with state-of-the-art methods.

版本指纹 dce93f666b6f970e5163c61fe1c0ead37843cbe44eaebd66be8bedc4d76dee43

返回筛选与清单 ↑
P131 2025 / 2026 Controllable Video Generation: A Survey Yue Ma; Kunyu Feng; Zhongyuan Hu et al. 系统梳理文本之外的姿态、深度、轨迹、相机、音频、身份等视频生成控制,比较单条件、多条件和通用控制机制。 创作与规则补全世界机制与演化展开笔记
#P13141页 · 核对于 2026-09-15

中文摘要

系统梳理文本之外的姿态、深度、轨迹、相机、音频、身份等视频生成控制,比较单条件、多条件和通用控制机制。

核心贡献

控制信号/注入方式分类、基础视频模型及文献资源汇集。

实现边界

综述,列出的生成分辨率、速度和代码状态属于原文时点/原实验配置;不是同硬件复现实验排行榜。

Method · 方法

PRISMA式四阶段筛选,按基础模型、条件类型、去噪注入方式和应用分析研究。

Results · 主要结果

形成控制分类与模型对照,指出多条件协调、精确局部控制、时序一致、通用接口和评估标准的挑战;无新模型统一提升数值。

Shortcomings · 局限

【解读】快速更新导致覆盖时点有限,各论文预算/数据/控制难度不同,列表不可直接作为质量排名。

证据定位

PDF §3检索流程、§4–7、§8 p.26。

Abstract · 英文原摘要

With the rapid development of AI-generated content (AIGC), video generation has emerged as one of its most dynamic and impactful subfields. In particular, the advancement of video generation foundation models has led to growing demand for controllable video generation methods that can more accurately reflect user intent. Most existing foundation models are designed for text-to-video generation, where text prompts alone are often insufficient to express complex, multi-modal, and fine-grained user requirements. This limitation makes it challenging for users to generate videos with precise control using current models. To address this issue, recent research has explored the integration of additional non-textual conditions—such as camera motion, depth maps, and human pose—to extend pretrained video generation models and enable more controllable video synthesis. These approaches aim to enhance the flexibility and practical applicability of AIGC-driven video generation systems. In this survey, we provide a systematic review of controllable video generation, covering both theoretical foundations and recent advances in the field. We begin by introducing the key concepts and commonly used open-source video generation models. We then focus on control mechanisms in video diffusion models, analyzing how different types of conditions can be incorporated into the denoising process to guide generation. Finally, we categorize existing methods based on the types of control signals they leverage, including single-condition generation, multi-condition generation, and universal controllable generation. For a complete list of the literature on controllable video generation reviewed, please visit our curated repository at https://github.com/mayuelala/Awesome-Controllable-Video-Generation.

版本指纹 a14847ae33974419f181f58ca0c4df227f2c1fdafdeb7b9910470cd15a236f86

返回筛选与清单 ↑
P130 2026 CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models Tobia Poppi; Burak Uzkent; Amanmeet Garg et al. 生成保留场景但改变短时动作/顺序的反事实视频硬负例,以文字和视觉偏好联合DPO减少视频VLM动作与时间幻觉。 世界机制与演化AI方法与评测展开笔记
#P13016页 · 核对于 2026-09-15

中文摘要

生成保留场景但改变短时动作/顺序的反事实视频硬负例,以文字和视觉偏好联合DPO减少视频VLM动作与时间幻觉。

核心贡献

约26K偏好对CounterVid与MixDPO,面向语言先验导致的时间/动作错误。

实现边界

反事实主要是<2秒动作的语义替换,不是严格结构因果模型干预;生成数据质量不完美,评估中只有68%标为good。

Method · 方法

多模态LLM提出替代动作/编辑指导,图像与视频扩散合成负例,过滤并构造文字/视觉偏好,冻结视觉编码器进行参数高效优化。

Results · 主要结果

留出集Qwen2.5VL7B平均57.8→66.2%;顺序列表16.5→43.8%;3B平均36.9→45.2%。样本审核7%视觉质量差,部分任务有约17%歧义。

Shortcomings · 局限

【作者】过滤和生成质量、短动作限制、冻结视觉编码器;【解读】合成负例收益需关注跨真实域迁移而非只看内部留出集。

证据定位

PDF §3–4、表1–2 p.6、Limitations p.9。

Abstract · 英文原摘要

Video-language models (VLMs) achieve strong multimodal understanding but remain prone to hallucinations, especially when reasoning about actions and temporal order. Existing mitigation strategies, such as textual filtering or random video perturbations, often fail to address the root cause: over-reliance on language priors rather than fine-grained visual dynamics. We propose a scalable framework forcounterfactual video generationthat synthesizes videos differing only in actions or temporal structure while preserving scene context. Our pipeline combines multimodal LLMs for action proposal and editing guidance with diffusion-based image and video models to generate semantic hard negatives at scale. Using this framework, we build CounterVid, a synthetic dataset of ∼26k preference pairs targeting action recognition and temporal reasoning. We further introduce MixDPO, a unified Direct Preference Optimization approach that jointly leverages textual and visual preferences. Finetuning Qwen2.5-VL with MixDPO yields consistent improvements, notably in temporal ordering, and transfers effectively to standard video hallucination benchmarks. Code and models will be made publicly available.

版本指纹 473d1665bbd2a82bfbf319b6598336ea9023c21145d6fc9bf9d750622bb9b610

返回筛选与清单 ↑
P129 2025 StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation Daniel A. P. Oliveira; David Martins de Matos 为电影图像序列生成带跨帧实体链接的场景分析和故事,建立StoryReasoning并微调Qwen Storyteller,减少人物/物体指代幻觉。 创作与规则补全世界机制与演化展开笔记
#P12931页 · 核对于 2026-09-15

中文摘要

为电影图像序列生成带跨帧实体链接的场景分析和故事,建立StoryReasoning并微调Qwen Storyteller,减少人物/物体指代幻觉。

核心贡献

4,178故事、52,016图像的结构化分析/grounded叙事数据,跨帧重识别和基线模型。

实现边界

输出以多图到文字故事为主,不是生成视频;创造性/幻觉主要由LLM评判,不能等同人类创意评估。

Method · 方法

视觉相似性与人脸识别匹配对象,表格组织跨帧场景,CoT生成并将词语链接到实体,微调Qwen2.5VL7B。

Results · 主要结果

平均每故事幻觉4.06→3.56(相对−12.3%);创造性评分2.58→3.38/5(+31%);描述准确评分2.69→2.76,收益较小。

Shortcomings · 局限

【作者】外观相似实体如双胞胎可混淆、电影构图偏差、对话第一人称难grounding;LLM评判偏差和文本相似指标可能惩罚合理创作。

证据定位

PDF §3–5、表1–2 p.8、§6。

Abstract · 英文原摘要

Visual storytelling systems struggle to maintain character identity across frames and link actions to appropriate subjects, frequently leading to referential hallucinations. These issues can be addressed through grounding of characters, objects, and other entities on the visual elements. We propose StoryReasoning, a dataset containing 4,178 stories derived from 52,016 movie images, with both structured scene analyses and grounded stories. Each story maintains character and object consistency across frames while explicitly modeling multi-frame relationships through structured tabular representations. Our approach features cross-frame object re-identification using visual similarity and face recognition, chain-of-thought reasoning for explicit narrative modeling, and a grounding scheme that links textual elements to visual entities across multiple frames. We establish baseline performance by fine-tuning Qwen2.5-VL 7B, creating Qwen Storyteller, which performs end-to-end object detection, re-identification, and landmark detection while maintaining consistent object references throughout the story. Evaluation demonstrates a reduction from 4.06 to 3.56 (-12.3%) hallucinations on average per story and an improvement in creativity from 2.58 to 3.38 (+31.0%) when compared to a non-fine-tuned model.

版本指纹 ba6b37f97eb4e938f932a69fc2e4f6572cdd454f72329fffc733ac3dedb43ca1

返回筛选与清单 ↑
P128 2025 StoryMem: Multi-shot Long Video Storytelling with Memory Kaiwen Zhang; Liming Jiang; Angtian Wang et al. 用动态历史关键帧记忆把单镜头视频扩散改造成逐镜头长叙事生成,并通过语义/审美选择维持紧凑记忆。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P12820页 · 核对于 2026-09-15

中文摘要

用动态历史关键帧记忆把单镜头视频扩散改造成逐镜头长叙事生成,并通过语义/审美选择维持紧凑记忆。

核心贡献

Memory-to-Video(M2V)、负RoPE位置与latent拼接、LoRA训练及ST-Bench。

实现边界

需微调单镜头骨干;分钟级逐镜头生成不是无限记忆,纯视觉记忆可能混淆多角色;平滑过渡和提示跟随有取舍。

Method · 方法

历史镜头选相关美观关键帧写入记忆,潜空间拼接注入模型;MI2V/MR2V支持过渡和定制。

Results · 主要结果

ST-Bench总体跨镜头一致性0.5065,报告比基础模型相对提高28.7%、比HoloCine提高9.4%;用户成对偏好更高;单镜头提示跟随略下降。

Shortcomings · 局限

【作者】复杂多角色和大运动差异过渡困难;【解读】视觉一致性/审美不证明事件链完成,记忆选择会过滤重要但不美观的状态。

证据定位

PDF §3–4、表1–2、图7、§5。

Abstract · 英文原摘要

Visual storytelling requires generating multi-shot videos with cinematic quality and long-range consistency. Inspired by human memory, we proposeStoryMem, a paradigm that reformulates long-form video storytelling as iterative shot synthesis conditioned on explicit visual memory, transforming pre-trained single-shot video diffusion models into multi-shot storytellers. This is achieved by a novelMemory-to-Video (M2V)design, which maintains a compact and dynamically updated memory bank of keyframes from historical generated shots. The stored memory is then injected into single-shot video diffusion models via latent concatenation and negative RoPE shifts with only LoRA fine-tuning. A semantic keyframe selection strategy, together with aesthetic preference filtering, further ensures informative and stable memory throughout generation. Moreover, the proposed framework naturally accommodates smooth shot transitions and customized story generation application. To facilitate evaluation, we introduce ST-Bench, a diverse benchmark for multi-shot video storytelling. Extensive experiments demonstrate thatStoryMemachieves superior cross-shot consistency over previous methods while preserving high aesthetic quality and prompt adherence, marking a significant step toward coherent minute-long video storytelling.

版本指纹 893eb41d0811d6480248c118b3146657400c5b93dfc5ae1c4ff1a62b75d116af

返回筛选与清单 ↑
P127 2025 MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequences Canyu Zhao; Mingyu Liu; Wen Wang; Weihua Chen; Fan Wang; Hao Chen; Bo Zhang; Chunhua Shen 用自回归模型规划长序列关键帧token,再以扩散渲染图像和视频,以多模态剧本和人脸身份条件维持跨场景角色一致。 创作与规则补全世界机制与演化展开笔记
#P12731页 · 核对于 2026-09-15

中文摘要

用自回归模型规划长序列关键帧token,再以扩散渲染图像和视频,以多模态剧本和人脸身份条件维持跨场景角色一致。

核心贡献

叙事/渲染分层框架、包含角色及风格的剧本和身份保持渲染。

实现边界

“叙事一致”主要由脚本对齐和角色视觉指标代理;关键帧及短片段组装不保证每项事件真实发生或长时物理因果一致。

Method · 方法

扩散自动编码器产生紧凑关键帧token,自回归预测下一个keyframe,文本/FaceID条件解码,再生成帧间视频。

Results · 主要结果

表1无参考Ours长期一致LT0.814对StoryDiffusion0.596,FID2.043对4.643;审美6.093略低于6.134,非逐项最佳;有参考Ours-ref LT0.893但使用额外条件。

Shortcomings · 局限

【解读】人脸身份覆盖、长时错误累积和剧本粒度影响结果;参考/无参考条件需分开比较,电影域指标不等于人类叙事理解。

证据定位

PDF §3–4、表1–2 p.9、§5。

Abstract · 英文原摘要

Recent advancements in video generation have primarily leveraged diffusion models for short-duration content. However, these approaches often fall short in modeling complex narratives and maintaining character consistency over extended periods, which is essential for long-form video production like movies. We propose MovieDreamer, a novel hierarchical framework that integrates the strengths of autoregressive models with diffusion-based rendering to pioneer long-duration video generation with intricate plot progressions and high visual fidelity. Our approach utilizes autoregressive models for global narrative coherence, predicting sequences of visual tokens that are subsequently transformed into high-quality video frames through diffusion rendering. This method is akin to traditional movie production processes, where complex stories are factorized down into manageable scene capturing. Further, we employ a multimodal script that enriches scene descriptions with detailed character information and visual style, enhancing continuity and character identity across scenes. We present extensive experiments across various movie genres, demonstrating that our approach not only achieves superior visual and narrative quality but also effectively extends the duration of generated content significantly beyond current capabilities.

版本指纹 19dcbd7282b7ec5eab617b7d97a0aaaa42d43b765a7c7d57a866b1f88d22f93a

返回筛选与清单
P126 2025 Diffusion-Based Visual Art Creation: A Survey and New Perspectives Bingyuan Wang; Qifeng Chen; Zeyu Wang 从艺术需求和技术方法共同审视扩散视觉艺术创作,系统编码相关论文,建立应用、理解和生成的分析框架及人机协作展望。 创作与规则补全展开笔记
#P12638页 · 核对于 2026-09-15

中文摘要

从艺术需求和技术方法共同审视扩散视觉艺术创作,系统编码相关论文,建立应用、理解和生成的分析框架及人机协作展望。

核心贡献

四阶段文献筛选、七维编码和场景—模态—任务—方法框架,连接艺术要求与计算问题。

实现边界

综述,不是新的图像/视频生成模型;PDF封面的2026-01-31为下载日期,不是发表日。

Method · 方法

明确研究问题和纳入条件,结构/时间分析论文编码,归纳技术与人机协作趋势。

Results · 主要结果

识别视觉艺术的风格控制、内容编辑、跨模态与多场景生成热点,提出技术能力与艺术家参与方式共同演化的研究方向;无统一新实验排名。

Shortcomings · 局限

【解读】文献筛选/编码有解释性,领域更新快;创作质量和创造性没有跨艺术门类统一客观标准。

证据定位

PDF封面元数据;§4–6、图4、§7–8(正文到PDF p.30)。

Abstract · 英文原摘要

The integration of generative AI in visual art has revolutionized not only how visual content is created but also how AI interacts with and reflects the underlying domain knowledge. This survey explores the emerging realm of diffusion-based visual art creation, examining its development from both artistic and technical perspectives. We structure the survey into three phases: data feature and framework identification, detailed analyses using a structured coding process, and open-ended prospective outlooks. Our findings reveal how artistic requirements are transformed into technical challenges and highlight the design and application of diffusion-based methods within visual art creation. We also provide insights into future directions from technical and synergistic perspectives, suggesting that the confluence of generative AI and art has shifted the creative paradigm and opened up new possibilities. By summarizing the development and trends of this emerging interdisciplinary area, we aim to shed light on the mechanisms through which AI systems emulate and, possibly, enhance human capacities in artistic perception and creativity.

版本指纹 18c343dc471df6180c288a6b3bc1c30e4075f42475deec95b9f059a3c5981f6e

返回筛选与清单 ↑
P125 2025 Causally Steered Diffusion for Automated Video Counterfactual Generation Nikos Spyrou; Athanasios Vlontzos; Paraskevas Pegios et al. 给定属性因果图,把干预及其应保留/改变的关系写入提示,用VLM文字反馈反复优化视频编辑以生成更符合指定因果关系的反事实。 世界机制与演化AI方法与评测展开笔记
#P12523页 · 核对于 2026-09-15

中文摘要

给定属性因果图,把干预及其应保留/改变的关系写入提示,用VLM文字反馈反复优化视频编辑以生成更符合指定因果关系的反事实。

核心贡献

黑箱可接入的CSVC提示级因果引导,评估有效性、最小性和时序质量。

实现边界

依赖先验因果图,主要真实人脸年龄/性别/胡须/秃发等属性编辑;不是从视频发现因果结构,基于外观标签的假设不等于生物学因果真值。

Method · 方法

因果目标/解耦提示→TokenFlow/FLATTEN/Tune-A-Video等编辑器→VLM评估损失→语言提示迭代,核心框架不需改编辑器内部。

Results · 主要结果

表1中CSVC通常提高各编辑后端的目标属性有效性,加入因果解耦提示效果更佳;通过LPIPS、VLM、DOVER、FVD及帧间CLIP检查最小性/质量。

Shortcomings · 局限

【解读】评估和优化共享VLM语义偏差,有限属性图与人脸域限制因果解释;基础编辑器若需one-shot适配,整体并非完全无训练。

证据定位

PDF §3–5、表1、§6。

Abstract · 英文原摘要

Adapting text-to-image (T2I) latent diffusion models (LDMs) to video editing has shown strong visual fidelity and controllability, but challenges remain in maintaining causal relationships inherent to the video data generating process. Edits affecting causally dependent attributes often generate unrealistic or misleading outcomes if these relationships are ignored. In this work, we introduce a causally faithful framework for counterfactual video generation, formulated as an Out-of-Distribution (OOD) prediction problem. We embed prior causal knowledge by encoding the relationships specified in a causal graph into text prompts and guide the generation process by optimizing these prompts using a vision-language model (VLM)-based textual loss. This loss encourages the latent space of the LDMs to capture OOD variations in the form of counterfactuals, effectively steering generation toward causally meaningful alternatives. The proposed framework, dubbed CSVC, is agnostic to the underlying video editing system and does not require access to its internal mechanisms or fine-tuning. We evaluate our approach using standard video quality metrics and counterfactual-specific criteria, such as causal effectiveness and minimality. Experimental results show that CSVC generates causally faithful video counterfactuals within the LDM distribution via prompt-based causal steering, achieving state-of-the-art causal effectiveness without compromising temporal consistency or visual quality on real-world facial videos. Due to its compatibility with any black-box video editing system, our framework has significant potential to generate realistic ’what if’ hypothetical video scenarios in diverse areas such as digital media and healthcare. Code: https://github.com/nysp78/counterfactual-video-generation.

版本指纹 6d89932cdf6a8eceef98e749d795c15861c7334d7a30d7bc4f32914e6c72bd67

返回筛选与清单 ↑
P124 2024 iVideoGPT: Interactive VideoGPTs are Scalable World Models Jialong Wu; Shaofeng Yin; Ningya Feng et al. 把视觉、动作与奖励统一为token序列,使用压缩视频tokenizer及自回归Transformer预训练,适配预测、规划与模型式RL。 世界机制与演化展开笔记
#P12425页 · 核对于 2026-09-15

中文摘要

把视觉、动作与奖励统一为token序列,使用压缩视频tokenizer及自回归Transformer预训练,适配预测、规划与模型式RL。

核心贡献

交互VideoGPT框架、上下文条件压缩tokenization及大规模人类/机器人轨迹预训练。

实现边界

主要机器人操作/视觉控制任务;未经适配在新机器人上会生成旧机器人外观,少样本tokenizer适配仍重要。

Method · 方法

用上下文帧帮助大幅压缩后续帧token,将动作奖励交错建模;下游微调模型/编码器,并以模型生成经验供策略学习。

Results · 主要结果

在所评连续控制上改善相对无模型方法的样本效率,与DreamerV3相当或更高;100/1000轨迹时预训练优势更明显,全量数据时较小;压缩方案按自回归forward次数计约16倍降低。

Shortcomings · 局限

【解读】16倍是token/调用计数,不是端到端硬件实测速比;预训练机器人多样性不足,模型误差与合成轨迹偏差仍影响策略。

证据定位

PDF §3–4,图6–8、§4.4 p.8。

Abstract · 英文原摘要

World models empower model-based agents to interactively explore, reason, and plan within imagined environments for real-world decision-making. However, the high demand for interactivity poses challenges in harnessing recent advancements in video generative models for developing world models at scale. This work introduces Interactive VideoGPT (iVideoGPT), a scalable autoregressive transformer framework that integrates multimodal signals—visual observations, actions, and rewards—into a sequence of tokens, facilitating an interactive experience of agents via next-token prediction. iVideoGPT features a novel compressive tokenization technique that efficiently discretizes high-dimensional visual observations. Leveraging its scalable architecture, we are able to pre-train iVideoGPT on millions of human and robotic manipulation trajectories, establishing a versatile foundation that is adaptable to serve as interactive world models for a wide range of downstream tasks. These include action-conditioned video prediction, visual planning, and model-based reinforcement learning, where iVideoGPT achieves competitive performance compared with state-of-the-art methods. Our work advances the development of interactive general world models, bridging the gap between generative video models and practical model-based reinforcement learning applications.

版本指纹 1e2d26119085edcf56158c4a199484aba285e21059fae3de0815d87574ff80e6

返回筛选与清单 ↑
P123 2024 Genie: Generative Interactive Environments Jake Bruce; Michael Dennis; Ashley Edwards et al. 从无动作标签的互联网视频学习潜动作和动态,用图像、照片或草图初始化可逐帧控制的生成式环境。 世界机制与演化展开笔记
#P12327页 · 核对于 2026-09-15

中文摘要

从无动作标签的互联网视频学习潜动作和动态,用图像、照片或草图初始化可逐帧控制的生成式环境。

核心贡献

11B生成式交互环境,时空tokenizer、潜动作模型与自回归动态模型联合支持视频到可控世界。

实现边界

文字提示经图像生成可间接初始化,模型本体主要图像提示/潜动作控制;主要平台游戏等域,非任意真实世界高保真模拟。

Method · 方法

潜动作模型从相邻帧推断离散控制,ST-transformer编码视频token,动态模型根据历史与动作预测下一帧;不需真实动作标签训练。

Results · 主要结果

展示未见图片/手绘初始化、潜动作可控性和从视频模仿策略;模型约1fps、记忆仅16帧,作者明确长时一致与交互速度待提升。

Shortcomings · 局限

【作者】可幻觉不合理未来、上下文短、速度低;【解读】无监督动作语义在所有情境并不保证一致,视觉可玩不等于任务可用。

证据定位

PDF §2–4、§5 p.11。

Abstract · 英文原摘要

We introduce Genie, the first generative interactive environment trained in an unsupervised manner from unlabelled Internet videos. The model can be prompted to generate an endless variety of actioncontrollable virtual worlds described through text, synthetic images, photographs, and even sketches. At 11B parameters, Genie can be considered a foundation world model. It is comprised of a spatiotemporal video tokenizer, an autoregressive dynamics model, and a simple and scalable latent action model. Genie enables users to act in the generated environments on a frame-by-frame basis despite training without any ground-truth action labels or other domain-specific requirements typically found in the world model literature. Further the resulting learned latent action space facilitates training agents to imitate behaviors from unseen videos, opening the path for training generalist agents of the future.

版本指纹 94c63a5ced89355326706c88236591c2972ced12f3dece4f8982f020110c81f3

返回筛选与清单 ↑
P122 2023 Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions Ruben Villegas; Mohammad Babaeizadeh; Pieter-Jan Kindermans et al. 通过因果视频tokenizer与文本条件掩码Transformer,从随时间改变的文字提示生成可延续的视频。 创作与规则补全世界机制与演化展开笔记
#P12214页 · 核对于 2026-09-15

中文摘要

通过因果视频tokenizer与文本条件掩码Transformer,从随时间改变的文字提示生成可延续的视频。

核心贡献

C-ViViT变长视频离散表示、图文与视频文本联合训练、随故事提示自回归延续。

实现边界

“任意长”是可反复延长的机制,不保证任意时长保持质量/角色记忆;训练短片与展示长片之间没有无限泛化保证。

Method · 方法

因果时间注意力压缩视频token,T5文本条件下迭代补全被掩token,解码后以已有帧/新提示生成后续片段。

Results · 主要结果

相较逐帧编码减少约40%或更多视频token并改善时空重建一致性;训练1.4秒、8fps片段后展示分钟级变提示生成;图文联合数据帮助覆盖视频训练中未见概念组合。

Shortcomings · 局限

【解读】长期误差积累、低分辨率/细节和精确动作控制限制;token效率和视觉演示不能等同电影级叙事/物理可靠性。

证据定位

PDF §2–4、tokenizer及生成实验、附录;首页摘要。

Abstract · 英文原摘要

We present Phenaki, a model capable of realistic video synthesis, given a sequence of textual prompts. Generating videos from text is particularly challenging due to the computational cost, limited quantities of high quality text-video data and variable length of videos. To address these issues, we introduce a new model for learning video representation which compresses the video to a small representation of discrete tokens. This tokenizer uses causal attention in time, which allows it to work with variable-length videos. To generate video tokens from text we are using a bidirectional masked transformer conditioned on pre-computed text tokens. The generated video tokens are subsequently de-tokenized to create the actual video. To address data issues, we demonstrate how joint training on a large corpus of image-text pairs as well as a smaller number of video-text examples can result in generalization beyond what is available in the video datasets. Compared to the previous video generation methods, Phenaki can generate arbitrary long videos conditioned on a sequence of prompts (i.e. time variable text or a story) in open domain. To the best of our knowledge, this is the first time a paper studies generating videos from open domain time variable prompts. In addition, compared to the per-frame baselines, the proposed video encoder-decoder computes fewer tokens per video but results in better spatio-temporal consistency.

版本指纹 176243b1066c4db80df9b1f3de4de6fb8d6f9631fd65726c3e19015eaff5e4e2

返回筛选与清单 ↑
P121 2018 World Models David Ha, Jürgen Schmidhuber 用生成式模型压缩视觉并预测时间动态,训练小控制器,展示在学到的梦境中学习策略后迁移回真实游戏环境。 世界机制与演化展开笔记
#P12121页 · 核对于 2026-09-15

中文摘要

用生成式模型压缩视觉并预测时间动态,训练小控制器,展示在学到的梦境中学习策略后迁移回真实游戏环境。

核心贡献

VAE视觉模型、MDN-RNN记忆模型和简洁控制器的模块化世界模型,区分表征学习与控制优化。

实现边界

CarRacing和VizDoom等游戏;CarRacing控制器并非全部仅在梦中训练,梦中转移主要由Doom实验展示;不能保证学到完整物理因果结构。

Method · 方法

无监督学习V和M,控制器用z及RNN隐状态选动作,由进化策略优化;在随机梦境模型中训练并调温防利用模型缺陷。

Results · 主要结果

CarRacing100随机试验906±21,视觉表示单独632±251、加隐藏层788±141;展示Doom梦境训练后的真实环境迁移。

Shortcomings · 局限

【作者/解读】代理可利用世界模型错误,温度和数据覆盖影响转移;简单低分辨率游戏与独立模块训练不代表普遍开放环境控制。

证据定位

PDF §3表1、§4梦境实验及讨论。

Abstract · 英文原摘要

We explore building generative neural network models of popular reinforcement learning environments. Our world model can be trained quickly in an unsupervised manner to learn a compressed spatial and temporal representation of the environment. By using features extracted from the world model as inputs to an agent, we can train a very compact and simple policy that can solve the required task. We can even train our agent entirely inside of its own hallucinated dream generated by its world model, and transfer this policy back into the actual environment. An interactive version of this paper is available at https://worldmodels.github.io

版本指纹 b0c1e30aab53efd28ddf61d661f680150918d4d03b77bae62bc52d62dbd76cce

返回筛选与清单 ↑
P120 2018 Imagine This! Scripts to Compositions to Videos Tanmay Gupta; Dustin Schwenk; Ali Farhadi et al. CRAFT先从文本预测实体的时空布局,再检索视频实体片段并合成视频,利用组合式表示提高语义匹配和视觉一致性。 创作与规则补全世界机制与演化展开笔记
#P12022页 · 核对于 2026-09-15

中文摘要

CRAFT先从文本预测实体的时空布局,再检索视频实体片段并合成视频,利用组合式表示提高语义匹配和视觉一致性。

核心贡献

Composition/Retrieval/Fusion网络、布局与外观联合建模及超过25,000视频的Flintstones标注数据。

实现边界

主要动画域和已有视频片段重组,不能任意合成库中不存在的对象/运动;不同模块评测有使用前序真值布局/外观的条件。

Method · 方法

逐实体布局预测、联合文本/场景/位置检索,triplet与辅助分类学习检索空间,融合时空片段。

Results · 主要结果

在语义名词/形容词/动词召回、布局与人评视觉质量上优于直接像素生成基线;可组合未见描述并转移到无字幕视频库。

Shortcomings · 局限

【解读】依赖精细实体标注与候选片段覆盖,检索组合易产生接缝/动态不一致;动画证据不能外推写实长视频。

证据定位

PDF §3–5、表1–3与§5.3;ECVA用于会议信息。

Abstract · 英文原摘要

Imagining a scene described in natural language with realistic layout and appearance of entities is the ultimate test of spatial, visual, and semantic world knowledge. Towards this goal, we present the Composition, Retrieval and Fusion Network (Craft), a model capable of learning this knowledge from video-caption data and applying it while generating videos from novel captions. Craft explicitly predicts a temporal-layout of mentioned entities (characters and objects), retrieves spatio-temporal entity segments from a video database and fuses them to generate scene videos. Our contributions include sequential training of components of Craft while jointly modeling layout and appearances, and losses that encourage learning compositional representations for retrieval. We evaluate Craft on semantic fidelity to caption, composition consistency, and visual quality . Craft outperforms direct pixel generation approaches and generalizes well to unseen captions and to unseen video databases with no text annotations. We demonstrate Craft on Flintstones, a new richly annotated video-caption dataset with over 25000 videos. For a glimpse of videos generated by Craft, see https://youtu.be/688Vv86n0z8.

版本指纹 aeae85082dd70d12d6744a5045231e6a74fa98947a26e4fc29249b04339f83e9

返回筛选与清单 ↑
P119 2025 Reasoning Models Know When They’re Right: Probing Hidden States for Self-Verification Anqi Zhang; Yulin Chen; Jane Pan et al. 训练隐状态探针识别中间答案正确性,发现答案形成前已有可预测信号,并用高置信提前结束降低过度推理。 XR与人机协作AI方法与评测展开笔记
#P11918页 · 核对于 2026-09-15

中文摘要

训练隐状态探针识别中间答案正确性,发现答案形成前已有可预测信号,并用高置信提前结束降低过度推理。

核心贡献

中间/未来答案正确性探测、校准分析和动态早退出。

实现边界

需要带正确性标签训练探针、访问隐状态;标题“知道”指可解码统计信号,并非意识或无监督自证。

Method · 方法

收集中间答案隐状态与标签,训练MLP探针,验证集调参/校准,推理中达到阈值时退出并输出答案。

Results · 主要结果

阈值0.85约节省24%token,准确率88.2对不退出88.6%,是近似保持并非完全相等;0.9阈值节省19%,准确率同为88.6%;同预算胜固定退出约5个百分点。

Shortcomings · 局限

【解读】探针迁移/校准可能随模型任务改变;阈值越低越可能提前接受错误,token减少不必然线性缩短端到端延迟。

证据定位

PDF §3–5、§5.2 p.8、图5。

Abstract · 英文原摘要

Reasoning models have achieved remarkable performance on tasks like math and logical reasoning thanks to their ability to search during reasoning. However, they still suffer from overthinking, often performing unnecessary reasoning steps even after reaching the correct answer. This raises the question: can models evaluate the correctness of their intermediate answers during reasoning? In this work, we study whether reasoning models encode information about answer correctness through probing the model’s hidden states. The resulting probe can verify intermediate answers with high accuracy and produces highly calibrated scores. Additionally, we find models’ hidden states encode correctness of future answers, enabling early prediction of the correctness before the intermediate answer is fully formulated. We then use the probe as a verifier to decide whether to exit reasoning at intermediate answers during inference, reducing the number of inference tokens by 24% without compromising performance. These findings confirm that reasoning models do encode a notion of correctness yet fail to exploit it, revealing substantial untapped potential to enhance their efficiency.

版本指纹 c32a216f1eb0d49db8a1c6873e465b0a52e3c67fb15dc3961361cc6edf700504

返回筛选与清单 ↑
P118 2024 Calibrating Reasoning in Language Models with Internal Consistency Zhihui Xie; Jizhou Guo; Tong Yu et al. 解码中间层对答案的潜在预测,以层间一致性衡量置信度,并优先选择内部更一致的推理路径。 XR与人机协作AI方法与评测展开笔记
#P11823页 · 核对于 2026-09-15

中文摘要

解码中间层对答案的潜在预测,以层间一致性衡量置信度,并优先选择内部更一致的推理路径。

核心贡献

Internal consistency无需训练置信信号、推理路径加权与attention/FFN跨层分析。

实现边界

需要隐状态访问和可定义答案的任务;内部一致不保证正确,也不是标准概率意义的普遍校准保证。

Method · 方法

用中间层潜预测与末层比较,计算一致性;对多条CoT/L2M路径加权,提高更可信答案的权重。

Results · 主要结果

跨模型/数据发现错误CoT常有更低内部一致性,加权后推理表现改善;实验使用二分类50/50平衡的calibrated accuracy,不能当作原始类别比例下准确率。

Shortcomings · 局限

【作者】主要decoder-only、基础CoT,其他架构/推理方式待扩展;【解读】需要多路径采样,任务格式及层选择影响可靠性。

证据定位

PDF §3–4、§4.1–3、§6 p.10。

Abstract · 英文原摘要

Large language models (LLMs) have demonstrated impressive capabilities in various reasoning tasks, aided by techniques like chain-of-thought prompting that elicits verbalized reasoning. However, LLMs often generate text with obvious mistakes and contradictions, raising doubts about their ability to robustly process and utilize generated rationales. In this work, we investigate reasoning in LLMs through the lens of internal representations, focusing on how these representations are influenced by generated rationales. Our preliminary analysis reveals that while generated rationales improve answer accuracy, inconsistencies emerge between the model’s internal representations in middle layers and those in final layers, potentially undermining the reliability of their reasoning processes. To address this, we propose internal consistency as a measure of the model’s confidence by examining the agreement of latent predictions decoded from intermediate layers. Extensive empirical studies across different models and datasets demonstrate that internal consistency effectively distinguishes between correct and incorrect reasoning paths. Motivated by this, we propose a new approach to calibrate reasoning by up-weighting reasoning paths with high internal consistency, resulting in a significant boost in reasoning performance. Further analysis uncovers distinct patterns in attention and feed-forward modules across layers, providing insights into the emergence of internal inconsistency. In summary, our results demonstrate the potential of using internal representations for self-evaluation of LLMs. Our code is available at github.com/zhxieml/internal-consistency.

版本指纹 ab6abe3fc5cdc39c45c1f877d6426ca7303d79f918e3f8d84f9ca2e84d783661

返回筛选与清单 ↑
P117 2025 Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Zhoujun Cheng; Shibo Hao; Tianyang Liu et al. 构建92K条六域可验证推理数据GURU,研究RL跨域迁移及难度影响,并训练7B/32B多域推理模型。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P11721页 · 核对于 2026-09-15

中文摘要

构建92K条六域可验证推理数据GURU,研究RL跨域迁移及难度影响,并训练7B/32B多域推理模型。

核心贡献

数学、代码、科学、逻辑、仿真、表格数据与验证器,跨域训练分析和17任务评估套件。

实现边界

只覆盖可构造验证奖励的领域;混合训练并非每项都优于专用模型,难源域还可能负迁移到简单任务。

Method · 方法

来源清洗去重、领域/难度过滤,Qwen2.5-Base上GRPO训练,控制域混合和难度研究迁移。

Results · 主要结果

表3平均GURU7B41.17对ORZ7B33.90(+7.27);32B52.68对ORZ46.95(+5.73)。32B AIME24为32.29,低于ORZ47.50,说明总体更均衡不等于数学全面领先。

Shortcomings · 局限

【解读】任务平均权重、验证器可靠性和混合比例影响结论,数据规模/在线混合未充分研究;摘要提升数值存在口径冲突。

证据定位

PDF §2–4、表3 p.8、§6。

Abstract · 英文原摘要

Reinforcement learning (RL) has shown promise in enhancing large language model (LLM) reasoning, yet progress towards broader capabilities is limited by the availability of high-quality, multi-domain datasets. This work introduces GURU, a 92K RL-for-reasoning dataset designed to address this gap, covering six reasoning domains: Math, Code, Science, Logic, Simulation, and Tabular, each with corresponding verifiers. We build GURU via a careful data-curation pipeline, including sourcing, deduplication, reward design, and domain-specific and difficulty-based filtering. With GURU, we present a systematic investigation of cross-domain RL generalization, and reveal several key aspects affecting crossdomain transferability. We further train two models GURU-7B and GURU-32B purely with RL on our curated data and observe largely improved performance over leading open RL reasoning model baselines, with gains of 7.3% and 7.8% respectively on an extensive 17-task, six-domain evaluation suite. We are releasing our dataset, code, and evaluation suite to the community, aiming to support further research and development of more general RL-enhanced reasoning models.

版本指纹 47973c5ee52be94e5c210f58fa1f1df7f9a775538d9752decff760f7ba8d31e5

返回筛选与清单 ↑
P116 2025 Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought Hanlin Zhu; Shibo Hao; Zhiting Hu et al. 构造两层Transformer在连续CoT中并行编码多个搜索前沿,以图直径D步解决有向图可达,并用训练实验观察相似潜表示。 世界机制与演化AI方法与评测展开笔记
#P11633页 · 核对于 2026-09-15

中文摘要

构造两层Transformer在连续CoT中并行编码多个搜索前沿,以图直径D步解决有向图可达,并用训练实验观察相似潜表示。

核心贡献

连续thought并行BFS的表达能力构造及经验对应分析。

实现边界

与离散CoT的O(n²)是对比已有最好构造,不是已证明离散CoT必需Ω(n²);严格分离的下界明确留作未来。

Method · 方法

在连续向量中叠加搜索前沿,用两层注意力迭代扩展;ProsQA合成子集上课程训练与潜态/注意力分析。

Results · 主要结果

2层Coconut在所评ProsQA接近满分,CoT/无CoT约75%,12层CoT约83%;理论需D个连续步骤,条件和数值精度按构造。

Shortcomings · 局限

【作者/解读】离散CoT下界未建立,结论局限图可达和构造假设;训练动力学与更广任务的充分解释仍需研究(P113进一步分析)。

证据定位

PDF 定理及§3–4、§5图4、§6 p.10。

Abstract · 英文原摘要

Large Language Models (LLMs) have demonstrated remarkable performance in many applications, including challenging reasoning problems via chain-ofthought (CoT) techniques that generate “thinking tokens” before answering the questions. While existing theoretical works demonstrate that CoT with discrete tokens boosts the capability of LLMs, recent work on continuous CoT lacks a theoretical understanding of why it outperforms discrete counterparts in various reasoning tasks, such as directed graph reachability, a fundamental graph reasoning problem that includes many practical domain applications as special cases. In this paper, we prove that a two-layer transformer with D steps of continuous CoT can solve the directed graph reachability problem, whereD is the diameter of the graph, while the best known result of constant-depth transformers with discrete CoT requires O(n2) decoding steps where n is the number of vertices (D < n). In our construction, each continuous thought vector is a superposition state that encodes multiple search frontiers simultaneously (i.e., parallel breadth-first search (BFS)), while discrete CoT must choose a single path sampled from the superposition state, which leads to a sequential search that requires many more steps and may be trapped in local solutions. We also performed extensive experiments to verify that our theoretical construction aligns well with the empirical solution obtained via training dynamics. Notably, encoding of multiple search frontiers as a superposition state automatically emerges in training continuous CoT, without explicit supervision to guide the model to explore multiple paths simultaneously. Our code is available at https://github.com/Ber666/reasoning-by-superposition .

版本指纹 d40150700bdbfbb721e65bc728c473fc266d716cba5479f5e1387d5a88870849

返回筛选与清单 ↑
P115 2023 ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings Shibo Hao; Tianyang Liu; Zhen Wang et al. 把工具当作词表里的特殊token,仅学习工具embedding,使冻结LLM能选择大量工具,再通过提示生成参数并执行。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P11525页 · 核对于 2026-09-15

中文摘要

把工具当作词表里的特殊token,仅学习工具embedding,使冻结LLM能选择大量工具,再通过提示生成参数并执行。

核心贡献

toolken表示及低参数工具学习,支持扩展工具集合并利用示范数据。

实现边界

冻结骨干不等于无训练;每个新工具仍需embedding学习/示范,参数生成及执行错误未被消除。

Method · 方法

把工具embedding矩阵拼到输出词表,联合选择文字/工具;触发工具后切参数提示,执行结果回填上下文。

Results · 主要结果

GSM8K-XL(568题)ToolkenGPT33%对ReAct32%;FuncQA13工具单跳73%对57%,多跳15%对6%,多跳绝对成功率仍低;另有知识库与具身规划实验。

Shortcomings · 局限

【解读】工具数量扩展的选择质量依赖演示分布,复杂组合与参数泛化困难;不是任意未知工具零样本使用保证。

证据定位

PDF §3–4、表2 p.6、§5。

Abstract · 英文原摘要

Augmenting large language models (LLMs) with external tools has emerged as a promising approach to solving complex problems. However, traditional methods, which fine-tune LLMs with tool demonstration data, can be both costly and restricted to a predefined set of tools. Recent in-context learning paradigm alleviates these issues, but the limited context length only allows for a few shots of demonstrations, leading to suboptimal understandings of the tools. Moreover, when there are numerous tools to choose from, in-context learning could completely fail to work. In this paper, we propose an alternative approach, ToolkenGPT, which combines the benefits of both sides. Our approach represents each tool as a token (“toolken”) and learns an embedding for it, enabling tool calls in the same way as generating a regular word token. Once a toolken is triggered, the LLM is prompted to complete arguments for the tool to execute. ToolkenGPT offers the flexibility to plug in an arbitrary number of tools by expanding the set of toolkens on the fly. In addition, it improves tool use by allowing extensive demonstration data for learning the toolken embeddings. In diverse domains, including numerical reasoning, knowledge-based question answering, and embodied plan generation, our approach effectively augments LLMs with tools and substantially outperforms various latest baselines. ToolkenGPT demonstrates the promising ability to use relevant tools from a large tool set in complex scenarios.1

版本指纹 052e79422c205ba6f4155a8f06c22ad1766da376e8077be3a75cf45c7efe88e3

返回筛选与清单 ↑
P114 2026 / 2025 LLM Pretraining with Continuous Concepts Jihoon Tack; Jack Lanchantin; Jane Yu et al. CoCoMix在下一token预训练之外预测来自稀疏自编码器的连续概念,并与token表示交错输入,以提高样本效率及一定程度的可控性。 世界机制与演化AI方法与评测展开笔记
#P11417页 · 核对于 2026-09-15

中文摘要

CoCoMix在下一token预训练之外预测来自稀疏自编码器的连续概念,并与token表示交错输入,以提高样本效率及一定程度的可控性。

核心贡献

连续概念预测+混合的端到端预训练方案,比较NTP、蒸馏和pause tokens。

实现边界

需要预训练模型/SAE提供概念目标;概念可解释性依赖SAE,不能保证全模型透明;主要模型规模69M–1.38B。

Method · 方法

从教师隐状态经SAE提取稀疏概念,学生同时预测token和概念,将压缩概念向量插入隐状态流。

Results · 主要结果

200B token实验中1.38B模型平均下游准确率49.7对NTP48.7、KD49.1%;报告达到NTP同等性能所需token减少21.5%;124M概念教师也可帮助更大模型。

Shortcomings · 局限

【解读】总体提升温和且不保证逐任务领先;教师概念提取有额外成本,token节省不直接等于总训练算力同比下降。

证据定位

PDF §2–3、表1 p.6、§5;首页日期。

Abstract · 英文原摘要

Next token prediction has been the standard training objective used in large language model pretraining. Representations are learned as a result of optimizing for token-level perplexity. We propose Continuous Concept Mixing (CoCoMix), a novel pretraining framework that combines discrete next token prediction with continuous concepts. Specifically, CoCoMix predicts “continuous concepts” learned from a pretrained sparse autoencoder and mixes them into the model’s hidden state by interleaving with token hidden representations. Through experiments on multiple benchmarks, including language modeling and downstream reasoning tasks, we show that CoCoMix is more sample efficient and consistently outperforms standard next token prediction, knowledge distillation and inserting pause tokens. We find that combining both concept learning and interleaving in an end-to-end framework is critical to performance gains. Furthermore, CoCoMix enhances interpretability and steerability by allowing direct inspection and modification of the predicted concept, offering a transparent way to guide the model’s internal reasoning process.

版本指纹 02442c5e0d6a0156893b45222b6d2ce4089a8eb5414986bac6760a7f82781f59

返回筛选与清单 ↑
P113 2026 Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought Hanlin Zhu; Shibo Hao; Zhiting Hu et al. 分析连续CoT隐式并行搜索如何在训练中形成,针对简化两层Transformer的有向图可达任务刻画关键注意力logit动态。 世界机制与演化AI方法与评测展开笔记
#P11332页 · 核对于 2026-09-15

中文摘要

分析连续CoT隐式并行搜索如何在训练中形成,针对简化两层Transformer的有向图可达任务刻画关键注意力logit动态。

核心贡献

在思考生成和答案预测两阶段分析index-matching logit先增长再有界,从而保留多个可能前沿的理论机制。

实现边界

定理依赖简化两层模型、任务结构与对称等假设,不适用于任意大模型训练;superposition是向量多路径编码,不是量子计算。

Method · 方法

推导梯度训练下局部搜索logit变化,用课程训练跟踪注意力及潜状态,检验理论预测。

Results · 主要结果

受控图任务测试准确率96.2%,训练logit轨迹与有界假设一致;部分候选提升通路随设置/随机种子改变,并不总经同一<R> token。

Shortcomings · 局限

【解读】简化参数化和合成图数据限制一般性,多层大模型、预训练/不同优化器的机制仍需检验。

证据定位

PDF §3–5、§5训练细节p.9、§6及附录E。

Abstract · 英文原摘要

Previous work shows that the chain of continuous thought (continuous CoT) improves the reasoning capability of large language models (LLMs) by enabling implicit parallel thinking, and a subsequent work provided theoretical insight by showing that a two-layer transformer equipped with continuous CoT can efficiently solve directed graph reachability by maintaining a superposition of multiple reasoning traces in the continuous thought. However, it remains unclear how the superposition mechanism is naturally learned from gradient-based training methods. To fill this gap, we theoretically analyze the training dynamics of a simplified two-layer transformer on the directed graph reachability problem to unveil how the superposition mechanism emerges during training in two training stages – (i) athought-generationstage that autoregressively expands the continuous thought, and (ii) apredictionstage that converts the thought into the final answer. Our analysis reveals that during training using continuous thought, the index-matching logit, an important quantity which reflects the strength of the model’s local search ability, will first increase and then remain bounded under mild assumptions. The bounded index-matching logit effectively balances exploration and exploitation during the reasoning process: the model will exploit local problem structures to identify plausible search traces, and assign comparable weights to multiple such traces to explore when it is uncertain about which solution is correct, which results in superposition. Our experimental results tracking the growth of logits further validate our theory.

版本指纹 0618e8beba581d69a8b8483fc36d8930855935373137d66090116eebb07bb01e

返回筛选与清单 ↑
P112 2026 Vision-G1: Towards General Reasoning Vision-Language Models via Reinforcement Learning Yuheng Zha, Kun Zhou, Yujia Wu, Yushu Wang, Jie Feng, Zhi Xu, Shibo Hao, Zhengzhong Liu, Eric P. Xing, Zhiting Hu 汇集多域视觉推理可验证奖励数据,结合影响函数筛选与难度课程,多轮RL训练通用视觉推理模型。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P1129页 · 核对于 2026-09-15

中文摘要

汇集多域视觉推理可验证奖励数据,结合影响函数筛选与难度课程,多轮RL训练通用视觉推理模型。

核心贡献

46数据集、5域13维度的RL-ready数据及Vision-G1-7B训练方案。

实现边界

“general”限于涵盖的图像任务;视频和3D是未来方向;正文对评测数量有9/18/17三种表述,按具体表格任务阅读。

Method · 方法

统一题目/奖励格式,影响函数过滤低价值样本,再按中等难度及类别平衡进行多轮GRPO。

Results · 主要结果

数学表2平均42.1%,基础Qwen2.5VL-7B39.0,但Vision-R1-7B42.5%、GPT4o45.7%更高;因此不能将摘要领先描述套到每个数学指标。跨综合/专业任务另有收益。

Shortcomings · 局限

【作者/解读】数据/奖励质量、任务均衡及影响近似影响结果;数据混合收益不等于全面推理泛化,需防跨基准数据重叠。

证据定位

PDF Approach、Main Results、表1–3、Conclusion p.7;指标例外见表2。

Abstract · 英文原摘要

Recent vision-language models (VLMs) show strong reasoning capabilities through training with reinforcement learning from verifiable rewards (RLVR). Despite their impressive capabilities, current VLMs focus on a limited range of reasoning tasks, such as mathematical and logical reasoning, due to the lack of readily available verifiable reward data in broader domains. As a result, these models struggle to generalize their reasoning abilities to the wide variety of challenges encountered in real-world environments. To address this limitation, we collect and assemble a comprehensive RL-ready visual reasoning training dataset encompassing 46 datasets across 13 dimensions of 5 domains, covering a wide range of realistic scenarios such as infographic reasoning, mathematical reasoning, spatial reasoning, and general science reasoning. Based on this dataset, we propose an influence function-based data filtering strategy and a multi-round data curriculum method to iteratively strengthen general visual reasoning abilities. Using this approach, we train a general reasoning VLM, namely Vision-G1. Our 7B model achieves state-of-the-art performance across nine visual reasoning benchmarks, surpassing similar-sized VLMs and even GPT-4o and Gemini-1.5 Flash. Code — https://github.com/yuh-zha/Vision-G1

版本指纹 244c5846a1bf20d1a4a57c0c793e431a075dbeaa5279de26c5b3664d63cb9753

返回筛选与清单 ↑
P111 2026 CocoaBench: Evaluating Unified Digital Agents in the Wild CocoaBench Team; Shibo Hao; Zhining Zhang et al. 用同时需要视觉、搜索和编程的长流程任务评估统一数字代理,以最终输出自动评测,并提供轻量共享Cocoa-Agent框架。 XR与人机协作展开笔记
#P11126页 · 核对于 2026-09-15

中文摘要

用同时需要视觉、搜索和编程的长流程任务评估统一数字代理,以最终输出自动评测,并提供轻量共享Cocoa-Agent框架。

核心贡献

CocoaBench跨能力组合任务及控制模型骨干差异的统一实验支架。

实现边界

完整代理系统和共享框架的成绩不可混为纯模型能力;“in the wild”仍是人工设计、有自动验证器的任务样本。

Method · 方法

只给任务说明,以最终产物函数判定成功;分别测完整系统和相同Cocoa-Agent下的模型,分析规划/执行/视觉错误。

Results · 主要结果

GPT5.4在Codex/OpenClaw中45.1%,共享Cocoa-Agent36.6%;ClaudeSonnet4.6在OpenClaw34.0%、ClaudeCode25.5%、Cocoa-Agent15.7%,显示框架影响显著。

Shortcomings · 局限

【解读】评估函数覆盖范围、基础设施与外部环境变化影响可复现性,成功率不能代替所有产物质量;所测任务离可靠全能代理仍有差距。

证据定位

PDF §3–5、图4、§6。

Abstract · 英文原摘要

LLM agents now perform strongly in software engineering, deep research, GUI automation, and various other applications, while recent agent scaffolds and models are increasingly integrating these capabilities into unified systems. Yet, most evaluations still test these capabilities in isolation, which leaves a gap for more diverse use cases that require agents to combine different capabilities. We introduce COCOABENCH, a benchmark for unified digital agents built from human-designed, long-horizon tasks that require flexible composition ofvision,search, andcoding. Tasks are specified only by an instruction and an automatic evaluation function over the final output, enabling reliable and scalable evaluation across diverse agent infrastructures. We also present COCOA-AGENT, a lightweight shared scaffold for controlled comparison across model backbones. Experiments show that current agents remain far from reliable on COCOABENCH, with the best evaluated system achieving only 45.1% success rate. Our analysis further points to substantial room for improvement in reasoning and planning, tool use and execution, and visual grounding.1

版本指纹 2832e5b0a617129a2f6de538b03da95a3b71e29e4f4d9fdce9996040d7423fe4

返回筛选与清单 ↑
P110 2025 Understanding the Sources of Uncertainty for Large Language and Multimodal Models Ziran Yang; Shibo Hao; Hao Sun et al. 将模型输出不确定性按提示措辞、上下文和视觉预处理等因素分解,识别与错误率更相关的分量以用于幻觉检测和自训练筛选。 XR与人机协作AI方法与评测展开笔记
#P11020页 · 核对于 2026-09-15

中文摘要

将模型输出不确定性按提示措辞、上下文和视觉预处理等因素分解,识别与错误率更相关的分量以用于幻觉检测和自训练筛选。

核心贡献

超出传统epistemic/aleatoric二分的信息论分解框架及effective calibrator概念。

实现边界

分量含义依赖选定扰动因素与采样分布;与错误相关不意味着识别真正因果来源,也不保证概率校准。

Method · 方法

用条件熵与互信息逐层分解总熵,对提示/输入变体采样,比较分量与错误关联;用于VQA及SVAMP自训练。

Results · 主要结果

部分分量比总不确定性更能指示幻觉;在视觉QA和数学推理展示检测/筛选收益;SVAMP采用Gemma2-9B、6种实体改写和6种CoT模板,结论受该扰动空间约束。

Shortcomings · 局限

【解读】需多次查询和语义等价改写,改写错误可污染分解;有效分量跨域/模型是否稳定尚无通用保证。

证据定位

PDF §2、表1、§3–4 pp.6–9。

Abstract · 英文原摘要

Understanding and quantifying uncertainty in large model predictions is critical for their safe and trustworthy deployment. However, existing methods that estimate the overall prediction uncertainty often fail due to miscalibration like model overconfidence. Uncertainty decomposition provides a way to focus on some specific parts in total uncertainty, removing those unrelated components. Traditional uncertainty decomposition into epistemic (model-related) and aleatoric (data-related) components is insufficient for current model usage, as additional factors like prompt phrasing and context significantly influence the model’s predictions and add the source of uncertainty. We introduce a unified uncertainty decomposition framework that systematically separates uncertainty contributed by various factors such as prompting, context, and preprocessing of multimodal inputs. By quantifying each component’s uncertainty, our approach identifies which uncertainty terms are well-correlated with the model’s hallucination rates, thereby enhancing hallucination detection and model improvement. We validate our framework through applications in visual question answering and math reasoning, demonstrating that effective uncertainty components can serve as metrics for hallucination detection and improve model performance through self-training. Grounded in information theory and highly extensible, our framework provides a novel perspective on uncertainty decomposition in large language and multimodal models, offering valuable insights for future research.

版本指纹 2cd60cc497dacba53d97c7c56ccb153e879d408445af64b57ed24429940e268c

返回筛选与清单 ↑
P108 未注明(匿名稿) Flow of Reasoning: Training LLMs for Divergent Problem Solving with Minimal Examples Anonymous authors(本地双盲稿) 用GFlowNet式训练让LLM按奖励比例采样不同有效推理路径,在少量问题示例下同时提高正确性和解法多样性。 世界机制与演化AI方法与评测展开笔记
#P10832页 · 核对于 2026-09-15

中文摘要

用GFlowNet式训练让LLM按奖励比例采样不同有效推理路径,在少量问题示例下同时提高正确性和解法多样性。

核心贡献

Flow of Reasoning(FOR)把多步推理表示为DAG上的概率流,优化多样高奖励轨迹。

实现边界

“15示例”是部分任务的问题数,不代表只有15次训练交互;依赖任务奖励/模拟器,创造性是任务定义的解法多样性指标。

Method · 方法

以Markov推理状态与路径奖励构造流匹配/轨迹训练,从有限问题反复探索高质量路径并微调LLM。

Results · 主要结果

五类谜题评测;Rubik四步183题、15训练示例时FOR准确率10.87±1.18%,SFT1.82%,XoT4.92%;FOR多样性1.29、创造性82.61%。Game24仍落后GPT4o/o1-mini等更强基础模型。

Shortcomings · 局限

【解读】奖励设计和有限可验证环境限制一般开放创意任务;魔方绝对成功率仍低,更多样不等同更正确或更有实际创新价值。

证据定位

PDF §3–4、表1–3、§4.4 p.8。

Abstract · 英文原摘要

The ability to generate diverse solutions to a given problem is a hallmark of human creativity. This divergent reasoning is also crucial for machines, enhancing their robustness and enabling them to assist humans in many applications such as scientific discovery. However, existing approaches to multi-step reasoning with large language models (LLMs) have mostly focused only on reasoning accuracy, without further discovering more diverse valid solutions. For example, supervised fine-tuning can improve LLM reasoning quality, but requires extensive supervised data to capture the full range of possible solutions. Reinforcement learning aims to find limited highest-reward solutions while neglecting the solution diversity. To fill this gap, we propose Flow of Reasoning (FOR), an efficient diversity-seeking LLM finetuning method aimed at improving reasoning quality and diversity with minimal data. FOR formulates multi-step LLM reasoning as a Markovian flow on a DAG-structured reasoning graph. This formulation allows us to incorporate and adapt principled GFlowNet approaches, for finetuning LLMs to sample diverse reasoning paths with probabilities proportional to the (unnormalized) reward of target problems. Extensive experiments show that, with limited training examples (e.g., 15 examples), FOR enables the discovery of diverse, creative, high-quality solutions, greatly outperforming a wide range of existing inference and training methods across five challenging puzzle-solving tasks, including BlocksWorld (embodied reasoning), Game24 (math puzzle solving), Rubik’s Cube (spatial reasoning), 1D-ARC (abstraction reasoning), and PrOntoQA (logical reasoning).

版本指纹 938263956875f85c04bb18094173c51bb5da27b8f308b3a4ccec5dc96e60e47b

返回筛选与清单 ↑
P107 2025 Offline Reinforcement Learning for LLM Multi-step Reasoning Huaijie Wang; Shibo Hao; Hanze Dong et al. OREO用离线轨迹联合学习策略与价值函数,以soft Bellman方程进行细粒度信用分配,减少对成对偏好数据的依赖。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P10713页 · 核对于 2026-09-15

中文摘要

OREO用离线轨迹联合学习策略与价值函数,以soft Bellman方程进行细粒度信用分配,减少对成对偏好数据的依赖。

核心贡献

离线推理优化目标,可复用学到的价值函数指导测试时树搜索。

实现边界

不需要偏好对不等于不需要带奖励数据;价值模型可直接复用不代表搜索没有额外算力成本。

Method · 方法

最大熵RL下优化策略/价值的Bellman一致性,支持token或响应层次目标、迭代数据更新和价值引导搜索。

Results · 主要结果

Qwen1.5B GSM8K77.3%、MATH52.5%,SFT73.5/47.5;DeepSeekMath7B85.9/49.2;ALFWorld unseen79.1%、seen80.7%,SFT67.2/62.9。

Shortcomings · 局限

【作者】部分消融/搜索仅1.5B,任务主要数学与ALFWorld,代码/浏览待验证;【解读】离线分布覆盖与价值误差会限制策略改进。

证据定位

PDF §3–5、表1–2 p.7、§7 p.9。

Abstract · 英文原摘要

Improving the multi-step reasoning ability of large language models (LLMs) with offline reinforcement learning (RL) is essential for quickly adapting them to complex tasks. While Direct Preference Optimization (DPO) has shown promise in aligning LLMs with human preferences, it is less suitable for multi-step reasoning tasks because (1) DPO relies on paired preference data, which is not readily available for multi-step reasoning tasks, and (2) it treats all tokens uniformly, making it ineffective for credit assignment in multi-step reasoning tasks, which often come with sparse reward. In this work, we propose OREO (Offline REasoning Optimization), an offline RL method for enhancing LLM multi-step reasoning. Building on insights from previous works of maximum entropy reinforcement learning, it jointly learns a policy model and value function by optimizing the soft Bellman Equation. We show in principle that it reduces the need to collect pairwise data and enables better credit assignment. Empirically, OREO surpasses existing offline learning methods on multi-step reasoning benchmarks, including mathematical reasoning tasks (GSM8K, MATH), and embodied agent control (ALFWorld). The approach can be extended to a multi-iteration framework when additional resources are available. Furthermore, the learned value function can be leveraged to guide the tree search for free, which can further boost the performance during test time.

版本指纹 54bc06c0e9082ca1d952447839dd3ba3a39d109632f75bd5f0e1b4818d9458b2

返回筛选与清单 ↑
P106 待核实 Pandora: Towards General World Model with Natural Language Actions and Video States Jiannan Xiang; Guangyi Liu; Yi Gu et al. 把语言自回归模型与视频扩散生成器结合,按自由文本动作连续生成下一段世界状态视频。 世界机制与演化展开笔记
#P10621页 · 核对于 2026-09-15

中文摘要

把语言自回归模型与视频扩散生成器结合,按自由文本动作连续生成下一段世界状态视频。

核心贡献

混合自回归—扩散架构与复用预训练模型的分阶段对齐/指令微调。

实现边界

世界状态为视频片段,动作跟随和物理一致性可能失败;通用世界模型是目标,“实时控制”不等于每帧物理实时仿真。

Method · 方法

Vicuna7B接收历史视觉状态与动作,输出条件embedding供DynamiCrafter生成下一段,额外使用上一段末4帧维持连续性。

Results · 主要结果

展示室内外、人类/机器人、2D/3D等跨域可控生成;扩大训练规模后动作跟随改善;§3.4明确展示语义、运动、常识和时序一致性失败。

Shortcomings · 局限

【作者】公共视频字幕噪声影响控制,高质量仿真数据域更容易;【解读】主要视觉演示不能证明长程决策可靠性,后续大模型扩展仍为设想。

证据定位

PDF §2、§3示例与§3.4 p.14、§5。

Abstract · 英文原摘要

World models simulate future states of the world in response to different actions. They facilitate interactive content creation and provides a foundation for grounded, long-horizon reasoning. Current foundation models do not fully meet the capabilities of general world models: large language models (LLMs) are constrained by their reliance on language modality and their limited understanding of the physical world, while video models lack interactive action control over the world simulations. This paper makes a step towards building a general world model by introducing Pandora , a hybrid autoregressive-diffusion model that simulates world states by generating videos and allows real-time control with free-text actions. Pandora achieves domain generality, video consistency, and controllability through large-scale pretraining and instruction tuning. Crucially, Pandora bypasses the cost of training-from-scratch by integrating a pretrained LLM (7B) and a pretrained video model, requiring only additional lightweight finetuning. We illustrate extensive outputs by Pandora across diverse domains (indoor/outdoor, natural/urban, human/robot, 2D/3D, etc.). The results indicate great potential of building stronger general world models with larger-scale training.

版本指纹 11a16778bc562baf9abab2aa90a8b8b32c0827fa034d9510da76779a515c401d

返回筛选与清单 ↑
P105 2024 New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models Shibo Hao; Yi Gu; Haotian Luo et al. 提出自动生成任务特定评价标准的AutoRace与统一搜索、奖励、世界模型组件的LLM Reasoners库,系统比较多步推理策略。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P10524页 · 核对于 2026-09-15

中文摘要

提出自动生成任务特定评价标准的AutoRace与统一搜索、奖励、世界模型组件的LLM Reasoners库,系统比较多步推理策略。

核心贡献

推理链自动评测、模块化库与搜索因素实验分析。

实现边界

AutoRace以GPT4为评判者,自动不等于无误;评判是否符合标准,不保证推理链忠实反映内部过程。

Method · 方法

自动归纳任务错误/规则形成rubric,再评估链;将CoT、ToT、RAP统一为搜索/奖励/转移,研究宽度、深度和提示。

Results · 主要结果

6任务推理链评判平均准确率0.86,SocREval0.82、直接整链判断0.56;搜索奖励可减少“答案对但推理错”,部分任务广度优于深度。

Shortcomings · 局限

【解读】评判依赖GPT4及自动rubric质量,搜索比较受预算与提示影响;结论依任务,不能证明所有场景BFS或RAP最优。

证据定位

PDF §3–5、表1 p.5、§5.2 p.10。

Abstract · 英文原摘要

Generating accurate step-by-step reasoning is essential for Large Language Models (LLMs) to address complex problems and enhance robustness and interpretability. Despite the flux of research on developing advanced reasoning approaches, systematically analyzing the diverse LLMs and reasoning strategies in generating reasoning chains remains a significant challenge. The difficulties stem from the lack of two key elements: (1) an automatic method for evaluating the generated reasoning chains on different tasks, and (2) a unified formalism and implementation of the diverse reasoning approaches for systematic comparison. This paper aims to close the gap: (1) We introduceAutoRace for fully automated reasoning chain evaluation. Existing metrics rely on expensive human annotations or pre-defined LLM prompts not adaptable to different tasks. In contrast, AutoRace automatically creates detailed evaluation criteria tailored for each task, and uses GPT-4 for accurate evaluation following the criteria. (2) We developLLM Reasoners, a library for standardized modular implementation of existing and new reasoning algorithms, under a unified formulation of the search, reward and world model components. With the new evaluation and library, (3) we conduct extensive study of different reasoning approaches (e.g., CoT, ToT, RAP). The analysis reveals interesting findings about different factors contributing to reasoning, including the reward-guidance, breadth-vs-depth in search, world model, and prompt formats, etc.

版本指纹 e76d095d0dd17d3c7c502650e2f93035e3bc9f9a914df1c72075b73cd9a35f32

返回筛选与清单 ↑
P104 2023 Reasoning with Language Model is Planning with World Model Shibo Hao; Yi Gu; Haodi Ma et al. RAP让LLM分别提出推理动作和预测状态变化,再用蒙特卡洛树搜索规划较高价值的推理路径。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P10420页 · 核对于 2026-09-15

中文摘要

RAP让LLM分别提出推理动作和预测状态变化,再用蒙特卡洛树搜索规划较高价值的推理路径。

核心贡献

统一推理为规划,将LLM世界模型和MCTS用于积木规划、数学及逻辑任务。

实现边界

世界模型是语言预测状态,不是真实环境模拟器;搜索增加多次模型调用,效果受转移/奖励错误限制。

Method · 方法

定义状态、动作和奖励,MCTS选择/扩展/回传,LLM模拟后果并评估中间收益,输出一个选定计划。

Results · 主要结果

Blocksworld RAP20在2/4/6步任务成功率1.00/0.88/0.42,GPT4-CoT0.50/0.63/0.40;6步优势很小,33%相对提升是特定汇总口径,不代表每项。

Shortcomings · 局限

【作者】冻结模型受预训练能力限制;【解读】搜索预算、任务特定提示/奖励及不可靠状态预测影响扩展到开放现实问题。

证据定位

PDF §2–4、表1、Limitations p.10。

Abstract · 英文原摘要

Large language models (LLMs) have shown remarkable reasoning capabilities, particularly with chain-of-thought (CoT) prompting. However, LLMs sometimes still struggle with problems that are easy for humans, such as generating action plans to achieve given goals in an environment, or performing complex math or logical reasoning. The deficiency stems from the key fact that LLMs lack an internal world model to predict the world state (e.g., environment status, intermediate variable values) and simulate long-term outcomes of actions. This prevents LLMs from performing deliberate planning akin to human brains, which involves exploring alternative reasoning paths, anticipating future states and rewards, and iteratively refining existing reasoning steps. To overcome the limitations, we propose a new LLM reasoning framework, Reasoning vi a Planning (RAP). RAP repurposes the LLM as both a world model and a reasoning agent, and incorporates a principled planning algorithm based on Monte Carlo Tree Search for strategic exploration in the vast reasoning space. During reasoning, the LLM (as agent) incrementally builds a reasoning tree under the guidance of the LLM (as world model) and rewards, and efficiently obtains a high-reward reasoning path with a proper balance between exploration vs. exploitation. We apply RAP to various challenging reasoning problems including plan generation, math reasoning, and logical inference, and demonstrate its superiority over strong baselines. RAP with LLaMA-33B even surpasses CoT with GPT-4, achieving 33% relative improvement in a plan generation setting.1

版本指纹 f67d075c889d885db80355f6d398fb2aa6830406340c365140e234af05056dc3

返回筛选与清单 ↑
P103 2025 Training Large Language Models to Reason in a Continuous Latent Space Shibo Hao; Sainbayar Sukhbaatar; DiJia Su; Xian Li; Zhiting Hu; Jason Weston; Yuandong Tian Coconut把LLM最后隐状态直接作为下一个输入embedding,在连续潜空间进行中间推理,以课程训练逐步取代文本CoT。 世界机制与演化AI方法与评测展开笔记
#P10318页 · 核对于 2026-09-15

中文摘要

Coconut把LLM最后隐状态直接作为下一个输入embedding,在连续潜空间进行中间推理,以课程训练逐步取代文本CoT。

核心贡献

Chain of Continuous Thought架构及课程,展示某些任务中潜状态可同时容纳备选路径的行为。

实现边界

以小模型和合成逻辑/数学任务验证,潜状态类似BFS的观察不等于通用、严格或无限宽搜索;数学表现仍低于文本CoT。

Method · 方法

逐阶段用连续thought替代更多文本步骤,回馈隐状态,再生成文字答案;比较无CoT、iCoT、pause token等。

Results · 主要结果

表1 GSM8K34.1±1.5%对CoT42.9±0.2%,但高于无CoT16.5%;ProsQA97.0对CoT77.5,仍低于iCoT98.2;GSM8K平均生成位置8.2对25.0(包含潜步骤的效率定义须遵循论文)。

Shortcomings · 局限

【作者/解读】课程与已有CoT监督重要、规模和任务有限,难解释/检查潜过程;减少显式token不自动等于同比例实际速度提升。

证据定位

PDF §3–5、表1 p.9、§5.3–6。

Abstract · 英文原摘要

Large language models (LLMs) are restricted to reason in the “language space”, where they typically express the reasoning process with a chain-of-thought (CoT) to solve a complex reasoning problem. However, we argue that language space may not always be optimal for reasoning. For example, most word tokens primarily ensure textual coherence and are not essential for reasoning, while some critical tokens require complex planning and pose huge challenges to LLMs. To explore the potential of LLM reasoning in an unrestricted latent space instead of using natural language, we introduce a new paradigm Coconut (Chain of Continuous Thought). We utilize the last hidden state of the LLM as a representation of the reasoning state (termed “continuous thought”). Rather than decoding this into a word token, we feed it back to the LLM as the subsequent input embedding directly in the continuous space. This latent reasoning paradigm leads to the emergence of an advanced reasoning pattern: the continuous thought can encode multiple alternative next reasoning steps, allowing the model to perform a breadth-first search (BFS) to solve the problem, rather than prematurely committing to a single deterministic path like CoT. Coconut outperforms CoT on certain logical reasoning tasks that require substantial search during planning, and shows a better trade-off between accuracy and efficiency.

版本指纹 6eb32c71eaa571b727ee95bce20396243fd70dc1ee8a37f91a7de717790d5b46

返回筛选与清单
P101 2022 Computational Understanding of Narratives: A Survey Priyanka Ranade; Sanorita Dey; Anupam Joshi et al. 综述叙事的计算理解,特别是在线多源碎片化叙事的构建、抽取、演化、生成、表示与评估。 创作与规则补全世界机制与演化展开笔记
#P10120页 · 核对于 2026-09-15

中文摘要

综述叙事的计算理解,特别是在线多源碎片化叙事的构建、抽取、演化、生成、表示与评估。

核心贡献

整理叙事结构组成、语义/时间关系和研究任务层次,汇集资源与开放挑战。

实现边界

综述及概念整理,不是统一实现系统;涵盖到2022年前后的技术,不能作为后续LLM叙事研究全景。

Method · 方法

围绕实体/事件、主题、意图和关系组织IR/NLU工作,比较自包含故事与跨来源演化叙事。

Results · 主要结果

产出研究分类图、语义关系示例和代表项目/挑战表,强调跨源连接、时间演化、意图/修辞及一致评估不足;无新模型准确率结果。

Shortcomings · 局限

【解读】叙事定义与粒度跨学科不统一,在线数据偏差/噪声和标准真值缺乏使方法难公平比较;综述选取本身非穷尽。

证据定位

PDF §§II–V、图2、表1/3、§VI p.16。

Abstract · 英文原摘要

Storytelling, and the delivery of societal narratives, enable human beings to communicate, connect, and understand one another and the world around them. Narratives can be defined as spoken, visual, or written accounts of interconnected events and actors, generally evolving through some notion of time. Today, information is typically conveyed over online communication mediums, such as social media and blogging websites. Consequently, the act of narrative delivery itself has shifted from simply imparting information through self-contained structures such as books, to more fragmented structures, such as social media websites, where evolving story events are constructed over multiple online sources. Ubiquitous online conversation can manifest into sophisticated narratives that have the potential to influence wide-spread user interpretations of cultural sentiments, attitudes, values, as well as geopolitical events and facts. As a result, narratives are actively being used as strategic tools for shaping local events, promoting collective opinions, and asserting ideologies and propaganda, making them sources of interest for identifying themes, intentions, and goals across multiple communities and potential adversaries. Identifying fragmented narratives, extracting thematic and temporal components that constitute evolving narratives, and locating signs of active rhetoric framing tactics, are difficult to detect and analyze without large-scale automation. This problem can be addressed through the use of natural language understanding technologies. Our goal is to document and discuss methods to efficiently construct, extract, and detect evolving online narratives. The novel contribution of this paper is the formal collation and documentation of such technologies and research areas, as well as extensive discussion on open research challenges and goals in the definition, identification, construction, generation, and representation of online narratives. To our knowledge, there is currently no existing formal documentation that organizes and provides extended discussion on narrative understanding research areas and open challenges.

版本指纹 976245eb5b4ee27353330a79987c9c069803301b597c0adbedf36e2ae4e9318c

返回筛选与清单 ↑
P100 待核实 When Thinking Drifts: Evidential Grounding for Robust Video Reasoning Mi Luo; Zihui Xue; Alex Dimakis et al. 分析视频CoT可能因语言先验而偏离视觉内容,提出Visual Evidence Reward,用RL促使推理过程保持可验证的视频证据。 世界机制与演化XR与人机协作展开笔记
#P10032页 · 核对于 2026-09-15

中文摘要

分析视频CoT可能因语言先验而偏离视觉内容,提出Visual Evidence Reward,用RL促使推理过程保持可验证的视频证据。

核心贡献

Visual Thinking Drift诊断及Video-VER证据奖励训练。

实现边界

主要在选择题等封闭答案任务构造规则奖励;开放式QA明确列为未来工作;Bayesian解释不构成所有漂移的因果证明。

Method · 方法

将答案正确、视觉证据、格式和长度奖励结合GRPO(证据权重0.3),训练模型产生与问题相关视频内容一致的推理。

Results · 主要结果

10基准中所比较开放模型9项排名第一,VSI-Bench由Video-R1更强;TempCompass74.0%、TVBench52.8%。多基础模型直接CoT会下降,证据训练后较稳定。

Shortcomings · 局限

【作者】开放式推理证据奖励待扩展;【解读】受奖励验证器、封闭答案及基础视频感知限制,长而有格式的推理仍可能不忠实。

证据定位

PDF §3–5、表1、§6 p.10。

Abstract · 英文原摘要

Video reasoning, the task of enabling machines to infer from dynamic visual content through multi-step logic, is crucial for advanced AI. While the Chain-of-Thought (CoT) mechanism has enhanced reasoning in text-based tasks, its application to video understanding remains underexplored. This paper presents a systematic analysis revealing that CoT often degrades performance in video reasoning, generating verbose but misleading internal monologues, and leading to hallucinated visual details and overridden correct intuitions—a phenomenon we term "visual thinking drift." We explain this drift through a Bayesian lens, positing that CoT traces often diverge from actual visual evidence, instead amplifying internal biases or language priors, causing models to storytell rather than engage in grounded reasoning. To counteract this, we introduce Visual Evidence Reward (VER), a reinforcement learning framework that explicitly rewards the generation of reasoning traces that are verifiably grounded in visual evidence. Comprehensive evaluation across 10 diverse video understanding benchmarks demonstrates that our Video-VER consistently achieves top performance. Our work sheds light on the distinct challenges of video-centric reasoning and encourages the development of AI that robustly grounds its inferences in visual evidence—for large multimodal models that not only “think before answering", but also “see while thinking".1

版本指纹 2ae02aa04e836398b722dd92b870b3c1937e7f102f2a6a84be28ff44e7e04e26

返回筛选与清单 ↑
P099 2026 VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs Govinda Kolli; Adinath Madhavrao Dukre; Behzad Bozorgtabar et al. 通过原图与加噪图条件下词概率的差异估计视觉依赖,按token自适应调整医疗VLM解码以减少幻觉。 世界机制与演化XR与人机协作展开笔记
#P09911页 · 核对于 2026-09-15

中文摘要

通过原图与加噪图条件下词概率的差异估计视觉依赖,按token自适应调整医疗VLM解码以减少幻觉。

核心贡献

Visual Grounding Score与VGS-Decoding,区别于固定权重对比解码。

实现边界

医疗影像问答离线评测,不是临床验证;视觉依赖分数不保证医学正确性;代码在稿中仅承诺录用后发布。

Method · 方法

向原图加Gaussian/Poisson噪声,双路得到token分布,以视觉退化后的概率变化定义VGS并重加权候选。

Results · 主要结果

LLaVA-Med、CheXagent、MedGemma在VQA-RAD和MIMIC-Diff-VQA六组合均报告改善;MedGemma总体分别+8.16/+9.12个百分点,CheXagent在MIMIC仅+0.12;约2倍推理开销。

Shortcomings · 局限

【解读】加噪反应未必等同病灶依据,可能损伤细微信号;仅两个数据集,缺乏临床安全/外部验证,摘要“适合临床部署”超出实验已证实范围。

证据定位

PDF §2–3、表1–2、§4 p.9。

Abstract · 英文原摘要

Medical Vision-Language Models (VLMs) often hallucinate by generating responses based on language priors rather than visual evidence, posing risks in clinical applications. We propose Visual Grounding Score Guided Decoding (VGS-Decoding), a training-free method to mitigate hallucinations during inference. Our key insight is that hallucinated tokens maintain or increase their probability when visual information is degraded, while visually grounded tokens decrease in probability. We introduce the Visual Grounding Score (VGS), which measures each token’s visualdependencybycomparingdistributionsfromoriginalanddistorted images. During decoding, we reweight probabilities by amplifying visually grounded tokens while suppressing hallucinations. Unlike fixedweight contrastive methods, VGS-Decoding provides per-token adaptive control. Experiments on MIMIC-Diff-VQA and VQA-RAD across LLaVA-Med, CheXagent, and MedGemma demonstrate consistent improvements, with up to+9.12%overall gain and+8.98%in open-ended recall, while introducing only2×inference overhead and no additional training, making it practical for clinical deployment. Upon acceptance, code will be released publicly to facilitate reproducibility.

版本指纹 cbffff846249c3568249b13ebeb8e15d339fece08618710efe4eaecd716e4206

返回筛选与清单 ↑
P098 2026 First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models Jiwoo Ha; Jongwoo Baek; Jinhyun So 保存首次生成时的整条词表logit向量,并在后续解码中加权补回,缓解长文本生成时视觉约束减弱造成的对象幻觉。 世界机制与演化XR与人机协作展开笔记
#P09819页 · 核对于 2026-09-15

中文摘要

保存首次生成时的整条词表logit向量,并在后续解码中加权补回,缓解长文本生成时视觉约束减弱造成的对象幻觉。

核心贡献

First Logit Boosting(FLB)轻量解码方法,并分析初始视觉信号与“The”等词的间接稳定作用。

实现边界

复用的是第一步完整logits,不是重复第一个词;不增加额外模型或双路逐token推理,但不能动态重新读取新证据。

Method · 方法

缓存l₀,在每一步对当前logits加入加权初始分布后采样;跨对象幻觉任务、模型及基准比较。

Results · 主要结果

报告在多LVLM和幻觉基准上减少虚构对象,且推理开销接近基线;改进来自静态早期信号补偿,并非消除位置编码导致的长期衰减。

Shortcomings · 局限

【作者】无法充分处理上下文变化的视觉语义,未根治RoPE衰减;【解读】首步不可靠或任务需新证据时,静态强化也可能引入偏差。

证据定位

PDF §4–6、§7及Limitations p.8。

Abstract · 英文原摘要

Recent Large Vision-Language Models (LVLMs) have demonstrated remarkable performance across various multimodal tasks that require understanding both visual and linguistic inputs. However, object hallucination — the generation of nonexistent objects in answers — remains a persistent challenge. Although several approaches such as retraining and external grounding methods have been proposed to mitigate this issue, they still suffer from high data costs or structural complexity. Training-free methods such as Contrastive Decoding (CD) are more costeffective, avoiding additional training or external models, but still suffer from long-term decay, where visual grounding weakens and language priors dominate as the generation progresses. In this paper, we propose First Logit Boosting (FLB), a simple yet effective training-free technique designed to alleviate long-term decay in LVLMs. FLB stores the logit of the first generated token and adds it to subsequent token predictions, effectively mitigating longterm decay of visual information. We observe that FLB (1) sustains the visual information embedded in the first token throughout generation, and (2) suppresses hallucinated words through the stabilizing effect of the “The” token. Experimental results show that FLB significantly reduces object hallucination across various tasks, benchmarks, and backbone models. Notably, it causes negligible inference overhead, making it highly applicable to real-time multimodal systems. Code is available athttps://github.com/jiwooha20/FLB

版本指纹 ab4f4c867fb503cf82a5beed05b964b90cb445abb3ee0729e0fdc4b4857665d3

返回筛选与清单 ↑
P097 2026 Useful Memories Become Faulty When Continuously Updated by LLMs Dylan Zhang; Yanshan Lin; Zhengkun Wu et al. 持续把经验压缩改写成文字记忆可能先有帮助再逐渐损坏,即使输入是有用轨迹或标准答案,抽象/合并过程仍会积累失真。 世界机制与演化XR与人机协作展开笔记
#P09769页 · 核对于 2026-09-15

中文摘要

持续把经验压缩改写成文字记忆可能先有帮助再逐渐损坏,即使输入是有用轨迹或标准答案,抽象/合并过程仍会积累失真。

核心贡献

多代理基准的连续记忆退化诊断,控制更新顺序/分组及原始情节保留,并构建ARC-AGI Stream记忆动作环境。

实现边界

研究自然语言外部记忆及当前LLM整理器,不涉及权重更新或所有结构化记忆;不能推出记忆本身必然有害。

Method · 方法

固定经验池比较Static-All、Static-Group、Stream与只保留episodic轨迹;允许Retain/Delete/Consolidate;分析错分组、过度概括和窄分布过拟合。

Results · 主要结果

WebShop AWM随经验从8增至128,成功率0.64→0.20(无记忆0.20);19题已被GPT5.4无记忆全部解出的ARC切片,在带真值合并后正文报告准确率降至约54%;原始轨迹对照仍有竞争力。

Shortcomings · 局限

【作者】文本代理/受控ARC环境、少数模型家族,重复次数少且未报正式误差条;真实具身、多模态及其他记忆格式待验证。

证据定位

PDF pp.1–3、§4–6、图1–2/4、§8 p.11;摘要与正文数值冲突。

Abstract · 英文原摘要

Learning from past experience benefits from two complementary forms of memory: episodic traces—raw trajectories of what happened—and consolidated abstractions distilled across many episodes into reusable, schema-like lessons. Recent agentic-memory systems pursue the consolidated form: an LLM rewrites past trajectories into a textual memory bank that it continuously updates with new interactions, promising selfimproving agents without parameter updates. Yet we find that such consolidated memories produced by today’s LLMs are often faulty even when derived from useful experiences. As consolidation proceeds, memory utility first rises, then degrades, and can fall below the no-memory baseline. More surprisingly, even when consolidating from ground-truth solutions, GPT-5.4 fails on 54% of a set of ARC-AGI problems it had previously solved without memory. We trace the regression to the consolidation step rather than the underlying experience: the same trajectories yield qualitatively different memories under different update schedules, and an episodiconly control that simply retains those trajectories remains competitive with the consolidators we test. In a controlled ARC-AGI Stream environment that exposes Retain, Delete, and Consolidate actions, agents preserve raw episodes by default and double the accuracy of their forced-consolidation counterparts; disabling consolidation entirely (episodic management only) matches this auto regime. Practically, robust agent memory should treat raw episodes as first-class evidence and gate consolidation explicitly rather than firing it after every interaction. Looking forward, reliable agentic memory will require LLMs that can consolidate without overwriting the evidence they depend on.

版本指纹 16613d73b3dfe8de8dd73d42c4fb7b2e803b84a78d7ecf748c9e23a7e3b4aa92

返回筛选与清单 ↑
P096 2026 TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models Fangxu Yu; Xingang Guo; Lingzhi Yuan et al. 用文本、图形时间序列评估通用模型在感知、推理、预测与决策上的能力,并分析规模和模态组合效应。 世界机制与演化展开笔记
#P09632页 · 核对于 2026-09-15

中文摘要

用文本、图形时间序列评估通用模型在感知、推理、预测与决策上的能力,并分析规模和模态组合效应。

核心贡献

14领域、4,125题、15任务的TSRBench及30余种LLM/VLM/TSLLM比较。

实现边界

基准得分衡量所构造任务,不能直接代表真实预测收益、临床/金融决策质量;“scaling规律失效”是该样本上的经验现象。

Method · 方法

统一时间序列多模态输入和任务定义,比较文本/视觉/合并输入、模型规模及子任务关联。

Results · 主要结果

GPT5文本+视觉总体55.6%;开放LLM Qwen2.5-72B42.4%,开放VLM Qwen3VL-32B44.9%。推理/感知随规模改善,预测关联较弱或负;多模态互补未被稳定利用。

Shortcomings · 局限

【解读】文本序列编码、绘图格式和答案评分均影响结果,有限领域题库与模型快照不能建立普遍规模定律。

证据定位

PDF §3–4、表2、图3–4、§5。

Abstract · 英文原摘要

Time series are ubiquitous in real-world scenarios and crucial for applications ranging from energy management to traffic control. Consequently, the ability to reason over time series is a fundamental skill for generalist models to solve complex problems. However, current benchmarks for generalist models largely overlook this dimension. To bridge this gap, we introduce TSRBENCH, a comprehensive multi-modal benchmark designed to stress-test the full spectrum of time series reasoning capabilities. TSRBENCH features: i) a diverse set of 4125 problems from 14 domains, and is categorized into 4 major dimensions: Perception, Reasoning, Prediction, and Decision-Making. ii) 15 tasks from the 4 dimensions evaluating essential reasoning capabilities (e.g., numerical reasoning). Through extensive experiments, we evaluate over 30 leading proprietary and open-source LLMs, VLMs, and TSLLMs within TSRBENCH. Our findings reveal that: i) scaling laws hold for perception and reasoning but break down for prediction; ii) strong reasoning does not guarantee accurate context-aware forecasting, indicating a decoupling between semantic understanding and numerical prediction; and iii) despite the complementary nature of textual and visual forms of time series as inputs, current multimodal models fail to effectively fuse them for reciprocal performance gains. TSRBENCH provides a standardized evaluation platform that not only highlights existing challenges but also offers valuable insights to advance generalist models. Our code and dataset are available at https://tsrbench.github.io/.

版本指纹 25dea52cdcb7c8a0a3177586f33d7cd35d7ea00f89222942859987d2928ea700

返回筛选与清单 ↑
P095 2026 TIR-Flow: Active Video Search and Reasoning with Frozen VLMs Hongbo Jin; Siyi Xie; Jiayu Ding et al. 冻结视频VLM,通过分解问题、主动局部观察与持久证据工作区迭代进行视频搜索和推理。 XR与人机协作展开笔记
#P09514页 · 核对于 2026-09-15

中文摘要

冻结视频VLM,通过分解问题、主动局部观察与持久证据工作区迭代进行视频搜索和推理。

核心贡献

HDD任务分解、HAP高保真主动感知、EBA证据仲裁组成TIR-Flow。

实现边界

不更新模型参数,但使用多轮推理/视频片段访问;所谓“严格逻辑一致”无形式证明,受基础模型规划能力限制。

Method · 方法

把问题拆成可验证子任务,针对假设搜索/放大视频证据,累积修订线索再回答。

Results · 主要结果

7个基准报告平均约5.9个百分点收益;Qwen2.5VL-7B EgoSchema69.2%,较基线+10.5个百分点;推理类子集平均约6.7,两个平均不能混用。

Shortcomings · 局限

【作者】仅重点评估7B级LLaVA-Video/Qwen2.5VL,错误初始分解可传播,多轮主动感知降低速度。

证据定位

PDF §3–4、表1、Limitations p.9。

Abstract · 英文原摘要

While Large Video-Language Models (Video- LLMs) have achieved remarkable progress in perception, their reasoning capabilities remain a bottleneck. Existing solutions typically resort to a heavy "data engineering" paradigm—synthesizing large-scale Chain-of- Thought (CoT) datasets followed by Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL). This pipeline primarily optimizes probability sampling efficiency and aligns output distributions, but fails to activate the intrinsic intelligence required for dynamic visual exploration. In this work, we proposeTIR-Flow, a novel framework that shifts the paradigm from passive processing to active video searching and reasoning without additional data or parameter updating. Concretely, our framework operates through three synergistic modules:HDDdecomposes complex queries into a set of verifiable sub-tasks; HAPactively directs visual attention to gather high-resolution evidence for hypothesis validation;EBAmaintains a persistent workspace to accumulate and update the discovered clues for logical reasoning. Extensive experiments on seven benchmarks demonstrate that TIR- Flow significantly outperforms recent strong baselines, delivering an average performance boost of5.9%, with gains reaching10.5%on Egoschema. Our analysis confirms that empowering frozen VLMs with System-2-like active perception is a scalable path toward solving long-horizon video reasoning.

版本指纹 55c6f57cdd9fd2a838d7f75df0e26eee001942e0b8bebe7806c901f85b182dc2

返回筛选与清单 ↑
P094 2026 SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows? Kean Shi; Zihang Li; Tianyi Ma et al. 在23个可部署SaaS系统、6个职业领域中设置106个跨应用长流程任务,以加权检查点衡量部分进度和完整完成。 XR与人机协作展开笔记
#P09424页 · 核对于 2026-09-15

中文摘要

在23个可部署SaaS系统、6个职业领域中设置106个跨应用长流程任务,以加权检查点衡量部分进度和完整完成。

核心贡献

可部署真实软件环境及长流程多模态评测,区分checkpoint score与resolved rate。

实现边界

是受控部署的SaaS工作流评测,成绩依赖给定工具/步数/模型版本;部分纯文本模型只评文本域,分母不同。

Method · 方法

提供任务、应用入口和凭据,代理操作浏览器/GUI;检查各中间状态和最终目标,分析阶段衰减与错误类型。

Results · 主要结果

表2最高总体检查点分43.9%,最高全流程完成率3.8%;GPT5.5High等头部检查点约43–44%,不代表完成同等比例任务;模型在后续阶段持续衰减。

Shortcomings · 局限

【解读】有限任务及应用配置不能穷尽专业工作,检查点权重和预算影响排名;多次尝试提升部分表现但未解决完整流程可靠性。

证据定位

PDF §3–4、表2 pp.7–9、§6。

Abstract · 英文原摘要

Computer-Using Agents (CUAs) are rapidly extending large language models (LLMs) beyond text-based reasoning toward action execution in more complex environments, such as web browsers and graphical user interfaces (GUIs). However, existing web and GUI agent benchmarks often rely on simplified settings, isolated tasks, or short-horizon interactions, making it difficult to assess capabilities of agents in realistic professional workflows. Software-as-a-Service (SaaS) environments are a natural choice for CUA evaluation, as they host a large share of modern digital work and naturally involve dynamic system states, cross-application coordination, domainspecific knowledge, and long-horizon dependencies. To this end, we introduce SAAS-BENCH, a benchmark built on 23 deployable SaaS systems across six professional domains, containing 106 tasks grounded in realistic work scenarios. These tasks require long-horizon execution, cover both text-only and multimodal settings, and are evaluated with weighted verification checkpoints that measure strict task completion and partial progress. Experiments show that representative LLM-based agents struggle on SAAS-BENCH, with even the strongest model completing fewer than 4% of tasks end-to-end, exposing limitations in planning, state tracking, cross-application context maintenance, and error recovery. Code are available at UniPat-AI/SaaS-Bench for reproduction. HOMEPAGE:https://unipat.ai/blog/SaaS-Bench

版本指纹 99ec0f81715a715fb4709c1810e1537ba5cad294c9a1878bd63531abdfc9a8ed

返回筛选与清单 ↑
P093 2026 Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning Yashwant Pravinrao Bangde; Debaditya Roy 分别以任务指令和严格视觉证据提示计算两条token分布,用分歧自适应门控融合,降低语言先验驱动的幻觉。 世界机制与演化XR与人机协作展开笔记
#P09314页 · 核对于 2026-09-15

中文摘要

分别以任务指令和严格视觉证据提示计算两条token分布,用分歧自适应门控融合,降低语言先验驱动的幻觉。

核心贡献

Instruction-Evidence Contrastive Dual-Stream Decoding(IECD²)的双流及对称KL门控。

实现边界

推理时双流概率,依赖开放模型logits和证据提示;两流均来自模型,证据流不是真实标签。

Method · 方法

每步计算instruction/evidence两分布;一致时保留表达性,分歧大时抑制仅语言流偏好的token;跨caption/VQA/对象幻觉评估。

Results · 主要结果

在LLaVA1.5和InstructBLIP的POPE、AMBER、VQAv2、MME及COCO报告改善,尤其POPE adversarial;各指标与骨干详见表1及生成评测表,不能把所有子项概括为同一提升幅度。

Shortcomings · 局限

【作者】视觉证据不足时收益受限、提示分离与KL门控超参数跨任务/架构变化;【解读】双流增加推理成本,一致但错误仍难检测。

证据定位

PDF §3–4、表1、§5 p.10。

Abstract · 英文原摘要

Vision-Language Models (VLMs) exhibit strong performance in instruction following and open-ended vision-language reasoning, yet they frequently generate fluent outputs that are weakly grounded in visual evidence. Prior works have shown that instruction prompting further worsens this issue by amplifying language priors, especially when the visual signal is uncertain or ambiguous. To address this challenge, we propose a decoding framework that explicitly balances linguistic informativeness and visual faithfulness during generation. Our method, Instruction-Evidence Contrastive Dual-Stream Decoding (IECD2), maintains two parallel probability distribution of tokens at each decoding step: an instruction-driven stream that promotes expressive and informative responses, and an evidence-driven stream that enforces strict grounding in the image. These two streams are adaptively fused using a symmetric KL-based contrastive gate, which suppresses tokens favored by language priors but unsupported by visual evidence, while preserving them when both distributions agree. We evaluate IECD2 on multiple datasets spanning various generative vision-language reasoning tasks such as captioning and visual question answering on multiple datasets such as, POPE, MME, VQAv2, AMBER, and MSCOCO. IECD 2 demonstrates consistent improvements in task accuracy and reasoning performance with substantial reduction in hallucination compared to state-of-the-art decoding approaches.

版本指纹 68ff3ed3e82e6fec964e338c9348812bd24878ec360a421ddff61a154b9fab90

返回筛选与清单 ↑
P092 2026 Improving Visual Reasoning with Iterative Evidence Refinement Zeru Shi; Kai Mei; Yihao Quan et al. SIEVE通过模型内部显著图像区域的embedding重复访问证据,以RL学习何时以及取哪些区域,避免外部裁剪与重新编码。 世界机制与演化XR与人机协作展开笔记
#P09221页 · 核对于 2026-09-15

中文摘要

SIEVE通过模型内部显著图像区域的embedding重复访问证据,以RL学习何时以及取哪些区域,避免外部裁剪与重新编码。

核心贡献

内生视觉重访和证据嵌入插入推理链的训练框架。

实现边界

需要RL训练和隐状态访问,不是training-free;复用已有视觉编码不能恢复首次编码完全丢失的细节。

Method · 方法

依据文本锚点和视觉显著性抽取区域表示,在生成中触发重访并注入embedding,按回答奖励学习调用策略。

Results · 主要结果

表1 Qwen3VL-4B V78.01→85.86%(+7.85个百分点/约10.06%相对),HR4K77.75→81.25、HR8K72.38→76.13;但ZoomEye的4B V为90.05,高于SIEVE,正文“所有基线均胜出”的概括不完全符合表格。

Shortcomings · 局限

【解读】既有表征、显著性定位错误和RL奖励限制证据质量;不同工具方法速度/输入预算需一起比较,不能只看平均得分。

证据定位

PDF §3–4、表1 pp.7–8;正文与表格例外已注明。

Abstract · 英文原摘要

Vision–language models (VLMs) are increasingly capable of reasoning over images, but robust visual reasoning often requires re-grounding intermediate steps in the underlying visual evidence. Recent approaches typically rely on external image operations such as zooming or cropping to re-access fine-grained details during inference, which requires additional image re-encoding and can disrupt the reasoning trajectory. We argue that VLMs already provide strong internal signals for identifying and reusing visual evidence, and that these signals can be directly leveraged to support image-grounded reasoning. Motivated by this insight, we propose an end-to-end self-revisit framework,SIEVE, that trains models to re-engage image evidence through internal representations. SIEVEautomatically extracts embeddings of salient image regions and injects them into the reasoning chain when additional grounding is needed, enabling later steps to condition on relevant visual cues without external tool calls or re-encoding. We use reinforcement learning to teach the model when to trigger visual revisiting and which region embeddings to retrieve and insert during the reasoning process. Experiments on multiple visual reasoning benchmarks, together with perception, reasoning, and hallucination evaluations, show that SIEVEyields consistent gains, improving performance by 8% on average across several benchmarks.

版本指纹 90f64b8dd352647c94fd531a6da25b2f0ddbc909fd3c6c949eb59f10a351edb2

返回筛选与清单 ↑
P091 2026 Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces Runtao Zhou; Giang Nguyen; Nikita Kharya et al. 比较传统CoT与可交互文本、程序和图形解释,研究用户能否更准确核查数学解答及定位推理错误。 创作与规则补全XR与人机协作展开笔记
#P09118页 · 核对于 2026-09-15

中文摘要

比较传统CoT与可交互文本、程序和图形解释,研究用户能否更准确核查数学解答及定位推理错误。

核心贡献

iCoT、iPoT、iGraph三种格式转换界面及125人验证实验。

实现边界

优化的是人类核查模型解释的表现,不是LLM自主解题;10道实验题中正确/错误解释比例1:9,结果受错误高基率影响。

Method · 方法

保持解释底层内容,改变结构、渐进展示、变量高亮和依赖关系;被试组间比较正确性核验、错误定位、时间及体验。

Results · 主要结果

核验准确率iGraph85.6%、iPoT82.5%、iCoT80.6%、普通CoT73.5%;平均响应时间57.9、约60、约60、64.7秒。

Shortcomings · 局限

【作者】1:9不平衡是为覆盖9类错误并控制疲劳;图复杂度、代码语法和顺序文本各有成本;【解读】有限数学任务不能代表长期学习提升或真实低错误率审核。

证据定位

PDF §3–5、图5–7、§7 p.10。

Abstract · 英文原摘要

The reasoning capabilities of Large Language Models (LLMs) have led to their increasing employment in several critical applications, particularly education, where they support problem-solving, tutoring, and personalized study. While there are a plethora of works showing the effectiveness of LLMs in generating step-by-step solutions through chain-of-thought (CoT) reasoning on reasoning benchmarks, little is understood about whether the generated CoT is helpful for end-users in improving their ability to comprehend mathematical reasoning problems and detect errors/hallucinations in LLM-generated solutions. To address this gap and contribute to understanding how reasoning can improve human-AI interaction, we present three new interactive reasoning interfaces: interactive CoT (iCoT), interactive Program-of-Thought (iPoT), and interactive Graph (iGraph), and a novel framework that generates the LLM’s reasoning from traditional CoT to alternative, interactive formats. Across 125 participants, we found that interactive interfaces significantly improved performance. Specifically, the iGraph interface yielded the highest clarity and error detection rate (85.6%), followed by iPoT (82.5%), iCoT (80.6%), all outperforming standard CoT (73.5%). Interactive interfaces also led to faster response times, where participants using iGraph were fastest (57.9 secs), compared to iCoT and iPoT (60 secs), and the standard CoT baseline (64.7 secs). Furthermore, participants preferred the iGraph reasoning interface, citing its superior ability to enable users to follow the LLM’s reasoning process. We discuss the implications of these results and provide recommendations for the future design of reasoning models. The code and interfaces for this project can be found here: https://github.com/Runtaozhou/Interactive-CoT

版本指纹 9ec925e6e875d9130a70e08ff8777481680bd097aad8d78aacbca46319149bf2

返回筛选与清单 ↑
P090 未注明(匿名稿) From &lt;Answer&gt; to &lt;Think&gt;: Multi-Dimensional Supervision of Reasoning Process for LLM Optimization Anonymous authors(本地双盲稿未署名) 用置信度、相关性与连贯性三个维度评价完整推理过程,作为无需逐步切分或标准答案的奖励,支持偏好优化和RL。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P09033页 · 核对于 2026-09-15

中文摘要

用置信度、相关性与连贯性三个维度评价完整推理过程,作为无需逐步切分或标准答案的奖励,支持偏好优化和RL。

核心贡献

Dimension-level Reward Model(DRM)及DPO/GRPO训练应用,补充仅最终正确性或逐步PRM监督。

实现边界

评分不要求答案真值,但仍借助预训练相关性/奖励模型及训练数据;不等于没有任何监督或能保证逻辑正确。

Method · 方法

置信度校准、Qwen3-8B-Reranker语义相关性及Nemotron70B奖励模型连贯性组成分数,构造偏好对或在线奖励,可与可验证答案奖励组合。

Results · 主要结果

在Llama3.1-8B、R1-Distill-Llama8B及Qwen3-8B上报告数学、QA、代码执行与谜题的ID/OOD收益;DRM能区分答案均对或均错的样本,DRM@ANY在表4优于对应只看答案的偏好构造。

Shortcomings · 局限

【解读】高置信/相关/流畅不保证事实与逻辑正确,存在奖励投机;外部评判模型较大,评分和优化成本不可忽略;匿名稿元数据与公开复现状态未确认。

证据定位

PDF §2–3、表4–5、§6;首页匿名状态。

Abstract · 英文原摘要

Large language models (LLMs) can develop strong reasoning ability when trained appropriately. Existing approaches are broadly categorized into outcome-level answer supervision and process-level reasoning supervision. However, the former provides only sparse binary feedback and overlooks intermediate step quality, while the latter scores individual steps but requires task-specific segmentation. To this end, we propose a novel framework that assesses the quality of reasoning process along three dimensions:Confidencefor uncertainty calibration,Relevancefor semantic alignment andCoherencefor logical consistency. Together, these dimensions capture aspects beyond final answer correctness and enable interpretable assessment without requiring ground truth answers. Our framework serves as aDimension-levelRewardModel (DRM) that assigns scores to reasoning processes and provides supervision signals for both off-policy (e.g., DPO) and on-policy (e.g., GRPO) optimization. Experimental results show that DRM provides effective supervision signals, guides the optimization of LLMs and enhances their reasoning ability. In particular, DRM-supervised training achieves consistent gains on both in-distribution and out-of-distribution open-domain tasks, including mathematics, question answering, code execution and puzzles. Our findings demonstrate that multidimensional supervision of reasoning process can improve the generalized reasoning ability of LLMs beyond the training distribution.

版本指纹 ffe9f19fb7c2282d7818de1e63fbceaacdcd600c34e4b357d03e839a8c20605a

返回筛选与清单 ↑
P089 2026 Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models Yanting Miao; Yutao Sun; Dexin Wang et al. 诊断连续视觉潜推理将decoder隐状态直接反馈到输入时的特征尺度失配,提出特征、数据/上下文及难度分配的多粒度对齐。 世界机制与演化XR与人机协作展开笔记
#P08923页 · 核对于 2026-09-15

中文摘要

诊断连续视觉潜推理将decoder隐状态直接反馈到输入时的特征尺度失配,提出特征、数据/上下文及难度分配的多粒度对齐。

核心贡献

GAP的PCA对齐latent head、可检查辅助图像监督与按难度选择潜token训练。

实现边界

在Qwen2.5VL-7B等所评设置微调;辅助图像用于监督构造,不是推理时外部图像生成;前作系统对比训练配方不同,不能全部归因为架构。

Method · 方法

构造49,309个图像—问题—辅助图像样本,学习映射回视觉输入子空间,选择基础模型困难题应用潜监督,并控制latent token预算。

Results · 主要结果

相对Monet,平均感知+1.74、平均推理+5.98个百分点;相对LVR+0.57/+6.31;基础Qwen Avg-R52.62,而前两者47.99/47.66,说明潜推理也可能退化。

Shortcomings · 局限

【作者/解读】结果主要是均值点估计,潜目标质量/子空间和难度阈值影响收益;更多潜token不必然更好,泛化到其他架构仍需验证。

证据定位

PDF §3–5、表2–5、§6;作者p.1。

Abstract · 英文原摘要

Visual latent reasoning lets a multimodal large language model (MLLM) create intermediate visual evidence as continuous tokens, avoiding external tools or image generators. However, existing methods usually follow an output-as-input latent paradigm and yield unstable gains. We identify evidence for a feature-space mismatch that can contribute to this instability: dominant visual-latent models build on pre-norm MLLMs and reuse decoder hidden states as predicted latent inputs, even though these states occupy a substantially different norm regime from the input embeddings the model was trained to consume (Xie et al., 2025; Li et al., 2026; Team et al., 2026). This mismatch can make direct latent feedback unreliable. Motivated by this diagnosis, we propose GAP, a Granular Alignment Paradigm for visual latent modeling. GAP aligns visual latent reasoning at three levels: feature-level alignment maps decoder outputs into input-compatible visual latents through a lightweight PCA-aligned latent head; context-level alignment grounds latent targets with inspectable auxiliary visual supervision; and capacityguided alignment assigns latent supervision selectively to examples where the base MLLM struggles. On Qwen2.5-VL 7B, the resulting model achieves the best mean aggregate perception and reasoning performance among our supervised variants. Inference-time intervention probing further suggests that generated latents provide task-relevant visual signal beyond merely adding token slots.

版本指纹 4c3611e580ebef4d36d768a4b052d534b7185aab603c5bdce7e121eed47cd053

返回筛选与清单 ↑
P088 2026 V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval Dongyang Chen; Chaoyang Wang; Dezhao Su et al. 在多模态检索候选重排时主动调用视觉工具查看细节,以交替假设与验证代替只依赖固定图像编码的文字推理。 世界机制与演化XR与人机协作展开笔记
#P08826页 · 核对于 2026-09-15

中文摘要

在多模态检索候选重排时主动调用视觉工具查看细节,以交替假设与验证代替只依赖固定图像编码的文字推理。

核心贡献

V-Retrver代理式视觉检索推理及三阶段课程训练。

实现边界

在给定候选池上检索/重排,依赖初始召回及视觉工具;不是无成本全库端到端搜索。

Method · 方法

监督激活推理→拒绝采样精炼→证据对齐RL,学习针对模糊候选进行选择性图像检查。

Results · 主要结果

M-BEIR平均Recall69.7%,U-MARVEL-7B64.8%(+4.9个百分点);FIQ51.2对38.2、CIRR73.5对63.2。各子任务Recall@K的K不同;摘要“平均23%”不能替代这里的同表绝对差。

Shortcomings · 局限

【解读】多轮工具调用与候选数量增加成本,局部检查错误可传入重排,外部检索分布变化及规模化延迟仍需验证。

证据定位

PDF §3–4、表2 pp.6–7。

Abstract · 英文原摘要

Multimodal Large Language Models (MLLMs) have recently been applied to universal multimodal retrieval, where Chain-of-Thought (CoT) reasoning improves candidate reranking. However, existing approaches remain largely languagedriven, relying on static visual encodings and lacking the ability to actively verify fine-grained visual evidence, which often leads to speculative reasoning in visually ambiguous cases. We propose V-Retrver, an evidence-driven retrieval framework that reformulates multimodal retrieval as an agentic reasoning process grounded in visual inspection. V-Retrver enables an MLLM to selectively acquire visual evidence during reasoning via external visual tools, performing a multimodal interleaved reasoning process that alternates between hypothesis generation and targeted visual verification. To train such an evidence-gathering retrieval agent, we adopt a curriculum-based learning strategy combining supervised reasoning activation, rejection-based refinement, and reinforcement learning with an evidence-aligned objective. Experiments across multiple multimodal retrieval benchmarks demonstrate consistent improvements in retrieval accuracy (with 23.0% improvements on average), perception-driven reasoning reliability, and generalization.

版本指纹 5ad4ffde63f37dc3ccae679a3335edcf4126775661e934ae8201ab65dfcb18b5

返回筛选与清单 ↑
P087 2026 Don't Blink: Evidence Collapse during Multimodal Reasoning Suresh Raghu; Satwik Pandey 发现推理过程中视觉证据注意力下降,但其与出错的关系取决于任务;结合熵和视觉信号进行选择性拒答风险控制。 世界机制与演化XR与人机协作展开笔记
#P08718页 · 核对于 2026-09-15

中文摘要

发现推理过程中视觉证据注意力下降,但其与出错的关系取决于任务;结合熵和视觉信号进行选择性拒答风险控制。

核心贡献

证据衰减诊断、熵—视觉交互模型及任务条件的vision veto。

实现边界

3个2B–8B模型、2模型家族、每数据集约300题;注意力是相关性信号,不能证明证据衰减导致错误。

Method · 方法

用标注证据区域选视觉grounding层,分析推理前后注意力、输出熵和正确性,拟合跨任务交互并在固定覆盖率筛除高风险回答。

Results · 主要结果

视觉证据注意力常下降超过一半;持续视觉参考任务中的低熵/低视觉关注更危险,符号任务未必;针对性veto在90%覆盖率下最多降低1.9个百分点选择性风险,全局线性融合可能恶化迁移。

Shortcomings · 局限

【作者】模型/数据规模有限、极端象限每格仅2–8样本;分析假定任务类型已知,真实部署还需自动分类;待做激活干预检验因果性。

证据定位

PDF §3–5、Limitations p.8、附录B。

Abstract · 英文原摘要

Reasoning VLMs can become more accurate while progressively losing visual grounding as they think. This creates task-conditional danger zones where low-entropy predictions are confident but ungrounded, a failure mode text-only monitoring cannot detect. Evaluating three reasoning VLMs on MathVista, HallusionBench, and MMMU_Pro, we find a pervasive evidence-collapse phenomenon: attention to annotated evidence regions drops substantially, often losing over half of evidence mass, as reasoning unfolds. Full-response entropy is the most reliable text-only uncertainty signal under cross-dataset transfer, yet adding vision features with a single global linear rule is brittle and often degrades transfer. An entropy-vision interaction model reveals a task-conditional regime: lowentropy, visually disengaged predictions are hazardous on sustained visual-reference tasks but benign on symbolic tasks. Using this structure, a targeted vision veto reduces selective risk by up to 1.9 percentage points at 90% coverage, while avoiding degradations where disengagement is expected. The results support task-aware multimodal monitoring for safe deployment under distribution shift. All code is publicly available at https:// github.com/R-Suresh07/Dont-Blink.

版本指纹 d4c05386de217c426af7adda5962f890cb31635e3ba957b26c4a18e7442825f9

返回筛选与清单 ↑
P086 2026 See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs Yongchang Zhang; Oliver Ma; Tianyi Liu et al. ECRD在推理过程中维护文字视觉证据池,将基础生成概率与证据引导分布结合,不足时再次观察图片补充证据。 世界机制与演化XR与人机协作展开笔记
#P08610页 · 核对于 2026-09-15

中文摘要

ECRD在推理过程中维护文字视觉证据池,将基础生成概率与证据引导分布结合,不足时再次观察图片补充证据。

核心贡献

无需训练的证据条件解码与动态visual decider,尝试抑制推理中视觉幻觉传播。

实现边界

需要访问token概率并多次视觉查询;证据池来自模型描述,不是已验证真值,“每个token有视觉依据”是设计目标而非形式保证。

Method · 方法

改进VDGD的候选词和KL证据偏好,融合基础置信度,按当前上下文决定是否追加图像证据并继续解码。

Results · 主要结果

TreeBench Qwen2.5VL-7B总体37.0→47.9(+10.9个百分点,约29.5%相对提升);32B42.5→48.6、72B42.2→49.9。摘要16.5–29.5%不应全部写成百分点;RH-Bench另报告RH-AUC收益。

Shortcomings · 局限

【解读】证据生成错误仍可能循环强化;推理延迟、超参数和决策器可靠性影响实际收益,部分子项不变。

证据定位

PDF §2–3、表1 p.4、§4。

Abstract · 英文原摘要

Recent large vision-language models (LVLMs) have demonstrated impressive reasoning ability by generating long chain-of-thought (CoT) responses. However, CoT reasoning in multimodal contexts is highly vulnerable to visual hallucination propagation: once an intermediate reasoning step becomes inconsistent with the visual evidence, subsequent steps—even if logically valid—can still lead to incorrect final answers. Existing solutions attempt to mitigate this issue by training models to “think with images” via reinforcement learning (RL). While effective, these methods are costly, model-specific, and difficult to generalize across architectures. Differently, we present a lightweight method that bypasses RL training and provides an iterative, training-free, plug-and-play framework for visuallygrounded multimodal reasoning. Our key idea is to supervise each reasoning step at test time with visual evidence, ensuring that every decoded token is justified by corresponding visual cues. Concretely, we construct a textual visual-evidence pool that guides the model’s reasoning generation. When existing evidence is insufficient, a visual decider module dynamically extracts additional relevant evidence from the image based on the ongoing reasoning context, expanding the pool until the model achieves sufficient visual certainty to terminate reasoning and produce the final answer. Extensive experiments on multiple LVLM backbones and benchmarks demonstrate the effectiveness of our approach. Our method achieves 16.5%–29.5% improvements on TreeBench and 13.7% RH-AUC gains on RH- Bench, substantially reducing hallucination rates while improving reasoning accuracy without additional training.

版本指纹 f0cf8bcf783bce9a16ed1d4e2b2f7637ef9fb33b402e6646d2012dee7de1f46c

返回筛选与清单 ↑
P085 2026 SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models Junchao Huang; Guian Fang; Shengju Qian et al. 统一多源视频、相机几何、字幕和质量记录,跨视频骨干实施三阶段训练,支持相机可控的长时自回归视频生成。 世界机制与演化展开笔记
#P08526页 · 核对于 2026-09-15

中文摘要

统一多源视频、相机几何、字幕和质量记录,跨视频骨干实施三阶段训练,支持相机可控的长时自回归视频生成。

核心贡献

10数据源143万canonical clips的数据引擎、可重配筛选与混合配方、四种5B–33B标称骨干的统一适配/蒸馏框架。

实现边界

长时展示主要为5B-fast学生;固定场景文本、预定相机轨迹是控制条件,不是任意任务代理或经过验证的物理仿真;发布矩阵含作者承诺,未逐项验证下载。

Method · 方法

对齐帧、度量相机几何、字幕和来源;双向适配→teacher-forced自回归初始化/AnyFlow→分布匹配蒸馏;保留各骨干原生表征。

Results · 主要结果

报告16fps、4步采样,5秒片段训练后连续生成分钟/60分钟序列;§7主要以图6–11定性展示跨域、相机跟随和长时外观保持,缺少统一量化长时物理/记忆基准,不能将小时端点示例解读为所有帧一致性保证。

Shortcomings · 局限

【解读】长时证据为抽样可视化和有限轨迹;相机控制不同于对象交互,训练数据清洗/几何误差及来源分布可影响泛化;实时性依赖硬件和模型配置。

证据定位

PDF §4–6、表1/4/5;§7 pp.15–20、图10–11。

Abstract · 英文原摘要

We introduce SolarWM, a fully open foundation for building interactive video world models from data preparation through long-horizon inference. Training across heterogeneous data sources and video backbones is challenging: datasets differ in temporal scale, camera geometry, visual quality, motion, and captioning styles, while video generators use distinct representations and architectures. Naive data mixing and model-specific implementations therefore produce inconsistent supervision and make results difficult to reproduce and compare. SolarWM addresses this coupling with a reconfigurable multi-source data engine and a backbone-native adaptation framework. The engine converts 1.43 million canonical clips from 10 datasets into a unified, frame-aligned contract covering visual observations, metric camera geometry, captions, quality metadata, selection decisions, and provenance, while decoupling source processing from mixture construction. Under shared camera-conditioning, training, and inference interfaces, we instantiate four 5B–33B models based on Wan2.2, LTX-2.5, and MiniMax-H3 while preserving their native representations and objectives. A unified three-stage recipe combines bidirectional adaptation, teacherforced autoregressive initialization, and distribution matching distillation. The resulting causal models enable real-time interaction over rollouts ranging from minutes to hours after being trained on only 5s sequences. By releasing the resulting data, pipeline, recipes, weights, and framework, SolarWM provides a reproducible and extensible foundation for interactive world-model research. Website (Dataset & Code & Model):https://junchao-cs.github.io/SolarWM-Web/

版本指纹 b11f376c90bdd340cfe8f64953858ffa142ddee989d8b5bfc237400650418115

返回筛选与清单 ↑
P084 2026 CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models León Begiristain; Olaf Dünkel; Adam Kortylewski 在Unreal Engine中保持物理事件类别并系统改变视角、场景、对象类别和外观,测量视频世界模型预测是否稳定符合物理。 世界机制与演化展开笔记
#P08427页 · 核对于 2026-09-15

中文摘要

在Unreal Engine中保持物理事件类别并系统改变视角、场景、对象类别和外观,测量视频世界模型预测是否稳定符合物理。

核心贡献

可匹配干预的CRONOS基准与经人评校验的物体稳定/物理合理性指标。

实现边界

主要衡量视觉条件变化下的物理一致性,非现实因果效应估计;I2V首帧无法唯一确定未来,采用best-of-three缓解而未完全解决。

Method · 方法

生成碰撞、跌落、遮挡等受控视频;比较Cosmos2.5、CogVideoX1.5、MAGI1、Wan2.2;部分支持5帧V2V;结合规则、视觉模型和VLM评判。

Results · 主要结果

所评最强模型成功率仍仅22%;视角变化尤其破坏结果;报告的多种得分从3次采样中按参考运动相似度挑选,不能作单次成功率理解。

Shortcomings · 局限

【作者】合成—真实域差、单参考未来、仅开放模型;【解读】评判模型误差和选优协议影响绝对分数。

证据定位

PDF §3–4、§4.1 p.6、§5 p.9。

Abstract · 英文原摘要

Video prediction is increasingly viewed as a path toward generalizable world models, yet it remains unclear whether these systems learn underlying causal structure or merely exploit superficial visual correlations for future prediction. We introduce CRONOS, an intervention-based benchmark designed to evaluate counterfactual physical consistency: whether a model’s predictions of physical events respond appropriately to controlled changes in the visual input, such as variations of scene context, viewpoint, object appearance, and object category. Built in a photorealistic Unreal Engine environment, CRONOS enables controlled, high-fidelity generation of videos across diverse scenes and dynamics. In contrast to previous benchmarks, CRONOS systematically intervenes on four key factors — viewpoint, scene, object category, and object appearance — while keeping the underlying physical event type, such as a collision, occlusion, or fall, fixed. Our evaluation of recent open-source video generators reveals substantial failures in counterfactual physical consistency: prediction quality for the same physical event type is affected by appearance, environment, and, particularly by viewpoint changes. CRONOS provides a controlled and reproducible testbed for diagnosing how the quality of generated videos changes for different interventions, establishing a concrete target for developing models that perform consistently across changes of multiple conditions. The dataset and code are available at: https://genintel.github.io/CRONOS/.

版本指纹 c2a65989b5dce1061ecdafc430424d43a388220cfd38a6c9f5721e5ab8678137

返回筛选与清单 ↑
P083 2026 Causal-JEPA: Learning World Models through Object-Level Latent Masking Heejeong Nam; Quentin Le Lidec; Lucas Maes et al. 将JEPA掩码预测从图像patch移到对象潜变量,通过遮住部分对象迫使模型利用交互关系,改善反事实问答与规划效率。 世界机制与演化AI方法与评测展开笔记
#P08325页 · 核对于 2026-09-15

中文摘要

将JEPA掩码预测从图像patch移到对象潜变量,通过遮住部分对象迫使模型利用交互关系,改善反事实问答与规划效率。

核心贡献

C-JEPA对象级潜掩码学习目标与可观测性理论分析,区分仅对象表示和对象掩码的作用。

实现边界

object masking是“counterfactual-like”预测,不直接等同do干预;没有用显式时间因果图验证影响邻域。

Method · 方法

对象编码器产生slots,预测被遮对象的历史/未来潜状态,避免像素重建;基于紧凑潜模型规划控制。

Results · 主要结果

表2 SAVi骨干反事实按问题准确率60.19%,无对象掩码OC-JEPA41.10%(+19.09个百分点),总体83.88对77.28%;控制任务用约patch模型1%的潜输入特征达到可比结果。

Shortcomings · 局限

【作者】对象编码器质量限制上限、过度掩码会丢失有效依赖、缺乏真实因果图验证;【解读】简化对象环境和所评控制任务限制现实外推。

证据定位

PDF §4–6、表2 p.6、§7 p.9。

Abstract · 英文原摘要

World models require robust relational understanding to support prediction, reasoning, and control. While object-centric representations provide a useful abstraction, they are not sufficient to capture interaction-dependent dynamics. We therefore propose C-JEPA, a simple and flexible objectcentric world model that extends masked joint embedding prediction from image patches to objectcentric representations. By masking object-level latents and requiring each masked object state to be inferred from the surrounding context, C- JEPA imposes structured partial observability during training, creating counterfactual-like prediction queries that discourage shortcut solutions and make interaction-dependent prediction necessary under the learning objective. Empirically, C-JEPA leads to consistent gains in visual question answering, with an absolute improvement of about 20% in counterfactual reasoning over the same architecture without object-level masking. On agent control tasks, C-JEPA enables substantially more efficient planning by using only 1% of the total latent input features required by patch-based world models, while achieving comparable performance. Finally, we provide a formal analysis demonstrating that object-level masking induces useful inductive bias by controlling observability. Our code is available at https://github.com/galilai-group/cjepa.

版本指纹 956e136d92c4c944a53e3c2d9cd826aebc96b06af542cd767a0a213e47fb609b

返回筛选与清单 ↑
P081 2026 Olaf-World: Orienting Latent Actions for Video World Modeling Yuxin Jiang; Yuchao Gu; Ivor W. Tsang et al. 针对无标签视频中潜动作与场景纠缠的问题,用冻结视频表征的时间变化为潜动作提供跨场景共享语义参考,训练可迁移世界模型。 世界机制与演化展开笔记
#P08118页 · 核对于 2026-09-15

中文摘要

针对无标签视频中潜动作与场景纠缠的问题,用冻结视频表征的时间变化为潜动作提供跨场景共享语义参考,训练可迁移世界模型。

核心贡献

SeqΔ-REPA序列控制效果对齐与Olaf-World预训练/控制适配流水线。

实现边界

潜动作是从视频变化学习的控制表示,非保证唯一可识别真实动作;“1分钟”是特定新控制空间的少量标注适配,不是完整机器人任务训练时间。

Method · 方法

β-VAE逆/前向动力学学习潜动作;累计动作表征对齐冻结自监督视频编码器特征差;训练潜动作条件视频生成并适配新控制接口。

Results · 主要结果

第一/第三人称跨域动作线性探测和动作原型一致性优于AdaWorld;展示零样本动作转移、新场景生成及少标注适配收益。

Shortcomings · 局限

【作者/解读】依赖视频编码器捕捉动作效果,视角/外观变化仍可混入;跨人到机器人等具身迁移列为未来工作,未建立普遍因果可识别性。

证据定位

PDF §3–4、图4–5、§5及附录E。

Abstract · 英文原摘要

Scaling action-controllable world models is limited by the scarcity of action labels. While latent action learning promises to extract control interfaces from unlabeled video, learned latents often fail to transfer across contexts: they entangle scene-specific cues and lack a shared coordinate system. This occurs because standard objectives operate onlywithineach clip, providing no mechanism to align action semantics across contexts. Our key insight is that although actions are unobserved, theirsemantic effectsare observable and can serve as a shared reference. We introduceSeq ∆-REPA, a sequence-level controleffect alignment objective that anchors integrated latent action to temporal feature differences from a frozen, self-supervised video encoder. Building on this, we presentOlaf-World, a pipeline that pretrains action-conditioned video world models from large-scale passive video. Extensive experiments demonstrate that our method learns a more structured latent action space, leading to stronger zero-shot action transfer and more data-efficient adaptation to new control interfaces than state-ofthe-art baselines.

版本指纹 f108f25fdbcf882621692aef27c19b0b06a75a4405abffef226cbe130019e983

返回筛选与清单 ↑
P080 2025 Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning Kaviraj Pather; Elena Hadjigeorgiou; Arben Krasniqi et al. 将线性CoT转换成交互图,由用户标记、剪除错误分支并补充前提,再继续生成,报告人机协作正确率和体验提升。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P08010页 · 核对于 2026-09-15

中文摘要

将线性CoT转换成交互图,由用户标记、剪除错误分支并补充前提,再继续生成,报告人机协作正确率和体验提升。

核心贡献

Vis-CoT图结构、pruning/grafting干预流程与用户研究。

实现边界

结果包含用户新增知识和纠错,不是Llama2-70B独立解题能力;图是CoT的结构化展示,不保证忠实反映内部推理。

Method · 方法

Llama2-70B-Chat、React/D3界面与FastAPI,24名相关专业参与者;GSM8K/StrategyQA及100项自建规划任务,人工评价部分任务的答案与有效推理链。

Results · 主要结果

作者报告CoT→Vis-CoT:GSM8K74.8→91.7%,StrategyQA79.5→94.1%,规划68→92%;平均时间410.5→285.2秒,2.1次干预/题;SUS65.5→88.2。

Shortcomings · 局限

【解读】正文对全测试集评测与24人用户实验的样本分配、统计不确定性及复现材料交代有限,数值应作作者报告;参与者有专业背景,需独立复现及更广泛人群验证。

证据定位

PDF pp.6–8,算法1、实验设置、表I–III。

Abstract · 英文原摘要

Large Language Models (LLMs) have demonstrated remarkable reasoning capabilities through Chain-of-Thought (CoT) prompting. However, the underlying reasoning process remains an opaque ”black box,” making it difficult to verify, debug, or control, which limits trust and reliability in highstakes applications. To address this critical gap, we introduce Vis-CoT, a novel human-in-the-loop framework that transforms the linear CoT text into a structured, interactive reasoning graph. Our system allows users to visualize the logical flow of the model’s reasoning, identify flawed steps, and directly intervene by pruning incorrect paths and grafting new, user-defined premises. This transforms the interaction from a passive observation to an active collaboration, enabling users to steer the model toward more accurate and trustworthy conclusions. Through comprehensive experiments on diverse reasoning benchmarks, including GSM8K and StrategyQA, we demonstrate that Vis- CoT significantly improves final answer accuracy by up to 24 percentage points over non-interactive baselines. Furthermore, our user study reveals a substantial increase in perceived usability and user trust, underscoring the value of transparency and control. Our work presents a promising paradigm for creating more reliable, understandable, and collaborative reasoning systems by synergizing the computational power of LLMs with human critical oversight.

版本指纹 7ac33fd5fafb7173409dd79467e23080aeebc87bb5f9a9874e66c02df4d9ec78

返回筛选与清单 ↑
P079 2025 Thinking in 360°: Humanoid Visual Search in the Wild Heyang Yu; Yinan Han; Xiangyu Zhang et al. 在360°全景中通过头部转动主动寻找目标物体或路径,构建公共复杂环境H*Bench并训练视觉搜索代理。 XR与人机协作展开笔记
#P07923页 · 核对于 2026-09-15

中文摘要

在360°全景中通过头部转动主动寻找目标物体或路径,构建公共复杂环境H*Bench并训练视觉搜索代理。

核心贡献

对象搜索HOS/路径搜索HPS任务、全景感知—动作闭环与SFT+RL训练。

实现边界

环境由单张全景表示,主要动作是头部视角旋转/对准;没有真实行走、避障、动态环境或完整机器人部署验证。

Method · 方法

从全景渲染当前视角,根据图像/历史选择头部动作;Qwen2.5-VL-3B全参数SFT后RL优化搜索成功。

Results · 主要结果

对象搜索14.83%→47.38%,路径6.44%→24.94%;Gemini2.5Pro基线HOS31.96%、HPS33.00%,故训练模型并非在路径上超过最佳闭源模型。

Shortcomings · 局限

【作者/解读】物理/社会空间常识和视觉—动作转化困难;静态全景不含真实移动、视差和传感误差,路径任务仍远未解决。

证据定位

PDF §3–4、表1与训练结果、图5。

Abstract · 英文原摘要

Humans rely on the synergistic control of head (cephalomotor) and eye (oculomotor) to efficiently search for visual information in 360°. However, prior approaches to visual search are limited to a static image, neglecting the physical embodiment and its interaction with the 3D world. How can we develop embodied visual search agents as efficient as humans while bypassing the constraints imposed by realworld hardware? To this end, we proposehumanoid visual searchwhere a humanoid agent actively rotates its head to search forobjectsorpathsin an immersive world represented by a 360° panoramic image. To study visual search in visually-crowded real-world scenarios, we build H∗Bench, a new benchmark that moves beyond household scenes to challenging in-the-wild scenes that necessitate advanced visual-spatial reasoning capabilities, such as transportation hubs, large-scale retail spaces, urban streets, and public institutions. Our experiments first reveal that even top-tier proprietary models falter, achieving only∼30% success in object and path search. We then use post-training techniques to enhance the open-source Qwen2.5-VL, increasing its success rate by overthreefoldfor both object search (14.83%→47.38%) and path search (6.44%→ 24.94%). Notably, the lower ceiling of path search reveals its inherent difficulty, which we attribute to the demand for sophisticated spatial commonsense. Our results not only show a promising path forward but also quantify the immense challenge that remains in building MLLM agents that can be seamlessly integrated into everyday human life.

版本指纹 864de2cd0e517e00859e476929d6b7381cda259798222181b6e00f4b44c92e02

返回筛选与清单 ↑
P078 2025 Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs Zhining Liu; Ziyi Chen; Hui Liu et al. 分析视觉注意力与答对之间的分离,发现模型错误回答时也可能关注正确证据,提出测试时视觉证据增强VEA。 世界机制与演化XR与人机协作展开笔记
#P07821页 · 核对于 2026-09-15

中文摘要

分析视觉注意力与答对之间的分离,发现模型错误回答时也可能关注正确证据,提出测试时视觉证据增强VEA。

核心贡献

层间注意力诊断与按深层注意力选择/突出证据区域的无需训练干预。

实现边界

“看到”用注意力定位代理衡量,不等于模型完整理解或证据对答案有因果作用;需要开放权重/注意力访问。

Method · 方法

定位视觉grounding层,提取证据分数,选择性遮罩/突出图像区域后重推理;跨4个系列8个VLM比较。

Results · 主要结果

表1平均Exact Match+5.67个百分点(最高11.1),Token F1+6.83(最高17.3);跨LLaVA、Qwen、Gemma、InternVL收益较一致,小模型收益更大。

Shortcomings · 局限

【解读】关注区域也可能错误,遮罩会丢失上下文;额外推理成本及架构依赖,本文定位为诊断与干预研究而非部署完备系统。

证据定位

PDF §3–4、表1–2、§6。

Abstract · 英文原摘要

Vision-Language Models (VLMs) achieve strong results on multimodal tasks such as visual question answering, yet they can still fail even when the correct visual evidence is present. In this work, we systematically investigate whether these failures arise from notperceivingthe evidence or from notleveragingit effectively. By examining layer-wise attention dynamics, we find that shallow layers focus primarily on text, while deeper layers sparsely but reliably attend to localized evidence regions. Surprisingly, VLMs often perceive the visual evidence when outputting incorrect answers, a phenomenon we term“seeing but not believing” that widely exists in major VLM families. Building on this, we introduce an inference-time intervention that highlights deep-layer evidence regions through selective attention-based masking. It requires no training and consistently improves accuracy across multiple families, including LLaV A, Qwen, Gemma, and InternVL. These results show that VLMs encode reliable evidence internally but underutilize it, making such signals explicit can bridge the gap between perception and reasoning, advancing the diagnostic understanding and reliability of VLMs.

版本指纹 b8bec5569aa162e20a84ec3ff8ad4d9f9b33d37157fed6b7feadd35bd121ea22

返回筛选与清单 ↑
P077 2026 Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens Chengshuai Zhao; Zhen Tan; Pingchuan Ma et al. 以可控合成环境研究CoT在训练与测试分布的任务、长度和格式差异下何时失败,解释推理链与最终答案可能不一致。 世界机制与演化AI方法与评测展开笔记
#P07738页 · 核对于 2026-09-15

中文摘要

以可控合成环境研究CoT在训练与测试分布的任务、长度和格式差异下何时失败,解释推理链与最终答案可能不一致。

核心贡献

DataAlchemy精确控制分布偏移,分离推理过程、答案与完整链正确性,检验由训练分布形成的归纳偏置。

实现边界

合成符号转化任务中的受控证据,不是证明所有自然语言推理仅为记忆;大模型训练语料不透明。

Method · 方法

控制训练变换组合、链长度和表达格式,训练/微调多架构规模模型并对比ID、组合迁移和OOD;分别评估链与答案exact match。

Results · 主要结果

指定变换实验中完整链ID100%,CMP0.01%、POOD/OOD0%;可出现推理100%但答案0.01%,或推理0%但答案100%的分离。数值只适用于该受控任务。

Shortcomings · 局限

【作者】合成环境无法覆盖自然语言丰富性,真实预训练分布难度量;【解读】特定分布外失败支持脆弱性,不能直接推出不存在任何系统泛化能力。

证据定位

PDF §3–8、表1–2 p.7、Limitations p.11。

Abstract · 英文原摘要

Chain-of-Thought (CoT) prompting has been shown to be effective in eliciting structured reasoning (i.e., CoT reasoning) from large language models (LLMs). Regardless of its popularity, recent studies expose its failures in some reasoning tasks, raising fundamental questions about the nature of CoT reasoning. In this work, we propose a data distribution lens to understand when and why CoT reasoning succeeds or fails. We hypothesize that CoT reasoning reflects a structured inductive bias learned from in-distribution data, enabling models to conditionally generate reasoning trajectories that approximate those observed during training. As such, the effectiveness of CoT reasoning is fundamentally governed by the nature and degree of distribution discrepancy between training data and test queries. Guided by this lens, we dissect CoT reasoning via three dimensions:task,length, andformat. To test the hypothesis, we introduceDataAlchemy, an abstract and fully controllable environment that trains LLMs from scratch and systematically probes them under various distribution conditions. Through rigorous controlled experiments, we reveal that CoT reasoning is a brittle mirage when it is pushed beyond training distributions, emphasizing the ongoing challenge of achieving genuine and generalizable reasoning. Our code is available at GitHub: https://github.com/ChengshuaiZhao0/DataAlchemy.

版本指纹 a039bae82027a21ab7d38f00228c4d1e549f5b543ad1ad172b9b6c656cf05c6f

返回筛选与清单 ↑
P076 2025 Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models Rock Yuren Pang; K. J. Kevin Feng; Shangbin Feng et al. Hippo将长推理文本组织成可交互的主题树,允许用户删除、添加、修改假设并重新生成,支持有权衡的日常决策。 创作与规则补全XR与人机协作展开笔记
#P07615页 · 核对于 2026-09-15

中文摘要

Hippo将长推理文本组织成可交互的主题树,允许用户删除、添加、修改假设并重新生成,支持有权衡的日常决策。

核心贡献

提出Interactive Reasoning界面与原型,展示在输出最终答案前介入推理内容的人机协作。

实现边界

可视化的是生成的CoT及其整理结果,不是模型真实内部计算图;作者明确没有声称反馈使推理或答案更准确/更个性化。

Method · 方法

DeepSeek-R1生成推理,GPT-4o负责整理树、澄清和连接节点;反馈节点/直接编辑后续写;16人被试内比较。

Results · 主要结果

感知控制评分Hippo5.75对基线4.19,p=.003;用户报告更易理解结构和察觉假设,观察到更有针对性的反馈;没有客观准确率提升结论。

Shortcomings · 局限

【作者】N=16且较熟悉LLM,两项日常两难任务;没有系统验证反馈后的模型行为或CoT忠实性,知识密集任务需外部证据。

证据定位

PDF §4.3、§5.3、§8 p.11。

Abstract · 英文原摘要

The output quality of large language models (LLMs) can be improved via “reasoning”: generating segments of chain-of-thought (CoT) content to further condition the model prior to producing user-facing output. While these chains contain valuable information, they are verbose and lack explicit organization, making them tedious to review. Moreover, they lack opportunities for user feedback, such as to remove unwanted considerations, add desired ones, or clarify unclear assumptions. We introduce Interactive Reasoning, an interaction design that visualizes chain-of-thought outputs as a hierarchy of topics and enables user review and modification. We implement interactive reasoning in Hippo, a prototype for AIassisted decision making in the face of uncertain trade-offs. In a user study with 16 participants, we find that interactive reasoning in Hippo allows users to quickly identify and interrupt erroneous generations, efficiently steer the model towards customized responses, and better understand both model reasoning and model outputs. Our work contributes to a new paradigm that incorporates user oversight into LLM reasoning processes.

版本指纹 f659a7c8bfc4836d0491888233347daea905380b2a73283dc5f7305cfd0ce316

返回筛选与清单 ↑
P075 2025 Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization Mengshi Qi; Hongwei Ji; Wulian Yun et al. 将视频与由VLM/LLM生成的Chain-of-Evidence文本结合,在少样本条件下定位未见动作类别的时间范围。 世界机制与演化XR与人机协作展开笔记
#P07522页 · 核对于 2026-09-15

中文摘要

将视频与由VLM/LLM生成的Chain-of-Evidence文本结合,在少样本条件下定位未见动作类别的时间范围。

核心贡献

层次文本—视觉对齐、逐阶段证据链生成和Human-related Anomaly Localization(HAL)数据集。

实现边界

few-shot针对新动作类别,基础VLM/LLM和特征器已有预训练;文本生成后有自动过滤、一致性校验、迭代及人工审核,不是无需人工的通用因果定位。

Method · 方法

从视频产生事件证据描述,逐层精化时间/动作关系;对齐query/support视觉及语义特征,联合建模动作共同性与差异。

Results · 主要结果

ActivityNet1.3单实例1-shot mAP@0.5=71.5,多实例5-shot=58.7;在THUMOS14多实例设置改善,但单实例1-shot下降,作者归因于短且不完整动作片段妨碍完整CoE生成。

Shortcomings · 局限

【作者/解读】依赖生成文本质量、验证成本和完整动作语境;HAL及少样本划分的提升不能直接外推到开放世界长视频;证据链提及因果关系并不构成因果识别。

证据定位

PDF §III–IV、表I/III、图6 pp.6–8。

Abstract · 英文原摘要

Traditional temporal action localization (TAL) methods rely on large amounts of detailed annotated data, whereas few-shot TAL reduces this dependence by using only a few training samples to identify unseen action categories. However, existing few-shot TAL methods typically focus solely on video-level information, neglecting textual information, which can provide valuable semantic support for the action localization task. To address these issues, in this work, we propose a new few-shot temporal action localization method by Chain-of-Evidence multimodal reasoning to improve localization performance. Specifically, we design a novel few-shot learning framework to capture action commonalities and variations, which includes a semantic-aware text-visual alignment module designed to align the query and support videos at different levels. Meanwhile, to better express the temporal dependencies and causal relationships between actions at the textual level, we design a Chain-of-Evidence (CoE) reasoning method that progressively guides the Vision Language Model (VLM) and Large Language Model (LLM) to generate CoE text descriptions for videos. The generated texts can capture more variance of action than visual features. We conduct extensive experiments on the publicly available ActivityNet1.3, THUMOS14 and our newly collected Human-related Anomaly Localization Dataset . The experimental results demonstrate that our proposed method significantly outperforms existing methods in single-instance and multi-instance scenarios. Our source code and data are available at https://github.com/MICLAB-BUPT/VAL-VLM.

版本指纹 b7cc35891863b534350013194741c2b2bdb2484992030b98ef52a200fee69b5c

返回筛选与清单 ↑
P074 2025 Beyond Single-Sentence Prompts: Upgrading Value Alignment Benchmarks with Dialogues and Stories Yazhou Zhang; Qimeng Liu; Qiuchi Li et al. 把单句中文价值观评测改写成多轮对话与伦理故事,检验更复杂上下文中的价值对齐与责任判断。 世界机制与演化展开笔记
#P07424页 · 核对于 2026-09-15

中文摘要

把单句中文价值观评测改写成多轮对话与伦理故事,检验更复杂上下文中的价值对齐与责任判断。

核心贡献

基于CVALUES构建C-Plus Values/CVALUES PLUS数据及分层评估框架,暴露单轮直接问题不易发现的失误。

实现边界

中文语境和定义的伦理评分;分数并非客观普世道德质量,也不等于已改善模型安全性。

Method · 方法

自动/人工清洗原始问题,生成对话陷阱与故事,组合人工和自动评分,比较不同模型在对话/叙事场景的表现。

Results · 主要结果

本地报告Claude3.5对话得分83.7、故事65.3;许多模型在故事任务下降,但各模型并非一致,Llama3.1-405B对话49.4、故事55.2。

Shortcomings · 局限

【作者】文化和场景覆盖有限,评分主观,复杂伦理标准难统一;【解读】合成改写及自动评判可能引入系统偏差。

证据定位

PDF §2–5,§5.2–3 p.13、Limitations p.15。

Abstract · 英文原摘要

Evaluating the value alignment of large language models (LLMs) has traditionally relied on single-sentence adversarial prompts, which directly probe models with ethically sensitive or controversial questions. However, with the rapid advancements in AI safety techniques, models have become increasingly adept at circumventing these straightforward tests, limiting their effectiveness in revealing underlying biases and ethical stances. To address this limitation, we propose an upgraded value alignment benchmark that moves beyond single-sentence prompts by incorporating multi-turn dialogues and narrative-based scenarios. This approach enhances the stealth and adversarial nature of the evaluation, making it more robust against superficial safeguards implemented in modern LLMs. We design and implement a dataset that includes conversational traps and ethically ambiguous storytelling, systematically assessing LLMs’ responses in more nuanced and context-rich settings. Experimental results demonstrate that this enhanced methodology can effectively expose latent biases that remain undetected in traditional single-shot evaluations. Our findings highlight the necessity of contextual and dynamic testing for value alignment in LLMs, paving the way for more sophisticated and realistic assessments of AI ethics and safety.

版本指纹 f87a1db46bf43589966d1bf5fd3334cc597bee27afaab611b70859c0073e3b08

返回筛选与清单 ↑
P073 2025 The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity Parshin Shojaee; Iman Mirzadeh; Keivan Alizadeh et al. 在可调复杂度的谜题中比较推理模型与普通LLM,分析准确率与思考token随复杂度变化的规律。 世界机制与演化AI方法与评测展开笔记
#P07330页 · 核对于 2026-09-15

中文摘要

在可调复杂度的谜题中比较推理模型与普通LLM,分析准确率与思考token随复杂度变化的规律。

核心贡献

使用汉诺塔、棋子交换、过河及积木等可模拟验证任务,识别低、中、高复杂度的不同表现区间并检查推理轨迹。

实现边界

测量有限模型在给定提示、完整动作序列输出和预算下的谜题表现;不能据此证明模型完全没有推理能力,或所有未来架构存在同一不可逾越上限。

Method · 方法

调节任务规模、以模拟器验证逐步动作,每实例25次采样;匹配推理预算比较pass@k,分析解答出现位置及token使用。

Results · 主要结果

低复杂度普通模型常较有效,中复杂度推理模型占优,高复杂度二者可降至0;临界复杂度附近思考token反而下降,即使仍有预算;给出算法也未稳定解决精确执行。

Shortcomings · 局限

【作者】谜题领域窄、主要黑箱API、确定性逐步验证难推广;【解读】输出长度、任务可解性/表示和执行协议均影响阈值,不能把经验失败解释为普遍理论结论。

证据定位

PDF §4、图4–8、§5及Limitations p.11。

Abstract · 英文原摘要

Recent generations of frontier language models have introduced Large Reasoning Models (LRMs) that generate detailed thinking processes before providing answers. While these models demonstrate improved performance on reasoning benchmarks, their fundamental capabilities, scaling properties, and limitations remain insufficiently understood. Current evaluations primarily focus on established mathematical and coding benchmarks, emphasizing final answer accuracy. However, this evaluation paradigm often suffers from data contamination and does not provide insights into the reasoning traces’ structure and quality. In this work, we systematically investigate these gaps with the help of controllable puzzle environments that allow precise manipulation of compositional complexity while maintaining consistent logical structures. This setup enables the analysis of not only final answers but also the internal reasoning traces, offering insights into how LRMs “think”. Through extensive experimentation across diverse puzzles, we show that frontier LRMs face a complete accuracy collapse beyond certain complexities. Moreover, they exhibit a counterintuitive scaling limit: their reasoning effort increases with problem complexity up to a point, then declines despite having an adequate token budget. By comparing LRMs with their standard LLM counterparts under equivalent inference compute, we identify three performance regimes: (1) lowcomplexity tasks where standard models surprisingly outperform LRMs, (2) medium-complexity tasks where additional thinking in LRMs demonstrates advantage, and (3) high-complexity tasks where both models experience complete collapse. We found that LRMs have limitations in exact computation: they fail to use explicit algorithms and reason inconsistently across puzzles. We also investigate the reasoning traces in more depth, studying the patterns of explored solutions and analyzing the models’ computational behavior, shedding light on their strengths, limitations, and ultimately raising crucial questions about their true reasoning capabilities.

版本指纹 cb4c72f922d3eb75d5fa10c371818027374bf8b592453fc569003a0dfff12a0d

返回筛选与清单 ↑
P072 2025 Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance Ruihang Chu; Yefei He; Zhekai Chen et al. 用密集点轨迹移动首帧潜特征,直接作为图生视频条件,实现无需额外运动编码器的精细运动控制,并提出MoveBench。 世界机制与演化展开笔记
#P07222页 · 核对于 2026-09-15

中文摘要

用密集点轨迹移动首帧潜特征,直接作为图生视频条件,实现无需额外运动编码器的精细运动控制,并提出MoveBench。

核心贡献

latent trajectory guidance与运动控制评测集,保持Wan-I2V架构并进行规模化训练。

实现边界

无架构变化不等于无需训练;需要首帧及运动轨迹,主要展示5秒480p生成,不保证长期遮挡下的可控性。

Method · 方法

将点轨迹投影到VAE潜空间,沿轨迹复制首帧特征,形成时空条件图,对基础I2V模型微调。

Results · 主要结果

MoveBench/DAVIS上取得较低轨迹EPE和较高PSNR/SSIM;192个多物体样例继续评估;用户研究认为运动控制可与Kling1.5Pro Motion Brush相比,比较限定于所评设置。

Shortcomings · 局限

【作者】长时间遮挡、轨迹缺失可使控制丢失;【解读】质量和控制受基础模型、轨迹准确性及训练分布限制,用户偏好不等同所有指标领先。

证据定位

PDF §3、§5表1–2、§6 p.10。

Abstract · 英文原摘要

We present Wan-Move, a simple and scalable framework that brings motion control to video generative models. Existing motion-controllable methods typically suffer from coarse control granularity and limited scalability, leaving their outputs insufficient for practical use. We narrow this gap by achieving precise and high-quality motion control. Our core idea is to directly make the original condition features motion-aware for guiding video synthesis. To this end, we first represent object motions with dense point trajectories, allowing fine-grained control over the scene. We then project these trajectories into latent space and propagate the first frame’s features along each trajectory, producing an aligned spatiotemporal feature map that tells how each scene element should move. This feature map serves as the updated latent condition, which is naturally integrated into the off-the-shelf image-to-video model,e.g., Wan-I2V-14B, as motion guidance without any architecture change. It removes the need for auxiliary motion encoders and makes fine-tuning base models easily scalable. Through scaled training, Wan-Move generates 5-second, 480p videos whose motion controllability rivals Kling 1.5 Pro’s commercial Motion Brush, as indicated by user studies. To support comprehensive evaluation, we further design MoveBench, a rigorously curated benchmark featuring diverse content categories and hybrid-verified annotations. It is distinguished by larger data volume, longer video durations, and high-quality motion annotations. Extensive experiments on MoveBench and the public dataset consistently show Wan-Move’s superior motion quality. Code, models, and benchmark data are made available.

版本指纹 d9a58b9d2755593daeac68fd1ff16c24e6acf21b605077b53c9a007c14d384d3

返回筛选与清单 ↑
P071 2025 Counterfactual World Models via Digital Twin-conditioned Video Diffusion Yiqing Shen; Aiza Maksutova; Chenjia Li et al. 把视频转为显式对象与关系的数字孪生描述,LLM修改干预后的时间演化,再条件生成反事实视频。 世界机制与演化展开笔记
#P07114页 · 核对于 2026-09-15

中文摘要

把视频转为显式对象与关系的数字孪生描述,LLM修改干预后的时间演化,再条件生成反事实视频。

核心贡献

CWMDT将感知、干预传播和视频合成分开,提供可编辑结构条件。

实现边界

数字孪生为结构化文本/轨迹描述,不是经过物理验证的仿真器;LLM预测的反事实合理性不等于识别真实因果效应。

Method · 方法

提取场景摘要、对象帧描述、深度/面积/质心轨迹→LLM生成干预后的表示→视频扩散条件合成;每个干预采样3条孪生轨迹。

Results · 主要结果

在RVEBench及另一反事实视频基准报告优于比较方法;补充CausalVQA debug评估中Qwen2.5VL+CWMDT反事实准确率70.0%,比基础模型+17.5个百分点,anticipation62.5%、hypothetical72.5%。这些是小型debug集结果。

Shortcomings · 局限

【解读】感知、结构化与LLM推断错误可逐级传播;小规模反事实QA不能证明真实部署或物理约束严格满足;生成成本和多候选选择影响效果。

证据定位

PDF §3–4 pp.3–8;附录A表4 p.10。

Abstract · 英文原摘要

World models learn to predict the temporal evolution of visual observations given a control signal, potentially enabling agents to reason about environments through forward simulation. Because of the focus on forward simulation, current world models generate predictions based on factual observations. For many emerging applications, such as comprehensive evaluations of physical AI behavior under varying conditions, the ability of world models to answer counterfactual queries – such as “what would happen if this object was removed?” – is of increasing importance. We formalize counterfactual world models that additionally take interventions as explicit inputs, predicting temporal sequences under hypothetical modifications to observed scene properties. Traditional world models operate directly on entangled pixel-space representations where object properties and relationships cannot be selectively modified. This modeling choice prevents targeted interventions on specific scene properties. We introduce CWMDT, a framework to overcome those limitations, turning standard video diffusion models into effective counterfactual world models. First, CWMDT constructs digital twins of observed scenes to explicitly encode objects and their relationships, represented as structured text. Second, CWMDT applies large language models to reason over these representations and predict how a counterfactual intervention propagates through time to alter the observed scene. Third, CWMDT conditions a video diffusion model with the modified representation to generate counterfactual visual sequences. Evaluations on two benchmarks show that the CWMDT approach achieves state-of-the-art performance, suggesting that alternative representations of videos, such as the digital twins considered here, offer powerful control signals for video forward simulation-based world models.

版本指纹 7f7d56e5b755149cc609ad0acdf0b5e58ccdf160a388465ebd8c1f1b9d83044e

返回筛选与清单 ↑
P070 2025 Impossible Videos Zechen Bai; Hai Ci; Mike Zheng Shou 构建违背物理、生物、地理或社会常识的视频生成/理解基准,检查模型能否遵循不可能情景提示并识别视频异常。 世界机制与演化展开笔记
#P07026页 · 核对于 2026-09-15

中文摘要

构建违背物理、生物、地理或社会常识的视频生成/理解基准,检查模型能否遵循不可能情景提示并识别视频异常。

核心贡献

IPV-Bench分类体系(4域14类)、IPV-TXT生成提示与IPV-VID理解数据及综合生成指标。

实现边界

目标是按提示生成反现实内容,不能把高分解读为更准确模拟物理;“不可能”包括语境化社会/地理常识,非全是严格物理定律。

Method · 方法

按分类设计提示、收集筛选生成视频,对生成质量/提示跟随及Video-LLM异常理解做评测。

Results · 主要结果

所测生成模型最佳Mochi1仅37.3%情形生成高质量不可能视频;高视觉质量与异常提示跟随常不一致;视频理解模型仍难联合时间动态和世界知识识别异常。

Shortcomings · 局限

【解读】人工分类、生成器分布和评判者影响结果;反现实题材不覆盖普通现实视频能力,模型排名仅对应本地版本评测。

证据定位

PDF §3–5,表2、§4.1 p.8。

Abstract · 英文原摘要

Synthetic videos nowadays is widely used to complement data scarcity and diversity of realworld videos. Current synthetic datasets primarily replicate real-world scenarios, leaving impossible, counterfactual and anti-reality video concepts underexplored. This work aims to answer two questions: 1) Can today’s video generation models effectively follow prompts to create impossible video content? 2) Are today’s video understanding models good enough for understanding impossible videos? To this end, we introduce IPV-B ENCH , a novel benchmark designed to evaluate and foster progress in video understanding and generation. IPV-B ENCH is underpinned by a comprehensive taxonomy, encompassing 4 domains, 14 categories. It features diverse scenes that defy physical, biological, geographical, or social laws. Based on the taxonomy, a prompt suite is constructed to evaluate video generation models, challenging their prompt following and creativity capabilities. In addition, a video benchmark is curated to assess Video-LLMs on their ability of understanding impossible videos, which particularly requires reasoning on temporal dynamics and world knowledge. Comprehensive evaluations reveal limitations and insights for future directions of video models, paving the way for next-generation video models.

版本指纹 5b6d3239d06f838dbbfd470e42f62eeea8a74a38479c99979b2fc1a3edf6918e

返回筛选与清单 ↑
P069 2026 VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning Ye Liu; Kevin Qinghong Lin; Chang Wen Chen et al. 用规划、时刻定位、验证、回答四个角色进行带时间证据的视频问答,以共享骨干上的多个LoRA切换角色。 世界机制与演化XR与人机协作展开笔记
#P06926页 · 核对于 2026-09-15

中文摘要

用规划、时刻定位、验证、回答四个角色进行带时间证据的视频问答,以共享骨干上的多个LoRA切换角色。

核心贡献

角色化视频推理与Chain-of-LoRA,兼顾专门训练能力与显存效率,评估15个基准。

实现边界

各角色有专门训练数据/优化,并非零训练工具链;定位证据不代表严格因果解释,尚未结合音频。

Method · 方法

planner决定需要何种角色,grounder提出时间段,verifier筛选,answerer基于片段回答;同一Qwen2-VL骨干动态加载角色LoRA。

Results · 主要结果

表7(2B)Chain-of-LoRA峰值显存4.2GB,对独立四模型16.6GB,性能相同;Video-MME总分55.4对基础53.0,长视频46.3对43.1;NExT-GQA准确率71.4对69.6、mIoU28.6。

Shortcomings · 局限

【作者】角色与数据需精细优化,联合优化/音频待研究;【解读】多步定位验证仍增加延迟,收益跨基准不均匀。

证据定位

PDF §3–4、表7 p.9、结论局限。

Abstract · 英文原摘要

Videos, with their unique temporal dimension, demand precise grounded understanding, where answers are directly linked to visual, interpretable evidence. Despite significant breakthroughs in text-based reasoning with large language models, multi-modal reasoning – especially for videos – remains limited. In this work, we fill this gap by introducingVideoMind, a novel video-language agent for temporal-grounded video reasoning. Our method involves two key innovations: (1) We identify four essential capabilities for grounded video reasoning and propose a role-based agentic workflow, comprising aplannerto coordinate roles, a grounderfor temporal event localization, averifierto assess event candidates, and ananswererfor question answering. (2) To efficiently integrate these roles during inference, we propose a novelChain-of-LoRAmechanism, where a unified base model with multiple LoRA adapters is leveraged to enable seamless role switching, balancing efficiency and flexibility. Extensive experiments on 15 benchmarks across Grounded VideoQA, Video Temporal Grounding, and General VideoQA tasks demonstrate the effectiveness of the proposed scheme in advancing video agent, test-time scaling, and long-form video reasoning. Code, models, datasets, and demos are available athttps://videomind.github.io/.

版本指纹 7e5ba7dcd966c8bd72980a005b98027b8f67c0a05fb6f778f241a2a0bf09e666

返回筛选与清单 ↑
P068 2025 TPDiff: Temporal Pyramid Video Diffusion Model Lingmin Ran; Mike Zheng Shou 利用扩散前期高噪声下的帧冗余,以低帧率起步并逐阶段增加帧率,配合分阶段扩散训练降低视频生成成本。 世界机制与演化展开笔记
#P06811页 · 核对于 2026-09-15

中文摘要

利用扩散前期高噪声下的帧冗余,以低帧率起步并逐阶段增加帧率,配合分阶段扩散训练降低视频生成成本。

核心贡献

时间金字塔扩散与stage-wise训练,统一减少训练和采样计算。

实现边界

需要相应训练/适配;验证以MiniFlux-vid、AnimateDiff等配置为主,不是任意预训练视频模型的无损即插即用加速。

Method · 方法

沿去噪过程分段求解概率流ODE,阶段间时序插值并对齐数据/噪声,仅末段使用完整帧率。

Results · 主要结果

30步采样:MiniFlux-vid20.79→12.18秒(1.71倍),AnimateDiff6.01→4.04秒(1.49倍);训练速度约2/2.13倍,所评VBench多数指标保持或改善。

Shortcomings · 局限

【解读】速度依赖帧数/架构/硬件;早期低时间分辨率可能丢失快速运动信息,长视频/高动态真实需求的普遍质量保证未建立。

证据定位

PDF §3–4、表1–2、图5 pp.6–8。

Abstract · 英文原摘要

The development of video diffusion models unveils a significant challenge: the substantial computational demands. To mitigate this challenge, we note that the reverse process of diffusion exhibits an inherent entropy-reducing nature. Given the inter-frame redundancy in video modality, maintaining full frame rates in high-entropy stages is unnecessary. Based on this insight, we propose TPDiff, a unified framework to enhance training and inference efficiency. By dividing diffusion into several stages, our framework progressively increases frame rate along the diffusion process with only the last stage operating on full frame rate, thereby optimizing computational efficiency. To train the multi-stage diffusion model, we introduce a dedicated training framework: stage-wise diffusion. By solving the partitioned probability flow ordinary differential equations (ODE) of diffusion under aligned data and noise, our training strategy is applicable to various diffusion forms and further enhances training efficiency. Comprehensive experimental evaluations validate the generality of our method, demonstrating 50% reduction in training cost and 1.5x improvement in inference efficiency. Our project page is: https://showlab.github.io/TPDiff/

版本指纹 6b838eac12b8bc1270dcdc00e5c80b63d18971a73a7554cd9d0f9f90206ced06

返回筛选与清单 ↑
P067 2024 τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains Shunyu Yao; Noah Shinn; Pedram Razavi et al. 用模拟用户、领域规则和API数据库交互评估语言代理,检查最终数据库是否达成目标,并衡量多次执行都成功的可靠性。 XR与人机协作展开笔记
#P06750页 · 核对于 2026-09-15

中文摘要

用模拟用户、领域规则和API数据库交互评估语言代理,检查最终数据库是否达成目标,并衡量多次执行都成功的可靠性。

核心贡献

零售/航空服务任务及pass^k一致性指标,补充静态工具调用基准。

实现边界

用户由LLM模拟,后端为受控数据库;pass^k指k次都成功,和至少一次成功的pass@k相反;数据库结果匹配无法穷尽所有对话品质/规则违规。

Method · 方法

给代理政策与工具、模拟用户给需求,通过交互完成状态改变;匹配最终状态并重复运行估计一致成功率。

Results · 主要结果

表2 GPT-4o pass^1零售61.2%、航空35.2%,按领域平均48.2%;零售pass^8低于25%。因此摘要“<50%”是跨领域平均,不是每个域都低于50%。

Shortcomings · 局限

【解读】两域、模拟用户和有限任务影响外部效度;成功依赖模型版本/提示/工具实现,最终状态评估也可能漏掉过程中错误。

证据定位

PDF §2–5、表2、图4。

Abstract · 英文原摘要

Existing benchmarks do not test language agents on their interaction with human users or ability to follow domain-specific rules, both of which are vital for deploying them in real world applications. We propose τ-bench, a benchmark emulating dynamic conversations between a user (simulated by language models) and a language agent provided with domain-specific API tools and policy guidelines. We employ an efficient and faithful evaluation process that compares the database state at the end of a conversation with the annotated goal state. We also propose a new metric (pass^k) to evaluate the reliability of agent behavior over multiple trials. Our experiments show that even state-of-the-art function calling agents (like gpt-4o) succeed on < 50% of the tasks, and are quite inconsistent (pass^8 < 25% in retail). Our findings point to the need for methods that can improve the ability of agents to act consistently and follow rules reliably.

版本指纹 0ce66a1763d698c61bb311c3c874bf593d1e9a5bfff11bb35f6f72b981f6da56

返回筛选与清单 ↑
P066 2024 Let’s Verify Step by Step Hunter Lightman; Vineet Kosaraju; Yura Burda et al. 比较对每一步推理给反馈的过程监督与只标记最终答案的结果监督,在数学推理中过程奖励模型更适合挑选可靠解答,并发布PRM800K人工标注。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P06629页 · 核对于 2026-09-15

中文摘要

比较对每一步推理给反馈的过程监督与只标记最终答案的结果监督,在数学推理中过程奖励模型更适合挑选可靠解答,并发布PRM800K人工标注。

核心贡献

系统对比PRM/ORM、主动学习收集步骤标注及约80万条反馈数据集。

实现边界

主要训练奖励/排序模型,固定生成器进行best-of-N选择;作者明确没有用奖励模型对生成器做RL。78%是在代表性MATH测试子集、较大采样预算下的结果。

Method · 方法

人类逐步判断正确/错误/中性,训练步骤奖励模型;与自动最终答案标签训练的ORM和多数投票比较;主动选择高价值错误样本。

Results · 主要结果

最佳过程监督系统在所评MATH子集解出约78%;PRM随N增加优于ORM和多数投票;主动学习带来约2.6倍数据效率提升。

Shortcomings · 局限

【作者/解读】数学域和可检查答案限制泛化;大规模PRM/ORM训练数据并非完全可比,小规模实验补充控制;人工步骤标注昂贵,多样本排序增加推理成本。

证据定位

PDF §2、§3–5、图3、§8;方法边界p.3。

Abstract · 英文原摘要

In recent years, large language models have greatly improved in their ability to perform complex multi-step reasoning. However, even stateof-the-art models still regularly produce logical mistakes. To train more reliable models, we can turn either to outcome supervision, which provides feedback for a final result, or process supervision, which provides feedback for each intermediate reasoning step. Given the importance of training reliable models, and given the high cost of human feedback, it is important to carefully compare the both methods. Recent work has already begun this comparison, but many questions still remain. We conduct our own investigation, finding that process supervision significantly outperforms outcome supervision for training models to solve problems from the challenging MATH dataset. Our process-supervised model solves 78% of problems from a representative subset of the MATH test set. Additionally, we show that active learning significantly improves the efficacy of process supervision. To support related research, we also release PRM800K, the complete dataset of 800,000 step-level human feedback labels used to train our best reward model.

版本指纹 af32cabec7d40ca2d5b6bfc8ea28d6b5fdcf987eabb0843ca9a5a6f2371fdfaf

返回筛选与清单 ↑
P065 2023 Human-in-the-Loop through Chain-of-Thought Zefan Cai; Baobao Chang; Wenjuan Han 通过人类局部修改LLM推理链提升多步推理,并用成本—效用模型分析人工纠错投入的取舍。 创作与规则补全世界机制与演化XR与人机协作展开笔记
#P06520页 · 核对于 2026-09-15

中文摘要

通过人类局部修改LLM推理链提升多步推理,并用成本—效用模型分析人工纠错投入的取舍。

核心贡献

Manual Correction System(MCS)与CAMLOP成本效用模型,将中间逻辑修正和人工成本一起评估。

实现边界

使用text-davinci-002及12个推理数据集;改善包含额外人工信息,不能等同模型自主推理提升;经济模型最优性仅相对其成本/效用假设。

Method · 方法

人工检查并修正推理子步骤,继续生成;可结合self-consistency;以Cobb–Douglas式效用与预算分析纠错策略。

Results · 主要结果

8个算术数据集MCS比CoT平均+4.68个百分点,结合self-consistency平均+6.39;GSM8K56.48→61.56→62.92(5次运行中位);还评估常识/符号任务。

Shortcomings · 局限

【解读】人工知识、纠错质量及时间计价会影响结论;旧单一骨干和有限任务限制对现今模型与真实人机协作的外推。

证据定位

PDF §3–4、表2–3、§5–6。

Abstract · 英文原摘要

While the emergence of powerful language models along with Chain-of-thought prompting has made automation more and more omnipresent, it sometimes demonstrates its weakness in long-term or multi-step logical reasoning. For example, users don’t always get desirable answers for complex mathematical problems without human involvement. Against this background, we present the Manual Correction System (MCS) — a human-in-the-loop system enhanced by Chainof-Thought prompting, which explores how manual correction of sub-logics in rationales can improve LLM’s reasoning performance. Moving one step forward, considering a system with human-in-the-loop involves more than having humans improve performance but also controlling the cost. Therefore, we post a Costutility Analysis Model for Human-in-the-Loop systems (CAMLOP) based on classical economics theory to analyze, quantify and balance the utility and the corresponding cost. We conduct experiments of MCS and CAMLOP with twelve datasets. A significant advantage w.r.t cost and utility proves its superiority over strong baselines.

版本指纹 0a48c6cfe64884bc4292a0b31e6fd639697b72ad6161f55fcdbc5369721205f6

返回筛选与清单 ↑
P064 2025 Causality Model for Semantic Understanding on Videos Yicong Li(李逸聪;学位作者);导师Tat-Seng Chua 围绕视频关系检测与视频问答中的长尾、背景混淆和复杂时空结构,依次提出IVRD、IGV、EIGV和STR/TranSTR,研究因果建模与视觉证据选择。 世界机制与演化XR与人机协作展开笔记
#P064139页 · 核对于 2026-09-15

中文摘要

围绕视频关系检测与视频问答中的长尾、背景混淆和复杂时空结构,依次提出IVRD、IGV、EIGV和STR/TranSTR,研究因果建模与视觉证据选择。

核心贡献

四部分:关系原型与干预去偏;问题关键场景的不变定位;结合等变性的可解释定位;复杂长视频中关键帧和对象的时空选择。

实现边界

针对具体监督视频理解任务的结构建模与正则化;没有证实任意现实因果发现。作者明确缺少人类因果场景定位标注,主要由QA准确率间接验证定位质量。

Method · 方法

IVRD以对象轨迹和关系原型降低对象—关系偏置;IGV置换环境保持答案不变;EIGV再要求因果场景/问题语义变化引发答案等变;TranSTR可微选择时刻/对象并改进候选答案解码。

Results · 主要结果

表3.2 ImageNet-VidVRD:mAP22.97对基线21.24,零样本mAP1.47对0.60;表4.2 IGV NExT-QA51.34对HGA50.01;表5.2 EIGV跨骨干/数据集提升1.3–5.2个百分点;表6.3 TranSTR NExT-QA61.5、MSVD47.1、MSRVTT43.1,表6.4 Causal-VidQA62.2对VGT55.4。不同章的骨干/设置不同,不能视为单一连续受控消融。

Shortcomings · 局限

【作者】缺乏直接视觉因果定位评估、迁移到大型VLM计算开销高、3D与现实复杂场景待探索;【解读】背景置换和因果图是建模假设,QA改进本身不证明识别真实因果机制。

证据定位

摘要PDF pp.9–11;表3.2 p.46、表4.2–3 p.71、表5.2 p.91、表6.3–4 p.114;结论pp.120–123。

Abstract · 英文原摘要

After a decade of prosperity, the development of video understanding has reached a critical juncture, where the sole reliance on massive data and complex architectures is no longer a one-size-fits-all solution to all situations. The presence of ubiquitous data imbalance hampers DNNs from effectively learning the underlying causal mechanisms, leading to significant performance drops when encountering distribution shifts, such as long-tail imbalances and perturbed imbalances. This realization has prompted researchers to seek alternative methodologies to capture causal patterns in video data. To tackle these challenges and increase the robustness of DNNs, causal modeling emerged as a principle to discover the true causal patterns behind the observed correlations. This thesis focuses on the domain of semantic video understanding and explores the potential of causal modeling to advance two fundamental tasks: Video Relation Detection (VidVRD) and Video Question Answering (VideoQA). In summary, the major contributions of this thesis are as follows: • We propose an interventional video relation detection method , named IVRD, to address the long-tail imbalance of relation in VidVRD, where tail relations, despite being informative, are difficult to predict due to their scarcity in the dataset. Specifically, we form a set of relation prototypes in a hierarchical manner, which forces the relation reasoning module to focus on the visual content of dynamic interactions between entities rather than relying on spurious correlations between objects and relation labels. By incorporating causal reasoning, IVRD offers a promising direction for improving video understanding in the presence of long-tail imbalances, enabling models to better generalize to real-world scenarios where rare or infrequent relations may play a crucial role in the overall understanding of the scene. • We introduce the invariant grounding for VideoQA , dubbed as IGV, a model-agnostic learning framework that addresses the negative effect induced by the spurious correlations in the answer-environment. In essence, IGV discovers the causal reasoning pattern by grounding the questioncritical (causal) scene. Specifically, it leverages the fact that the relations between causal scenes and answers are invariant regardless of changes in the environment, and the removal of causal scenes should cause failure in answering the question. By grounding these critical scenes, IGV compels the VideoQA models to focus on the essential visual content for accurate reasoning, while shielding them from the negative influence of the environment, thus significantly improving the reasoning ability of the backbone models. • We introduce the equivariant grounding for VideoQA , EIGV, to further advance the robustness and visual explainability in a model-agnostic manner. Built on top of IGV, EIGV additionally incorporates equivariance, which encourages the answering process to be sensitive to the semantic changes in the causal scene and question. In comparison, invariant grounding enforces the answering to be insensitive to changes in the environmental scene. As a result, these two regularizations work collaboratively to distinguish the causal scene from the environment while providing more transparency by presenting the visual-linguistic alignment. By combining the strengths of both invariant and equivariant grounding, EIGV creates a more robust and explainable framework for VideoQA. • We discover spatio-Temporal rationales for VideoQA, which solve the low accuracy on samples with long video and multiple objects ( i.e.complex VideoQA). Since current VideoQA practices (including pretrained models, e.g.SeVila [158]) are mostly trained with short video clips ( ∼15s) with few entities (∼2), they tend to suffer from poor transferability to complex video (over 80s and 5 objects). The reason behind is that long videos inevitably introduce vast redundancy and spurious correlations due to the presence of numerous question-irrelevant environmental objects. Confronting this challenge, we first highlight the importance of modeling question-critical temporal moments and spatial objects, and then introduce Spatio-Temporal Rationalization (STR), which utilizes a differentiable selection module to adaptively gather question-critical moments and objects through cross-modal interaction. Coupled with a more reasonable candidate answer decoding strategy, STR effectively identifies question-irrelevant frames and objects as causal patterns, leading to improved predictions, especially in complex scenarios. A limitation of this thesis pertains to the evaluation of the identified causal scenes. Throughout the research, we have relied on the overall Question Answering (QA) performance as an indirect indicator of the discovered causal scene’s quality, which is based on the rationale that a more accurate localization of the causal scene can potentially yield richer question-relation visual cues, subsequently enhancing QA performance. However, it is essential to acknowledge that a direct quantitative measure rooted in the causal scene would offer more compelling insights. Regrettably, due to the absence of human-level grounding annotations, such a measurement remains absent in the current work. Therefore, future endeavors will focus on establishing an evaluation benchmark specifically tailored to the causal scene, involving human annotations on the visual elements that underpin the answering process. This initiative will contribute to a more comprehensive and rigorous assessment of causal scene discovery. In summary, our contributions extend the frontiers of causal modeling in semantic video understanding, empowering AI systems to grasp causal patterns and improve performance on challenging video understanding tasks.

版本指纹 f9114bfd9eae7a7dc8539edb63337135da99bd93a5bc3319fd7cf0c0e06ad626

返回筛选与清单 ↑
P063 2025 Large Language Models and Causal Inference in Collaboration: A Comprehensive Survey Xiaoyu Liu; Paiheng Xu; Junda Wu et al. 从双向关系综述因果推断与LLM:因果方法帮助推理、公平安全、可解释性和多模态建模;LLM知识与生成能力帮助因果发现和效应估计。 世界机制与演化展开笔记
#P06317页 · 核对于 2026-09-15

中文摘要

从双向关系综述因果推断与LLM:因果方法帮助推理、公平安全、可解释性和多模态建模;LLM知识与生成能力帮助因果发现和效应估计。

核心贡献

提供双向任务分类与方法梳理,组织因果视角下的LLM评测、干预和知识辅助推断。

实现边界

综述,没有提出统一因果求解器或新实验排行榜;文献中的因果保证依赖各自识别假设。

Method · 方法

按“因果推断→LLM”和“LLM→因果推断”组织研究,人工筛选相关论文/预印本并归纳挑战。

Results · 主要结果

主要产出为分类、研究对照和开放问题:因果知识、可识别性、模型偏差和评估可靠性仍需结合;无统一效应量可报告。

Shortcomings · 局限

【作者】领域快速发展,侧重关键工作覆盖而非穷尽检索,预印本质量由人工判断;【解读】不同因果任务与数据假设之间的结果不可直接横比。

证据定位

PDF §2–5、p.9 Limitations。

Abstract · 英文原摘要

Causal inference has demonstrated significant potential to enhance Natural Language Processing (NLP) models in areas such as predictive accuracy, fairness, robustness, and explainability by capturing causal relationships among variables. The rise of generative Large Language Models (LLMs) has greatly impacted various language processing tasks. This survey focuses on research that evaluates or improves LLMs from a causal view in the following areas: reasoning capacity, fairness and safety issues, explainability, and handling multimodality. Meanwhile, LLMs can assist in causal inference tasks, such as causal relationship discovery and causal effect estimation, by leveraging their generation ability and knowledge learned during pre-training. This review explores the interplay between causal inference frameworks and LLMs from both perspectives, emphasizing their collective potential to further the development of more advanced and robust artificial intelligence systems.

版本指纹 c65902b8d31e407e95a5902d022c21236bf54757c131aea82c03d264e43e73ee

返回筛选与清单 ↑
P062 2025 InstructPipe: Generating Visual Blocks Pipelines with Human Instructions and LLMs Zhongyi Zhou; Jing Jin; Vrushank Phadnis et al. 用自然语言生成Visual Blocks的ML可视化流水线,再由用户检查和编辑节点图,减少从空白画布寻找和连接节点的工作。 创作与规则补全XR与人机协作展开笔记
#P06222页 · 核对于 2026-09-15

中文摘要

用自然语言生成Visual Blocks的ML可视化流水线,再由用户检查和编辑节点图,减少从空白画布寻找和连接节点的工作。

核心贡献

节点选择器、伪代码生成器与纠错编译器的模块化助手,结合技术评测及N=16用户研究。

实现边界

生成范围受已支持节点/API和解释器约束;不保证流水线语义完全正确,用户仍需理解和调试。

Method · 方法

LLM按指令选择节点→依据节点文档生成伪代码→解释器修复并编译JSON节点图→Visual Blocks交互修改。

Results · 主要结果

用户研究表2:完成时间中位203.5秒对304.5秒;交互次数中位5对16,均p<.001;NASA-TLX六项中五项改善,心理需求未显著下降。论文“5倍”交互缩减来自其他评测条件,不能代替该用户研究的3.2倍。

Shortcomings · 局限

【作者】生成结果的理解与调试、精确提示编写会增加心理负担;语言与视觉思考切换有成本;有限节点及用户任务限制外推。

证据定位

PDF §3–5、§6.5、表2 p.9、§7–8。

Abstract · 英文原摘要

Visual programming has the potential of providing novice programmers with a low-code experience to build customized processing pipelines. Existing systems typically require users to build pipelines from scratch, implying that novice users are expected to set up and link appropriate nodes from a blank workspace. In this paper, we introduce InstructPipe, an AI assistant for prototyping machine learning (ML) pipelines with text instructions. We contribute two large language model (LLM) modules and a code interpreter as part of our framework. The LLM modules generate pseudocode for a target pipeline, and the interpreter renders the pipeline in the node-graph editor for further human-AI collaboration. Both technical and user evaluation (N=16) shows that InstructPipe empowers users to streamline their ML pipeline workflow, reduce their learning curve, and leverage open-ended commands to spark innovative ideas.

版本指纹 1c79bb8d2488e8d95ccebbb3496de4af2ac61c9a35d52e479d9b7237d307b410

返回筛选与清单 ↑
P061 2026 AgentHands: Generating Interactive Hand Gestures for Spatially Grounded Agent Conversations in XR Ziyi Liu; David Li; Zhongyi Zhou et al. 让XR会话助手以与语音同步、指向真实场景的虚拟手势解释对象、动作和位置,缩小语言指令与空间理解之间的差距。 XR与人机协作展开笔记
#P06124页 · 核对于 2026-09-15

中文摘要

让XR会话助手以与语音同步、指向真实场景的虚拟手势解释对象、动作和位置,缩小语言指令与空间理解之间的差距。

核心贡献

形成手势设计分类并实现带GestureEvents的语言生成、解析和动画流水线。

实现边界

依赖轻量预扫描对象注册表,主要适合静态场景;手势实例来自人工编写的有限集合,并非任意动作生成或物理机器人操作。

Method · 方法

N=10形成性研究→LLM生成按词对齐的手势类型/参数→解析为时间戳姿态→Unity/OpenXR渲染;Galaxy XR、Gemini2.5Flash与语音识别/合成。

Results · 主要结果

N=12被试内研究,定位对象评分6.50对4.58/7,参与感6.08对4.58,理解困难1.83对3.58;数值信息理解差异不显著。主要指标是体验问卷,未证明长期记忆或实际任务正确率提升。

Shortcomings · 局限

【作者】预注册静态场景、有限手势库、细粒度操作精度、文化和个性化适配不足;【解读】小样本短时语音基线比较,不能分离所有视觉/同步因素。

证据定位

PDF §4.5、§6、图8 p.13、§7 pp.14–15。

Abstract · 英文原摘要

Communicating spatial tasks via text or speech creates “a mental mapping gap” that limits an agent’s expressiveness. Inspired by co-speech gestures in face-to-face conversation, we proposeAgentHands, an LLM-powered XR system that equips agents with hands to render responses clearer and more engaging. Guided by a design taxonomy distilled from a formative study (N=10), we implement a novel pipeline to generate and render a hand agent that augments conversational responses with synchronized, space-aware, and interactive hand gestures: using a meta-instruction,AgentHands generates verbal responses embedded withGestureEvents aligned to specific words; each event specifies gesture type and parameters. At runtime, a parser converts events into time-stamped poses and motions, driving an animation system that renders expressive hands synchronized with speech. In a within-subjects study (N=12), AgentHands increased engagement and made spatially grounded conversations easier to follow compared to a speech-only baseline.

版本指纹 4e70cdb316ca2322b9d9f88e65c0f61e7650371854027fe51de20c96b656225c

返回筛选与清单 ↑
P060 2025 XR Blocks: Accelerating Human-centered AI + XR Innovation David Li; Nels Numan; Xun Qian et al. 提出跨桌面模拟器与XR设备的模块化Web框架,统一感知、渲染、交互和AI服务,以减少AI+XR原型开发的集成工作。 创作与规则补全XR与人机协作展开笔记
#P0609页 · 核对于 2026-09-15

中文摘要

提出跨桌面模拟器与XR设备的模块化Web框架,统一感知、渲染、交互和AI服务,以减少AI+XR原型开发的集成工作。

核心贡献

Reality Model与可插拔Core引擎,提供用户、世界、交互及AI模板和演示。

实现边界

作者明确说agents、peers、context等概念原语仅初步实现;不是完整通用多代理/持久记忆/跨设备协作平台。

Method · 方法

WebXR、three.js、TensorFlow及Gemini之上封装相机/深度/音频、物理、手势与智能模块,同一高层脚本在模拟器和设备运行。

Results · 主要结果

展示遮挡/重照明、虚实物理交互、手势控制和情境助手等开源样例;本白皮书未报告受控开发效率实验或通用基准提升数值。

Shortcomings · 局限

【作者】设计愿景尚未全部实现,Web性能低于原生引擎、云延迟、复杂用户与情境模型待完善。

证据定位

PDF §4–6,尤其§6.2 pp.6–7。

Abstract · 英文原摘要

We are on the cusp where Artificial Intelligence (AI) and Extended Reality (XR) are converging to unlock new paradigms of interactive computing. However, a significant gap exists between the ecosystems of these two fields: while AI research and development is accelerated by mature frameworks like JAX and benchmarks like LMArena, prototyping novel AI-driven XR interactions remains a high-friction process, often requiring practitioners to manually integrate disparate, low-level systems for perception, rendering, and interaction. To bridge this gap, we present XR Blocks, a crossplatform framework designed to accelerate human-centered AI + XR innovation. XR Blocks strives to provide a modular architecture with plug-and-play components for core abstraction in AI + XR: user, world, peers; interface, context, and agents. Crucially, it is designed with the mission of “reducing frictions from idea to reality”, thus accelerating rapid prototyping of AI + XR apps. Built upon accessible technologies (WebXR, three.js, TensorFlow, Gemini), our toolkit lowers the barrier to entry for XR creators. We demonstrate its utility through a set of open-source templates, samples, and advanced demos, empowering the community to quickly move from concept to interactive XR prototype.

版本指纹 e55cf9cd2a2e2651019cb9926d88c8c242fdda9c1df4e3e29b8c1bf375ec6f08

返回筛选与清单 ↑
P059 2025 Sensible Agent: A Framework for Unobtrusive Interaction with Proactive AR Agents Geonsun Lee; Min Xia; Nels Numan et al. 结合多模态情境感知决定主动AR助手提供什么帮助,以及用语音、视觉、头/手/注视等何种方式交互,从而降低打扰和主观操作负担。 XR与人机协作展开笔记
#P05922页 · 核对于 2026-09-15

中文摘要

结合多模态情境感知决定主动AR助手提供什么帮助,以及用语音、视觉、头/手/注视等何种方式交互,从而降低打扰和主观操作负担。

核心贡献

将建议内容和交互模态联合适配;专家工作坊N=12、标注研究N=40及XR原型研究N=10支撑设计。

实现边界

当前没有长期用户偏好建模,也未求解精确的介入时机;测试为有限AR和360°视频场景。

Method · 方法

第一视角相机/传感器与LMM推断活动和约束,选择图标、二选一或多选建议及可用输入模态;与语音提问基线做被试内比较。

Results · 主要结果

N=10:Raw-TLX均值20.55对43.27,主观负担降低;偏好6.00对3.80/7;但交互更慢,28.54秒对16.43秒(p<.001)。SUS81.33对76.67,差异不显著(p=.11)。

Shortcomings · 局限

【作者】小样本、探索统计未校正多重比较,缺少常显多选界面对照;无长期个性化/时机模型。【解读】不能由较低主观负担推断客观效率提高。

证据定位

PDF pp.14–16,§7.4、图8、§9。

Abstract · 英文原摘要

Proactive AR agents promise context-aware assistance, but their interactions often rely on explicit voice prompts or responses, which can be disruptive or socially awkward. We introduce Sensible Agent, a framework designed for unobtrusive interaction with these proactive agents. Sensible Agent dynamically adapts both “what” assistance to offer and, crucially, “how” to deliver it, based on real-time multimodal context sensing. Informed by an expert workshop (n=12) and a data annotation study (n=40), the framework leverages egocentric cameras, multimodal sensing, and Large Multimodal Models (LMMs) to infer context and suggest appropriate actions delivered via minimally intrusive interaction modes. We demonstrate our prototype on an XR headset through a user study (n=10) in both AR and VR scenarios. Results indicate that Sensible Agent significantly reduces perceived interaction effort compared to voice-prompted baseline, while maintaining high usability and achieving higher preference.

版本指纹 f5caf04876cd2886402ba5aaff888b582997be5298e87724d8a715a334b73344

返回筛选与清单 ↑
P058 2026 How Well Can 3D Accessibility Guidelines Support XR Development? An Interview Study with XR Practitioners in Industry Daniel Killough; Tiger F. Ji; Kexin Zhang et al. 访谈25位XR行业从业者,检查六套资源中的20项3D无障碍指南能否支持XR开发,分析指南含糊、场景不匹配和落实责任问题。 创作与规则补全XR与人机协作展开笔记
#P05815页 · 核对于 2026-09-15

中文摘要

访谈25位XR行业从业者,检查六套资源中的20项3D无障碍指南能否支持XR开发,分析指南含糊、场景不匹配和落实责任问题。

核心贡献

给出跨视觉、运动、认知、言语、听觉的指南适用性分析与开发责任/实施建议;强调指南应提供可操作示例。

实现边界

评估对象是从业者对指南的解释和可行性判断;没有实现并测量全套辅助功能,也没有证明残障用户效果改善。

Method · 方法

半结构访谈、指南排序/讨论、主题分析,将优先级、开发阶段和责任组织成矩阵。

Results · 主要结果

25人均提出可结合其项目的实现思路;12人报告沉浸与无障碍的张力,20人希望补充具体案例/实现;发现即时安全、平台依赖、需情境调整等不同优先级。

Shortcomings · 局限

【作者/解读】样本规模和行业背景限制概括性,25人中23男2女;自述意愿不等于真实落地,残障最终用户的直接验证仍不足。

证据定位

PDF §3–4、表2–3、§5.3;pp.3–11。

Abstract · 英文原摘要

While accessibility (a11y) guidelines exist for 3D games and virtual worlds, their applicability to extended reality (XR)’s unique interaction paradigms (e.g.,spatial tracking, kinesthetic interactions) remains unexplored. XR practitioners need practical guidance to successfully implement a11y guidelines under real-world constraints. We present the first evaluation of existing 3D a11y guidelines applied to XR development through semi-structured interviews with 25 XR practitioners across diverse organization contexts. We assessed 20 commonly-agreed a11y guidelines from six major resources across visual, motor, cognitive, speech, and hearing domains, comparing practitioners’ development practices against guideline applicability to XR. Our investigation reveals that guidelines can be highly effective when designed as transformation catalysts rather than compliance checklists, but fundamental mismatches exist between existing 3D guidelines and XR requirements, creating both implementation barriers and design gaps. This work provides foundational insights towards developing a11y guidelines and support tools that address XR’s distinct characteristics.

版本指纹 f35c8a8c027b4841c09d5f2ae8da50f5844ff810285a9c4c4eef92710867daf9

返回筛选与清单 ↑
P057 2025 Thing2Reality: Enabling Spontaneous Creation of 3D Objects from 2D Content using Generative AI in XR Meetings Erzhen Hu, Mingyi Li, Jungtaek Hong, Xun Qian, Alex Olwal, David Kim, Seongkook Heo, and Ruofei Du 在远程XR会议中把物理物体、网页图片转成可共同操作的3D表示,并在3D对象与2D白板快照间切换,支持即时讨论。 XR与人机协作展开笔记
#P05716页 · 核对于 2026-09-15

中文摘要

在远程XR会议中把物理物体、网页图片转成可共同操作的3D表示,并在3D对象与2D白板快照间切换,支持即时讨论。

核心贡献

实现Thing2Reality的物体级2D→3D→2D交互链,研究多种表示在协作不同阶段的互补用途。

实现边界

生成的是条件多视图/3D Gaussian近似表示,不保证精确几何、尺寸或不可见表面;研究为探索性原型评估,未设置2D屏幕共享基线。

Method · 方法

用户圈选对象→MobileSAM分割→条件多视图扩散与LGM Gaussian重建→Unity多人XR;支持缩放、移动、正交视图和白板投影。

Results · 主要结果

单人研究N=12均完成任务,工作流评分4.9/5、参与感5/5;双人研究18人/9对观察到2D组织叙事、3D空间解释及混合/顺序使用策略;7/9对准备演示时主动生成多个2D快照。

Shortcomings · 局限

【作者】小样本、单次实验,缺少基线和长期使用;专业精度不足,抽象概念难以实体化;生成误差、尺寸理解与格式切换认知负担。

证据定位

PDF pp.4–7:实现、研究1;pp.8–12:研究2;§8.3。

Abstract · 英文原摘要

During remote communication, participants often share both digital and physical content, such as product designs, digital assets, and environments, to enhance mutual understanding. Recent advances in augmented communication have facilitated users to swiftly create and share digital 2D copies of physical objects from video feeds into a shared space. However, conventional 2D representations of digital objects limits spatial referencing in immersive environments. To address this, we propose Thing2Reality, an Extended Reality (XR) meeting platform that facilitates spontaneous discussions of both digital and physical items during remote sessions. With Thing2Reality, users can quickly materialize ideas or objects in immersive environments and share them as conditioned multiview renderings or 3D Gaussians. Thing2Reality enables users to interact with remote objects or discuss concepts in a collaborative manner. Our user studies revealed that the ability to interact with and manipulate 3D representations of objects significantly enhances the efficiency of discussions, with the potential to augment discussion of 2D artifacts.

版本指纹 76717358341146a96d67837248e800d3852cdff07b304ccea212e53a425ff561

返回筛选与清单 ↑
P056 待核实 Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini Ruofei Du; Benjamin Hersh; David Li et al. 通过XR Blocks的高层空间交互API与Gemini,将自然语言需求生成可运行WebXR原型,并提供60条提示的初步技术评测。 创作与规则补全XR与人机协作展开笔记
#P05610页 · 核对于 2026-09-15

中文摘要

通过XR Blocks的高层空间交互API与Gemini,将自然语言需求生成可运行WebXR原型,并提供60条提示的初步技术评测。

核心贡献

整合提示、代码生成、人工检查与即时XR运行的工作流;发布XR Blocks及VCXR60试点任务。

实现边界

60提示来自20人四次工作坊;pass@1仅指桌面模拟器无运行错误,不衡量视觉质量、需求满足或真机交互正确性。“一分钟内”不是所有配置的结果。

Method · 方法

Reality Model封装用户、物理场景、感知/交互组件;Gemini生成脚本;XR Blocks v0.11.0通过Playwright无头Chromium监控错误,四种配置各运行5轮。

Results · 主要结果

表1:Gemini3.1Pro高思考pass@1=95.5%,时间中位86.02秒;低思考94.1%/33.39秒;3Flash高87.8%/22.26秒、低87.4%/17.30秒。每条提示5次中至少一次无错误。

Shortcomings · 局限

【作者】Web性能与云延迟、模型幻觉API及复杂空间逻辑错误;【解读】开发时基于该试点反复修复框架,独立留出集与任务语义/真机评测不足。

证据定位

PDF pp.3–5:框架、表1及§4–5。

Abstract · 英文原摘要

While large language models have accelerated software development through “vibe coding”, prototyping intelligent Extended Reality (XR) experiences remains inaccessible due to the friction of complex game engines and low-level sensor integration. To bridge this gap, we contribute XR Blocks, an open-source, modular WebXR framework that abstracts spatial computing complexities into high-level, human-centered primitives. Building upon this foundation, we present Vibe Coding XR, an end-to-end rapid prototyping workflow that leverages LLMs to translate natural language intent directly into functional XR software. Using a web-based interface, creators can transform high-level prompts (e.g., “create a dandelion that reacts to hand” ) into interactive WebXR applications in under a minute. We provide a preliminary technical evaluation on a pilot dataset (VCXR60) alongside diverse application scenarios highlighting mixed-reality realism, multi-modal interaction, and generative AI integrations. By democratizing spatial software creation, this work empowers practitioners to bypass lowlevel hurdles and rapidly move from “idea to reality. ” Code and live demos are available at https://github.com/google/xrblocks and http://xrblocks.github.io/gem.

版本指纹 eeb4f0c125281216f66235077762dabb3a17831374fc227303153c7d33c50ed3

返回筛选与清单 ↑
P055 1999 Principles of Mixed-Initiative User Interfaces Eric Horvitz 讨论如何将直接操作与自动化代理结合,提出处理用户意图不确定性、打扰成本和人机共同修正结果的设计原则,以Lookout邮件日程助手说明。 创作与规则补全XR与人机协作展开笔记
#P0558页 · 核对于 2026-09-15

中文摘要

讨论如何将直接操作与自动化代理结合,提出处理用户意图不确定性、打扰成本和人机共同修正结果的设计原则,以Lookout邮件日程助手说明。

核心贡献

归纳12条混合主动权界面原则,并将不确定性与动作效用引入“等待/询问/主动执行”的选择。

实现边界

实现是叠加在Outlook上的邮件时间解析和日程建议原型;不是通用任务代理,也不是对12条原则的全面因果验证。

Method · 方法

SVM文本分类并校准意图概率;按收益、误操作及打扰成本设置决策阈值;结合阅读停留时间选择介入时机;允许手动调用、取消、降级到日历范围及编辑建议。

Results · 主要结果

展示Lookout自动提取会议日期、创建待确认预约、低置信度询问和时机建模;文中主要证据是系统与概率/效用曲线,未提供现代意义的大样本随机对照效率提升结果。

Shortcomings · 局限

【解读】依赖领域解析规则、意图概率与主观成本模型;意图识别错误和不适当打断仍可能发生,原则能否跨任务成立需另行评估。

证据定位

PDF pp.1–2:12条原则;pp.2–7:Lookout实现、概率/效用及注意力模型;pp.7–8:总结。

Abstract · 英文原摘要

Recent debate has centered on the relative promise of focusing user-interface research on developing new metaphors and tools that enhance users’ abilities to directly manipulate objects versus directing effort toward developing interface agents that provide automation. In this paper, we review principles that show promise for allowing engineers to enhance human-computer interaction through an elegant coupling of automated services with direct manipulation. Key ideas will be highlighted in terms of the Lookout system for scheduling and meeting management.

版本指纹 d242048fb0ad4247cd2b0f4a1872c94f319ae8b311fa18df6195fb5361331348

返回筛选与清单 ↑
P054 2019 Melding the Data-Decisions Pipeline: Decision-Focused Learning for Combinatorial Optimization Bryan Wilder, Bistra Dilkina, Milind Tambe 把预测与组合优化端到端连接,直接按最终决策质量训练预测器。 XR与人机协作展开笔记
#P0549页 · 核对于 2026-09-15

中文摘要

把预测与组合优化端到端连接,直接按最终决策质量训练预测器。

核心贡献

为线性规划和子模最大化提供可反传的连续松弛框架。

实现边界

适用所分析的优化结构和松弛条件;不是用户建模或计算机使用日志研究。

Method · 方法

将离散优化连续化,计算决策目标对预测参数的梯度;以优化效用训练模型并与两阶段 MSE 训练比较。

Results · 主要结果

多种决策问题上提高最终效用,即使预测 MSE 更差;示例中决策训练模型的通道总权重与真值相关 r²=0.94,解释了正确排序的重要性。

Shortcomings · 局限

【解读】松弛与整数决策存在差距,依赖优化器和任务结构;牺牲预测校准后的输出不宜直接当真实量。

证据定位

首页/元数据;技术框架及实验;图2讨论,PDF p7–8。

Abstract · 英文原摘要

Creating impact in real-world settings requires artificial intelligence techniques to span the full pipeline from data, to predictive models, to decisions. These components are typically approached separately: a machine learning model is first trained via a measure of predictive accuracy, and then its predictions are used as input into an optimization algorithm which produces a decision. However, the loss function used to train the model may easily be misaligned with the end goal, which is to make the best decisions possible. Hand-tuning the loss function to align with optimization is a difficult and error-prone process (which is often skipped entirely). We focus on combinatorial optimization problems and introduce a general framework for decision-focused learning, where the machine learning model is directly trained in conjunction with the optimization algorithm to produce highquality decisions. Technically, our contribution is a means of integrating common classes of discrete optimization problems into deep learning or other predictive models, which are typically trained via gradient descent. The main idea is to use a continuous relaxation of the discrete problem to propagate gradients through the optimization procedure. We instantiate this framework for two broad classes of combinatorial problems: linear programs and submodular maximization. Experimental results across a variety of domains show that decisionfocused learning often leads to improved optimization performance compared to traditional methods. We find that standard measures of accuracy are not a reliable proxy for a predictive model’s utility in optimization, and our method’s ability to specify the true goal as the model’s training objective yields substantial dividends across a range of decision problems.

版本指纹 a7997e4591c5b639447f6fed81bd226792d743fe767781af22f9ce39b112a3fc

返回筛选与清单 ↑
P053 2026 Superhuman performance of a large language model on the reasoning tasks of a physician Peter G. Brodeur; Thomas A. Buckley; Zahir Kanjee et al. 用医生评分的复杂病例、诊断/管理任务及急诊第二意见场景评价 OpenAI o1 系列。 XR与人机协作展开笔记
#P05325页 · 核对于 2026-09-15

中文摘要

用医生评分的复杂病例、诊断/管理任务及急诊第二意见场景评价 OpenAI o1 系列。

核心贡献

把评价扩展到临床推理过程和真实病历,而不局限选择题考试。

实现边界

主要为离线病例及预定义时间点第二意见;未证明真实部署改善患者结局,也未实证人机团队优于医生。

Method · 方法

五类病例推理实验加急诊研究,专家使用 Bond/R-IDEA 等量表评分,与历史和医生基线比较;分别考察 o1-preview 与 o1。

Results · 主要结果

143 个 NEJM 病例中鉴别列表含正确诊断 78.3%(95%CI 70.7–84.8),首位诊断正确 52%;80 份 Healer 回答中 78 份 R-IDEA 满分;“不可漏诊”覆盖未显著优于对照。

Shortcomings · 局限

【作者】领域/病例有限,需前瞻试验及协作研究;【解读】量表满分和候选列表命中不是独立临床胜任,历史对照与数据泄漏风险需保留。

证据定位

摘要 PDF p2;结果 p3–5;讨论 p5–6;方法 p6 起。

Abstract · 英文原摘要

A seminal paper published by Ledley and Lusted in 1959 introduced complex clinical diagnostic reasoning cases as the gold standard for the evaluation of expert medical computing systems, a standard that has held ever since. Here, we report the results of a physician evaluation of a large language model (LLM) on challenging clinical cases against a baseline of hundreds of physicians. We conduct five experiments to measure clinical reasoning across differential diagnosis generation, display of diagnostic reasoning, triage differential diagnosis, probabilistic reasoning, and management reasoning, all adjudicated by physician experts with validated psychometrics. We then report a real-world study comparing human expert and AI second opinions in randomly-selected patients in the emergency room of a major tertiary academic medical center in Boston, MA. We compared LLMs and board-certified physicians at three predefined diagnostic touchpoints: triage in the emergency room, initial evaluation by a physician, and admission to the hospital or intensive care unit. In all experiments—both vignettes and emergency room second opinions—the LLM displayed superhuman diagnostic and reasoning abilities, as well as continued improvement from prior generations of AI clinical decision support. Our study suggests that LLMs have achieved superhuman performance on general medical diagnostic and management reasoning, fulfilling the vision put forth by Ledley and Lusted, and motivating the urgent need for prospective trials.

版本指纹 4e1cb616b98899043525e3ff7dc712029af55202ad46371e676e7f2d52ac471f

返回筛选与清单 ↑
P052 2025 Valid Inference with Imperfect Synthetic Data Yewon Byun; Shantanu Gupta; Zachary C. Lipton et al. 以广义矩估计整合真实、代理及完全合成数据,提高有限真实数据下的统计效率。 世界机制与演化展开笔记
#P05240页 · 核对于 2026-09-15

中文摘要

以广义矩估计整合真实、代理及完全合成数据,提高有限真实数据下的统计效率。

核心贡献

无需超参数的 GMM 估计器及一致性/渐近推断理论。

实现边界

仍需要真实数据与可识别的矩条件;理论有效性是渐近的,不能保证极少样本时精确覆盖。

Method · 方法

联合真实与合成矩残差,利用它们的预测相关性,估计权重和协方差构造参数与置信区间。

Results · 主要结果

8/8 个下游任务获得最低 MSE,7/8 的置信区间更窄;少标注设置多次 MSE 降幅超过 50%,并经验保持覆盖。

Shortcomings · 局限

【作者】劣质合成数据可能无收益,极低数据量可欠覆盖;【解读】不能用模型模拟受试者完全替代真实样本。

证据定位

§4.5;§5.3/图1–2;§6 Limitations。

Abstract · 英文原摘要

Predictions and generations from large language models are increasingly being explored as an aid in limited data regimes, such as in computational social science and human subjects research. While prior technical work has mainly explored the potential to use model-predicted labels for unlabeled data in a principled manner, there is increasing interest in using large language models to generate entirely new synthetic samples (e.g., synthetic simulations), such as in responses to surveys. However, it remains unclear by what means practitioners can combine such data with real data and yet produce statistically valid conclusions upon them. In this paper, we introduce a new estimator based on generalized method of moments, providing a hyperparameter-free solution with strong theoretical guarantees to address this challenge. Intriguingly, we find that interactions between the moment residuals of synthetic data and those of real data (i.e., when they are predictive of each other) can greatly improve estimates of the target parameter. We validate the finite-sample performance of our estimator across different tasks in computational social science applications, demonstrating large empirical gains.

版本指纹 f36995c8bce9d2c778ff92294498365045028b0df617164756664c6fa99ce9b8

返回筛选与清单 ↑
P051 2025 Fostering the Ecosystem of AI for Social Impact Requires Expanding and Strengthening Evaluation Standards Bryan Wilder; Angela Zhou 主张扩大社会影响贡献的认可范围,同时提高真实部署影响评价的严谨性。 世界机制与演化XR与人机协作展开笔记
#P05112页 · 核对于 2026-09-15

中文摘要

主张扩大社会影响贡献的认可范围,同时提高真实部署影响评价的严谨性。

核心贡献

区分方法创新、伙伴能力建设及部署贡献,讨论评审激励如何影响研究生态。

实现边界

立场论文,提出评价建议;没有新预测模型、受控干预结果或统一算法排行榜。

Method · 方法

分析既有评审标准和应用研究案例,分别讨论试点、随机与非随机部署、反方意见。

Results · 主要结果

建议作者明确影响机制、评审按贡献类型要求证据,并对部署研究采用更清晰和严格的效果评价。

Shortcomings · 局限

【解读】观点依赖案例和规范性判断,尚无证据量化采用这些评审规则后的长期生态效果。

证据定位

§2–5;§6 Alternative views;§7。

Abstract · 英文原摘要

There has been increasing research interest in AI/ML for social impact, and correspondingly more publication venues have refined review criteria for practice-driven AI/ML research. However, these review guidelines tend to most concretely recognize projects that simultaneously achieve deployment and novel ML methodological innovation. We argue that this introduces incentives for researchers that undermine the sustainability of a broader research ecosystem of social impact, which benefits from projects that make contributions on single front (applied or methodological) that may better meet project partner needs. Our position is that researchers and reviewers in machine learning for social impact must simultaneously adopt: 1) a more expansive conception of social impacts beyond deployment and 2) more rigorous evaluations of the impact of deployed systems.

版本指纹 6b56fdf0a819fde5506ab115474a0b52b77b5cb85fb93651b35c2f8a3e26a794

返回筛选与清单 ↑
P050 2025 Distributionally Robust Feature Selection Maitreyi Swaroop; Tamar Krishnamurti; Bryan Wilder 在观测特征预算下选择对多个子群体都有用的特征,以支持分别训练高质量模型。 XR与人机协作展开笔记
#P05030页 · 核对于 2026-09-15

中文摘要

在观测特征预算下选择对多个子群体都有用的特征,以支持分别训练高质量模型。

核心贡献

噪声连续松弛和 Bayes 最优预测方差目标,避免反传穿过训练过程。

实现边界

选择共享特征,但下游允许各群体自己的模型;理论推导核心为 MSE,不能当作已证明所有损失适用。

Method · 方法

对特征加可控噪声,估计各组目标并最小化最差组损失,用重参数化和核估计做梯度优化。

Results · 主要结果

合成及 ACS/UCI 试验中优于所列 Lasso、XGBoost 和 DRO 改编基线;ACS 设置报告 MSE 数量级下降,UCI 分类也有经验收益。

Shortcomings · 局限

【作者】插件估计在小群体可能偏,非 MSE 理论待扩展;【解读】依赖已知群体及代表性训练数据。

证据定位

§3;§4.3/图3;§5。

Abstract · 英文原摘要

We study the problem of selecting limited features to observe such that models trained on them can perform well simultaneously across multiple subpopulations. This problem has applications in settings where collecting each feature is costly, e.g. requiring adding survey questions or physical sensors, and we must be able to use the selected features to create high-quality downstream models for different populations. Our method frames the problem as a continuous relaxation of traditional variable selection using a noising mechanism, without requiring backpropagation through model training processes. By optimizing over the variance of a Bayes-optimal predictor, we develop a model-agnostic framework that balances overall performance of downstream prediction across populations. We validate our approach through experiments on both synthetic datasets and real-world data.

版本指纹 cac9cafdc4deee05eb02c15751e5836ebb631d2b2dc2cfdc711c559e78b23cb1

返回筛选与清单 ↑
P049 2022 Decision-Focused Learning without Differentiable Optimization: Learning Locally Optimized Decision Losses Sanket Shah; Kai Wang; Bryan Wilder et al. 通过学习局部决策损失,让预测训练适应下游优化而无需对求解器求导。 XR与人机协作展开笔记
#P04913页 · 核对于 2026-09-15

中文摘要

通过学习局部决策损失,让预测训练适应下游优化而无需对求解器求导。

核心贡献

LODL 用黑盒优化器生成监督,学习可凸的任务相关损失。

实现边界

仍需大量调用黑盒求解器来拟合损失;“without differentiable optimization”并非完全不做优化。

Method · 方法

在真实标签附近扰动预测,用决策质量作为目标,拟合加权 MSE/方向二次型等局部损失,再用于训练预测网络。

Results · 主要结果

三个资源分配域均优于任务无关的两阶段训练,部分超过手工可微代理;样本增多通常提高表现,损失学习可并行/复用。

Shortcomings · 局限

【作者】局部邻域/损失族选择影响泛化和成本;【解读】关于损失的凸性不使整个神经网络训练全局凸。

证据定位

§4;§5/表1–3;§6。

Abstract · 英文原摘要

Decision-Focused Learning (DFL) is a paradigm for tailoring a predictive model to a downstream optimization task that uses its predictions in order to perform better on that specific task . The main technical challenge associated with DFL is that it requires being able to differentiate through the optimization problem, which is difficult due to discontinuous solutions and other challenges. Past work has largely gotten around this this issue by handcrafting task-specific surrogates to the original optimization problem that provide informative gradients when differentiated through. However, the need to handcraft surrogates for each new task limits the usability of DFL. In addition, there are often no guarantees about the convexity of the resulting surrogates and, as a result, training a predictive model using them can lead to inferior local optima. In this paper, we do away with surrogates altogether and instead learn loss functions that capture task-specific information. To the best of our knowledge, ours is the first approach that entirely replaces the optimization component of decision-focused learning with a loss that is automatically learned. Our approach (a) only requires access to a black-box oracle that can solve the optimization problem and is thus generalizable, and (b) can be convex by construction and so can be easily optimized over. We evaluate our approach on three resource allocation problems from the literature and find that our approach outperforms learning without taking into account task-structure in all three domains, and even hand-crafted surrogates from the literature.

版本指纹 07b280867fab39304c2cddf0d2c056e09cce4810f27d2c1fa7395b6ecf454ccf

返回筛选与清单 ↑
P048 2025 Utility-Directed Conformal Prediction: A Decision-Aware Framework for Actionable Uncertainty Quantification Santiago Cortes-Gomez; Carlos Patiño; Yewon Byun et al. 把下游成本纳入保形预测,使具有覆盖保证的预测集合更适合实际决策。 XR与人机协作AI方法与评测展开笔记
#P04820页 · 核对于 2026-09-15

中文摘要

把下游成本纳入保形预测,使具有覆盖保证的预测集合更适合实际决策。

核心贡献

针对可分/不可分效用构造 nonconformity score 与集合选择方法,并证明保留标准覆盖。

实现边界

标准覆盖依赖校准/测试交换性等条件,通常是边际保证;皮肤诊断为数据集示例,未做临床试验。

Method · 方法

利用标签或集合成本构造惩罚比率/保形分数,再做校准;在分类层级中偏好临床或语义更一致的集合。

Results · 主要结果

CIFAR-100、iNaturalist、ImageNet、Fitzpatrick 的所测效用成本均低于标准保形基线,并经验保持覆盖率。

Shortcomings · 局限

【解读】需预先定义有意义的效用,分布变化影响保证;成本低不必然代表所有用户或群体都受益。PDF 代码链接仍写 [hidden]。

证据定位

§3;§4/图3及附录表4–6;§5、Reproducibility Statement。

Abstract · 英文原摘要

Interest has been growing in decision-focused machine learning methods which train models to account for how their predictions are used in downstream optimization problems. Doing so can often improve performance on subsequent decision problems. However, current methods for uncertainty quantification do not incorporate any information about downstream decisions. We develop a methodology based on conformal prediction to identify prediction sets that account for a downstream cost function, making them more appropriate to inform high-stakes decision-making. Our approach harnesses the strengths of conformal methods—modularity, model-agnosticism, and statistical coverage guarantees—while incorporating downstream decisions and user-specified utility functions. We prove that our methods retain standard coverage guarantees. Empirical evaluation across a range of datasets and utility metrics demonstrates that our methods achieve significantly lower costs than standard conformal methods. We present a real-world use case in healthcare diagnosis, where our method effectively incorporates the hierarchical structure of dermatological diseases. The method successfully generates sets with coherent diagnostic meaning, potentially aiding triage for dermatology diagnosis and illustrating how our method can ground high-stakes decision-making employing domain knowledge.

版本指纹 014cd623273d23418cf34a7100f3f8741e56e4c4ca3ad9442505448e46e2df75

返回筛选与清单 ↑
P047 2025 Can LLMs Propose Instrumental Variables for Causal Reasoning? 本地稿匿名;官方 CISPA 记录补充:Ivaxi Sheth; Zhijing Jin; Bryan Wilder et al. 用 LLM 提议并批判工具变量,探索观察数据中候选工具的发现。 世界机制与演化展开笔记
#P04718页 · 核对于 2026-09-15

中文摘要

用 LLM 提议并批判工具变量,探索观察数据中候选工具的发现。

核心贡献

IV Co-Scientist 多角色流程,以及无真值时的内部一致性比较。

实现边界

只能辅助提出候选;高 F 统计量只支持相关性,不能验证排除限制/独立性,内部一致也不等于因果有效。

Method · 方法

先测试恢复文献工具和拒绝已被推翻的工具;代理提议处理—结果—工具组合并批判假设,再比较第一阶段强度与估计一致性。

Results · 主要结果

5 个自动发现案例中多种候选表现出较强相关及高于随机代理的内部一致性;论文未建立所有新工具的真实有效性。

Shortcomings · 局限

【解读】语义批评共享模型偏差;缺乏真值时一致性不足以排除共同混杂,候选须领域知识进一步审核。

证据定位

摘要;§2.1–2.2/表1;附录 C、H;CISPA 作者记录。

Abstract · 英文原摘要

In the presence of confounding between an endogenous variable and the outcome, instrumental variables (IVs) are used to isolate causal effects. Identifying valid instruments requires interdisciplinary knowledge and contextual understanding, making it a difficult task. In this paper, we examine whether large language models (LLMs) can assist. We adopt a two-stage evaluation: first, testing whether LLMs recover established instruments from the literature, and second, assessing whether they avoid empirically or theoretically discredited ones. Building on these results, we introduce IV Co-Scientist, a multi-agent system that proposes, critiques, and refines IVs, along with a statistical test to contextualize consistency without ground truth. Our results show the potential of LLMs to identify valid IVs from large observational data.

版本指纹 c93595a135d3c4e837633d1fd4b30fe3f47805aa52e29411a4ef9dcbc6fa53c5

返回筛选与清单 ↑
P046 2025 Explaining Concept Shift with Interpretable Feature Attribution Ruiqi Lyu; Alistair Turcan; Bryan Wilder SGShift 将预测失效归因到条件标签分布发生变化的少数特征。 世界机制与演化展开笔记
#P04625页 · 核对于 2026-09-15

中文摘要

SGShift 将预测失效归因到条件标签分布发生变化的少数特征。

核心贡献

稀疏 GAM 归因、吸收模型误设项和 knockoff 错误发现控制扩展。

实现边界

表格数据的概念漂移,需源/目标域信息和标注;被选特征不是必然的干预因果变量。

Method · 方法

在原模型输出上拟合带 L1 惩罚的加性修正,结合两域共享误设项;用 knockoffs 筛选发生变化的特征。

Results · 主要结果

在糖尿病再入院、COVID 和 SUPPORT2 的半合成实验中,knockoff 变体多次获得 AUC>0.9;召回率按 FPR=10% 评价,不能与任意阈值召回混用。

Shortcomings · 局限

【作者】假设变化稀疏,密集变化难解释;【解读】GAM 加性结构和有限目标域标签限制复杂交互漂移识别。

证据定位

§4;§5–6/表2;§7。

Abstract · 英文原摘要

Regardless the amount of data a machine learning (ML) model is trained on, there will inevitably be data that differs from their training set, lowering model performance. Concept shift occurs when the distribution of labels conditioned on the features changes, making even a well-tuned ML model to have learned a fundamentally incorrect representation. Identifying these shifted features provides unique insight into how one dataset differs from another, considering the difference may be across a scientifically relevant dimension, such as time, disease status, population, etc. In this paper, we propose SGShift, a model for detecting concept shift in tabular data and attributing reduced model performance to a sparse set of shifted features. SGShift models concept shift with a Generalized Additive Model (GAM) and performs subsequent feature selection to identify shifted features. We propose further extensions of SGShift by incorporating knockoffs to control false discoveries and an absorption term to account for models with poor fit to the data. We conduct extensive experiments in synthetic and real data across various ML models and find SGShift can identify shifted features with AUC > 0.9 and recall > 90%, often 2 or 3 times as high as baseline methods.

版本指纹 b06c08edda94ada5d2c1566b92694110d440fab9c921c2fad4806ad9c010bcbc

返回筛选与清单 ↑
P045 2025 Failure Modes of LLMs for Causal Reasoning on Narratives Khurram Yamin; Shantanu Gupta; Gaurav Ghosal et al. 研究语言模型在叙事因果理解中的失效模式,是 P042 的早期版本。 世界机制与演化展开笔记
#P04523页 · 核对于 2026-09-15

中文摘要

研究语言模型在叙事因果理解中的失效模式,是 P042 的早期版本。

核心贡献

明确事件顺序、参数知识一致性和叙事结构复杂度三类影响。

实现边界

因果关系识别/图抽取;本文明确把反事实案例留作未来工作。

Method · 方法

构造可控合成叙事并使用 CauseNet 的半合成/真实语句,比较多种模型和先抽图提示。

Results · 主要结果

事件拓扑顺序一致时较好,知识冲突及长链时较差;显式抽取因果图改善推理。本条按 v5 总结,不把后续 ICLR 附录结果回填为早期结果。

Shortcomings · 局限

【作者】其他类型因果推理未测;【解读】叙事中识别给定因果并不等同从混杂观测中识别因果。

证据定位

§3–4;§5.1;与 P042 对照。

Abstract · 英文原摘要

The ability to robustly identify causal relationships is essential for autonomous decision-making and adaptation to novel scenarios. However, accurately inferring causal structure requires integrating both world knowledge and abstract logical reasoning. In this work, we investigate the interaction between these two capabilities through the representative task of causal reasoning over narratives. Through controlled synthetic, semi-synthetic and real-world experiments, we find that stateof-the-art large language models (LLMs) often rely on superficial heuristics—for example, inferring causality from event order or recalling memorized world knowledge without attending to context. Furthermore, we show that simple reformulations of the task can elicit more robust reasoning behavior. Our evaluation spans a range of causal structures, from linear chains to complex graphs involving colliders and forks. These findings uncover systematic patterns in how LLMs perform causal reasoning and lay the groundwork for developing methods that better align LLM behavior with principled causal inference.

版本指纹 49a0e206675337354ceff5c93faef9493f58048c70a0088fde01fd9b9c3647b0

返回筛选与清单 ↑
P044 2025 Orthogonal Causal Calibration Justin Whitehouse; Christopher Jung; Vasilis Syrgkanis et al. 用正交损失把异质性因果效应估计的校准转化为较标准的预测校准。 世界机制与演化展开笔记
#P04449页 · 核对于 2026-09-15

中文摘要

用正交损失把异质性因果效应估计的校准转化为较标准的预测校准。

核心贡献

对 universal/conditional orthogonality 给出误差分解、样本切分和交叉校准算法及收敛保证。

实现边界

结论依赖识别条件、正交性、损失正则性和 nuisance 估计;重点是 L2 校准,不保证个体反事实准确或决策最优。

Method · 方法

构造广义伪结果或条件损失,在独立样本上校准;把误差分为 nuisance 估计误差与假想已知 nuisance 下的校准误差。

Results · 主要结果

401(k) 观察数据和合成条件分位数实验中降低校准误差,部分同时降低平均损失;理论提供高概率收敛及条件性的 do-no-harm 结果。

Shortcomings · 局限

【作者】其他 Lp 校准及最终决策效用仍待研究;【解读】真实观察数据无法直接观测全部个体处理效应。

证据定位

摘要;§3–4;§5 图1–2;§6。

Abstract · 英文原摘要

Estimates of heterogeneous treatment effects such as conditional average treatment effects (CATEs) and conditional quantile treatment effects (CQTEs) play an important role in real-world decision making. Given this importance, one should ensure these estimates are calibrated. While there is a rich literature on calibrating estimators of non-causal parameters, very few methods have been derived for calibrating estimators of causal parameters, or more generally estimators of quantities involving nuisance parameters. In this work, we develop general algorithms for reducing the task of causal calibration to that of calibrating a standard (non-causal) predictive model. Throughout, we study a notion of calibration defined with respect to an arbitrary, nuisance-dependent loss l, under which we say an estimator θ is calibrated if its predictions cannot be changed on any level set to decrease loss. For losses l satisfying a condition called universal orthogonality, we present a simple algorithm that transforms partially-observed data into generalized pseudo-outcomes and applies any off-the-shelf calibration procedure. For losses l satisfying a weaker assumption called conditional orthogonality, we provide a similar sample splitting algorithm the performs empirical risk minimization over an appropriately defined class of functions. Convergence of both algorithms follows from a generic, two term upper bound of the calibration error of any model: one term that measures the error in estimating unknown nuisance parameters and another that measures calibration error in a hypothetical world where the learned nuisances are true. We demonstrate the practical applicability of our results in experiments on both observational and synthetic data. Our results are exceedingly general, showing that essentially any existing calibration algorithm can be used in causal settings, with additional loss only arising from errors in nuisance estimation.

版本指纹 b80516dff71d6e559774e8c2192764cc4d0f0108448bff43f2114cbf85526080

返回筛选与清单 ↑
P043 2025 LLMs Struggle to Perform Counterfactual Reasoning with Parametric Knowledge Khurram Yamin, Gaurav Ghosal, Bryan Wilder 测试模型能否将新反事实前提与已存知识结合,而不是继续沿用默认知识。 世界机制与演化展开笔记
#P04310页 · 核对于 2026-09-15

中文摘要

测试模型能否将新反事实前提与已存知识结合,而不是继续沿用默认知识。

核心贡献

区分强化、添加、冲突与无关上下文的知识整合任务,并研究微调的副作用。

实现边界

受控知识图和短链因果查询;不是现实因果效应估计。

Method · 方法

在 GPT-4o/Llama3.1 与玩具模型上比较直接提示、CoT、160 条反事实示例微调及预训练干预。

Results · 主要结果

强化既有知识时 GPT-4o 直接提示约 85%、CoT 超过 95%;添加/冲突条件困难,简单微调可能仍依赖捷径或损害原有知识。

Shortcomings · 局限

【作者】玩具前提多为单边编辑、两跳查询;【解读】少量训练与模型范围限制结论,不可说微调普遍无效。

证据定位

§3;§4;§5–6;附录训练细节。

Abstract · 英文原摘要

Large Language Models have been shown to contain extensive world knowledge in their parameters, enabling impressive performance on many knowledge intensive tasks. However, when deployed in novel settings, LLMs often encounter situations where they must integrate parametric knowledge with new or unfamiliar information. In this work, we explore whether LLMs can combine knowledge in-context with their parametric knowledge through the lens of counterfactual reasoning. Through synthetic and real experiments in multi-hop reasoning problems, we show that LLMs generally struggle with counterfactual reasoning, often resorting to exclusively using their parametric knowledge. Moreover, we show that simple post-hoc finetuning can struggle to instill counterfactual reasoning ability – often leading to degradation in stored parametric knowledge. Ultimately, our work reveals important limitations of current LLM’s abilities to re-purpose parametric knowledge in novel settings.

版本指纹 ba93aa93e6f55f736903bae8c7fb437ddf9783864e2d8fa6c9ecf4aa06c7d579

返回筛选与清单 ↑
P042 2026 LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding Khurram Yamin; Shantanu Gupta; Gaurav Ghosal et al. 分析 LLM 在叙事因果理解中如何受事件顺序、已有知识和图结构复杂度影响。 世界机制与演化展开笔记
#P04228页 · 核对于 2026-09-15

中文摘要

分析 LLM 在叙事因果理解中如何受事件顺序、已有知识和图结构复杂度影响。

核心贡献

受控的合成、半合成和真实叙事评测,定位常识捷径与顺序偏差。

实现边界

主要判断事件间因果关系和抽取图;未涵盖完整反事实或干预推理。

Method · 方法

从链、fork、collider 和 CauseNet 构造叙事,操控叙述顺序/知识一致性/长度;比较直接回答与先抽因果图。

Results · 主要结果

模型倾向按叙事顺序推断因果、以参数知识覆盖上下文;图更长/复杂时下降。先显式识别因果图可改善稳定性。

Shortcomings · 局限

【作者】未覆盖其他因果任务;【解读】CauseNet 是文本声称的因果关系,受控叙事不等于真实科学因果发现。

证据定位

§3–4;§5;与 P045 封面、摘要比对。

Abstract · 英文原摘要

The ability to robustly identify causal relationships is essential for autonomous decision-making and adaptation to novel scenarios. However, accurately inferring causal structure requires integrating both world knowledge and abstract logical reasoning. In this work, we investigate the interaction between these two capabilities through the representative task of causal reasoning over narratives. Through controlled synthetic, semi-synthetic and real-world experiments, we find that stateof-the-art large language models (LLMs) often rely on superficial heuristics—for example, inferring causality from event order or recalling memorized world knowledge without attending to context. Furthermore, we show that simple reformulations of the task can elicit more robust reasoning behavior. Our evaluation spans a range of causal structures, from linear chains to complex graphs involving colliders and forks. These findings uncover systematic patterns in how LLMs perform causal reasoning and lay the groundwork for developing methods that better align LLM behavior with principled causal inference.

版本指纹 0264b3dec2f81a06f3272ce9328b2324bea065f9d9a77f4733091cb48ca9595d

返回筛选与清单 ↑
P041 2020 Learning to Complement Humans Bryan Wilder; Eric Horvitz; Ece Kamar 联合训练预测模型和求助策略,以人机团队的整体效用而非机器独立准确率为目标。 XR与人机协作展开笔记
#P0418页 · 核对于 2026-09-15

中文摘要

联合训练预测模型和求助策略,以人机团队的整体效用而非机器独立准确率为目标。

核心贡献

提出判别式及决策论式的联合优化,显式利用人类与机器错误模式的互补。

实现边界

Galaxy Zoo 和 CAMELYON 的离线人类标注数据;交互主要为是否查询一个人类答案。

Method · 方法

建模标签、人类响应及条件预测;同时优化分类和查询决策,将求助成本/非对称错误代价纳入期望损失。

Results · 主要结果

表1中 Galaxy Zoo 一层 VOI 的平均损失改善 38.9%(跨查询成本),不同容量/任务收益差异很大,部分设置存在负改善。

Shortcomings · 局限

【解读】需可靠的人类响应模型和代表性数据;未覆盖人类因 AI 建议而改变行为的长期双向协作。

证据定位

§2–3;§4/表1;§5。

Abstract · 英文原摘要

A rising vision for AI in the open world centers on the development of systems that can complement humans for perceptual, diagnostic, and reasoning tasks. To date, systems aimed at complementing the skills of people have employed models trained to be as accurate as possible in isolation. We demonstrate how an end-to-end learning strategy can be harnessed to optimize the combined performance of human-machine teams by considering the distinct abilities of people and machines. The goal is to focus machine learning on problem instances that are difficult for humans, while recognizing instances that are difficult for the machine and seeking human input on them. We demonstrate in two real-world domains (scientific discovery and medical diagnosis) that human-machine teams built via these methods outperform the individual performance of machines and people. We then analyze conditions under which this complementarity is strongest, and which training methods amplify it. Taken together, our work provides the first systematic investigation of how machine learning systems can be trained to complement human reasoning.

版本指纹 f2db8ece3b71eb3c52f40b5398ed32992f5d032a2a1a5bcf4ab054ff4cf68f9d

返回筛选与清单 ↑
P040 2026 Collaposer: Transforming Photo Collections into Visual Assets for Storytelling with Collages Jiayi Zhou; Liwenhan Xie; Jiaju Ma et al. Collaposer 根据故事描述从照片集合中提取和组织可用于拼贴的视觉素材。 创作与规则补全展开笔记
#P04019页 · 核对于 2026-09-15

中文摘要

Collaposer 根据故事描述从照片集合中提取和组织可用于拼贴的视觉素材。

核心贡献

把自动标注/检测/分割与故事驱动的语义选择、分层聚类展示结合。

实现边界

从输入照片提取切图并由用户构图;动画属于演示延伸,不是自主生成完整视频故事。

Method · 方法

6 名专家形成性访谈;流水线预处理照片,LLM 选择中心及相关标签,再按语义层次布局;12 人与两种消融基线被试内比较。

Results · 主要结果

12 人共创作 36 个静态拼贴故事、尝试 45 个提示;使用完整系统均一次获得可用素材集,故事匹配、多样性和可用性评价优于消融。

Shortcomings · 局限

【作者】文字意图可能错配,选择依据透明性不足;【解读】小样本且基线为消融,不能推断相对全部专业工具的效率优势。

证据定位

§3;§4;§6–7;§9。

Abstract · 英文原摘要

Digital collage is an artistic practice that combines image cutouts to tell stories. However, preparing cutouts from a set of photos remains a tedious and time-consuming task. A formative study identified three main challenges: 1) inefficient search for relevant photos, 2) manual image cutout, and 3) difficulty in organizing large sets of cutouts. To meet these challenges and facilitate asset preparation for collage, we propose Collaposer, a tool that transforms a collection of photos into organized, ready-to-use visual cutouts based on user-provided story descriptions. Collaposer tags, detects, and segments photos, and then uses an LLM to select central and related labels based on the user-provided story description. Collaposer presents the resulting visuals in varying sizes, clustered according to semantic hierarchy. Our evaluation shows that Collaposer effectively automates the preparation process to produce diverse sets of visual cutouts adhering to the storyline, allowing users to focus on collaging these assets for storytelling.

版本指纹 e579dd9e6132c26dbbbce515aba82204f8f109cd0a5f5c543472a6e717ae5c82

返回筛选与清单 ↑
P039 2023 Make-a-Story: Visual Memory Conditioned Consistent Story Generation Tanzila Rahman; Hsin-Ying Lee; Jian Ren et al. 以视觉记忆支持带指代的故事可视化,保持角色与背景跨图一致。 创作与规则补全世界机制与演化展开笔记
#P03910页 · 核对于 2026-09-15

中文摘要

以视觉记忆支持带指代的故事可视化,保持角色与背景跨图一致。

核心贡献

自回归 Story-LDM 及句子条件记忆注意力,并扩展 MUGEN/Flintstones 的指代设置。

实现边界

根据句子序列生成故事帧,主要是动画/游戏域;不是连续动作的长视频生成。

Method · 方法

潜在扩散逐帧生成,当前句子对过去图像和文本记忆做软注意力,以解析 he/she/they 等角色或背景指代。

Results · 主要结果

MUGEN、PororoSV、FlintstonesSV 上的图像质量、故事一致性和人评优于所列前作;同时演示保持一致与按情节改变背景。

Shortcomings · 局限

【解读】角色集合和视觉域较有限,自回归错误可能累积;一致性指标不能完整衡量故事叙事质量。

证据定位

§3;§4–5;§6。

Abstract · 英文原摘要

There has been a recent explosion of impressive generative models that can produce high quality images (or videos) conditioned on text descriptions. However, all such approaches rely on conditional sentences that contain unambiguous descriptions of scenes and main actors in them. Therefore employing such models for more complex task of story visualization, where naturally references and coreferences exist, and one requires to reason about when to maintain consistency of actors and backgrounds across frames/scenes, and when not to, based on story progression, remains a challenge. In this work, we address the aforementioned challenges and propose a novel autoregressive diffusion-based framework with a visual memory module that implicitly captures the actor and background context across the generated frames. Sentence-conditioned soft attention over the memories enables effective reference resolution and learns to maintain scene and actor consistency when needed. To validate the effectiveness of our approach, we extend the MUGEN dataset [19] and introduce additional characters, backgrounds and referencing in multisentence storylines. Our experiments for story generation on the MUGEN, the PororoSV [30] and the FlintstonesSV [16] dataset show that our method not only outperforms prior state-of-the-art in generating frames with high visual quality, which are consistent with the story, but also models appropriate correspondences between the characters and the background.

版本指纹 f15cd145c1869ec4b7661371bea534f5649cc8fa07eb39f3613b91c555c971da

返回筛选与清单 ↑
P038 2024 “I’m Not Sure, But...”: Examining the Impact of Large Language Models’ Uncertainty Expression on User Reliance and Trust Sunnie S. Y. Kim; Q. Vera Liao; Mihaela Vorvoreanu et al. 研究 LLM 用不同自然语言方式表达不确定性时,用户依赖、信任和任务表现如何变化。 XR与人机协作AI方法与评测展开笔记
#P03814页 · 核对于 2026-09-15

中文摘要

研究 LLM 用不同自然语言方式表达不确定性时,用户依赖、信任和任务表现如何变化。

核心贡献

预注册、N=404 的受控人类实验,区分第一人称、一般视角及无不确定性表达。

实现边界

虚构 AI 搜索系统中的医学事实是非题;操控表达,不训练或校准模型的真实不确定性。

Method · 方法

随机分组,对照有/无 AI 与不同措辞;用行为、答案正确性、信心和自报信任评价,并区分确认性/探索性分析。

Results · 主要结果

第一人称表达降低对系统信心与跟随率、提高用户准确率;一般视角效应较弱且未达显著。过度依赖仍存在,无 AI 组总体任务表现最好。

Shortcomings · 局限

【解读】单一任务和短期实验限制外推;谨慎措辞不是校准概率,也可能降低对正确答案的依赖。

证据定位

§3 预注册设计;§4;§5.1;§6。

Abstract · 英文原摘要

Widely deployed large language models (LLMs) can produce convincing yet incorrect outputs, potentially misleading users who may rely on them as if they were correct. To reduce such overreliance, there have been calls for LLMs to communicate their uncertainty to end users. However, there has been little empirical work examining how users perceive and act upon LLMs’ expressions of uncertainty. We explore this question through a large-scale, pre-registered, human-subject experiment (N=404) in which participants answer medical questions with or without access to responses from a fictional LLM-infused search engine. Using both behavioral and self-reported measures, we examine how different natural language expressions of uncertainty impact participants’ reliance, trust, and overall task performance. We find that firstperson expressions (e.g., “I’m not sure, but...”) decrease participants’ confidence in the system and tendency to agree with the system’s answers, while increasing participants’ accuracy. An exploratory analysis suggests that this increase can be attributed to reduced (but not fully eliminated) overreliance on incorrect answers. While we observe similar effects for uncertainty expressed from a general perspective (e.g., “It’s not clear, but...”), these effects are weaker and not statistically significant. Our findings suggest that using natural language expressions of uncertainty may be an effective approach for reducing overreliance on LLMs, but that the precise language used matters. This highlights the importance of user testing before deploying LLMs at scale.

版本指纹 2fe292249e998fb7c0158f8f63a30b65b9d4f560407b0625bf728ff2f7dc5f30

返回筛选与清单 ↑
P037 2026 SLM-MUX: Orchestrating Small Language Models for Reasoning Chenyu Wang; Zishen Wan; Hao Kang et al. 让多个小模型独立作答,用一致性选择结果,并搜索互补模型组合。 世界机制与演化AI方法与评测展开笔记
#P03727页 · 核对于 2026-09-15

中文摘要

让多个小模型独立作答,用一致性选择结果,并搜索互补模型组合。

核心贡献

SLM-MUX、模型子集搜索与配套测试时计算分配方案。

实现边界

使用固定模型组合及验证集;非模型间讨论,置信度主要以重复答案频次近似。

Method · 方法

每个模型多次采样,取自身众数并比较一致性;按 union accuracy 与冲突惩罚搜索组合,平局用验证准确率处理。

Results · 主要结果

论文报告相对既有编排方法最高提升 MATH 13.4、GPQA 8.8、GSM8K 7.0 个百分点;选定两个小模型的组合可在部分任务超过 Qwen2.5-72B。

Shortcomings · 局限

【作者】穷举组合开销高且静态,一致性高也可能一致地错;【解读】需将多模型多次采样成本纳入比较。

证据定位

§3;§4;§5 Limitation and Future Work。

Abstract · 英文原摘要

With the rapid development of language models, the number of small language models (SLMs) has grown significantly. Although they do not achieve state-of-theart accuracy, they are more efficient and often excel at specific tasks. This raises a natural question: can multiple SLMs be orchestrated into a system where each contributes effectively, achieving higher accuracy than any individual model? Existing orchestration methods have primarily targeted frontier models (e.g., GPT-4) and perform suboptimally when applied to SLMs. To address this gap, we propose a three-stage approach for orchestrating SLMs. First, we introduce SLM-MUX, a multi-model architecture that effectively coordinates multiple SLMs. Building on this, we develop two optimization strategies: (i) a model selection search that identifies the most complementary SLMs from a given pool, and (ii) test-time scaling tailored to SLM-MUX. Our approach delivers strong results: Compared to existing orchestration methods, our approach achieves up to 13.4% improvement on MATH, 8.8% on GPQA, and 7.0% on GSM8K. With just two SLMs, SLM-MUX outperforms Qwen 2.5 72B on GPQA and GSM8K, and matches its performance on MATH. We further provide theoretical analyses to substantiate the advantages of our method. Additional experiments show that the core principle of SLM-MUX extends to open-ended generation tasks (e.g., HumanEval) and benefits other model classes, including frontier LLMs and domain-specific fine-tuned SLMs. In summary, we demonstrate that SLMs can be effectively orchestrated into more accurate and efficient systems through the proposed approach.

版本指纹 a554693e80b40655b26e8479b00deb394efbb520aa37baba4cb6fac58fd96ad1

返回筛选与清单 ↑
P036 2026 SimStep: Human-in-the-Loop Authoring of Interactive Educational Simulations Through Task-Level Abstractions Zoe Kaputa; Anika Rajaram; Vryan Feliciano et al. 通过可检查、可修改的任务级图表示,让教师逐步创作并调试互动教学模拟。 创作与规则补全世界机制与演化展开笔记
#P03634页 · 核对于 2026-09-15

中文摘要

通过可检查、可修改的任务级图表示,让教师逐步创作并调试互动教学模拟。

核心贡献

Chain-of-Abstractions 及 inverse correction,将概念、场景、学习目标、UI 与代码衔接。

实现边界

实现的是模拟创作与纠错工具;没有证明学生学习成绩改善或仿真物理绝对正确。

Method · 方法

教师在抽象图上验证和编辑,Claude 生成/修改代码;自动测试和图形回溯定位隐含假设;进行教师使用与抽象保真度研究。

Results · 主要结果

11 名教师体验研究的 1–6 分可用性均值 4.66(SD 0.36);66 个模拟由 162 名 Prolific 参与者评价抽象保真度,概念图完整/连贯性 2.61/3。

Shortcomings · 局限

【作者】Prolific 评价者学科/教龄等信息未收集;【解读】短期创作体验不等于课堂效果,自动修复仍需人工核查。

证据定位

§3–5;§6.2;§7/表5;§8.3。

Abstract · 英文原摘要

Generative AI enables educators to create interactive learning content by describing goals in natural language. However, without programming affordances such as traceability, refinement, and debugging, teachers struggle to align simulations with learners’ needs, refine them step by step, or verify that they reflect intended learning concepts. We propose a task-level abstraction approach that structures authoring as a sequence of representations, mirroring how teachers plan lessons and providing checkpoints for specification, inspection, and refinement. We instantiate this approach in SimStep, an authoring environment that scaffolds simulation design with four abstractions, including Concept Graph, Scenario Graph, Learning Goal Graph, and UI Graph, and introduces an inverse correction process to revise hidden model assumptions without requiring code manipulation. A technical evaluation shows that these abstractions preserve fidelity across transformations, while a user study with educators demonstrates their effectiveness in authoring simulations. Our work reframes AI-assisted programming as human–AI co-authoring through structured, domain-aligned abstractions.

版本指纹 3eca89598fa6497b0ecd0c6fd84398cfbacc158792df23ae34e5e85bdc3ed648

返回筛选与清单 ↑
P035 2026 Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation Jun He; Junyan Ye; Zilong Huang et al. 以意图分析、主动搜索和显式推理补全图像生成所需的知识与隐含约束。 创作与规则补全展开笔记
#P03536页 · 核对于 2026-09-15

中文摘要

以意图分析、主动搜索和显式推理补全图像生成所需的知识与隐含约束。

核心贡献

训练无需新增的 Mind-Brush 编排框架,以及含 500 个动态知识/推理样本的 Mind-Bench。

实现边界

调用既有搜索、推理与生成模型;输出符合事实的程度受检索资料和生成器制约。

Method · 方法

检测认知缺口,搜索多模态证据、补充约束后生成;用 checklist-based strict accuracy(全部清单项通过)和 WISE/RISEBench 评价。

Results · 主要结果

完整框架在 Mind-Bench 的消融中比仅 reasoning agent 高 0.17、比仅 search agent 高 0.06 的准确率;另在 WISE/RISE 上取得所报改进。

Shortcomings · 局限

【解读】多模型调用成本高,清单覆盖和 MLLM 评价器可能漏检;“无需训练”只针对框架新增训练。

证据定位

§3;§4;§5.3–5.4;§6。

Abstract · 英文原摘要

While text-to-image generation has achieved unprecedented fidelity, the vast majority of existing models function fundamentally as static text-topixel decoders. Consequently, they often fail to grasp implicit user intentions. Although emerging unified understanding-generation models have improved intent comprehension, they still struggle to accomplish tasks involving complex knowledge reasoning within a single model. Moreover, constrained by static internal priors, these models remain unable to adapt to the evolving dynamics of the real world. To bridge these gaps, we introduce Mind-Brush, a unified agentic framework that transforms generation into a dynamic, knowledgedriven workflow. Simulating a human-like ’thinkresearch-create’ paradigm, Mind-Brush actively retrieves multimodal evidence to ground out-ofdistribution concepts and employs reasoning tools to resolve implicit visual constraints. To rigorously evaluate these capabilities, we propose Mind-Bench, a comprehensive benchmark comprising 500 distinct samples spanning real-time news, emerging concepts, and domains such as mathematical and Geo-Reasoning. Extensive experiments demonstrate that Mind-Brush significantly enhances the capabilities of unified models, realizing a zero-to-one capability leap for the Qwen-Image baseline on Mind-Bench, while achieving superior results on established benchmarks like WISE and RISE.

版本指纹 7b438d417f55156c2f8657fb74afedd81786a23c05c2bdb5b5a99b9385794488

返回筛选与清单 ↑
P034 2025 / 2026 Lost in Transmission: When and Why LLMs Fail to Reason Globally Tobias Schnabel; Kiran Tomlinson; Adith Swaminathan et al. 用注意力通信带宽受限模型解释 LLM 在跨输入全局推理上的失败。 世界机制与演化AI方法与评测展开笔记
#P03439页 · 核对于 2026-09-15

中文摘要

用注意力通信带宽受限模型解释 LLM 在跨输入全局推理上的失败。

核心贡献

提出 Bounded Attention Prefix Oracle(BAPO),证明可达性等问题的带宽下界,并分析 CoT 如何缓解限制。

实现边界

理论结论对所定义 BAPO 模型成立;经验结果支持带宽假说,未证明真实 Transformer 只有同样的严格上限。

Method · 方法

用 prefix/attention oracle 抽象信息流,区分 BAPO-easy/hard;在受控和现实任务上比较模型与 CoT 条件。

Results · 主要结果

GPT-4o、Claude、Gemini 对 easy 任务较强、对小规模 hard 任务也会失败;适当分解的 CoT 在理论模型中可把 hard 计算转化为逐步 easy 计算。

Shortcomings · 局限

【作者】真实有效带宽成因尚不清楚,部分下界较松;【解读】存在可用分解不保证模型会自动找到并可靠执行它。

证据定位

§2–3;§4;§6–7。

Abstract · 英文原摘要

Despite their many successes, transformer-based large language models (LLMs) continue to struggle with tasks that require complex reasoning over large parts of their input. We argue that these failures arise due to capacity limits on the accurate flow of information within LLMs. To formalize this issue, we introduce the bounded attention prefix oracle (BAPO) model, a new computational framework that models bandwidth constraints on attention heads, the mechanism for internal communication in LLMs. We show that several important reasoning problems like graph reachability require high communication bandwidth for BAPOs to solve; we call these problems BAPO-hard. Our experiments corroborate our theoretical predictions: GPT-4o, Claude, and Gemini succeed on BAPO-easy tasks and fail even on relatively small BAPO-hard tasks. BAPOs also reveal another benefit of chain of thought (CoT): we prove that breaking down a task using CoT can turn any BAPO-hard problem into a BAPO-easy one. Our results offer principled explanations for key LLM failures and suggest directions for architectures and inference methods that mitigate bandwidth limits.

版本指纹 9967dd46b0d1933065336b5d9d1ae994f04713da134b0099999ee7978a12e2d9

返回筛选与清单 ↑
P033 2026 Gen-Searcher: Reinforcing Agentic Search for Image Generation Kaituo Feng; Manyuan Zhang; Shawn Chen et al. 为知识密集的图像生成训练多步搜索智能体,先找文字知识与参考图,再调用生成器。 创作与规则补全展开笔记
#P03320页 · 核对于 2026-09-15

中文摘要

为知识密集的图像生成训练多步搜索智能体,先找文字知识与参考图,再调用生成器。

核心贡献

Gen-Searcher-SFT-10k/RL-6k 数据、KnowGen 基准和结合文字/图像反馈的 RL。

实现边界

搜索代理增强已有图像生成器;输出仍受搜索质量、网页时效和生成器能力限制。

Method · 方法

Qwen3-VL-8B 先 SFT 再 agentic RL;工具执行搜索/浏览,双奖励评价知识正确性与生成图的实际符合度。

Results · 主要结果

KnowGen、WISE 上相对所列生成器和代理基线获得提升,并展示跨生成器迁移;训练设置还需图像生成和网页摘要辅助模型,不能把代理 8B 视为全部计算规模。

Shortcomings · 局限

【解读】外部来源可能错误,评价器及合成训练图可能带偏;多跳搜索和图像 rollout 的计算/服务成本高。

证据定位

§3 数据与训练;§4.1–4.4、表1–3;§5。

Abstract · 英文原摘要

Recent image generation models have shown strong capabilities in generating high-fidelity and photorealistic images. However, they are fundamentally constrained by frozen internal knowledge, thus often failing on real-world scenarios that are knowledge-intensive or require up-to-date information. In this paper, we present Gen-Searcher, as the first attempt to train a search-augmented image generation agent, which performs multi-hop reasoning and search to collect the textual knowledge and reference images needed for grounded generation. To achieve this, we construct a tailored data pipeline and curate two high-quality datasets, Gen-Searcher-SFT-10k and Gen-Searcher-RL-6k, containing diverse search-intensive prompts and corresponding ground-truth synthesis images. We further introduce KnowGen, a comprehensive benchmark that explicitly requires search-grounded external knowledge for image generation and evaluates models from multiple dimensions. Based on these resources, we train Gen-Searcher with SFT followed by agentic reinforcement learning with dual reward feedback, which combines text-based and image-based rewards to provide more stable and informative learning signals for GRPO training. Experiments show that Gen-Searcher brings substantial gains, improving Qwen-Image by around 16 points on KnowGen and 15 points on WISE. We hope this work can serve as an open foundation for search agents in image generation, and we fully open-source our data, models, and code.

版本指纹 26f20d758c0536cd6839012347e0f7bccc94a0add0d978870236cd6d5ad3343a

返回筛选与清单 ↑
P032 2026 Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation Chengran Yang; Zichao Wei; Heminghao Deng et al. 让自回归模型在生成过程中输出编辑指令,从而及时修改已经构造的代码。 创作与规则补全展开笔记
#P03221页 · 核对于 2026-09-15

中文摘要

让自回归模型在生成过程中输出编辑指令,从而及时修改已经构造的代码。

核心贡献

Stream of Revision 以虚拟光标、编辑 token 和确定性渲染器把生成流转换为可修订程序。

实现边界

token 流仍单调自回归,改变的是渲染后的代码;主要在 C/C++ 安全对齐和 CSE2 检测器上评价。

Method · 方法

从真实 CVE 修复对构造训练数据,学习编辑动作及普通代码;用安全检查通过率、HumanEval 功能测试和 AST 解析率分别验证。

Results · 主要结果

相较多种修复/对齐基线改善 CSE2 安全通过率;叠加 ProSec 后文中报告 C +1.16、C++ +4.15 个百分点。

Shortcomings · 局限

【解读】静态检查通过不等于无漏洞;需修改训练与渲染执行协议,仍可能生成语法/语义错误,跨语言效果有条件。

证据定位

§3;§4–6、表2;§7.3、表5;§9。

Abstract · 英文原摘要

Large Language Model (LLM) based code generation is predominantly formulated as a strictly monotonic process, appending tokens linearly to an immutable prefix. This formulation contrasts to the cognitive process of programming, which is inherently interleaved with forward generation and on-the-fly revision. While prior works attempt to introduce revision via post-hoc agents or external static tools, they either suffer from high latency or fail to leverage the model’s intrinsic semantic reasoning. In this paper, we propose Stream of Revision, a paradigm shift that elevates code generation from a monotonic stream to a dynamic, self-correcting trajectory by leveraging model’s intrinsic capabilities. We introduce specific action tokens that enable the model to seamlessly backtrack and edit its own history within a single forward pass. By internalizing the revision loop, our framework Stream of Revision allows the model to activate its latent capabilities just-intime without external dependencies. Empirical results on secure code generation show that Stream of Revision significantly reduces vulnerabilities with minimal inference overhead.

版本指纹 c9b7c702d280df7d23ac4f1133a46a1725bb3ccf82b0b77b70db469d9b05c775

返回筛选与清单 ↑
P031 2026 Agentic Reasoning for Large Language Models Tianxin Wei; Ting-Wei Li; Zhining Liu et al. 系统梳理将推理与行动连接的语言智能体研究,覆盖基础能力、自我演化和多智能体协作。 世界机制与演化XR与人机协作AI方法与评测展开笔记
#P031135页 · 核对于 2026-09-15

中文摘要

系统梳理将推理与行动连接的语言智能体研究,覆盖基础能力、自我演化和多智能体协作。

核心贡献

按环境动态、优化方式与协作范围组织统一分类及应用/基准地图。

实现边界

135 页综述,正文说明汇总截至 2025 年的进展;没有训练或统一重测一个新模型。

Method · 方法

分别梳理规划/工具/搜索、反馈/记忆/适应、角色/分工/协作演化,区分上下文编排与 SFT/RL 后训练,并整理跨领域基准。

Results · 主要结果

产出研究分类、方法对照表和开放问题:个性化、长时交互、世界模型、潜在推理与协作治理;没有可归于本文新算法的单一准确率。

Shortcomings · 局限

【解读】文献选择和分类含作者判断,跨论文成绩并非同条件比较,快速发展的领域需要持续更新。

证据定位

摘要;§2–5;应用 §6;基准 §7;开放问题 §8。

Abstract · 英文原摘要

Reasoning is a fundamental cognitive process underlying inference, problem-solving, and decisionmaking. While large language models (LLMs) demonstrate strong reasoning capabilities in closed-world settings, exemplified by standard benchmarks in mathematics and code, they struggle in open-ended and dynamic environments. The emergence ofagentic reasoningmarks a paradigm shift, bridging thought and action by reframing LLMs as autonomous agents that plan, act, and learn through continual interaction. In this survey, we provide a systematic roadmap by organizing agentic reasoning along three complementary dimensions. First, we characterize environmental dynamics through three layers:foundational agentic reasoning establishes core single-agent capabilities, including planning, tool use, and search, that operate in stable environments;self-evolving agentic reasoningexamines how agents refine these capabilities through feedback, memory, and adaptation in evolving settings; andcollective multi-agent reasoningextends intelligence to collaborative scenarios where multiple agents coordinate roles, share knowledge, and pursue shared goals. Across all layers, we analyze system constraints and optimization settings by distinguishingin-context reasoning, which scales test-time interaction through structured orchestration and adaptive workflow design, fromposttraining reasoning, which optimizes behaviors through reinforcement learning and supervised fine-tuning. We further review and contextualize agentic reasoning frameworks in real-world applications and benchmarks spanning science, robotics, healthcare, autonomous research, and math, illustrating how different reasoning mechanisms are instantiated and evaluated across domains. This survey synthesizes agentic reasoning methods into a unified roadmap that bridges thoughts and actions, offering actionable guidance for agentic systems across environmental dynamics, optimization settings, and agent interaction settings. Finally, we outline open challenges and future directions, situating how agentic reasoning has developed while identifying what remains ahead: personalization, long-horizon interaction, world modeling, scalable multi-agent training, and governance frameworks for real-world deployment.

版本指纹 edc82b75fe0496cb13bf8288aac941e4437dc136a82b2dce4a7ab55d130db916

返回筛选与清单 ↑
P030 2026 AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs Boyu Chang; Qi Wang; Xi Guo et al. 结合语言假设筛选与图像想象,增强多模态模型对缺失视觉事件的溯因推理。 世界机制与演化XR与人机协作展开笔记
#P0309页 · 核对于 2026-09-15

中文摘要

结合语言假设筛选与图像想象,增强多模态模型对缺失视觉事件的溯因推理。

核心贡献

REASONER 与 IMAGINER 双模块联合学习:前者筛选假设,后者用扩散视觉表示辅助解释。

实现边界

标准 VAR 任务中的解释生成;想象画面属于条件生成,不能作为对真实隐藏事件的新观测证据。

Method · 方法

LLM 根据视频描述提出候选,经因果相关对比学习筛选;条件扩散模块通过适配器融合视频和推理表示,联合优化语言与图像分支。

Results · 主要结果

作者在标准 VAR 基准报告优于所列传统模型和 MLLM;消融显示去掉 IMAGINER 或其适配器会降低 CIDEr 等生成指标。

Shortcomings · 局限

【解读】生成图像可能强化错误假设;依赖视频描述、候选覆盖和训练数据,自动文本指标不直接证明因果解释正确。

证据定位

摘要;REASONER/IMAGINER 方法;实验表格;表6及结论。

Abstract · 英文原摘要

Visual abductive reasoning (V AR) is a challenging task that requires AI systems to infer the most likely explanation for incomplete visual observations. While recent MLLMs develop strong general-purpose multimodal reasoning capabilities, they fall short in abductive inference, as compared to human beings. To bridge this gap, we draw inspiration from the interplay between verbal and pictorial abduction in human cognition, and propose to strengthen abduction of MLLMs by mimicking such dual-mode behavior. Concretely, we introduceAbductiveMLLMcomprising of two synergistic components: REASONERand IMAGINER. The REASONERoperates in the verbal domain. It first explores a broad space of possible explanations using a blind LLM and then prunes visually incongruent hypotheses based on cross-modal causal alignment. The remaining hypotheses are introduced into the MLLM as targeted priors, steering its reasoning toward causally coherent explanations. The IMAGINER, on the other hand, further guides MLLMs by emulating human-like pictorial thinking. It conditions a text-to-image diffusion model on both the input video and the REASONER’s output embeddings to “imagine” plausible visual scenes that correspond to verbal explanation, thereby enriching MLLMs’ contextual grounding. The two components are trained jointly in an end-to-end manner. Experiments on standard V AR benchmarks show thatAbductiveMLLMachieves state-of-the-art performance, consistently outperforming traditional solutions and advanced MLLMs. Code— https://github.com/ChangPtR/AbdMLLM

版本指纹 2e9d58f9985c584aa48d97dbf51d1f7b98f81da5cc7bacd01997e66b8e388ea0

返回筛选与清单 ↑
P029 2025 VideoDiff: Human-AI Video Co-Creation with Alternatives Mina Huh; Ding Li; Kim Pimmel et al. 用对齐时间轴、转录文本和差异高亮,帮助视频创作者比较、筛选和修改多种 AI 剪辑方案。 创作与规则补全展开笔记
#P02919页 · 核对于 2026-09-15

中文摘要

用对齐时间轴、转录文本和差异高亮,帮助视频创作者比较、筛选和修改多种 AI 剪辑方案。

核心贡献

围绕 rough cut、B-roll 和文字效果的多方案共创交互。

实现边界

对用户已有素材提供编辑建议/组合,未训练新的通用视频生成模型。

Method · 方法

8 名专业创作者形成性研究;实现 React/D3/Remotion 界面,Whisper 转录与 GPT-4o 编辑建议;12 人被试内对照和 3 个真实素材案例。

Results · 主要结果

对“理解差异的有用性”评价均值为 4.92 vs 基线 2.25(p<0.05);参与者更易比较和定制,并报告更满意的创作结果。

Shortcomings · 局限

【解读】小样本短期研究,比较的是特定基线;转录/语言主导流程可能遗漏视觉细节,偏好与专业成片质量不同。

证据定位

§3;§4.3;§5.1–5.3;§6–7。

Abstract · 英文原摘要

To make an engaging video, people sequence interesting moments and add visuals such as B-rolls or text. While video editing requires time and effort, AI has recently shown strong potential to make editing easier through suggestions and automation. A key strength of generative models is their ability to quickly generate multiple variations, but when provided with many alternatives, creators struggle to compare them to find the best fit. We propose VideoDiff, an AI video editing tool designed for editing with alternatives. With VideoDiff, creators can generate and review multiple AI recommendations for each editing process: creating a rough cut, inserting B-rolls, and adding text effects. VideoDiff simplifies comparisons by aligning videos and highlighting differences through timelines, transcripts, and video previews. Creators have the flexibility to regenerate and refine AI suggestions as they compare alternatives. Our study participants (N=12) could easily compare and customize alternatives, creating more satisfying results.

版本指纹 4387e6879b388b1371bad2857839323e56437fdc255065cc2245000586305adc

返回筛选与清单 ↑
P028 2025 Video models are zero-shot learners and reasoners Thaddäus Wiedemer; Yuxuan Li; Paul Vicol et al. 探索 Veo 3 能否仅通过提示执行感知、操作和视觉推理任务,提出视频模型具备通用视觉能力的早期证据。 世界机制与演化展开笔记
#P02846页 · 核对于 2026-09-15

中文摘要

探索 Veo 3 能否仅通过提示执行感知、操作和视觉推理任务,提出视频模型具备通用视觉能力的早期证据。

核心贡献

跨任务定性探索及 7 类任务定量评估,涵盖分割、边缘检测、编辑、迷宫、对称和类比。

实现边界

Veo API 连同 LLM prompt rewriter 作为黑盒;作者承认部分答案可能来自重写器。best-frame 和 pass@10 不是单次最终输出表现。

Method · 方法

输入图像及任务提示生成 8 秒视频,再按任务读取最好/最后一帧;比较 Veo 2、Veo 3 和图像/语言基线。

Results · 主要结果

Veo 3 在多任务中明显优于 Veo 2,增加尝试次数提升成功率;边缘检测在 BIPEDv2 的 50 张测试图评测,分割只测 50 张较容易的 LVIS 图。

Shortcomings · 局限

【作者/设定】专用模型仍更强、成功不稳定,训练数据不可见;【解读】挑最好帧/多次尝试会高估实际可直接使用的可靠性。

证据定位

§2;§4 及图3–9;§5。

Abstract · 英文原摘要

The remarkable zero-shot capabilities of Large Language Models (LLMs) have propelled natural language processing from task-specific models to unified, generalist foundation models. This transformation emerged from simple primitives: large, generative models trained on web-scale data. Curiously, the same primitives apply to today’s generative video models. Could video models be on a trajectory towards general-purposevisionunderstanding, much like LLMs developed general-purposelanguage understanding? We demonstrate that Veo 3 can solve a broad variety of tasks it wasn’t explicitly trained for: segmenting objects, detecting edges, editing images, understanding physical properties, recognizing object affordances, simulating tool use, and more. These abilities to perceive, model, and manipulate the visual world enable early forms of visual reasoning like maze and symmetry solving. Veo’s emergent zero-shot capabilities indicate that video models are on a path to becoming unified, generalist vision foundation models.

版本指纹 e4bb6ec0a03c7a08e7fedf5beb10e54fbdbb54f6de4569fbb87883ad8b498219

返回筛选与清单 ↑
P027 2025 VCD: A Dataset for Visual Commonsense Discovery in Images Xiangqing Shen; Fanfan Wang; Siwei Wu et al. VCD 将物体框与可见、不可见常识三元组连接,支持图像中的常识发现。 世界机制与演化XR与人机协作展开笔记
#P02716页 · 核对于 2026-09-15

中文摘要

VCD 将物体框与可见、不可见常识三元组连接,支持图像中的常识发现。

核心贡献

超过 100K 图片、14M 物体—常识对,以及 Seen/Unseen、Property/Action/Space 层级分类;训练 VCM 基线。

实现边界

静态图片、区域级常识生成;尚未覆盖视频时序和动态因果。

Method · 方法

结合 Visual Genome 与 ConceptNet,映射/扩展三元组并进行质量控制,再用指令微调视觉语言模型生成常识。

Results · 主要结果

ImageNetVC 平均分由 OFA 80.7 到 VCM 83.5;Qwen-VL-7B 加常识后 OK-VQA 从 58.6 到 60.0。人评对 GPT-4o 的 Unseen 胜/平/负为 41%/29%/30%。

Shortcomings · 局限

【作者】下游验证较简单、仅静态图像;【解读】大量自动构造常识可能保留知识库偏差,规模不代表每条均正确。

证据定位

§3;表3–5;Limitations。

Abstract · 英文原摘要

Visual commonsense plays a vital role in understanding and reasoning about the visual world. While commonsense knowledge bases like ConceptNet provide structured collections of general facts, they lack visually grounded representations. Scene graph datasets like Visual Genome, though rich in object-level descriptions, primarily focus on directly observable information and lack systematic categorization of commonsense knowledge. We present Visual Commonsense Dataset ( VCD), a large-scale dataset containing over 100,000 images and 14 million object-commonsense pairs that bridges this gap. VCD introduces a novel three-level taxonomy for visual commonsense, integrating both Seen (directly observable) and Unseen (inferrable) commonsense across Property, Action, and Space aspects. Each commonsense is represented as a triple where the head entity is grounded to object bounding boxes in images, enabling scenedependent and object-specific visual commonsense representation. To demonstrate VCD’s utility, we develop VCM, a generative model that combines a vision-language model with instruction tuning to discover diverse visual commonsense from images. Extensive evaluations demonstrate both the high quality of VCD and its value as a resource for advancing visually grounded commonsense understanding and reasoning. Our dataset and code will be released on https://github.com/NUSTM/VCD.

版本指纹 8fde486cc3f7096a777b415c3b45f71bd4d074255948644b0f7daf9eeea921da

返回筛选与清单 ↑
P025 2025 Reasoning with Sampling: Your Base Model is Smarter Than You Think Aayush Karan; Yilun Du 不训练模型或使用验证器,而通过基础模型自身似然驱动的采样提升推理表现。 世界机制与演化AI方法与评测展开笔记
#P02520页 · 核对于 2026-09-15

中文摘要

不训练模型或使用验证器,而通过基础模型自身似然驱动的采样提升推理表现。

核心贡献

用自回归 MCMC 近似从幂分布采样,研究 RL 后训练之外的能力激发方式。

实现边界

需要访问模型似然和反复生成/打分;single-shot 指最终提交一条答案,不代表只进行一次采样计算。

Method · 方法

按块扩展序列,随机位置重采样后缀,用 Metropolis–Hastings 接受率逼近 p(x)^α;测试数学、代码、科学及一般帮助性。

Results · 主要结果

MATH500/GPQA 上部分设置接近 GRPO,HumanEval 和 AlpacaEval 部分设置更高;保持较好的多样性。收益需结合模型与采样预算看表1,不能统一为所有模型提升同一百分比。

Shortcomings · 局限

【作者/设定】精确幂分布采样不可行,采用近似且计算昂贵;【解读】高似然并非正确性保证,省训练不等于省总算力。

证据定位

§4 算法1;§5.2 表1;计算分析及 §6。

Abstract · 英文原摘要

Frontier reasoning models have exhibited incredible capabilities across a wide array of disciplines, driven by posttraining large language models (LLMs) with reinforcement learning (RL). However, despite the widespread success of this paradigm, much of the literature has been devoted to disentangling truly novel behaviors that emerge during RL but are not present in the base models. In our work, we approach this question from a different angle, instead asking whether comparable reasoning capabilites can be elicited from base models at inference time by pure sampling,without any additional training. Inspired by Markov chain Monte Carlo (MCMC) techniques for sampling from sharpened distributions, we propose a simple iterative sampling algorithm leveraging the base models’ own likelihoods. Over different base models, we show that our algorithm offers substantial boosts in reasoning that nearly match and even outperform those from RL on a wide variety of single-shot tasks, including MATH500, HumanEval, and GPQA. Moreover, our sampler avoids the collapse in diversity over multiple samples that is characteristic of RL-posttraining. Crucially, our method does not require training, curated datasets, or a verifier, suggesting broad applicability beyond easily verifiable domains.

版本指纹 8f029968f20292b320dda95d253911a187e34a18d33aa6cdc65883b9cc1a47d4

返回筛选与清单 ↑
P024 2025 Nested Learning: The Illusion of Deep Learning Architecture Ali Behrouz; Meisam Razaviyayn; Peilin Zhong et al. 把网络、优化器和记忆统一为不同更新频率的嵌套优化过程,并据此设计连续记忆系统和 Hope。 世界机制与演化XR与人机协作展开笔记
#P02452页 · 核对于 2026-09-15

中文摘要

把网络、优化器和记忆统一为不同更新频率的嵌套优化过程,并据此设计连续记忆系统和 Hope。

核心贡献

提出 NL 视角、表达力更强的优化器、自修改学习模块和 Continuum Memory System。

实现边界

提供理论重述与具体原型实验;作者明确表示未普遍解决灾难性遗忘。标题按首页单数 Architecture,元数据为 Architectures。

Method · 方法

将梯度/上下文压缩解释为关联记忆;设计多个时间尺度更新的 MLP 记忆、M3 优化器,以及结合自指 Titans 的 Hope。

Results · 主要结果

在语言建模、知识更新、形式语言和长上下文任务中展示收益;如表1 16K UUID 检索 Hope 24.8%、Titans 21.2%、Transformer 40.8%,说明优势取决于任务,非全面领先。

Shortcomings · 局限

【作者】有限容量的压缩仍带来遗忘;【解读】新概念的统一性不等于普适能力保证,需分别评价各组件、参数量和训练预算。

证据定位

§3–8;§9、表1–5;§10 的 Is Catastrophic Forgetting Solved?。

Abstract · 英文原摘要

Over the last decades, developing more powerful neural architectures and simultaneously designing optimization algorithms to effectively train them have been the core of research efforts to enhance the capability of machine learning models. Despite the recent progresses, particularly in developing Language Models (LMs), there are fundamental challenges and unanswered questions about how such models cancontinually learn/memorize, self-improve, and find effective solutions. In this paper, we present a new learning paradigm, called Nested Learning (NL), that coherently represents a machine learning model with a set of nested, multi-level, and/or parallel optimization problems, each of which with its own “context flow”. Through the lenses of NL, existing deep learning methods learns from data throughcompressingtheir own context flow, andin-context learningnaturally emerges in large models. NL suggests a philosophy to design more expressive learning algorithms with more “levels”, resulting in higher-order in-context learning and potentially unlocking effective continual learning capabilities. In addition to its neuro-scientific motivation, we advocate for NL by presenting three core contributions: (1) Expressive Optimizers: We show that known gradient-based optimizers, such as Adam, SGD with Momentum, etc., are in fact associative memory modules that aim to compress the gradients’ information (by gradient descent). Building on this insight, we present other “more expressive" optimizers with deep memory and/or more powerful learning rules; (2) Self-Modifying Learning Module: Taking advantage of NL’s insights on learning algorithms, we present a sequence model that learns how to modify itself by learning its own update algorithm; and (3) Continuum Memory System: We present a new formulation for memory system that generalizes the traditional viewpoint of “long-term/short-term memory”. Combining our self-modifying sequence model with the continuum memory system, we present a continual learning module, calledHope, showing promising results in language modeling, knowledge incorporation, and few-shot generalization tasks, continual learning, and long-context reasoning tasks.

版本指纹 e87a9ce82ff24e96f55b83fb9713a5d6fc9e4a1a232c12d42da49c10022ed891

返回筛选与清单 ↑
P023 2025 Generalizable Reasoning through Compositional Energy Minimization Alexandru Oarga; Yilun Du 先学习小子问题的能量函数,再在测试时组合约束求解更大、更复杂的问题。 世界机制与演化展开笔记
#P02322页 · 核对于 2026-09-15

中文摘要

先学习小子问题的能量函数,再在测试时组合约束求解更大、更复杂的问题。

核心贡献

组合能量景观与 Parallel Energy Minimization(PEM),支持增加约束和计算预算。

实现边界

N-Queens、3-SAT、图着色和填字;子问题分解由任务结构提供,不是自动发现任意问题分解。

Method · 方法

扩散与对比损失训练局部能量函数;求和形成全局目标,用多个并行候选进行能量最小化和筛选。

Results · 主要结果

只用一个 8 皇后训练实例时,P=1024 的方法在 100 次生成中得到 97 个有效解,表1最强比较设置为 41 个。

Shortcomings · 局限

【作者】高斯初始化/增量限制,图着色仍未充分达到最优;【解读】并行采样成本显著,不能把 97% 视为单一低成本轨迹成功率。

证据定位

§3;表1 p6;§4;§5。

Abstract · 英文原摘要

Generalization is a key challenge in machine learning, specifically in reasoning tasks, where models are expected to solve problems more complex than those encountered during training. Existing approaches typically train reasoning models in an end-to-end fashion, directly mapping input instances to solutions. While this allows models to learn useful heuristics from data, it often results in limited generalization beyond the training distribution. In this work, we propose a novel approach to reasoning generalization by learning energy landscapes over the solution spaces of smaller, more tractable subproblems. At test time, we construct a global energy landscape for a given problem by combining the energy functions of multiple subproblems. This compositional approach enables the incorporation of additional constraints during inference, allowing the construction of energy landscapes for problems of increasing difficulty. To improve the sample quality from this newly constructed energy landscape, we introduce Parallel Energy Minimization (PEM). We evaluate our approach on a wide set of reasoning problems. Our method outperforms existing state-of-the-art methods, demonstrating its ability to generalize to larger and more complex problems. Project website can be found at:https://alexoarga.github.io/compositional_reasoning/

版本指纹 26f0122c9977bee78286c8587ae868a3fe2db86dc60f7dabe4a4710c6ac3f5f9

返回筛选与清单 ↑
P022 2025 Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance Yufei He; Ruoyu Li; Alex Chen et al. ARIA 识别知识缺口、向专家求助并维护带时间戳的知识库,以适应运行中变化的规则。 世界机制与演化XR与人机协作展开笔记
#P02230页 · 核对于 2026-09-15

中文摘要

ARIA 识别知识缺口、向专家求助并维护带时间戳的知识库,以适应运行中变化的规则。

核心贡献

将主动询问、冲突消解和时效性知识更新结合,用于动态名称筛查与合同理解。

实现边界

更新主要是外部知识库;TikTok Pay 部署和用户覆盖是论文自述,不能将平台月活当作实验人数;公开 CUAD 实验用 LLM 模拟专家。

Method · 方法

自对话评估不确定性,在查询预算内请求解释/纠错;抽取知识、加时间戳,检测冲突并澄清后检索用于后续决策。

Results · 主要结果

真实序列测试为 11,846 例(156 阳性);CUAD 在 B=2000 时 GPT-4o+ARIA 准确率 0.6358,静态模型 0.4872,RAG 0.5735。

Shortcomings · 局限

【作者】依赖专家反馈质量和预算,运行开销未充分评测;【解读】模拟专家与人工长期使用存在差异。

证据定位

§4;表1;§6.1–6.2/表4;Limitations。

Abstract · 英文原摘要

Large language model (LLM) agents often struggle in environments where rules and required domain knowledge frequently change, such as regulatory compliance and user risk screening. Current approaches—like offline fine-tuning and standard prompting—are insufficient because they cannot effectively adapt to new knowledge during actual operation. To address this limitation, we propose theAdaptive ReflectiveInteractiveAgent (ARIA) 1, an LLM agent framework designed specifically to continuously learn updated domain knowledge at test time. ARIA assesses its own uncertainty through structured self-dialogue, proactively identifying knowledge gaps and requesting targeted explanations or corrections from human experts. It then systematically updates an internal, timestamped knowledge repository with provided human guidance, detecting and resolving conflicting or outdated knowledge through comparisons and clarification queries. We evaluate ARIA on the realistic customer due diligence name screening task on TikTok Pay, alongside publicly available dynamic knowledge tasks. Results demonstrate significant improvements in adaptability and accuracy compared to baselines using standard offline fine-tuning and existing self-improving agents.ARIA is deployed within TikTok Pay serving over 150 million monthly active users, confirming its practicality and effectiveness for operational use in rapidly evolving environments.

版本指纹 9a42692cacd30f0379aaa6d69bbbc4370208f53e0c08516c6d8fe84cd268ce0b

返回筛选与清单 ↑
P021 2025 Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events Aditya Chinchure; Sahithya Ravi; Raymond Ng et al. 以反常视频事件检验模型能否解释隐藏事件,以及获得新证据后修正原先假设。 世界机制与演化XR与人机协作展开笔记
#P02110页 · 核对于 2026-09-15

中文摘要

以反常视频事件检验模型能否解释隐藏事件,以及获得新证据后修正原先假设。

核心贡献

BlackSwanSuite 包含 1,655 个视频、超过 3,800 个选择题、4,900 个生成题和 6,700 个是非题。

实现边界

通过遮蔽或揭示视频片段构建 Forecaster/Detective/Reporter;是评测基准,未提出训练后消除缺陷的新模型。

Method · 方法

分阶段给出视觉证据,评估溯因和可撤销推理;使用选择题准确率、CLIP/LLM 生成指标及人类评价。

Results · 主要结果

表2 Detective MCQ:GPT-4o 65.1%、人类 90.0%,相差 24.9 个百分点;Reporter Y/N 为 60.1% vs 92.0%。注意本地表2图注与表头存在任务名称不一致,以上按表头及正文解释。

Shortcomings · 局限

【解读】反常事件样本有选择偏差,感知失败与推理失败相互影响;开放式解释评价依赖参考与评价器。

证据定位

§3–5;表2和 §6.1;§7–8。

Abstract · 英文原摘要

The commonsense reasoning capabilities of visionlanguage models (VLMs), especially in abductive reasoning and defeasible reasoning, remain poorly understood. Most benchmarks focus on typical visual scenarios [ 1, 23, 42], making it difficult to discern whether model performance stems from keen perception and reasoning skills, or reliance on pure statistical recall. We argue that by focusing on atypical events in videos, clearer insights can be gained on the core capabilities of VLMs. Explaining and understanding such out-of-distribution events requires models to extend beyond basic pattern recognition and regurgitation of their prior knowledge. To this end, we introduce Black- SwanSuite, a benchmark for evaluating VLMs’ ability to reason about unexpected events through abductive and defeasible tasks. Our tasks artificially limit the amount of visual information provided to models while questioning them about hidden unexpected events, or provide new visual information that could change an existing hypothesis about the event. We curate a comprehensive benchmark suite comprising over 3,800 MCQ, 4,900 generative and 6,700 yes/no questions, spanning 1,655 videos. After extensively evaluating various state-of-the-art VLMs, including GPT-4o and Gemini 1.5 Pro, as well as open-source VLMs such as LLaVA-Video, we find significant performance gaps of up to 32% from humans on these tasks. Our findings reveal key limitations in current VLMs, emphasizing the need for enhanced model architectures and training strategies. Our data and leaderboard is available at https://blackswan.cs.ubc.ca.

版本指纹 91efca47ea0eadf531cb7523e3cf6f4016d01a79de26626f2b5748c87ecfc46d

返回筛选与清单 ↑
P020 2024 ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models Kaiwen Zhou; Kwonjoon Lee; Teruhisa Misu et al. 区分直接视觉理解与超出画面的常识推断,让 LLM 选择并指挥合适的视觉处理路线。 世界机制与演化XR与人机协作展开笔记
#P02012页 · 核对于 2026-09-15

中文摘要

区分直接视觉理解与超出画面的常识推断,让 LLM 选择并指挥合适的视觉处理路线。

核心贡献

任务分类加主动视觉取证的 VLM/LLM 协作流程。

实现边界

VCR 和 A-OKVQA 四选一;不做域内微调,但依赖多个预训练模型及 in-context 示例。

Method · 方法

先从图像描述评估候选;不确定时由 LLM 分类为 VCU/VCI,调用 BLIP2 直接匹配或询问关键视觉因素,再重新推理。

Results · 主要结果

在论文所测无需域内微调的方法中表现最好;分析中 VCU 的 VLM/LLM+caption 平均准确率 63.6%/56.0%,VCI 为 50.5%/53.6%。

Shortcomings · 局限

【作者】文本沟通丢失视觉细节、仍落后最佳监督模型;VCR 主方法比较仅 500 个样本,受 GPT-4 调用成本限制。

证据定位

§4;§5.1–5.2;§6;§8。

Abstract · 英文原摘要

In our work, we explore the synergistic capabilities of pre-trained vision-and-language models (VLMs) and large language models (LLMs) on visual commonsense reasoning (VCR) problems. We find that VLMs and LLMs-based decision pipelines are good at different kinds of VCR problems. Pre-trained VLMs exhibit strong performance for problems involving understanding the literal visual content, which we noted as visual commonsense understanding (VCU). For problems where the goal is to infer conclusions beyond image content, which we noted as visual commonsense inference (VCI), VLMs face difficulties, while LLMs, given sufficient visual evidence, can use commonsense to infer the answer well. We empirically validate this by letting LLMs classify VCR problems into these two categories and show the significant difference between VLM and LLM with image caption decision pipelines on two subproblems. Moreover, we identify a challenge with VLMs’ passive perception, which may miss crucial context information, leading to incorrect reasoning by LLMs. Based on these, we suggest a collaborative approach, named ViCor, where pre-trained LLMs serve as problem classifiers to analyze the problem category, then either use VLMs to answer the question directly or actively instruct VLMs to concentrate on and gather relevant visual elements to support potential commonsense inferences. We evaluate our framework on two VCR benchmark datasets and outperform all other methods that do not require in-domain fine-tuning.

版本指纹 4503d215534a2016f3544189c73da3f8d25b8d674ba4dd04c05280d32364d827

返回筛选与清单 ↑
P019 2024 NL-EYE: Abductive NLI for Images Mor Ventura; Michael Toker; Nitay Calderon et al. 把溯因 NLI 扩展到多图输入,要求比较后果/原因图像的合理性并解释选择。 世界机制与演化XR与人机协作展开笔记
#P01927页 · 核对于 2026-09-15

中文摘要

把溯因 NLI 扩展到多图输入,要求比较后果/原因图像的合理性并解释选择。

核心贡献

350 个三元组、1,050 张人工策划合成图,覆盖物理、功能、逻辑、情绪、文化和社会推理。

实现边界

受控合成图像比较任务;事故预防和生成视频验证是潜在应用,未作为系统实现验证。

Method · 方法

人工撰写场景并迭代文生图;比较 triplet/pair 设置、合理性预测及解释,分析纯视觉和文本替代条件。

Results · 主要结果

被测 VLM 在多项设置接近随机基线,人类在合理性和解释质量上明显更好;结果限于本地版本使用的模型与测试集。

Shortcomings · 局限

【作者】常识标签存在文化/社会偏差,合成图仍可能含敏感内容;【解读】样本小、图像生成伪影与推理难度可能耦合。

证据定位

摘要;§2–4;结果 §5;失败分析 §6;Ethics。

Abstract · 英文原摘要

Will a Visual Language Model (VLM)-based bot warn us about slipping if it detects a wet floor? Recent VLMs have demonstrated impressive capabilities, yet their ability to infer outcomes and causes remains underexplored. To address this, we introduce NL-E YE, a benchmark designed to assess VLMs’ visual abductive reasoning skills. NL-E YE adapts the abductive Natural Language Inference (NLI) task to the visual domain, requiring models to evaluate the plausibility of hypothesis images based on a premise image and explain their decisions. NL-E YE consists of 350 carefully curated triplet examples (1,050 images) spanning diverse reasoning categories: physical, functional, logical, emotional, cultural, and social. The data curation process involved two steps—writing textual descriptions and generating images using text-to-image models, both requiring substantial human involvement to ensure high-quality and challenging scenes. Our experiments show that VLMs struggle significantly on NL-E YE, often performing at random baseline levels, while humans excel in both plausibility prediction and explanation quality. This demonstrates a deficiency in the abductive reasoning capabilities of modern VLMs. NL-E YE represents a crucial step toward developing VLMs capable of robust multimodal reasoning for real-world applications, including accident-prevention bots and generated video verification.

版本指纹 45dd19e417d1745940b12cc81023a0b7891e578e4bcfc24b69fe07fdc4032a67

返回筛选与清单 ↑
P018 2024 Learning Iterative Reasoning through Energy Diffusion Yilun Du; Jiayuan Mao; Joshua Tenenbaum IRED 通过退火能量景观与扩散训练提升迭代推理,允许测试时增加优化计算。 世界机制与演化展开笔记
#P01813页 · 核对于 2026-09-15

中文摘要

IRED 通过退火能量景观与扩散训练提升迭代推理,允许测试时增加优化计算。

核心贡献

结合分数匹配与能量监督,降低 IREM 训练不稳定和优化困难。

实现边界

连续算法、数独、图连通和离散规划;未扩展验证到通用语言推理。

Method · 方法

学习多噪声级能量函数,用对比监督塑造低能量正确解;推理时沿退火景观迭代梯度优化。

Results · 主要结果

数独同分布/更难测试准确率为 99.4%/62.1%,IREM 为 93.5%/24.6%,RRN 为 99.8%/28.6%;说明主要优势在更难分布,非所有设置最优。

Shortcomings · 局限

【作者】仍需许多梯度步,对需要中间记忆的任务可能不足;【解读】测试时扩算与鲁棒全局求解不同。

证据定位

§3;§4.2 表格 p7;§5 Conclusion and Discussions。

Abstract · 英文原摘要

We introduce iterative reasoning through energy diffusion (IRED), a novel framework for learning to reason for a variety of tasks by formulating reasoning and decision-making problems with energy-based optimization. IRED learns energy functions to represent the constraints between input conditions and desired outputs. After training, IRED adapts the number of optimization steps during inference based on problem difficulty, enabling it to solve problems outside its training distribution — such as more complex Sudoku puzzles, matrix completion with large value magnitudes, and path finding in larger graphs. Key to our method’s success is two novel techniques: learning a sequence of annealed energy landscapes for easier inference and a combination of score function and energy landscape supervision for faster and more stable training. Our experiments show that IRED outperforms existing methods in continuous-space reasoning, discrete-space reasoning, and planning tasks, particularly in more challenging scenarios. Code and visualizations are at https://energy-based-model.github.io/ired.

版本指纹 c68d47bc3b18df31bf9e8dc7aff3a0ea46cf4a94f6a634102cbad1e7462c8771

返回筛选与清单 ↑
P017 2024 Exploring Defeasibility in Causal Reasoning Shaobo Cui; Lazar Milikic; Yiyang Feng et al. 研究新信息如何增强或削弱常识因果关系,提出 δ-CAUSAL 与 CESAR 评分。 世界机制与演化XR与人机协作展开笔记
#P01720页 · 核对于 2026-09-15

中文摘要

研究新信息如何增强或削弱常识因果关系,提出 δ-CAUSAL 与 CESAR 评分。

核心贡献

约 11K 事件、10 个领域的可撤销因果数据;测量加入 supporter/defeater 后因果强度变化。

实现边界

文本常识因果关系的相对变化评价,不是通过干预数据估计因果效应。

Method · 方法

构造原因—结果及支持/反驳论据;以 token 级因果关联和注意力构建 CESAR,另测论据生成。

Results · 主要结果

捕捉强度变化的指标从基线 47.2% 提高到 80.1%,相对提升 69.7%;GPT-3.5 生成支持/反驳论据的人评分别比人类低 4.5/10.7 点。

Shortcomings · 局限

【作者】分数用于定量解释存在限制,领域覆盖待扩展;【解读】基于语言关联的强度并非已校准的因果概率。

证据定位

摘要;§5 CESAR;§6;Limitations。

Abstract · 英文原摘要

Defeasibility in causal reasoning implies that the causal relationship between cause and effect can be strengthened or weakened. Namely, the causal strength between cause and effect should increase or decrease with the incorporation of strengthening arguments (supporters) or weakening arguments (defeaters), respectively. However, existing works ignore defeasibility in causal reasoning and fail to evaluate existing causal strength metrics in defeasible settings. In this work, we present δ-CAUSAL, the first benchmark dataset for studying defeasibility in causal reasoning. δ-CAUSAL includes around 11K events spanning ten domains, featuring defeasible causality pairs, namely, cause-effect pairs accompanied by supporters and defeaters. We further show that current causal strength metrics fail to reflect the change of causal strength with the incorporation of supporters or defeaters in δ-CAUSAL. To this end, we propose CESAR (Causal Embedding a Ssociation with Attention Rating), a metric that measures causal strength based on token-level causal relationships. CESAR achieves a significant 69.7% relative improvement over existing metrics, increasing from 47.2% to 80.1% in capturing the causal strength change brought by supporters and defeaters. We further demonstrate even Large Language Models (LLMs) like GPT-3.5 still lag 4.5 and 10.7 points behind humans in generating supporters and defeaters, emphasizing the challenge posed by δ-CAUSAL.

版本指纹 86878994aeac20a87a1e4ff2d654bf615daf836681fdd1cf128fdaa7b2919652

返回筛选与清单 ↑
P016 2023 / 2024 DIVE: Towards Descriptive and Diverse Visual Commonsense Generation Jun-Hyung Park; Hyuntae Park; Youjin Kang et al. 通过过滤泛泛的推断并改进训练目标,让视觉常识生成更具体、多样。 世界机制与演化XR与人机协作展开笔记
#P01619页 · 核对于 2026-09-15

中文摘要

通过过滤泛泛的推断并改进训练目标,让视觉常识生成更具体、多样。

核心贡献

提出 generic inference filtering 与 contrastive retrieval learning。

实现边界

主要验证于 Visual Commonsense Graphs;“人类水平”限定于所测描述性/多样性指标。

Method · 方法

利用频次及图像语义集中度过滤通用推断,再用图结构构造对比检索监督;在原始、unique、novel 子集及人评中比较。

Results · 主要结果

在 VCG 的描述性和多样性指标上超过所列基线;450 条推断的人类成对评价支持改进,但并未证明常识正确性达到人类水平。

Shortcomings · 局限

【作者】主要只测 VCG,仍会产生与上下文无关的推断;【解读】过滤通用答案可能改变覆盖率,多样性不等于真实性。

证据定位

§3–4,表1–3;§4.3 人评;结论后局限。

Abstract · 英文原摘要

Towards human-level visual understanding, visual commonsense generation has been introduced to generate commonsense inferences beyond images. However, current research on visual commonsense generation has overlooked an important human cognitive ability: generating descriptive and diverse inferences. In this work, we propose a novel visual commonsense generation framework, called DIVE, which aims to improve the descriptiveness and diversity of generated inferences. DIVE involves two methods, generic inference filtering and contrastive retrieval learning, which address the limitations of existing visual commonsense resources and training objectives. Experimental results verify that DIVE outperforms state-ofthe-art models for visual commonsense generation in terms of both descriptiveness and diversity, while showing a superior quality in generating unique and novel inferences. Notably, DIVE achieves human-level descriptiveness and diversity on Visual Commonsense Graphs. Furthermore, human evaluations confirm that DIVE aligns closely with human judgments on descriptiveness and diversity.

版本指纹 e888c768a6d50a1c93040f51ec1e578f60acca8697a9dbe7af12f1d0fcdb7a06

返回筛选与清单 ↑
P015 2024 Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs Kewei Cheng; Jingfeng Yang; Haoming Jiang et al. 用 SolverLearner 分离从样例归纳规则与执行规则,重新比较 LLM 的归纳和演绎能力。 世界机制与演化展开笔记
#P01518页 · 核对于 2026-09-15

中文摘要

用 SolverLearner 分离从样例归纳规则与执行规则,重新比较 LLM 的归纳和演绎能力。

核心贡献

让 LLM 生成映射程序,再交给外部解释器执行,降低执行错误对归纳能力评价的干扰。

实现边界

限于具有明确函数族和可执行规则的合成任务;程序执行由工具完成。

Method · 方法

比较直接输入输出提示、显式给规则、由样例生成 Python 规则三种设置,测试算术、空间等默认/反事实任务。

Results · 主要结果

GPT-4 在大部分受限归纳条件下接近或达到准确率 1;直接演绎特别是反事实执行较弱,GPT-3.5 并不普遍达到同等水平。

Shortcomings · 局限

【作者】无搜索空间约束时归纳困难,结论依赖基础模型,主比较未纳入 CoT;【解读】不宜概括为所有归纳推理均强于演绎。

证据定位

§3 SolverLearner;§5;结论后的 Limitations。

Abstract · 英文原摘要

Reasoning encompasses two typical types: deductive reasoning and inductive reasoning. Despite extensive research into the reasoning capabilities of Large Language Models (LLMs), moststudieshavefailedtorigorouslydifferentiate between inductive and deductive reasoning, leading to a blending of the two. This raises an essential question:In LLM reasoning, which poses a greater challenge - deductive or inductive reasoning?While the deductive reasoning capabilities of LLMs, (i.e. their capacity to follow instructions in reasoning tasks), have received considerable attention, their abilities intrueinductivereasoningremainlargelyunexplored. To investigate the true inductive reasoning capabilities of LLMs, we propose a novel framework, SolverLearner. This framework enables LLMs to learn the underlying function (i.e., y = fw (x)), that maps input data points (x) to their corresponding output values(y), using only in-context examples. By focusing on inductive reasoning and separating it from LLM-baseddeductivereasoning,wecanisolate and investigate inductive reasoning of LLMs in its pure form viaSolverLearner. Our observationsrevealthatLLMsdemonstrateremarkable inductive reasoning capabilities throughSolver- Learner, achieving near-perfect performance with ACC of 1 in most cases. Surprisingly, despite their strong inductive reasoning abilities, LLMs tend to relatively lack deductive reasoning capabilities, particularly in tasks involving “counterfactual” reasoning.

版本指纹 565fc1b5b46f783169964078ab1dc9b1c1a075d382e428cb899ceac208044240

返回筛选与清单 ↑
P014 2023 VOYAGER: An Open-Ended Embodied Agent with Large Language Models Guanzhi Wang; Yuqi Xie; Yunfan Jiang et al. 在 Minecraft 中用自动课程、可执行技能库和反馈驱动的代码修正实现持续探索与技能积累。 世界机制与演化XR与人机协作展开笔记
#P01442页 · 核对于 2026-09-15

中文摘要

在 Minecraft 中用自动课程、可执行技能库和反馈驱动的代码修正实现持续探索与技能积累。

核心贡献

以代码技能外部记忆实现组合和迁移,配合自适应课程扩大探索范围。

实现边界

通过 Mineflayer JavaScript API 和结构化环境状态控制游戏;未训练模型权重,也未实现真实机器人上的终身学习。

Method · 方法

GPT-4 提议技能与代码,利用执行错误、环境反馈和自检反复修改;成功技能存入库,按任务检索重用。

Results · 主要结果

160 次提示迭代内发现 63 种物品,约为对照的 3.3 倍;探索距离 2.3 倍,关键科技里程碑最多快 15.3 倍;演示新地图任务迁移。

Shortcomings · 局限

【作者】API 成本高,代码生成/自检失败和不可完成的幻觉任务仍存在;【解读】技能迁移限于同一游戏/API 体系。

证据定位

摘要;方法 §2;实验 §3.3;局限 §4。

Abstract · 英文原摘要

We introduce VOYAGER, the first LLM-powered embodied lifelong learning agent in Minecraft that continuously explores the world, acquires diverse skills, and makes novel discoveries without human intervention. VOYAGER consists of three key components: 1) an automatic curriculum that maximizes exploration, 2) an ever-growing skill library of executable code for storing and retrieving complex behaviors, and 3) a new iterative prompting mechanism that incorporates environment feedback, execution errors, and self-verification for program improvement. VOYAGER interacts with GPT-4 via blackbox queries, which bypasses the need for model parameter fine-tuning. The skills developed by VOYAGER are temporally extended, interpretable, and compositional, which compounds the agent’s abilities rapidly and alleviates catastrophic forgetting. Empirically, VOYAGER shows strong in-context lifelong learning capability and exhibits exceptional proficiency in playing Minecraft. It obtains 3.3× more unique items, travels 2.3× longer distances, and unlocks key tech tree milestones up to 15.3× faster than prior SOTA. VOYAGER is able to utilize the learned skill library in a new Minecraft world to solve novel tasks from scratch, while other techniques struggle to generalize.

版本指纹 769a4e33ddeeb73870849232eece49afe882c2d146362e33917ccb432ba0efb8

返回筛选与清单 ↑
P013 2024 / 2023 Sequential Modeling Enables Scalable Learning for Large Vision Models Yutong Bai; Xinyang Geng; Karttikeya Mangalam et al. 把图像、视频和视觉标注统一为视觉句子,使用下一 token 预测训练无需语言输入的大视觉模型。 世界机制与演化展开笔记
#P01333页 · 核对于 2026-09-15

中文摘要

把图像、视频和视觉标注统一为视觉句子,使用下一 token 预测训练无需语言输入的大视觉模型。

核心贡献

构建统一视觉序列表示并展示多任务视觉提示和模型/数据扩展趋势。

实现边界

任务由示例图像定义,输出为视觉 token;训练与评价不证明任意视觉任务均能零样本解决。

Method · 方法

VQGAN 将图像离散化,再用自回归 Transformer 学习跨图像序列;在 420B 视觉 token 上训练 300M、600M、1B、3B 模型。

Results · 主要结果

420B token 约对应 1.64B 图像;文中语义分割视觉序列困惑度随规模从 23.1(300M)降到 14.0(3B),并展示类比、视频预测等视觉提示结果。

Shortcomings · 局限

【作者】视觉提示可能欠约束,tokenizer 与视频数据质量导致失败;算力限制了消融,对真正的涌现/泛化尚无定论。

证据定位

摘要;方法 §4;规模实验 §5.1/图3–4;局限 §6。

Abstract · 英文原摘要

We introduce a novel sequential modeling approach which enables learning a Large Vision Model (LVM) without making use of any linguistic data. To do this, we define a common format, “visual sentences”, in which we can represent raw images and videos as well as annotated data sources such as semantic segmentations and depth reconstructions without needing any meta-knowledge beyond the pixels. Once this wide variety of visual data (comprising 420 billion tokens) is represented as sequences, the model can be trained to minimize a cross-entropy loss for next token prediction. By training across various scales of model architecture and data diversity, we provide empirical evidence that our models scale effectively. Many different vision tasks can be solved by designing suitable visual prompts at test time.

版本指纹 6e6272927d093a531405429818c6067df826310ba8983a8a2968bb8d117c390e

返回筛选与清单 ↑
P012 2023 Reflexion: Language Agents with Verbal Reinforcement Learning Noah Shinn; Federico Cassano; Ashwin Gopinath et al. 让语言智能体把失败反馈总结成文字反思,并在后续尝试中利用记忆改进决策。 世界机制与演化XR与人机协作展开笔记
#P01219页 · 核对于 2026-09-15

中文摘要

让语言智能体把失败反馈总结成文字反思,并在后续尝试中利用记忆改进决策。

核心贡献

提出 actor—evaluator—self-reflection 框架,以语言记忆实现跨尝试改进。

实现边界

不更新模型参数;依赖可重复尝试、可获得反馈的环境,所谓 verbal RL 与梯度训练式 RL 不同。

Method · 方法

执行任务后由外部或内部评价器给出反馈,生成反思并写入有限情节记忆,下次提示时检索/拼接;在 ALFWorld、HotpotQA 和代码任务验证。

Results · 主要结果

论文报告 HumanEval 91% pass@1,相较引用的 GPT-4 80%;该数值来自允许反馈与迭代的完整协议,不能等同无反馈单次生成准确率。

Shortcomings · 局限

【作者】可能停在局部最优,记忆窗口有限;生成的测试不足以可靠检验非确定性、外部 API 或并发程序。

证据定位

摘要;§3;§4.3;局限 §5。

Abstract · 英文原摘要

Large language models (LLMs) have been increasingly used to interact with external environments (e.g., games, compilers, APIs) as goal-driven agents. However, it remains challenging for these language agents to quickly and efficiently learn from trial-and-error as traditional reinforcement learning methods require extensive training samples and expensive model fine-tuning. We propose Reflexion, a novel framework to reinforce language agents not by updating weights, but instead through linguistic feedback. Concretely, Reflexion agents verbally reflect on task feedback signals, then maintain their own reflective text in an episodic memory buffer to induce better decision-making in subsequent trials. Reflexion is flexible enough to incorporate various types (scalar values or free-form language) and sources (external or internally simulated) of feedback signals, and obtains significant improvements over a baseline agent across diverse tasks (sequential decision-making, coding, language reasoning). For example, Reflexion achieves a 91% pass@1 accuracy on the HumanEval coding benchmark, surpassing the previous state-of-the-art GPT-4 that achieves 80%. We also conduct ablation and analysis studies using different feedback signals, feedback incorporation methods, and agent types, and provide insights into how they affect performance. We release all code, demos, and datasets at https://github.com/noahshinn024/reflexion.

版本指纹 efba04cd48b779131fc4c3c58ae49e8523ded534f9225a7c57c7bdad0823803d

返回筛选与清单 ↑
P011 2024 Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks Zhaofeng Wu; Linlu Qiu; Alexis Ross et al. 用改变默认规则的反事实任务区分可迁移推理与对熟悉任务模式的依赖。 世界机制与演化展开笔记
#P01149页 · 核对于 2026-09-15

中文摘要

用改变默认规则的反事实任务区分可迁移推理与对熟悉任务模式的依赖。

核心贡献

构造 11 类任务的默认/反事实配对评测,并加入反事实规则理解检查及不同提示条件。

实现边界

任务包括算术、代码、逻辑、空间、音乐和游戏;研究基于指定的 2023 版闭源模型,不是对全部 LLM 的不可推理证明。

Method · 方法

保持任务结构、改动进制/索引/坐标/游戏规则等条件,比较 GPT-4、GPT-3.5、Claude、PaLM-2,控制 CoT 与 few-shot 提示。

Results · 主要结果

11 项任务整体呈现反事实条件下显著且一致的性能下降;few-shot 能缩小但不能消除差距,理解规则也不保证正确执行。

Shortcomings · 局限

【作者】默认与反事实任务难度不总能严格匹配,预训练内容未知,结果可能高估或低估能力;【解读】分布偏移与抽象推理失败不能完全分离。

证据定位

摘要;框架 §2;结果 §4;分析 §5;局限 §7。

Abstract · 英文原摘要

The impressive performance of recent language models across a wide range of tasks suggests that they possess a degree of abstract reasoning skills. Are these skills general and transferable, or specialized to specific tasks seen during pretraining? To disentangle these effects, we propose an evaluation framework based on “counterfactual” task variants that deviate from the default assumptions underlying standard tasks. Across a suite of 11 tasks, we observe nontrivial performance on the counterfactual variants, but nevertheless find that performance substantially and consistently degrades compared to the default conditions. This suggests that while current LMs may possess abstract task-solving skills to an extent, they often also rely on narrow, non-transferable procedures for task-solving. These results motivate a more careful interpretation of language model performance that teases apart these aspects of behavior.

版本指纹 c7e3f360460c7a66c6d1329891aabebf7bff4e1ef4ee67896538d803d5dec75b

返回筛选与清单 ↑
P010 2023 Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences Xudong Hong; Asad Sayeed; Khushboo Mehra et al. 用经过筛选的电影镜头序列和明确角色构建 VWP,以更好的输入与角色表示提升视觉故事的连贯性。 创作与规则补全世界机制与演化展开笔记
#P01015页 · 核对于 2026-09-15

中文摘要

用经过筛选的电影镜头序列和明确角色构建 VWP,以更好的输入与角色表示提升视觉故事的连贯性。

核心贡献

约 2K 个、每个 5–10 图的序列及约 12K 众包故事;提出角色感知的 CharGrid 基线。

实现边界

生成图像序列对应的文本故事;依赖电影镜头、角色框和筛选流程,不生成视频或验证事件真实发生。

Method · 方法

过滤低信息和重复镜头,提供角色名称/裁剪图引导写作;冻结 Swin 特征提取,结合角色特征与角色网格建模跨句连贯性。

Results · 主要结果

28 名众包者比较 50 对故事;本地稿表7中 CharGrid 相较 TAPM+char 的人类判断差值:连贯性 +8.41、视觉依据 +6.25、多样性 +11.06 个百分点。

Shortcomings · 局限

【作者】叙事结构/narrativity 和写作者能力差异未充分建模;【解读】人工评价样本小,电影域与现实相册存在分布差异。

证据定位

摘要;构建 §3–5;模型 §6.1;人评 §6.3/表7;§7。

Abstract · 英文原摘要

Current work on image-based story generation suffers from the fact that the existing image sequences collections do not have coherent plots behind them. We improve visual story generation by producing a new image-grounded dataset, Visual Writing Prompts (VWP). VWP contains almost 2K selected sequences of movie shots, each including 5-10 images. The image sequences are aligned with a total of 12K stories which were collected via crowdsourcing given the image sequences and a set of grounded characters from the corresponding image sequence. Our new image sequence collection and filtering process has allowed us to obtain stories that are more coherent and more diverse compared to previous work. We also propose a characterbased story generation model driven by coherence as a strong baseline. Evaluations show that our generated stories are more coherent, visually grounded, and more diverse than stories generated with the current stateof-the-art model.

版本指纹 33a8162c030e1f548ed7f94972bf7154d3efeb6b1ac91db896cf0d37217b1870

返回筛选与清单 ↑
P009 2023 Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images Nitzan Bitton-Guetta; Yonatan Bitton; Jack Hessel et al. 通过人为设计的反常识合成图像,评价模型是否能识别和解释图像中的异常,而不只描述物体。 世界机制与演化XR与人机协作展开笔记
#P00915页 · 核对于 2026-09-15

中文摘要

通过人为设计的反常识合成图像,评价模型是否能识别和解释图像中的异常,而不只描述物体。

核心贡献

提供视觉常识基准及解释异常任务,结合 captioning、匹配和 VQA;分析感知与推理各自的瓶颈。

实现边界

小规模、人工筛选的合成图像及四类任务;不能直接代表真实图像中的所有常识错误。

Method · 方法

设计师用文生图工具制作异常组合,众包标注解释;比较端到端 BLIP2 和图像描述→LLM 管线,并用人类及 GPT-4 评价解释。

Results · 主要结果

表1中,微调 BLIP2-XXL 异常识别 73%,人类 92%;解释的人类评分为 27%,oracle caption→GPT-3 为 68%,人类 95%。

Shortcomings · 局限

【作者】数据规模小,仍可能含令人不适内容;【解读】生成工具、文化常识及 GPT 评价器带来偏差,oracle 描述结果不是实际端到端水平。

证据定位

摘要;数据 §2;表1;结果 §5.2;局限 §8。

Abstract · 英文原摘要

Weird, unusual, and uncanny images pique the curiosity of observers because they challenge commonsense. For example, an image released during the 2022 world cup depicts the famous soccer stars Lionel Messi and Cristiano Ronaldo playing chess, which playfully violates our expectation that their competition should occur on the football field.1 Humans can easily recognize and interpret these unconventional images, but can AI models do the same? We introduce WHOOPS !, a new dataset and benchmark for visual commonsense. The dataset is comprised of purposefully commonsense-defying images created by designers using publicly-available image generation tools like Midjourney. We consider several tasks posed over the dataset. In addition to image captioning, cross-modal matching, and visual question answering, we introduce a difficult explanation generation task, where models must identify and explain why a given image is unusual. Our results show that state-of-the-art models such as GPT3 and BLIP2 still lag behind human performance on WHOOPS !. We hope our dataset will inspire the development of AI models with stronger visual commonsense reasoning abilities.

版本指纹 342485fdb71a2e2931d66cfd760bc87c9f78d58bd7edaf325cf0e921621629ab

返回筛选与清单 ↑
P008 2022 Visual Abductive Reasoning Chen Liang; Wenguan Wang; Tianfei Zhou et al. 在事件片段被遮蔽的视频中描述已知事件并生成最可能的缺失事件解释,提出 VAR 数据集和 REASONER。 世界机制与演化XR与人机协作展开笔记
#P00816页 · 核对于 2026-09-15

中文摘要

在事件片段被遮蔽的视频中描述已知事件并生成最可能的缺失事件解释,提出 VAR 数据集和 REASONER。

核心贡献

设计因果方向感知编码及置信度引导的级联解码,逐轮改进前提描述与假设。

实现边界

输入已有事件分段,缺失事件以黑帧遮蔽;实现的是语言解释生成,未识别或验证真实因果结构。

Method · 方法

使用预提取动作/外观特征,contextualized directional position embedding 区分关系;三个级联 Transformer 解码器通过句子置信度交换信息。

Results · 主要结果

消融中,普通 Transformer 的平均事件 CIDEr 30.04、BLEU-4 3.39;同时加入两个组件后为 36.13、4.66。完整模型领先比较的视频语言基线,但仍落后人类。

Shortcomings · 局限

【解读】依赖事件分割和视觉特征;多种合理解释会使参考文本指标失真,因果位置编码并非干预意义上的因果保证。

证据定位

任务 §3;实现 §4.4;实验 §5、表8;附录失败案例。

Abstract · 英文原摘要

Abductive reasoning seeks the likeliest possible explanation for partial observations. Although abduction is frequently employed in human daily reasoning, it is rarely explored in computer vision literature. In this paper, we propose a new task and dataset, Visual Abductive Reasoning (VAR), for examining abductive reasoning ability of machine intelligence in everyday visual situations. Given an incomplete set of visual events, AI systems are required to not only describe what is observed, but also infer the hypothesis that can best explain the visual premise. Based on our large-scale VAR dataset, we devise a strong baseline model, REASONER (causal-and-cascaded reasoning Transformer). First, to capture the causal structure of the observations, a contextualized directional position embedding strategy is adopted in the encoder, that yields discriminative representations for the premise and hypothesis. Then, multiple decoders are cascaded to generate and progressively refine the premise and hypothesis sentences. The prediction scores of the sentences are used to guide cross-sentence information flow in the cascaded reasoning procedure. Our VAR benchmarking results show that REASONER surpasses many famous video-language models, while still being far behind human performance. This work is expected to foster future efforts in the reasoning-beyond-observation paradigm.

版本指纹 90f39a03b4c4a282706963260126887bfd7658133b53f6b586bfe9e39cc5febe

返回筛选与清单 ↑
P007 2022 The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning Jack Hessel; Jena D. Hwang; Jae Sung Park et al. 构建 Sherlock,收集视觉线索和超出字面画面的合理推断,评估机器的视觉溯因能力。 世界机制与演化XR与人机协作展开笔记
#P00718页 · 核对于 2026-09-15

中文摘要

构建 Sherlock,收集视觉线索和超出字面画面的合理推断,评估机器的视觉溯因能力。

核心贡献

103K 图片、363K 线索—推断对及约 19K 合理性判断,覆盖推断检索、证据定位和合理性比较。

实现边界

推断是人类认为合理的假设;主要评价检索/定位/比较,开放式生成评价仍待解决。

Method · 方法

自由观察式众包标注线索框和推断;训练图像、区域、文本兼容性评分器,比较 LXMERT、UNITER 和 CLIP,并加入多任务训练。

Results · 主要结果

CLIP-RN50x64 加多任务目标在三类评测中优于所列强基线,但与人类判断一致性仍有明显差距;文中同时报告定位及排序指标,不能统一当作准确率。

Shortcomings · 局限

【作者】显著线索选择、合理推断的歧义及生成评价未解决;文字识别、动作识别等基础视觉错误也会传递到推断。

证据定位

摘要 p1;任务 §4;方法/结果 §5、表2;结论 §6。

Abstract · 英文原摘要

Humans have remarkable capacity to reason abductively and hypothesize about what lies beyond the literal content of an image. By identifying concrete visual clues scattered throughout a scene, we almost can’t help but draw probable inferences beyond the literal scene based on our everyday experience and knowledge about the world. For example, if we see a “20 mph” sign alongside a road, we might assume the street sits in a residential area (rather than on a highway), even if no houses are pictured. Can machines perform similar visual reasoning? We present Sherlock, an annotated corpus of 103K images for testing machine capacity for abductive reasoning beyond literal image contents. We adopt a free-viewing paradigm: participants first observe and identify salient clues within images (e.g., objects, actions ) and then provide a plausible inference about the scene, given the clue. In total, we collect 363K (clue, inference) pairs, which form a first-of-its-kind abductive visual reasoning dataset. Using our corpus, we test three complementary axes of abductive reasoning. We evaluate the capacity of models to: i) retrieve relevant inferences from a large candidate corpus; ii) localize evidence for inferences via bounding boxes, and iii) compare plausible inferences to match human judgments on a newlycollected diagnostic corpus of 19K Likert-scale judgments. While we find that fine-tuning CLIP-RN50x64 with a multitask objective outperforms strong baselines, significant headroom exists between model performance and human agreement. Data, models, and leaderboard available at http://visualabduction.com/.

版本指纹 6d3154700273e8716a1894925a16c6890426adc4cd9bb9d54a4fe1bde03c78ac

返回筛选与清单 ↑
P006 2022 Learning Iterative Reasoning through Energy Minimization Yilun Du; Shuang Li; Joshua Tenenbaum et al. 把推理写成学习能量函数后的迭代优化,使测试时可以增加计算以处理更大或更难的问题。 世界机制与演化展开笔记
#P00614页 · 核对于 2026-09-15

中文摘要

把推理写成学习能量函数后的迭代优化,使测试时可以增加计算以处理更大或更难的问题。

核心贡献

IREM 用统一能量最小化处理图与连续算法任务,并演示嵌套组合求解。

实现边界

验证于合成图运算、加法、矩阵补全/求逆等;优化过程不保证任意实例达到全局最优。

Method · 方法

学习输入与候选输出之间的能量景观;通过迭代梯度更新寻找低能量解,以回放缓冲和末步截断反传控制训练开销。

Results · 主要结果

10 节点训练、15 节点测试的最短路元素 MSE 为 0.0464,循环网络 0.1083、前馈模型 1.4089;更难加法 MSE 为 0.0021,对比最佳列示基线 0.1577。

Shortcomings · 局限

【解读】收益依赖能量函数及优化质量;增加推理时间有成本,合成任务的规模泛化不等于自然语言或开放世界推理。

证据定位

方法 §3;表1 p5;消融表2;§5 Conclusion and Limitations。

Abstract · 英文原摘要

Deep learning has excelled on complex pattern recognition tasks such as image classification and object recognition. However, it struggles with tasks requiring nontrivial reasoning, such as algorithmic computation. Humans are able to solve such tasks through iterative reasoning – spending more time thinking about harder tasks. Most existing neural networks, however, exhibit a fixed computational budget controlled by the neural network architecture, preventing additional computational processing on harder tasks. In this work, we present a new framework for iterative reasoning with neural networks. We train a neural network to parameterize an energy landscape over all outputs, and implement each step of the iterative reasoning as an energy minimization step to find a minimal energy solution. By formulating reasoning as an energy minimization problem, for harder problems that lead to more complex energy landscapes, we may then adjust our underlying computational budget by running a more complex optimization procedure. We empirically illustrate that our iterative reasoning approach can solve more accurate and generalizable algorithmic reasoning tasks in both graph and continuous domains. Finally, we illustrate that our approach can recursively solve algorithmic problems requiring nested reasoning. Code and additional information is available at https://energy-based-model.github.io/iterative-reasoning-as-energy-minimization/.

版本指纹 2c44b73b49bf1fad468a2f7a4e03c2ddfd5eaef4447890c7a5d980bc1c8ceead

返回筛选与清单 ↑
P005 2022 There’s a Time and Place for Reasoning Beyond the Image Xingyu Fu; Ben Zhou; Ishaan Preetam Chandratreya et al. 提出图像时空定位任务 TARA,要求综合画面线索与背景知识判断拍摄时间和地点。 世界机制与演化XR与人机协作展开笔记
#P00512页 · 核对于 2026-09-15

中文摘要

提出图像时空定位任务 TARA,要求综合画面线索与背景知识判断拍摄时间和地点。

核心贡献

构建约 16K 新闻图片和额外 61K WIT 弱监督样本,并提供基于局部图像线索的 CLIP 变体。

实现边界

主要为 NYT/Wikipedia 图片和给定标签集合的分类,不是无需候选的任意地点、精确日期识别。

Method · 方法

自动抽取新闻时空标签,众包验证可推理子集;比较 CLIP、微调、WIT 监督及 segment-wise 表征,使用 Accuracy 和层级 Example-F1。

Results · 主要结果

全测试集地点准确率 CLIP 11.11%、CLIP+Seg 16.46%。在人类对照子集,地点 23.33% vs 人类 86.21%,时间 3.33% vs 75.86%;不能把两个测试集合并比较。

Shortcomings · 局限

【作者/设定】人类只测 test set of interest;【解读】新闻来源和标签分布有偏,图片可能不足以确定唯一时间,WIT 的分布差异限制收益。

证据定位

摘要 p1;数据 §3–4;方法 §5;表2、表3及 §6.3。

Abstract · 英文原摘要

Images are often more significant than only the pixels to human eyes, as we can infer, associate, and reason with contextual information from other sources to establish a more complete picture. For example, in Figure 1, we can find a way to identify the news articles related to the picture through segment-wise understandings of the signs, the buildings, the crowds, and more. This reasoning could provide the time and place the image was taken, which will help us in subsequent tasks, such as automatic storyline construction, correction of image source in intended effect photographs, and upper-stream processing such as image clustering for certain location or time. In this work, we formulate this problem and introduce TARA: a dataset with 16k images with their associated news, time, and location, automatically extracted from New York Times1 (NYT), and an additional 61k examples as distant supervision from WIT (Srinivasan et al., 2021). On top of the extractions, we present a crowdsourced subset in which we believe it is possible to find the images’ spatiotemporal information for evaluation purpose. We show that there exists a 70% gap between a state-of-the-art joint model and human performance, which is slightly filled by our proposed model that uses segment-wise reasoning, motivating higher-level vision-language joint models that can conduct open-ended reasoning with world knowledge. The data and code are publicly available at https://github.com/zeyofu/TARA.

版本指纹 aaf98fccea956b5824724ffc590c892f805b3814ef30ed5f8e096a11dd9987f1

返回筛选与清单 ↑
P004 2021 / 2022 WebGPT: Browser-assisted question-answering with human feedback Reiichiro Nakano; Jacob Hilton; Suchir Balaji et al. 训练 GPT-3 操作文本浏览器、收集引用并回答长问题,以示范学习和人类偏好反馈提升答案质量。 XR与人机协作展开笔记
#P00432页 · 核对于 2026-09-15

中文摘要

训练 GPT-3 操作文本浏览器、收集引用并回答长问题,以示范学习和人类偏好反馈提升答案质量。

核心贡献

把检索、浏览、引用和回答统一为可训练的交互轨迹,并利用带引用答案支持人类评价。

实现边界

文本浏览器和 ELI5 长问答;最强模型使用 175B、best-of-64,有引用不代表引用真实或推断正确。

Method · 方法

约 6,000 条人类示范做行为克隆,约 21,500 组偏好比较训练奖励模型;比较 PPO 与拒绝采样,主要最优配置采用行为克隆加奖励筛选。

Results · 主要结果

在 ELI5 上,最强模型相对人类示范答案的偏好率为 56%,相对 Reddit 高赞答案为 69%(平局计半);这是偏好评价,不是事实准确率。

Shortcomings · 局限

【作者】分布外问题仍困难,引用支持性不能替代真实性,存在偏见和奖励优化问题;【解读】多次浏览与采样成本高。

证据定位

摘要 p1;训练 §3;评价 §4–5;真实性和引用局限 §6。

Abstract · 英文原摘要

We fine-tune GPT-3 to answer long-form questions using a text-based webbrowsing environment, which allows the model to search and navigate the web. By setting up the task so that it can be performed by humans, we are able to train models on the task using imitation learning, and then optimize answer quality with human feedback. To make human evaluation of factual accuracy easier, models must collect references while browsing in support of their answers. We train and evaluate our models on ELI5, a dataset of questions asked by Reddit users. Our best model is obtained by fine-tuning GPT-3 using behavior cloning, and then performing rejection sampling against a reward model trained to predict human preferences. This model’s answers are preferred by humans 56% of the time to those of our human demonstrators, and 69% of the time to the highest-voted answer from Reddit.

版本指纹 acad8d9fd55a30b94de9dfdae413e10b21e07bde54d767b2405b31341739cedb

返回筛选与清单 ↑
P002 2020 Abductive Commonsense Reasoning Chandra Bhagavatula; Ronan Le Bras; Chaitanya Malaviya et al. 把溯因推理定义为根据前后观察寻找最合理解释,构建 ART 数据及解释选择、解释生成两类任务。 世界机制与演化XR与人机协作展开笔记
#P00218页 · 核对于 2026-09-15

中文摘要

把溯因推理定义为根据前后观察寻找最合理解释,构建 ART 数据及解释选择、解释生成两类任务。

核心贡献

提供超过 2 万叙事情境和 20 万解释;提出 Abductive NLI/NLG,并分析预训练语言模型的推理缺口。

实现边界

英语短篇常识叙事中的候选解释选择/文本生成;合理解释不等于唯一、可验证的真实原因。

Method · 方法

众包构造观察及正负解释,使用对抗筛选降低捷径;比较 GPT/BERT 微调和不同观察依赖结构,进行人工与自动评价。

Results · 主要结果

ART 测试集最佳 BERT 68.9%±0.5%,人类多数投票 91.4%;5 个训练随机种子;生成任务仍有明显常识与因果连贯性问题。

Shortcomings · 局限

【解读】故事和众包解释限定了常识分布;二选一准确率不能代表开放世界因果发现,生成评价受多解性影响。

证据定位

摘要 p1;任务/数据 §2–4;结果 §5,表1;分析 §6。

Abstract · 英文原摘要

Abductive reasoning is inference to the most plausible explanation. For example, if Jenny finds her house in a mess when she returns from work, and remembers that she left a window open, she can hypothesize that a thief broke into her house and caused the mess, as the most plausible explanation. While abduction has long been considered to be at the core of how people interpret and read between the lines in natural language (Hobbs et al., 1988), there has been relatively little research in support of abductive natural language inference and generation. We present the first study that investigates the viability of language-based abductive reasoning. We introduce a challenge dataset, ART, that consists of over 20k commonsense narrative contexts and 200k explanations. Based on this dataset, we conceptualize two new tasks – (i) Abductive NLI: a multiple-choice question answering task for choosing the more likely explanation, and (ii) Abductive NLG: a conditional generation task for explaining given observations in natural language. On Abductive NLI, the best model achieves 68.9% accuracy, well below human performance of 91.4%. On Abductive NLG, the current best language generators struggle even more, as they lack reasoning capabilities that are trivial for humans. Our analysis leads to new insights into the types of reasoning that deep pre-trained language models fail to perform—despite their strong performance on the related but more narrowly defined task of entailment NLI—pointing to interesting avenues for future research.

版本指纹 c6d69ad1817d26ff208441dae37d9b638e82e6a0e85ce4eea2063adffbd1cdf7

返回筛选与清单 ↑
P001 2019 HG-DAgger: Interactive Imitation Learning with Human Experts Michael Kelly; Chelsea Sidrane; Katherine Driggs-Campbell et al. 让人类自主接管和交还控制权,改进真实系统中的交互式模仿学习,并从接管行为学习基于模型不确定性的风险阈值。 XR与人机协作展开笔记
#P0017页 · 核对于 2026-09-15

中文摘要

让人类自主接管和交还控制权,改进真实系统中的交互式模仿学习,并从接管行为学习基于模型不确定性的风险阈值。

核心贡献

提出 Human-Gated DAgger,减少随机切换控制导致的人类标注失真;同时估计策略的可接受状态区域。

实现边界

实现于仿真与实车驾驶任务;人类负责判断何时接管,风险阈值是经验估计,未给出无碰撞保证。

Method · 方法

迭代执行新手策略;专家接管时独占控制并收集示范,数据聚合后重训网络集成;用集成输出分歧及接管前的不确定性学习阈值。

Results · 主要结果

实车在 5 组障碍配置上优于 DAgger/行为克隆;与人类转向分布的 Bhattacharyya 距离相较 DAgger 改善 21.1%。仿真中阈值内初始化的碰撞率约为阈值外的 1/12。

Shortcomings · 局限

【作者】实车测试数据少,统计显著性有限;【解读】效果依赖专家及时接管,不确定性与真实危险之间并非严格等价。

证据定位

摘要 p1;方法 p2–3;实验 p4–6,表 I–II。

Abstract · 英文原摘要

Imitation learning has proven to be useful for many real-world problems, but approaches such as behavioral cloning suffer from data mismatch and compounding error issues. One attempt to address these limitations is the DA GGER algorithm, which uses the state distribution induced by the novice to sample corrective actions from the expert. Such sampling schemes, however, require the expert to provide action labels without being fully in control of the system. This can decrease safety and, when using humans as experts, is likely to degrade the quality of the collected labels due to perceived actuator lag. In this work, we propose HG-DA GGER , a variant of DA GGER that is more suitable for interactive imitation learning from human experts in real-world systems. In addition to training a novice policy, HG-DA GGER also learns a safety threshold for a model-uncertainty-based risk metric that can be used to predict the performance of the fully trained novice in different regions of the state space. We evaluate our method on both a simulated and real-world autonomous driving task, and demonstrate improved performance over both DA GGER and behavioral cloning.

版本指纹 5e3aefda8fa803c4bbd5c6760cc468a9ce926f0d2b38da24834069c3fdadbbd0

返回筛选与清单 ↑

提取全文

阅读说明

本地文献 398 篇,已提取 398 篇、9528 页。逐页全文仅保存在本机;论文标注分别注明既有笔记、摘要初筛与方法核查的证据深度。

每条记录分别说明依据作者摘要、既有笔记还是具体方法页整理;下载和全文提取不代表人工全文精读。结果为作者报告,未重跑实验;作者观察到的局限与资料库的适用范围判断分开。PDF页码从文件第一页起计。

本库每篇论文保留本地最新版;旧版本和完全相同副本已归档,旧编号保留跳转。全文为本机逐页文本层提取,不含图片OCR;公开网站保留摘要,不公开托管全文。

下载Markdown笔记下载结构化JSON网站仓库