{"schema_version":1,"updated":"2026-09-19","routes":[{"id":"world","label":"世界机制与演化","root":"W0","question":"如何从稀疏示例和部分规则构造可扩展的世界，区分推导与补充假设，并使多步、跨领域的演化持续符合已确定的机制？","explanation":"区分归纳机制、按规则推导、补充假设、演化与拓展。世界内部状态变化、规则修订和模型自我改进是不同研究对象。","anchors":["P150","P156","C06","C04","P163","C08","P158"],"metrics":"留出机制与组合泛化；假设可追踪性；逐步与整段规则满足；干预响应与保持；有效多样性；跨层反馈及用户理解。","short_title":"从示例与部分规则构造可推演世界"},{"id":"xr","label":"XR 与人机协作","root":"X0","question":"在部分可观测、人的注意力和行动能力受限的情境中，智能体如何与人建立并修正共享理解，选择观察、提问、提示或交还控制，以低交互成本实现可靠协作？","explanation":"核心对象是人与智能体的协作过程。重点不只是识别当前场景，而是表达假设、共同取证、选择介入方式，并允许人纠正错误推断。","anchors":["P055","P059","P061","P041","P143","P157","P159"],"metrics":"团队任务成功；证据获取收益；提问、身体行动与打扰成本；错误假设修复；恰当依赖；认知负荷与可访问性。","short_title":"共享理解、主动权与协作修复"}],"parents":[{"id":"W1","route":"world","label":"获得机制","question":"世界规则从哪里来，应该用什么表示才能学习、执行和迁移？","anchors":["P121","P150","P154","P156","P157","C06","C07","C10"]},{"id":"W2","route":"world","label":"改变条件","question":"当前提、规则或证据变化时，哪些结论和演化必须改变，哪些必须保持？","anchors":["P011","P017","P021","P071","P084","P158"]},{"id":"W3","route":"world","label":"持续演化","question":"时间、镜头、参与者和编辑次数增加后，如何保持状态与机制一致？","anchors":["P135","P128","P145","P163","P147","P160","C04","C08"]},{"id":"W4","route":"world","label":"推理与验证","question":"如何把机制用于多步推理，并判别正确机制、可靠证据与表面连贯？","anchors":["P104","P103","P078","P087","P044"]},{"id":"X1","route":"xr","label":"共享情境","question":"人与智能体怎样知道彼此指什么、想做什么，以及还缺什么证据？","anchors":["P061","P141","P155","P143","P157"]},{"id":"X2","route":"xr","label":"分配主动权","question":"何时应该询问、等待、建议、自主行动或请求人接管？","anchors":["P055","P059","P149","P159","P041","P001"]},{"id":"X3","route":"xr","label":"校准与修复","question":"怎样让人恰当地依赖、检查和纠正智能体，并检验协作是否真的有效？","anchors":["P038","P148","P065","P091","P067"]},{"id":"X4","route":"xr","label":"创作与可访问性","question":"怎样让人能构建、修改和使用这些协作机制，而不过度依赖开发专家？","anchors":["P060","P062","P036","P058"]}],"branches":[{"id":"W1a","parent":"W1","route":"world","label":"从描述到规则","question":"自然语言设定怎样变成可被规划器执行的前置条件与效果？","before":"世界作为一段描述","after":"世界作为有类型、谓词和动作语义的模型","gap":"可解析、与参考结构相似，仍不等于所有轨迹行为等价。","core":["P154"],"support":["P160","P062","P182","P201","P249","P244","P272","P356"],"anchors":["P154","P160"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W1b","parent":"W1","route":"world","label":"从经验到程序","question":"能否用少量交互学习、调试并组合世界转移程序？","before":"神经网络动力学，或一次性完整程序","after":"可修改的 Python 模型 → 多个带权程序专家；加入随机性与部分可观测性","gap":"WorldCoder 的确定性符号环境与 PoE-World 的对象输入，不能直接外推到任意原始视觉环境。","core":["P150","P156","C01"],"support":["S06","S04"],"anchors":["S06","P150","P156"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W1c","parent":"W1","route":"world","label":"从视频到可控动力学","question":"视频表征怎样支持动作条件预测，并把动作语义迁移到新场景？","before":"被动预测未来画面，或有动作标签的控制数据","after":"潜空间想象、视频 token、无标签潜动作、跨场景动作对齐","gap":"潜动作和逼真视频不自动带来可识别的因果机制；加速与几何控制是实现条件。","core":["P121","P123","P124","P132","P106","P081","P083","S01","S02","S03","S04","S05","P315","P398","P396"],"support":["P013","P068","P162","P164","P085","P168","P167","P180","P179","P177","P176","P173","P172","P189","P188","P183","P197","P209","P205","P202","P219","P217","P215","P214","P230","P224","P223","P222","P221","P233","P232","P231","P250","P241","P258","P256","P255","P264","P262","P276","P283","P282","P299","P294","P309","P308","P307","P304","P303","P301","P320","P319","P317","P316","P311","P330","P327","P326","P325","P321","P339","P334","P333","P349","P346","P345","P341","P359","P358","P357","P353","P352","P351","P368","P367","P364","P375","P373","P389","P388","P386","P383","P382","P381","P400","P399","P397","P392","P391","P404","P402","T260318246","T251008527","T221206384"],"anchors":["P121","P123","P124","P081"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W1d","parent":"W1","route":"world","label":"主动发现隐藏机制","question":"当规则未知时，怎样选实验、整合跨轮证据，并适应机制突变？","before":"观察与答案预先给定，环境规则固定","after":"主动干预、跨试次记忆、未知因果结构与规则突变","gap":"P157 已有模型请求人执行 3D 动作的原型；机会在复杂机制与人的成本联合优化。","core":["P142","P143","P152","P157","P014","S12","P391","C02"],"support":["P012","P347","C01","T260318246"],"anchors":["P142","S12","P143","P152","P157"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W2a","parent":"W2","route":"world","label":"抵抗默认常识","question":"明确给出反常识前提后，模型能否按新规则推理而非复述旧知识？","before":"默认规则和常识一致","after":"坐标/任务规则置换、反事实知识、反常事件和不可能视频","gap":"指令中的反事实规则、因果叙事和要求生成不可能情境，是不同实验问题。","core":["P011","P015","P043","P042","P045","P009","P070","C04"],"support":["P077","P355"],"anchors":["P011","P015","P043","P042"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W2b","parent":"W2","route":"world","label":"溯因与撤销假设","question":"如何从不完整观察形成解释，并在新证据到来后增强、削弱或撤销解释？","before":"静态文本的最合理解释","after":"图像/视频线索、隐藏事件、多假设及可撤销推断","gap":"合理解释不是被识别的真实原因；生成的想象图像也不是新观测。","core":["P002","P005","P007","P008","P016","P017","P019","P020","P021","P027","P030","S13","C07"],"support":[],"anchors":["P002","P008","S13","P017","P021"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W2c","parent":"W2","route":"world","label":"干预与反事实","question":"怎样显式指定改变的变量，同时保持其余机制，并产生可核验的后果？","before":"事实视频外推，或只改变提示词","after":"结构化对象/关系、给定因果图、数字孪生条件与反事实负例","gap":"P125 依赖给定图；P071 的孪生并非经验证的物理引擎；P130 是动作语义替换。","core":["P071","P125","P130","C03"],"support":["P064","P063","P047","P044","P083","P233","P302","P383","P396"],"anchors":["P071","P125","P130","P063"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W2d","parent":"W2","route":"world","label":"规则一致性的评测","question":"怎样区分画质、指令遵循、事件完成与真正的规则一致性？","before":"看起来合理的单段生成","after":"保持事件、改变外观/视角；逐规则核验；要求反常识规则","gap":"CRONOS 主要测外观条件变化下的物理稳定性；RULER 的归一化评分不是整条轨迹全对率。","core":["P158","P084","P028","P139","P380"],"support":["P073","P070","P211","P227","P274","P273","P287","P316","P329","P328","P343","P353","P351","P364","P362","P361","P378","P374","P389","C03"],"anchors":["P158","P084","P139"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W3a","parent":"W3","route":"world","label":"长程世界记忆","question":"离开再返回、时间推进或反复更新记忆后，怎样保留正确状态？","before":"局部时间窗口","after":"帧—位姿—时间记忆、状态空间长上下文、持续记忆更新","gap":"视觉重现、动态状态更新与记忆不失真需分开验证；训练外的无限记忆未被证明。","core":["P085","P137","P135","P097"],"support":["P024","P169","P175","P174","P240","P259","P257","P266","P261","P288","P286","P310","P316","P342","P359","P370","P384","P394","C02","T260517423"],"anchors":["P135","P137","P097"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W3b","parent":"W3","route":"world","label":"事件与跨镜头叙事","question":"怎样把多事件故事展开成长期序列，并保持实体、动作和事件完成？","before":"逐句图像与短片续接","after":"显式布局/关键帧、分层导演、跨镜头记忆与事件级评估","gap":"角色一致、布局一致和故事偏好不能代替因果机制或物理正确性。","core":["P010","P039","P120","P122","P127","P128","P129","P133","P136","P138","P139","P140","P161","S27","C10"],"support":["P101","P131","P169","P190","P198","P247","P245","P259","P269","P288","P284","P281","P307","P348","P365","P377","P371","P403","T260517423"],"anchors":["P138","P039","P136","P128","P161"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W3c","parent":"W3","route":"world","label":"多主体与开放演化","question":"怎样使局部规则产生可解释的群体行为、协作或持续新颖演化？","before":"单一智能体、固定目标","after":"Game Master 维护共同世界、联合动作预测；搜索模拟参数和新颖行为","gap":"社会模拟、命名博弈、个体预测和人工生命各有验证目标。要分别说明评价对象，不能将局部涌现或可信感当成完整社会预测。","core":["P145","P151","P163","S07","S08","S09","C08","C09"],"support":["P074","P186"],"anchors":["S09","P145","P151","S07","P163","C08","C09"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W3d","parent":"W3","route":"world","label":"创作者修改世界","question":"人修改规则或任务节点后，如何更新相关后果并保留无关内容？","before":"一次性设定/生成","after":"计划树、任务图、分层设定与迭代审核","gap":"DreamGarden、Retcon 与 AutoWorldBuilder 采用不同粒度的编辑、约束或审核。精确依赖更新不能仅据这几篇未测就宣称无人研究；B3 继续暂缓。","core":["P036","P147","P160","C06"],"support":["P164","P072","P199","P253","P393","C01","T230613078"],"anchors":["P147","P036","P160"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W4a","parent":"W4","route":"world","label":"组合与搜索（方法支撑）","question":"当推理深度与分支增加时，什么表示与搜索机制支持全局约束？","before":"单条文字 CoT 或固定计算预算","after":"显式状态规划、树搜索、连续潜推理、能量组合与训练/采样策略","gap":"这些论文多用数学/合成任务；支持推理组件，不等于已实现可编辑物理世界。","core":["P104","P105","S10","S11","S22"],"support":["P006","P018","P023","P025","P103","P108","P113","P114","P116","P034","P037","P073","P077","P107","P112","P117","P115","P031","P068","P166","P178","P187","P185","P182","P200","P210","P208","P205","P202","P201","P218","P212","P236","P231","P256","P254","P270","P262","P279","P277","P275","P282","P298","P296","P293","P292","P318","P313","P312","P329","P324","P322","P340","P338","P337","P336","P332","P350","P358","P369","P373","P381","P398","P397","P395","T240510316","C07"],"anchors":["S10","P104","P103","P023","P034"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W4b","parent":"W4","route":"world","label":"推理是否仍有视觉依据","question":"长推理过程中怎样发现证据丢失、重新观察并约束输出？","before":"一次视觉编码后继续语言推理","after":"时间定位、证据池、双流解码、特征重访和过程监督","gap":"注意力、熵与视觉依赖是代理指标；‘关注了’不等于因果使用或答对。","core":["P069","P075","P078","P086","P087","P088","P089","P092","P093","P098","P099","P100"],"support":["P090","P165","P181","P212","P228","P240","P237","P235","P243","P242","P257","P266","P265","P290","P289","P300","P295","P310","P308","P302","P328","P323","P360","P354","P352","P363","P376","P372","P392","T250901986"],"anchors":["P078","P087","P086","P092","P100"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W4c","parent":"W4","route":"world","label":"校准、漂移与有效推断","question":"模型或数据机制变化后，怎样判断结论仍可靠且对决策有用？","before":"静态准确率和合成数据拟合","after":"概念漂移归因、因果校准、真实/合成数据推断及多任务时间序列评价","gap":"统计识别、交换性和数据条件需明确；这组是验证方法支撑，不是世界生成系统。","core":[],"support":["P046","P044","P047","P051","P052","P063","P096","P227","P276","P271","P292","P343","P341","P360","P366","P375","P374","P391","C02"],"anchors":["P046","P044","P052","P096"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W4d","parent":"W4","route":"world","label":"生成过程作为推理","question":"视频生成过程能否执行规则与计算视觉答案，训练或测试时外援分别贡献了什么？","before":"用 VLM 先求解，再把结果交给视频生成器","after":"训练可用教师或仿真监督；测试区分不给未来答案、外部求解、给定未来轨迹。进一步检验未见规则组合与重复触发。","gap":"视觉轨迹像推理步骤不代表步骤忠实；需要任务规则、未见组合、过程约束和外部依赖消融。","core":["P158","P378"],"support":[],"anchors":["P158"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X1a","parent":"X1","route":"xr","label":"空间指涉与表达","question":"怎样让‘这个/那里/这样做’成为双方共享、可消歧的空间信息？","before":"屏幕上的语音+指向；用户输入端消歧","after":"可穿戴注视/指向/历史；对象锚定；智能体输出同步手势","gap":"AgentHands 依赖预扫描对象与有限手势；不能视为开放世界的任意动作理解。","core":["P061","P057","S17","S18","S24"],"support":["P170","P193","P226","P251","P268","P263","P331","P401"],"anchors":["S18","S17","S24","P061"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X1b","parent":"X1","route":"xr","label":"目标与任务状态","question":"怎样从示范、第一人称历史或动作表现推断用户目标与下一步需求？","before":"显式目标或单张当前画面","after":"观察后协助、历史进度、他者意图、动作技能反馈与 BDI 用户模型","gap":"离线下一动作选择不等于闭环执行；专家式反馈不等于已证明长期技能提升。","core":["P141","P155","P151","P146","S23"],"support":["P170","P168","P165","P181","P197","P220","P224","P235","P234","P248","P260","P280","P290","P289","P294","P315","P335","P379","P394","T241211621"],"anchors":["P141","P155","P151","S23"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X1c","parent":"X1","route":"xr","label":"通过行动获得证据","question":"不知道发生了什么时，应该看哪里、问谁，或请求人执行什么辨别动作？","before":"固定观察与文本澄清","after":"主动转头/视频搜索、物理实验、由人执行的取证动作","gap":"要区分澄清已有事实和创造新证据；P143/P157 已覆盖实验式取证，尚不足以验证自然 XR 中的负担权衡。","core":["P143","P157","P079","P095","S12"],"support":["P005","P007","P009","P020","P021","P027","P030","P069","P075","P088","P177","P176","P342","P376","P372"],"anchors":["P143","P157","P079","P095"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X2a","parent":"X2","route":"xr","label":"何时与怎样澄清","question":"怎样识别缺失条件，并用尽量少的问题获得正确决策所需信息？","before":"直接猜测或给出所有可能回答","after":"对话动作偏好学习；按条件 DAG 提问并裁剪分支","gap":"ACT/GPS 的用户主要提供已知信息；未学习通过身体行动产生新证据的策略。","core":["P149","P159","S21"],"support":["S19"],"anchors":["P149","S21","P159"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X2b","parent":"X2","route":"xr","label":"主动介入与打扰成本","question":"如何共同决定提供什么帮助、是否介入，以及何时用何种通道交互？","before":"用户发起请求，或只预测潜在需求","after":"将需求、通道可用性、社会情境和打扰成本一起考虑","gap":"小规模原型研究支持具体交互收益；尚不能推出长期部署中最优介入策略。","core":["P055","P059","S15","S16","S23","S25"],"support":[],"anchors":["P055","S15","S16","S23","P059"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X2c","parent":"X2","route":"xr","label":"控制权与团队效用","question":"何时交给人、让机器做，或更新知识，才能最大化团队净收益？","before":"机器单独准确率，算法决定采样/接管","after":"人自主接管、联合优化求助策略、将错误与获取信息的成本纳入决策","gap":"驾驶、离线分类、合约问答与 XR 各有边界；迁移需要真实的人的能力/成本模型。","core":["P001","P041","P022","S14","S20"],"support":["P048","P049","P050","P054","P186","P184","P193","P229","P267"],"anchors":["S14","P001","P041","P048"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X3a","parent":"X3","route":"xr","label":"不确定性与恰当依赖","question":"什么不确定性可信，怎样表达才帮助用户正确决定是否依赖？","before":"token 概率或一句‘不确定’","after":"语义簇、层间一致性、隐状态探针、来源分解与用户依赖实验","gap":"检测器、概率校准、表达方式和人的信任是四个不同环节；一致错误不会被语义熵自动发现。","core":["P038","P110","P118","P119","P144","P148","P153","S26"],"support":[],"anchors":["P144","P148","P038","P110"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X3b","parent":"X3","route":"xr","label":"核查、反馈与修复","question":"怎样让用户检查和修改关键假设，并让修正有效进入后续行为？","before":"线性解释与最终答案反馈","after":"局部 CoT 编辑、图/程序解释、过程监督、反思和知识更新","gap":"可见 CoT 不一定忠实反映内部计算；人提供的新知识须计入协作成本与收益。","core":["P065","P066","P076","P080","P091","P012","P022"],"support":["P090","P097","S19","P184","P216","P229","P239","P251","P272","P314","P347","P344","P390","T250215027"],"anchors":["P065","P080","P076","P091"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X3c","parent":"X3","route":"xr","label":"协作评测与真实效用","question":"如何测持续协作可靠性，而不只测模型某次答对？","before":"单轮静态问答与独立模型排行榜","after":"用户—工具—规则交互、重复成功、跨应用产物验证和部署效用","gap":"模拟用户或离线医疗评分不等于真实人机团队或真实部署获益。","core":["P067","P094","P111"],"support":["P053","P051","P004","S20","P189","P186","P194","P210","P206","P220","P218","P221","P234","P249","P260","P251","P267","P280","P271","P297","P306","P305","P314","P331","P344","P356","P361","P379","P401"],"anchors":["P067","P094","P111","P051"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X4a","parent":"X4","route":"xr","label":"可检查的协作创作工具","question":"怎样用自然语言和可编辑中间表示降低原型/内容创作成本？","before":"手写代码、黑盒生成与单个建议","after":"Visual Blocks/XR 模块、任务图、备选方案比较及人在环修改","gap":"原型速度与创作偏好不证明底层机制正确；通用图像/视频创作论文作为相关界面设计参照。","core":["P056","P060","P062","P036","P147","P029","P379","C05","C06"],"support":["P032","P035","P033","P040","P126","P166","P174","P171","P190","P199","P198","P196","P195","P192","P191","P209","P207","P204","P203","P219","P216","P214","P213","P226","P225","P239","P238","P246","P245","P244","P258","P253","P252","P269","P268","P263","P278","P285","P284","P281","P291","P306","P305","P301","P314","P325","P335","P349","P348","P345","P355","P370","P365","P377","P387","P385","P393","P402","T250901986","T241211621","T230613078"],"anchors":["P062","P060","P036","P147"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"X4b","parent":"X4","route":"xr","label":"可访问性与设计规范","question":"通用指南在具体 XR 场景里能否被开发者执行，并覆盖不同能力的用户？","before":"抽象设计原则或事后修补","after":"开发工作流中的可操作指南；按用户通道与能力适配","gap":"行业访谈暴露执行障碍，不是对全部残障群体体验的效果验证。","core":["P058","S19"],"support":["P055","S15"],"anchors":["P058","S19","S15"],"rq_origin":"跨论文综合归纳；不是作者逐字给出的统一 RQ"},{"id":"W1e","parent":"W1","route":"world","label":"不完备设定与候选世界","question":"哪些结论由规则蕴含，哪些依赖补充假设；怎样保留多个相容世界？","before":"设定被视为完备，或把一个合理补全当作唯一答案","after":"区分真、假、未定事实与可撤销默认；延迟承诺，并检查相容性","gap":"有限规则通常不唯一决定世界。假设跟踪、约束生成已有前作；跨模态可执行拓展仍须单独验证。","core":["C05","C06","C07","C10"],"support":["C04","P142","P160"],"anchors":["C10","C05","C06","C07"],"rq_origin":"本综述综合开放世界规划、约束 PCG、Retcon 与 PWM 的任务条件；不是某篇统一命名"},{"id":"W3e","parent":"W3","route":"world","label":"世界拓展与跨层反馈","question":"新增对象、机制与制度后，如何保持已定约束，并验证生态、行动与社会之间的反馈？","before":"固定对象类型与单层机制，或将丰富设定当成演化证据","after":"分别验证表示扩展、新旧实体交互、资源账目和跨层干预传播","gap":"扩展容忍度、人工生命和社会模拟已有工作；这些局部结果没有自动构成统一世界的端到端验证。","core":["C04"],"support":["C05","C06","C10","C08","C09","P145","P163","P160"],"anchors":["C04","C10","P163","P145","C08"],"rq_origin":"将表示拓展与跨层反馈作为综合阅读问题；下列前作分别支撑局部能力，不声称已解决全部目标"}],"papers":[{"id":"P010","title":"Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences","short":"Visual Writing Prompts","year":"2023","authors":"Xudong Hong; Asad Sayeed; Khushboo Mehra; Vera Demberg; Bernt Schiele","collected":true,"note":"p010","scope":"本地 PDF · 既有阅读笔记","summary":"用经过筛选的电影镜头序列和明确角色构建 VWP，以更好的输入与角色表示提升视觉故事的连贯性。","boundary":"生成图像序列对应的文本故事；依赖电影镜头、角色框和筛选流程，不生成视频或验证事件真实发生。","evidence":"摘要；构建 §3–5；模型 §6.1；人评 §6.3/表7；§7。","sources":["abductive/23_Character-Grounded Story Generation with Curated Image Sequences.pdf"],"sha256":"33a8162c030e1f548ed7f94972bf7154d3efeb6b1ac91db896cf0d37217b1870","pages":15,"links":[{"label":"arXiv本地版本 2301.08571v1","url":"https://arxiv.org/abs/2301.08571v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P010","title":"Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences","year":"2023","authors":"Xudong Hong; Asad Sayeed; Khushboo Mehra; Vera Demberg; Bernt Schiele","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"约 2K 个、每个 5–10 图的序列及约 12K 众包故事；提出角色感知的 CharGrid 基线。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用经过筛选的电影镜头序列和明确角色构建 VWP，以更好的输入与角色表示提升视觉故事的连贯性。","input_conditions":"生成图像序列对应的文本故事；依赖电影镜头、角色框和筛选流程，不生成视频或验证事件真实发生。","training_supervision":"过滤低信息和重复镜头，提供角色名称/裁剪图引导写作；冻结 Swin 特征提取，结合角色特征与角色网格建模跨句连贯性。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"28 名众包者比较 50 对故事；本地稿表7中 CharGrid 相较 TAPM+char 的人类判断差值：连贯性 +8.41、视觉依据 +6.25、多样性 +11.06 个百分点。","boundary":"【作者】叙事结构/narrativity 和写作者能力差异未充分建模；【解读】人工评价样本小，电影域与现实相册存在分布差异。","evidence":"摘要；构建 §3–5；模型 §6.1；人评 §6.3/表7；§7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2301.08571v1","url":"https://arxiv.org/abs/2301.08571v1"}],"note":"p010","priority":0},"aliases":[]},{"id":"P009","title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","short":"Breaking Common Sense","year":"2023","authors":"Nitzan Bitton-Guetta; Yonatan Bitton; Jack Hessel; Ludwig Schmidt; Yuval Elovici; Gabriel Stanovsky; Roy Schwartz","collected":true,"note":"p009","scope":"本地 PDF · 既有阅读笔记","summary":"通过人为设计的反常识合成图像，评价模型是否能识别和解释图像中的异常，而不只描述物体。","boundary":"小规模、人工筛选的合成图像及四类任务；不能直接代表真实图像中的所有常识错误。","evidence":"摘要；数据 §2；表1；结果 §5.2；局限 §8。","sources":["abductive/23_A Vision and Language Benchmark of Synthetic and Compositional Images.pdf"],"sha256":"342485fdb71a2e2931d66cfd760bc87c9f78d58bd7edaf325cf0e921621629ab","pages":15,"links":[{"label":"arXiv本地版本 2303.07274v4","url":"https://arxiv.org/abs/2303.07274v4"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P009","title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","year":"2023","authors":"Nitzan Bitton-Guetta; Yonatan Bitton; Jack Hessel; Ludwig Schmidt; Yuval Elovici; Gabriel Stanovsky; Roy Schwartz","teams":[],"topics":["world_model"],"rqs":["W2a","X1c"],"collected":true,"review_status":"existing_notes","question":"提供视觉常识基准及解释异常任务，结合 captioning、匹配和 VQA；分析感知与推理各自的瓶颈。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过人为设计的反常识合成图像，评价模型是否能识别和解释图像中的异常，而不只描述物体。","input_conditions":"小规模、人工筛选的合成图像及四类任务；不能直接代表真实图像中的所有常识错误。","training_supervision":"设计师用文生图工具制作异常组合，众包标注解释；比较端到端 BLIP2 和图像描述→LLM 管线，并用人类及 GPT-4 评价解释。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1中，微调 BLIP2-XXL 异常识别 73%，人类 92%；解释的人类评分为 27%，oracle caption→GPT-3 为 68%，人类 95%。","boundary":"【作者】数据规模小，仍可能含令人不适内容；【解读】生成工具、文化常识及 GPT 评价器带来偏差，oracle 描述结果不是实际端到端水平。","evidence":"摘要；数据 §2；表1；结果 §5.2；局限 §8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2303.07274v4","url":"https://arxiv.org/abs/2303.07274v4"}],"note":"p009","priority":0},"aliases":[]},{"id":"P008","title":"Visual Abductive Reasoning","short":"Visual Abductive Reasoning","year":"2022","authors":"Chen Liang; Wenguan Wang; Tianfei Zhou; Yi Yang","collected":true,"note":"p008","scope":"本地 PDF · 既有阅读笔记","summary":"在事件片段被遮蔽的视频中描述已知事件并生成最可能的缺失事件解释，提出 VAR 数据集和 REASONER。","boundary":"输入已有事件分段，缺失事件以黑帧遮蔽；实现的是语言解释生成，未识别或验证真实因果结构。","evidence":"任务 §3；实现 §4.4；实验 §5、表8；附录失败案例。","sources":["abductive/22_Visual Abductive Reasoning.pdf"],"sha256":"90f39a03b4c4a282706963260126887bfd7658133b53f6b586bfe9e39cc5febe","pages":16,"links":[{"label":"arXiv本地版本 2203.14040v1","url":"https://arxiv.org/abs/2203.14040v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"}],"annotation":{"id":"P008","title":"Visual Abductive Reasoning","year":"2022","authors":"Chen Liang; Wenguan Wang; Tianfei Zhou; Yi Yang","teams":[],"topics":["world_model"],"rqs":["W2b"],"collected":true,"review_status":"existing_notes","question":"设计因果方向感知编码及置信度引导的级联解码，逐轮改进前提描述与假设。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在事件片段被遮蔽的视频中描述已知事件并生成最可能的缺失事件解释，提出 VAR 数据集和 REASONER。","input_conditions":"输入已有事件分段，缺失事件以黑帧遮蔽；实现的是语言解释生成，未识别或验证真实因果结构。","training_supervision":"使用预提取动作/外观特征，contextualized directional position embedding 区分关系；三个级联 Transformer 解码器通过句子置信度交换信息。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"消融中，普通 Transformer 的平均事件 CIDEr 30.04、BLEU-4 3.39；同时加入两个组件后为 36.13、4.66。完整模型领先比较的视频语言基线，但仍落后人类。","boundary":"【解读】依赖事件分割和视觉特征；多种合理解释会使参考文本指标失真，因果位置编码并非干预意义上的因果保证。","evidence":"任务 §3；实现 §4.4；实验 §5、表8；附录失败案例。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2203.14040v1","url":"https://arxiv.org/abs/2203.14040v1"}],"note":"p008","priority":0},"aliases":[]},{"id":"P007","title":"The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning","short":"The Abduction of Sherlock Holmes","year":"2022","authors":"Jack Hessel; Jena D. Hwang; Jae Sung Park; Rowan Zellers; Chandra Bhagavatula; Anna Rohrbach; Kate Saenko; Yejin Choi","collected":true,"note":"p007","scope":"本地 PDF · 既有阅读笔记","summary":"构建 Sherlock，收集视觉线索和超出字面画面的合理推断，评估机器的视觉溯因能力。","boundary":"推断是人类认为合理的假设；主要评价检索/定位/比较，开放式生成评价仍待解决。","evidence":"摘要 p1；任务 §4；方法/结果 §5、表2；结论 §6。","sources":["abductive/22_The Abduction of Sherlock Holmes_A Dataset for Visual Abductive Reasoning.pdf"],"sha256":"6d3154700273e8716a1894925a16c6890426adc4cd9bb9d54a4fe1bde03c78ac","pages":18,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P007","title":"The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning","year":"2022","authors":"Jack Hessel; Jena D. Hwang; Jae Sung Park; Rowan Zellers; Chandra Bhagavatula; Anna Rohrbach; Kate Saenko; Yejin Choi","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"103K 图片、363K 线索—推断对及约 19K 合理性判断，覆盖推断检索、证据定位和合理性比较。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"构建 Sherlock，收集视觉线索和超出字面画面的合理推断，评估机器的视觉溯因能力。","input_conditions":"推断是人类认为合理的假设；主要评价检索/定位/比较，开放式生成评价仍待解决。","training_supervision":"自由观察式众包标注线索框和推断；训练图像、区域、文本兼容性评分器，比较 LXMERT、UNITER 和 CLIP，并加入多任务训练。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"CLIP-RN50x64 加多任务目标在三类评测中优于所列强基线，但与人类判断一致性仍有明显差距；文中同时报告定位及排序指标，不能统一当作准确率。","boundary":"【作者】显著线索选择、合理推断的歧义及生成评价未解决；文字识别、动作识别等基础视觉错误也会传递到推断。","evidence":"摘要 p1；任务 §4；方法/结果 §5、表2；结论 §6。","checked":"2026-09-15","links":[],"note":"p007","priority":0},"aliases":[]},{"id":"P006","title":"Learning Iterative Reasoning through Energy Minimization","short":"Learning Iterative Reasoning through Energy Minimization","year":"2022","authors":"Yilun Du; Shuang Li; Joshua Tenenbaum; Igor Mordatch","collected":true,"note":"p006","scope":"本地 PDF · 既有阅读笔记","summary":"把推理写成学习能量函数后的迭代优化，使测试时可以增加计算以处理更大或更难的问题。","boundary":"验证于合成图运算、加法、矩阵补全/求逆等；优化过程不保证任意实例达到全局最优。","evidence":"方法 §3；表1 p5；消融表2；§5 Conclusion and Limitations。","sources":["abductive/22_Learning Iterative Reasoning through Energy Minimization.pdf"],"sha256":"2c44b73b49bf1fad468a2f7a4e03c2ddfd5eaef4447890c7a5d980bc1c8ceead","pages":14,"links":[{"label":"arXiv本地版本 2206.15448v1","url":"https://arxiv.org/abs/2206.15448v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P006","title":"Learning Iterative Reasoning through Energy Minimization","year":"2022","authors":"Yilun Du; Shuang Li; Joshua Tenenbaum; Igor Mordatch","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"IREM 用统一能量最小化处理图与连续算法任务，并演示嵌套组合求解。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把推理写成学习能量函数后的迭代优化，使测试时可以增加计算以处理更大或更难的问题。","input_conditions":"验证于合成图运算、加法、矩阵补全/求逆等；优化过程不保证任意实例达到全局最优。","training_supervision":"学习输入与候选输出之间的能量景观；通过迭代梯度更新寻找低能量解，以回放缓冲和末步截断反传控制训练开销。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"10 节点训练、15 节点测试的最短路元素 MSE 为 0.0464，循环网络 0.1083、前馈模型 1.4089；更难加法 MSE 为 0.0021，对比最佳列示基线 0.1577。","boundary":"【解读】收益依赖能量函数及优化质量；增加推理时间有成本，合成任务的规模泛化不等于自然语言或开放世界推理。","evidence":"方法 §3；表1 p5；消融表2；§5 Conclusion and Limitations。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2206.15448v1","url":"https://arxiv.org/abs/2206.15448v1"}],"note":"p006","priority":0},"aliases":[]},{"id":"P005","title":"There’s a Time and Place for Reasoning Beyond the Image","short":"There’s a Time and Place for Reasoning Beyond the Image","year":"2022","authors":"Xingyu Fu; Ben Zhou; Ishaan Preetam Chandratreya; Carl Vondrick; Dan Roth","collected":true,"note":"p005","scope":"本地 PDF · 既有阅读笔记","summary":"提出图像时空定位任务 TARA，要求综合画面线索与背景知识判断拍摄时间和地点。","boundary":"主要为 NYT/Wikipedia 图片和给定标签集合的分类，不是无需候选的任意地点、精确日期识别。","evidence":"摘要 p1；数据 §3–4；方法 §5；表2、表3及 §6.3。","sources":["abductive/22_ACL_There’s a Time and Place for Reasoning Beyond the Image.pdf"],"sha256":"aaf98fccea956b5824724ffc590c892f805b3814ef30ed5f8e096a11dd9987f1","pages":12,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P005","title":"There’s a Time and Place for Reasoning Beyond the Image","year":"2022","authors":"Xingyu Fu; Ben Zhou; Ishaan Preetam Chandratreya; Carl Vondrick; Dan Roth","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"构建约 16K 新闻图片和额外 61K WIT 弱监督样本，并提供基于局部图像线索的 CLIP 变体。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出图像时空定位任务 TARA，要求综合画面线索与背景知识判断拍摄时间和地点。","input_conditions":"主要为 NYT/Wikipedia 图片和给定标签集合的分类，不是无需候选的任意地点、精确日期识别。","training_supervision":"自动抽取新闻时空标签，众包验证可推理子集；比较 CLIP、微调、WIT 监督及 segment-wise 表征，使用 Accuracy 和层级 Example-F1。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"全测试集地点准确率 CLIP 11.11%、CLIP+Seg 16.46%。在人类对照子集，地点 23.33% vs 人类 86.21%，时间 3.33% vs 75.86%；不能把两个测试集合并比较。","boundary":"【作者/设定】人类只测 test set of interest；【解读】新闻来源和标签分布有偏，图片可能不足以确定唯一时间，WIT 的分布差异限制收益。","evidence":"摘要 p1；数据 §3–4；方法 §5；表2、表3及 §6.3。","checked":"2026-09-15","links":[],"note":"p005","priority":0},"aliases":[]},{"id":"P004","title":"WebGPT: Browser-assisted question-answering with human feedback","short":"WebGPT","year":"2021 / 2022","authors":"Reiichiro Nakano; Jacob Hilton; Suchir Balaji; Jeff Wu; Long Ouyang; Christina Kim; Christopher Hesse; Shantanu Jain; Vineet Kosaraju; William Saunders; Xu Jiang; Karl Cobbe; Tyna Eloundou; Gretchen Krueger; Kevin Button; Matthew Knight; Benjamin Chess; John Schulman","collected":true,"note":"p004","scope":"本地 PDF · 既有阅读笔记","summary":"训练 GPT-3 操作文本浏览器、收集引用并回答长问题，以示范学习和人类偏好反馈提升答案质量。","boundary":"文本浏览器和 ELI5 长问答；最强模型使用 175B、best-of-64，有引用不代表引用真实或推断正确。","evidence":"摘要 p1；训练 §3；评价 §4–5；真实性和引用局限 §6。","sources":["abductive/21_WebGPT_Browser-assisted question-answering with human feedback.pdf"],"sha256":"acad8d9fd55a30b94de9dfdae413e10b21e07bde54d767b2405b31341739cedb","pages":32,"links":[{"label":"arXiv本地版本 2112.09332v3","url":"https://arxiv.org/abs/2112.09332v3"}],"verified":"2026-09-15","mappings":[{"rq":"X3c","role":"support"}],"annotation":{"id":"P004","title":"WebGPT: Browser-assisted question-answering with human feedback","year":"2021 / 2022","authors":"Reiichiro Nakano; Jacob Hilton; Suchir Balaji; Jeff Wu; Long Ouyang; Christina Kim; Christopher Hesse; Shantanu Jain; Vineet Kosaraju; William Saunders; Xu Jiang; Karl Cobbe; Tyna Eloundou; Gretchen Krueger; Kevin Button; Matthew Knight; Benjamin Chess; John Schulman","teams":[],"topics":["hci"],"rqs":["X3c"],"collected":true,"review_status":"existing_notes","question":"把检索、浏览、引用和回答统一为可训练的交互轨迹，并利用带引用答案支持人类评价。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"训练 GPT-3 操作文本浏览器、收集引用并回答长问题，以示范学习和人类偏好反馈提升答案质量。","input_conditions":"文本浏览器和 ELI5 长问答；最强模型使用 175B、best-of-64，有引用不代表引用真实或推断正确。","training_supervision":"约 6,000 条人类示范做行为克隆，约 21,500 组偏好比较训练奖励模型；比较 PPO 与拒绝采样，主要最优配置采用行为克隆加奖励筛选。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在 ELI5 上，最强模型相对人类示范答案的偏好率为 56%，相对 Reddit 高赞答案为 69%（平局计半）；这是偏好评价，不是事实准确率。","boundary":"【作者】分布外问题仍困难，引用支持性不能替代真实性，存在偏见和奖励优化问题；【解读】多次浏览与采样成本高。","evidence":"摘要 p1；训练 §3；评价 §4–5；真实性和引用局限 §6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2112.09332v3","url":"https://arxiv.org/abs/2112.09332v3"}],"note":"p004","priority":0},"aliases":[]},{"id":"P002","title":"Abductive Commonsense Reasoning","short":"Abductive Commonsense Reasoning","year":"2020","authors":"Chandra Bhagavatula; Ronan Le Bras; Chaitanya Malaviya; Keisuke Sakaguchi; Ari Holtzman; Hannah Rashkin; Doug Downey; Scott Wen-tau Yih; Yejin Choi","collected":true,"note":"p002","scope":"本地 PDF · 既有阅读笔记","summary":"把溯因推理定义为根据前后观察寻找最合理解释，构建 ART 数据及解释选择、解释生成两类任务。","boundary":"英语短篇常识叙事中的候选解释选择/文本生成；合理解释不等于唯一、可验证的真实原因。","evidence":"摘要 p1；任务/数据 §2–4；结果 §5，表1；分析 §6。","sources":["abductive/20_ABDUCTIVE COMMONSENSE REASONING.pdf"],"sha256":"c6d69ad1817d26ff208441dae37d9b638e82e6a0e85ce4eea2063adffbd1cdf7","pages":18,"links":[{"label":"arXiv本地版本 1908.05739v2","url":"https://arxiv.org/abs/1908.05739v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"}],"annotation":{"id":"P002","title":"Abductive Commonsense Reasoning","year":"2020","authors":"Chandra Bhagavatula; Ronan Le Bras; Chaitanya Malaviya; Keisuke Sakaguchi; Ari Holtzman; Hannah Rashkin; Doug Downey; Scott Wen-tau Yih; Yejin Choi","teams":[],"topics":["world_model"],"rqs":["W2b"],"collected":true,"review_status":"existing_notes","question":"提供超过 2 万叙事情境和 20 万解释；提出 Abductive NLI/NLG，并分析预训练语言模型的推理缺口。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把溯因推理定义为根据前后观察寻找最合理解释，构建 ART 数据及解释选择、解释生成两类任务。","input_conditions":"英语短篇常识叙事中的候选解释选择/文本生成；合理解释不等于唯一、可验证的真实原因。","training_supervision":"众包构造观察及正负解释，使用对抗筛选降低捷径；比较 GPT/BERT 微调和不同观察依赖结构，进行人工与自动评价。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"ART 测试集最佳 BERT 68.9%±0.5%，人类多数投票 91.4%；5 个训练随机种子；生成任务仍有明显常识与因果连贯性问题。","boundary":"【解读】故事和众包解释限定了常识分布；二选一准确率不能代表开放世界因果发现，生成评价受多解性影响。","evidence":"摘要 p1；任务/数据 §2–4；结果 §5，表1；分析 §6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 1908.05739v2","url":"https://arxiv.org/abs/1908.05739v2"}],"note":"p002","priority":0},"aliases":["P003"]},{"id":"P001","title":"HG-DAgger: Interactive Imitation Learning with Human Experts","short":"HG-DAgger","year":"2019","authors":"Michael Kelly; Chelsea Sidrane; Katherine Driggs-Campbell; Mykel J. Kochenderfer","collected":true,"note":"p001","scope":"本地 PDF · 既有阅读笔记","summary":"让人类自主接管和交还控制权，改进真实系统中的交互式模仿学习，并从接管行为学习基于模型不确定性的风险阈值。","boundary":"实现于仿真与实车驾驶任务；人类负责判断何时接管，风险阈值是经验估计，未给出无碰撞保证。","evidence":"摘要 p1；方法 p2–3；实验 p4–6，表 I–II。","sources":["abductive/18_HG-DAgger_Interactive Imitation Learning with Human Experts.pdf"],"sha256":"5e3aefda8fa803c4bbd5c6760cc468a9ce926f0d2b38da24834069c3fdadbbd0","pages":7,"links":[{"label":"arXiv本地版本 1810.02890v2","url":"https://arxiv.org/abs/1810.02890v2"}],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"core"}],"annotation":{"id":"P001","title":"HG-DAgger: Interactive Imitation Learning with Human Experts","year":"2019","authors":"Michael Kelly; Chelsea Sidrane; Katherine Driggs-Campbell; Mykel J. Kochenderfer","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"提出 Human-Gated DAgger，减少随机切换控制导致的人类标注失真；同时估计策略的可接受状态区域。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"让人类自主接管和交还控制权，改进真实系统中的交互式模仿学习，并从接管行为学习基于模型不确定性的风险阈值。","input_conditions":"实现于仿真与实车驾驶任务；人类负责判断何时接管，风险阈值是经验估计，未给出无碰撞保证。","training_supervision":"迭代执行新手策略；专家接管时独占控制并收集示范，数据聚合后重训网络集成；用集成输出分歧及接管前的不确定性学习阈值。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"实车在 5 组障碍配置上优于 DAgger/行为克隆；与人类转向分布的 Bhattacharyya 距离相较 DAgger 改善 21.1%。仿真中阈值内初始化的碰撞率约为阈值外的 1/12。","boundary":"【作者】实车测试数据少，统计显著性有限；【解读】效果依赖专家及时接管，不确定性与真实危险之间并非严格等价。","evidence":"摘要 p1；方法 p2–3；实验 p4–6，表 I–II。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 1810.02890v2","url":"https://arxiv.org/abs/1810.02890v2"}],"note":"p001","priority":0},"aliases":[]},{"id":"P020","title":"ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models","short":"ViCor","year":"2024","authors":"Kaiwen Zhou; Kwonjoon Lee; Teruhisa Misu; Xin Eric Wang","collected":true,"note":"p020","scope":"本地 PDF · 既有阅读笔记","summary":"区分直接视觉理解与超出画面的常识推断，让 LLM 选择并指挥合适的视觉处理路线。","boundary":"VCR 和 A-OKVQA 四选一；不做域内微调，但依赖多个预训练模型及 in-context 示例。","evidence":"§4；§5.1–5.2；§6；§8。","sources":["abductive/24_ViCor_Bridging Visual Understanding and Commonsense Reasoning with LLM.pdf"],"sha256":"4503d215534a2016f3544189c73da3f8d25b8d674ba4dd04c05280d32364d827","pages":12,"links":[{"label":"arXiv本地版本 2310.05872v2","url":"https://arxiv.org/abs/2310.05872v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P020","title":"ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models","year":"2024","authors":"Kaiwen Zhou; Kwonjoon Lee; Teruhisa Misu; Xin Eric Wang","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"任务分类加主动视觉取证的 VLM/LLM 协作流程。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"区分直接视觉理解与超出画面的常识推断，让 LLM 选择并指挥合适的视觉处理路线。","input_conditions":"VCR 和 A-OKVQA 四选一；不做域内微调，但依赖多个预训练模型及 in-context 示例。","training_supervision":"先从图像描述评估候选；不确定时由 LLM 分类为 VCU/VCI，调用 BLIP2 直接匹配或询问关键视觉因素，再重新推理。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在论文所测无需域内微调的方法中表现最好；分析中 VCU 的 VLM/LLM+caption 平均准确率 63.6%/56.0%，VCI 为 50.5%/53.6%。","boundary":"【作者】文本沟通丢失视觉细节、仍落后最佳监督模型；VCR 主方法比较仅 500 个样本，受 GPT-4 调用成本限制。","evidence":"§4；§5.1–5.2；§6；§8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2310.05872v2","url":"https://arxiv.org/abs/2310.05872v2"}],"note":"p020","priority":0},"aliases":[]},{"id":"P019","title":"NL-EYE: Abductive NLI for Images","short":"NL-EYE","year":"2024","authors":"Mor Ventura; Michael Toker; Nitay Calderon; Zorik Gekhman; Yonatan Bitton; Roi Reichart","collected":true,"note":"p019","scope":"本地 PDF · 既有阅读笔记","summary":"把溯因 NLI 扩展到多图输入，要求比较后果/原因图像的合理性并解释选择。","boundary":"受控合成图像比较任务；事故预防和生成视频验证是潜在应用，未作为系统实现验证。","evidence":"摘要；§2–4；结果 §5；失败分析 §6；Ethics。","sources":["abductive/24_NL-EYE_ABDUCTIVE NLI FOR IMAGES.pdf"],"sha256":"45dd19e417d1745940b12cc81023a0b7891e578e4bcfc24b69fe07fdc4032a67","pages":27,"links":[{"label":"arXiv本地版本 2410.02613v1","url":"https://arxiv.org/abs/2410.02613v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"}],"annotation":{"id":"P019","title":"NL-EYE: Abductive NLI for Images","year":"2024","authors":"Mor Ventura; Michael Toker; Nitay Calderon; Zorik Gekhman; Yonatan Bitton; Roi Reichart","teams":[],"topics":["world_model"],"rqs":["W2b"],"collected":true,"review_status":"existing_notes","question":"350 个三元组、1,050 张人工策划合成图，覆盖物理、功能、逻辑、情绪、文化和社会推理。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把溯因 NLI 扩展到多图输入，要求比较后果/原因图像的合理性并解释选择。","input_conditions":"受控合成图像比较任务；事故预防和生成视频验证是潜在应用，未作为系统实现验证。","training_supervision":"人工撰写场景并迭代文生图；比较 triplet/pair 设置、合理性预测及解释，分析纯视觉和文本替代条件。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"被测 VLM 在多项设置接近随机基线，人类在合理性和解释质量上明显更好；结果限于本地版本使用的模型与测试集。","boundary":"【作者】常识标签存在文化/社会偏差，合成图仍可能含敏感内容；【解读】样本小、图像生成伪影与推理难度可能耦合。","evidence":"摘要；§2–4；结果 §5；失败分析 §6；Ethics。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2410.02613v1","url":"https://arxiv.org/abs/2410.02613v1"}],"note":"p019","priority":0},"aliases":[]},{"id":"P018","title":"Learning Iterative Reasoning through Energy Diffusion","short":"Learning Iterative Reasoning through Energy Diffusion","year":"2024","authors":"Yilun Du; Jiayuan Mao; Joshua Tenenbaum","collected":true,"note":"p018","scope":"本地 PDF · 既有阅读笔记","summary":"IRED 通过退火能量景观与扩散训练提升迭代推理，允许测试时增加优化计算。","boundary":"连续算法、数独、图连通和离散规划；未扩展验证到通用语言推理。","evidence":"§3；§4.2 表格 p7；§5 Conclusion and Discussions。","sources":["abductive/24_Learning Iterative Reasoning through Energy Diffusion.pdf"],"sha256":"c68d47bc3b18df31bf9e8dc7aff3a0ea46cf4a94f6a634102cbad1e7462c8771","pages":13,"links":[{"label":"arXiv本地版本 2406.11179v1","url":"https://arxiv.org/abs/2406.11179v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P018","title":"Learning Iterative Reasoning through Energy Diffusion","year":"2024","authors":"Yilun Du; Jiayuan Mao; Joshua Tenenbaum","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"结合分数匹配与能量监督，降低 IREM 训练不稳定和优化困难。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"IRED 通过退火能量景观与扩散训练提升迭代推理，允许测试时增加优化计算。","input_conditions":"连续算法、数独、图连通和离散规划；未扩展验证到通用语言推理。","training_supervision":"学习多噪声级能量函数，用对比监督塑造低能量正确解；推理时沿退火景观迭代梯度优化。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"数独同分布/更难测试准确率为 99.4%/62.1%，IREM 为 93.5%/24.6%，RRN 为 99.8%/28.6%；说明主要优势在更难分布，非所有设置最优。","boundary":"【作者】仍需许多梯度步，对需要中间记忆的任务可能不足；【解读】测试时扩算与鲁棒全局求解不同。","evidence":"§3；§4.2 表格 p7；§5 Conclusion and Discussions。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2406.11179v1","url":"https://arxiv.org/abs/2406.11179v1"}],"note":"p018","priority":0},"aliases":[]},{"id":"P017","title":"Exploring Defeasibility in Causal Reasoning","short":"Exploring Defeasibility in Causal Reasoning","year":"2024","authors":"Shaobo Cui; Lazar Milikic; Yiyang Feng; Mete Ismayilzada; Debjit Paul; Antoine Bosselut; Boi Faltings","collected":true,"note":"p017","scope":"本地 PDF · 既有阅读笔记","summary":"研究新信息如何增强或削弱常识因果关系，提出 δ-CAUSAL 与 CESAR 评分。","boundary":"文本常识因果关系的相对变化评价，不是通过干预数据估计因果效应。","evidence":"摘要；§5 CESAR；§6；Limitations。","sources":["abductive/24_Exploring Defeasibility in Causal Reasoning.pdf"],"sha256":"86878994aeac20a87a1e4ff2d654bf615daf836681fdd1cf128fdaa7b2919652","pages":20,"links":[{"label":"arXiv本地版本 2401.03183v2","url":"https://arxiv.org/abs/2401.03183v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"}],"annotation":{"id":"P017","title":"Exploring Defeasibility in Causal Reasoning","year":"2024","authors":"Shaobo Cui; Lazar Milikic; Yiyang Feng; Mete Ismayilzada; Debjit Paul; Antoine Bosselut; Boi Faltings","teams":[],"topics":["world_model"],"rqs":["W2b"],"collected":true,"review_status":"existing_notes","question":"新信息怎样增强或削弱常识因果关系，怎样评价这种变化？","question_origin":"依作者任务定义改写","summary":"研究新信息如何增强或削弱常识因果关系，提出 δ-CAUSAL 与 CESAR 评分。","input_conditions":"文本常识因果关系的相对变化评价，不是通过干预数据估计因果效应。","training_supervision":"构造原因—结果及支持/反驳论据；以 token 级因果关联和注意力构建 CESAR，另测论据生成。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"捕捉强度变化的指标从基线 47.2% 提高到 80.1%，相对提升 69.7%；GPT-3.5 生成支持/反驳论据的人评分别比人类低 4.5/10.7 点。","boundary":"【作者】分数用于定量解释存在限制，领域覆盖待扩展；【解读】基于语言关联的强度并非已校准的因果概率。","evidence":"摘要；§5 CESAR；§6；Limitations。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2401.03183v2","url":"https://arxiv.org/abs/2401.03183v2"}],"note":"p017","priority":0},"aliases":[],"research_question":{"kind":"依作者任务定义改写","text":"新信息怎样增强或削弱常识因果关系，怎样评价这种变化？","location":"PDF p.3 对 δ-NLI 的区分；δ-CAUSAL 与 CESAR"}},{"id":"P016","title":"DIVE: Towards Descriptive and Diverse Visual Commonsense Generation","short":"DIVE","year":"2023 / 2024","authors":"Jun-Hyung Park; Hyuntae Park; Youjin Kang; Eojin Jeon; SangKeun Lee","collected":true,"note":"p016","scope":"本地 PDF · 既有阅读笔记","summary":"通过过滤泛泛的推断并改进训练目标，让视觉常识生成更具体、多样。","boundary":"主要验证于 Visual Commonsense Graphs；“人类水平”限定于所测描述性/多样性指标。","evidence":"§3–4，表1–3；§4.3 人评；结论后局限。","sources":["abductive/24_DIVE_Towards Descriptive and Diverse Visual Commonsense Generation.pdf"],"sha256":"e888c768a6d50a1c93040f51ec1e578f60acca8697a9dbe7af12f1d0fcdb7a06","pages":19,"links":[{"label":"arXiv本地版本 2408.08021v1","url":"https://arxiv.org/abs/2408.08021v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"}],"annotation":{"id":"P016","title":"DIVE: Towards Descriptive and Diverse Visual Commonsense Generation","year":"2023 / 2024","authors":"Jun-Hyung Park; Hyuntae Park; Youjin Kang; Eojin Jeon; SangKeun Lee","teams":[],"topics":["world_model"],"rqs":["W2b"],"collected":true,"review_status":"existing_notes","question":"提出 generic inference filtering 与 contrastive retrieval learning。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过过滤泛泛的推断并改进训练目标，让视觉常识生成更具体、多样。","input_conditions":"主要验证于 Visual Commonsense Graphs；“人类水平”限定于所测描述性/多样性指标。","training_supervision":"利用频次及图像语义集中度过滤通用推断，再用图结构构造对比检索监督；在原始、unique、novel 子集及人评中比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在 VCG 的描述性和多样性指标上超过所列基线；450 条推断的人类成对评价支持改进，但并未证明常识正确性达到人类水平。","boundary":"【作者】主要只测 VCG，仍会产生与上下文无关的推断；【解读】过滤通用答案可能改变覆盖率，多样性不等于真实性。","evidence":"§3–4，表1–3；§4.3 人评；结论后局限。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2408.08021v1","url":"https://arxiv.org/abs/2408.08021v1"}],"note":"p016","priority":0},"aliases":[]},{"id":"P015","title":"Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs","short":"SolverLearner","year":"2024","authors":"Kewei Cheng; Jingfeng Yang; Haoming Jiang; Zhengyang Wang; Binxuan Huang; Ruirui Li; Shiyang Li; Zheng Li; Yifan Gao; Xian Li; Bing Yin; Yizhou Sun","collected":true,"note":"p015","scope":"本地 PDF · 方法条件已核查","summary":"用 SolverLearner 分离从样例归纳规则与执行规则，重新比较 LLM 的归纳和演绎能力。","boundary":"限于具有明确函数族和可执行规则的合成任务；程序执行由工具完成。","evidence":"§3 SolverLearner；§5；结论后的 Limitations。","sources":["abductive/24_deductive_inductive_llm.pdf"],"sha256":"565fc1b5b46f783169964078ab1dc9b1c1a075d382e428cb899ceac208044240","pages":18,"links":[{"label":"arXiv本地版本 2408.00114v2","url":"https://arxiv.org/abs/2408.00114v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"}],"annotation":{"id":"P015","title":"Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs","year":"2024","authors":"Kewei Cheng; Jingfeng Yang; Haoming Jiang; Zhengyang Wang; Binxuan Huang; Ruirui Li; Shiyang Li; Zheng Li; Yifan Gao; Xian Li; Bing Yin; Yizhou Sun","teams":[],"topics":["world_model"],"rqs":["W2a"],"collected":true,"review_status":"method_checked","question":"让 LLM 生成映射程序，再交给外部解释器执行，降低执行错误对归纳能力评价的干扰。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用 SolverLearner 分离从样例归纳规则与执行规则，重新比较 LLM 的归纳和演绎能力。","input_conditions":"限于具有明确函数族和可执行规则的合成任务；程序执行由工具完成。","training_supervision":"比较直接输入输出提示、显式给规则、由样例生成 Python 规则三种设置，测试算术、空间等默认/反事实任务。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"GPT-4 在大部分受限归纳条件下接近或达到准确率 1；直接演绎特别是反事实执行较弱，GPT-3.5 并不普遍达到同等水平。","boundary":"限于具有明确函数族和可执行规则的合成任务；程序执行由工具完成。 有限示例一般允许多个规则，识别依赖假设空间；见 PDF p.9。","evidence":"§3 SolverLearner；§5；结论后的 Limitations。 2026-09-19 复核相关缓存页；未重跑实验。","checked":"2026-09-19","links":[{"label":"arXiv本地版本 2408.00114v2","url":"https://arxiv.org/abs/2408.00114v2"}],"note":"p015","priority":0},"aliases":[]},{"id":"P014","title":"VOYAGER: An Open-Ended Embodied Agent with Large Language Models","short":"VOYAGER","year":"2023","authors":"Guanzhi Wang; Yuqi Xie; Yunfan Jiang; Ajay Mandlekar; Chaowei Xiao; Yuke Zhu; Linxi “Jim” Fan; Anima Anandkumar","collected":true,"note":"p014","scope":"本地 PDF · 既有阅读笔记","summary":"在 Minecraft 中用自动课程、可执行技能库和反馈驱动的代码修正实现持续探索与技能积累。","boundary":"通过 Mineflayer JavaScript API 和结构化环境状态控制游戏；未训练模型权重，也未实现真实机器人上的终身学习。","evidence":"摘要；方法 §2；实验 §3.3；局限 §4。","sources":["abductive/23_VOYAGER_An Open-Ended Embodied Agent with Large Language Models.pdf"],"sha256":"769a4e33ddeeb73870849232eece49afe882c2d146362e33917ccb432ba0efb8","pages":42,"links":[{"label":"arXiv本地版本 2305.16291v2","url":"https://arxiv.org/abs/2305.16291v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"core"}],"annotation":{"id":"P014","title":"VOYAGER: An Open-Ended Embodied Agent with Large Language Models","year":"2023","authors":"Guanzhi Wang; Yuqi Xie; Yunfan Jiang; Ajay Mandlekar; Chaowei Xiao; Yuke Zhu; Linxi “Jim” Fan; Anima Anandkumar","teams":[],"topics":["world_model"],"rqs":["W1d"],"collected":true,"review_status":"existing_notes","question":"以代码技能外部记忆实现组合和迁移，配合自适应课程扩大探索范围。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在 Minecraft 中用自动课程、可执行技能库和反馈驱动的代码修正实现持续探索与技能积累。","input_conditions":"通过 Mineflayer JavaScript API 和结构化环境状态控制游戏；未训练模型权重，也未实现真实机器人上的终身学习。","training_supervision":"GPT-4 提议技能与代码，利用执行错误、环境反馈和自检反复修改；成功技能存入库，按任务检索重用。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"160 次提示迭代内发现 63 种物品，约为对照的 3.3 倍；探索距离 2.3 倍，关键科技里程碑最多快 15.3 倍；演示新地图任务迁移。","boundary":"【作者】API 成本高，代码生成/自检失败和不可完成的幻觉任务仍存在；【解读】技能迁移限于同一游戏/API 体系。","evidence":"摘要；方法 §2；实验 §3.3；局限 §4。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2305.16291v2","url":"https://arxiv.org/abs/2305.16291v2"}],"note":"p014","priority":0},"aliases":[]},{"id":"P013","title":"Sequential Modeling Enables Scalable Learning for Large Vision Models","short":"Sequential Modeling Enables Scalable Learning for Large Vision Models","year":"2024 / 2023","authors":"Yutong Bai; Xinyang Geng; Karttikeya Mangalam; Amir Bar; Alan Yuille; Trevor Darrell; Jitendra Malik; Alexei A. Efros","collected":true,"note":"p013","scope":"本地 PDF · 既有阅读笔记","summary":"把图像、视频和视觉标注统一为视觉句子，使用下一 token 预测训练无需语言输入的大视觉模型。","boundary":"任务由示例图像定义，输出为视觉 token；训练与评价不证明任意视觉任务均能零样本解决。","evidence":"摘要；方法 §4；规模实验 §5.1/图3–4；局限 §6。","sources":["abductive/23_Sequential Modeling Enables Scalable Learning for Large Vision Models.pdf"],"sha256":"6e6272927d093a531405429818c6067df826310ba8983a8a2968bb8d117c390e","pages":33,"links":[{"label":"arXiv本地版本 2312.00785v1","url":"https://arxiv.org/abs/2312.00785v1"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P013","title":"Sequential Modeling Enables Scalable Learning for Large Vision Models","year":"2024 / 2023","authors":"Yutong Bai; Xinyang Geng; Karttikeya Mangalam; Amir Bar; Alan Yuille; Trevor Darrell; Jitendra Malik; Alexei A. Efros","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"构建统一视觉序列表示并展示多任务视觉提示和模型/数据扩展趋势。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把图像、视频和视觉标注统一为视觉句子，使用下一 token 预测训练无需语言输入的大视觉模型。","input_conditions":"任务由示例图像定义，输出为视觉 token；训练与评价不证明任意视觉任务均能零样本解决。","training_supervision":"VQGAN 将图像离散化，再用自回归 Transformer 学习跨图像序列；在 420B 视觉 token 上训练 300M、600M、1B、3B 模型。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"420B token 约对应 1.64B 图像；文中语义分割视觉序列困惑度随规模从 23.1（300M）降到 14.0（3B），并展示类比、视频预测等视觉提示结果。","boundary":"【作者】视觉提示可能欠约束，tokenizer 与视频数据质量导致失败；算力限制了消融，对真正的涌现/泛化尚无定论。","evidence":"摘要；方法 §4；规模实验 §5.1/图3–4；局限 §6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2312.00785v1","url":"https://arxiv.org/abs/2312.00785v1"}],"note":"p013","priority":0},"aliases":[]},{"id":"P012","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","short":"Reflexion","year":"2023","authors":"Noah Shinn; Federico Cassano; Ashwin Gopinath; Karthik Narasimhan; Shunyu Yao","collected":true,"note":"p012","scope":"本地 PDF · 既有阅读笔记","summary":"让语言智能体把失败反馈总结成文字反思，并在后续尝试中利用记忆改进决策。","boundary":"不更新模型参数；依赖可重复尝试、可获得反馈的环境，所谓 verbal RL 与梯度训练式 RL 不同。","evidence":"摘要；§3；§4.3；局限 §5。","sources":["abductive/23_NeurIPS-reflexion-language-agents-with-verbal-reinforcement-learning-Paper-Conference.pdf"],"sha256":"efba04cd48b779131fc4c3c58ae49e8523ded534f9225a7c57c7bdad0823803d","pages":19,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"support"},{"rq":"X3b","role":"core"}],"annotation":{"id":"P012","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","year":"2023","authors":"Noah Shinn; Federico Cassano; Ashwin Gopinath; Karthik Narasimhan; Shunyu Yao","teams":[],"topics":["world_model"],"rqs":["W1d","X3b"],"collected":true,"review_status":"existing_notes","question":"提出 actor—evaluator—self-reflection 框架，以语言记忆实现跨尝试改进。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"让语言智能体把失败反馈总结成文字反思，并在后续尝试中利用记忆改进决策。","input_conditions":"不更新模型参数；依赖可重复尝试、可获得反馈的环境，所谓 verbal RL 与梯度训练式 RL 不同。","training_supervision":"执行任务后由外部或内部评价器给出反馈，生成反思并写入有限情节记忆，下次提示时检索/拼接；在 ALFWorld、HotpotQA 和代码任务验证。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"论文报告 HumanEval 91% pass@1，相较引用的 GPT-4 80%；该数值来自允许反馈与迭代的完整协议，不能等同无反馈单次生成准确率。","boundary":"【作者】可能停在局部最优，记忆窗口有限；生成的测试不足以可靠检验非确定性、外部 API 或并发程序。","evidence":"摘要；§3；§4.3；局限 §5。","checked":"2026-09-15","links":[],"note":"p012","priority":0},"aliases":[]},{"id":"P011","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","short":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","year":"2024","authors":"Zhaofeng Wu; Linlu Qiu; Alexis Ross; Ekin Akyürek; Boyuan Chen; Bailin Wang; Najoung Kim; Jacob Andreas; Yoon Kim","collected":true,"note":"p011","scope":"本地 PDF · 既有阅读笔记","summary":"用改变默认规则的反事实任务区分可迁移推理与对熟悉任务模式的依赖。","boundary":"任务包括算术、代码、逻辑、空间、音乐和游戏；研究基于指定的 2023 版闭源模型，不是对全部 LLM 的不可推理证明。","evidence":"摘要；框架 §2；结果 §4；分析 §5；局限 §7。","sources":["abductive/23_limitations of llm through counterfactual tasks.pdf"],"sha256":"c7e3f360460c7a66c6d1329891aabebf7bff4e1ef4ee67896538d803d5dec75b","pages":49,"links":[{"label":"arXiv本地版本 2307.02477v3","url":"https://arxiv.org/abs/2307.02477v3"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"}],"annotation":{"id":"P011","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","year":"2024","authors":"Zhaofeng Wu; Linlu Qiu; Alexis Ross; Ekin Akyürek; Boyuan Chen; Bailin Wang; Najoung Kim; Jacob Andreas; Yoon Kim","teams":[],"topics":["world_model"],"rqs":["W2a"],"collected":true,"review_status":"existing_notes","question":"构造 11 类任务的默认/反事实配对评测，并加入反事实规则理解检查及不同提示条件。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用改变默认规则的反事实任务区分可迁移推理与对熟悉任务模式的依赖。","input_conditions":"任务包括算术、代码、逻辑、空间、音乐和游戏；研究基于指定的 2023 版闭源模型，不是对全部 LLM 的不可推理证明。","training_supervision":"保持任务结构、改动进制/索引/坐标/游戏规则等条件，比较 GPT-4、GPT-3.5、Claude、PaLM-2，控制 CoT 与 few-shot 提示。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"11 项任务整体呈现反事实条件下显著且一致的性能下降；few-shot 能缩小但不能消除差距，理解规则也不保证正确执行。","boundary":"【作者】默认与反事实任务难度不总能严格匹配，预训练内容未知，结果可能高估或低估能力；【解读】分布偏移与抽象推理失败不能完全分离。","evidence":"摘要；框架 §2；结果 §4；分析 §5；局限 §7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2307.02477v3","url":"https://arxiv.org/abs/2307.02477v3"}],"note":"p011","priority":0},"aliases":[]},{"id":"P030","title":"AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs","short":"AbductiveMLLM","year":"2026","authors":"Boyu Chang; Qi Wang; Xi Guo; Zhixiong Nan; Yazhou Yao; Tianfei Zhou","collected":true,"note":"p030","scope":"本地 PDF · 既有阅读笔记","summary":"结合语言假设筛选与图像想象，增强多模态模型对缺失视觉事件的溯因推理。","boundary":"标准 VAR 任务中的解释生成；想象画面属于条件生成，不能作为对真实隐藏事件的新观测证据。","evidence":"摘要；REASONER/IMAGINER 方法；实验表格；表6及结论。","sources":["abductive/26_AbductiveMLLM_Boosting Visual Abductive Reasoning Within MLLMs.pdf"],"sha256":"2e9d58f9985c584aa48d97dbf51d1f7b98f81da5cc7bacd01997e66b8e388ea0","pages":9,"links":[{"label":"arXiv本地版本 2601.02771v1","url":"https://arxiv.org/abs/2601.02771v1"},{"label":"DOI正式记录","url":"https://doi.org/10.1609/aaai.v40i4.37258"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P030","title":"AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs","year":"2026","authors":"Boyu Chang; Qi Wang; Xi Guo; Zhixiong Nan; Yazhou Yao; Tianfei Zhou","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"REASONER 与 IMAGINER 双模块联合学习：前者筛选假设，后者用扩散视觉表示辅助解释。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"结合语言假设筛选与图像想象，增强多模态模型对缺失视觉事件的溯因推理。","input_conditions":"标准 VAR 任务中的解释生成；想象画面属于条件生成，不能作为对真实隐藏事件的新观测证据。","training_supervision":"LLM 根据视频描述提出候选，经因果相关对比学习筛选；条件扩散模块通过适配器融合视频和推理表示，联合优化语言与图像分支。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"作者在标准 VAR 基准报告优于所列传统模型和 MLLM；消融显示去掉 IMAGINER 或其适配器会降低 CIDEr 等生成指标。","boundary":"【解读】生成图像可能强化错误假设；依赖视频描述、候选覆盖和训练数据，自动文本指标不直接证明因果解释正确。","evidence":"摘要；REASONER/IMAGINER 方法；实验表格；表6及结论。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.02771v1","url":"https://arxiv.org/abs/2601.02771v1"},{"label":"DOI正式记录","url":"https://doi.org/10.1609/aaai.v40i4.37258"}],"note":"p030","priority":0},"aliases":[]},{"id":"P029","title":"VideoDiff: Human-AI Video Co-Creation with Alternatives","short":"VideoDiff","year":"2025","authors":"Mina Huh; Ding Li; Kim Pimmel; Hijung Valentina Shin; Amy Pavel; Mira Dontcheva","collected":true,"note":"p029","scope":"本地 PDF · 既有阅读笔记","summary":"用对齐时间轴、转录文本和差异高亮，帮助视频创作者比较、筛选和修改多种 AI 剪辑方案。","boundary":"对用户已有素材提供编辑建议/组合，未训练新的通用视频生成模型。","evidence":"§3；§4.3；§5.1–5.3；§6–7。","sources":["abductive/25_VideoDiff_Human-AI Video Co-Creation with Alternatives.pdf"],"sha256":"4387e6879b388b1371bad2857839323e56437fdc255065cc2245000586305adc","pages":19,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3706598.3713417"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"core"}],"annotation":{"id":"P029","title":"VideoDiff: Human-AI Video Co-Creation with Alternatives","year":"2025","authors":"Mina Huh; Ding Li; Kim Pimmel; Hijung Valentina Shin; Amy Pavel; Mira Dontcheva","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"围绕 rough cut、B-roll 和文字效果的多方案共创交互。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用对齐时间轴、转录文本和差异高亮，帮助视频创作者比较、筛选和修改多种 AI 剪辑方案。","input_conditions":"对用户已有素材提供编辑建议/组合，未训练新的通用视频生成模型。","training_supervision":"8 名专业创作者形成性研究；实现 React/D3/Remotion 界面，Whisper 转录与 GPT-4o 编辑建议；12 人被试内对照和 3 个真实素材案例。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"对“理解差异的有用性”评价均值为 4.92 vs 基线 2.25（p&lt;0.05）；参与者更易比较和定制，并报告更满意的创作结果。","boundary":"【解读】小样本短期研究，比较的是特定基线；转录/语言主导流程可能遗漏视觉细节，偏好与专业成片质量不同。","evidence":"§3；§4.3；§5.1–5.3；§6–7。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3706598.3713417"}],"note":"p029","priority":0},"aliases":[]},{"id":"P028","title":"Video models are zero-shot learners and reasoners","short":"Video models are zero-shot learners and reasoners","year":"2025","authors":"Thaddäus Wiedemer; Yuxuan Li; Paul Vicol; Shixiang Shane Gu; Nick Matarese; Kevin Swersky; Been Kim; Priyank Jaini; Robert Geirhos","collected":true,"note":"p028","scope":"本地 PDF · 既有阅读笔记","summary":"探索 Veo 3 能否仅通过提示执行感知、操作和视觉推理任务，提出视频模型具备通用视觉能力的早期证据。","boundary":"Veo API 连同 LLM prompt rewriter 作为黑盒；作者承认部分答案可能来自重写器。best-frame 和 pass@10 不是单次最终输出表现。","evidence":"§2；§4 及图3–9；§5。","sources":["abductive/25_Video models are zero-shot learners and reasoners.pdf"],"sha256":"e4bb6ec0a03c7a08e7fedf5beb10e54fbdbb54f6de4569fbb87883ad8b498219","pages":46,"links":[{"label":"arXiv本地版本 2509.20328v2","url":"https://arxiv.org/abs/2509.20328v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2d","role":"core"}],"annotation":{"id":"P028","title":"Video models are zero-shot learners and reasoners","year":"2025","authors":"Thaddäus Wiedemer; Yuxuan Li; Paul Vicol; Shixiang Shane Gu; Nick Matarese; Kevin Swersky; Been Kim; Priyank Jaini; Robert Geirhos","teams":[],"topics":["world_model"],"rqs":["W2d"],"collected":true,"review_status":"existing_notes","question":"跨任务定性探索及 7 类任务定量评估，涵盖分割、边缘检测、编辑、迷宫、对称和类比。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"探索 Veo 3 能否仅通过提示执行感知、操作和视觉推理任务，提出视频模型具备通用视觉能力的早期证据。","input_conditions":"Veo API 连同 LLM prompt rewriter 作为黑盒；作者承认部分答案可能来自重写器。best-frame 和 pass@10 不是单次最终输出表现。","training_supervision":"输入图像及任务提示生成 8 秒视频，再按任务读取最好/最后一帧；比较 Veo 2、Veo 3 和图像/语言基线。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Veo 3 在多任务中明显优于 Veo 2，增加尝试次数提升成功率；边缘检测在 BIPEDv2 的 50 张测试图评测，分割只测 50 张较容易的 LVIS 图。","boundary":"【作者/设定】专用模型仍更强、成功不稳定，训练数据不可见；【解读】挑最好帧/多次尝试会高估实际可直接使用的可靠性。","evidence":"§2；§4 及图3–9；§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2509.20328v2","url":"https://arxiv.org/abs/2509.20328v2"}],"note":"p028","priority":0},"aliases":[]},{"id":"P027","title":"VCD: A Dataset for Visual Commonsense Discovery in Images","short":"VCD","year":"2025","authors":"Xiangqing Shen; Fanfan Wang; Siwei Wu; Rui Xia","collected":true,"note":"p027","scope":"本地 PDF · 既有阅读笔记","summary":"VCD 将物体框与可见、不可见常识三元组连接，支持图像中的常识发现。","boundary":"静态图片、区域级常识生成；尚未覆盖视频时序和动态因果。","evidence":"§3；表3–5；Limitations。","sources":["abductive/25_VCD_A Dataset for Visual Commonsense Discovery in Images.pdf"],"sha256":"8fde486cc3f7096a777b415c3b45f71bd4d074255948644b0f7daf9eeea921da","pages":16,"links":[{"label":"arXiv本地版本 2402.17213v2","url":"https://arxiv.org/abs/2402.17213v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P027","title":"VCD: A Dataset for Visual Commonsense Discovery in Images","year":"2025","authors":"Xiangqing Shen; Fanfan Wang; Siwei Wu; Rui Xia","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"超过 100K 图片、14M 物体—常识对，以及 Seen/Unseen、Property/Action/Space 层级分类；训练 VCM 基线。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"VCD 将物体框与可见、不可见常识三元组连接，支持图像中的常识发现。","input_conditions":"静态图片、区域级常识生成；尚未覆盖视频时序和动态因果。","training_supervision":"结合 Visual Genome 与 ConceptNet，映射/扩展三元组并进行质量控制，再用指令微调视觉语言模型生成常识。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"ImageNetVC 平均分由 OFA 80.7 到 VCM 83.5；Qwen-VL-7B 加常识后 OK-VQA 从 58.6 到 60.0。人评对 GPT-4o 的 Unseen 胜/平/负为 41%/29%/30%。","boundary":"【作者】下游验证较简单、仅静态图像；【解读】大量自动构造常识可能保留知识库偏差，规模不代表每条均正确。","evidence":"§3；表3–5；Limitations。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2402.17213v2","url":"https://arxiv.org/abs/2402.17213v2"}],"note":"p027","priority":0},"aliases":[]},{"id":"P025","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","short":"Reasoning with Sampling","year":"2025","authors":"Aayush Karan; Yilun Du","collected":true,"note":"p025","scope":"本地 PDF · 既有阅读笔记","summary":"不训练模型或使用验证器，而通过基础模型自身似然驱动的采样提升推理表现。","boundary":"需要访问模型似然和反复生成/打分；single-shot 指最终提交一条答案，不代表只进行一次采样计算。","evidence":"§4 算法1；§5.2 表1；计算分析及 §6。","sources":["abductive/25_Reasoning with Sampling_Your Base Model is Smarter Than You Think.pdf"],"sha256":"8f029968f20292b320dda95d253911a187e34a18d33aa6cdc65883b9cc1a47d4","pages":20,"links":[{"label":"arXiv本地版本 2510.14901v1","url":"https://arxiv.org/abs/2510.14901v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P025","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","year":"2025","authors":"Aayush Karan; Yilun Du","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"用自回归 MCMC 近似从幂分布采样，研究 RL 后训练之外的能力激发方式。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"不训练模型或使用验证器，而通过基础模型自身似然驱动的采样提升推理表现。","input_conditions":"需要访问模型似然和反复生成/打分；single-shot 指最终提交一条答案，不代表只进行一次采样计算。","training_supervision":"按块扩展序列，随机位置重采样后缀，用 Metropolis–Hastings 接受率逼近 p(x)^α；测试数学、代码、科学及一般帮助性。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"MATH500/GPQA 上部分设置接近 GRPO，HumanEval 和 AlpacaEval 部分设置更高；保持较好的多样性。收益需结合模型与采样预算看表1，不能统一为所有模型提升同一百分比。","boundary":"【作者/设定】精确幂分布采样不可行，采用近似且计算昂贵；【解读】高似然并非正确性保证，省训练不等于省总算力。","evidence":"§4 算法1；§5.2 表1；计算分析及 §6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2510.14901v1","url":"https://arxiv.org/abs/2510.14901v1"}],"note":"p025","priority":0},"aliases":[]},{"id":"P024","title":"Nested Learning: The Illusion of Deep Learning Architecture","short":"Nested Learning","year":"2025","authors":"Ali Behrouz; Meisam Razaviyayn; Peilin Zhong; Vahab Mirrokni","collected":true,"note":"p024","scope":"本地 PDF · 既有阅读笔记","summary":"把网络、优化器和记忆统一为不同更新频率的嵌套优化过程，并据此设计连续记忆系统和 Hope。","boundary":"提供理论重述与具体原型实验；作者明确表示未普遍解决灾难性遗忘。标题按首页单数 Architecture，元数据为 Architectures。","evidence":"§3–8；§9、表1–5；§10 的 Is Catastrophic Forgetting Solved?。","sources":["abductive/25_Nested Learning.pdf"],"sha256":"e87a9ce82ff24e96f55b83fb9713a5d6fc9e4a1a232c12d42da49c10022ed891","pages":52,"links":[{"label":"arXiv本地版本 2512.24695v1","url":"https://arxiv.org/abs/2512.24695v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3a","role":"support"}],"annotation":{"id":"P024","title":"Nested Learning: The Illusion of Deep Learning Architecture","year":"2025","authors":"Ali Behrouz; Meisam Razaviyayn; Peilin Zhong; Vahab Mirrokni","teams":[],"topics":["world_model"],"rqs":["W3a"],"collected":true,"review_status":"existing_notes","question":"提出 NL 视角、表达力更强的优化器、自修改学习模块和 Continuum Memory System。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把网络、优化器和记忆统一为不同更新频率的嵌套优化过程，并据此设计连续记忆系统和 Hope。","input_conditions":"提供理论重述与具体原型实验；作者明确表示未普遍解决灾难性遗忘。标题按首页单数 Architecture，元数据为 Architectures。","training_supervision":"将梯度/上下文压缩解释为关联记忆；设计多个时间尺度更新的 MLP 记忆、M3 优化器，以及结合自指 Titans 的 Hope。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在语言建模、知识更新、形式语言和长上下文任务中展示收益；如表1 16K UUID 检索 Hope 24.8%、Titans 21.2%、Transformer 40.8%，说明优势取决于任务，非全面领先。","boundary":"【作者】有限容量的压缩仍带来遗忘；【解读】新概念的统一性不等于普适能力保证，需分别评价各组件、参数量和训练预算。","evidence":"§3–8；§9、表1–5；§10 的 Is Catastrophic Forgetting Solved?。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2512.24695v1","url":"https://arxiv.org/abs/2512.24695v1"}],"note":"p024","priority":0},"aliases":[]},{"id":"P023","title":"Generalizable Reasoning through Compositional Energy Minimization","short":"Generalizable Reasoning through Compositional Energy Minimization","year":"2025","authors":"Alexandru Oarga; Yilun Du","collected":true,"note":"p023","scope":"本地 PDF · 既有阅读笔记","summary":"先学习小子问题的能量函数，再在测试时组合约束求解更大、更复杂的问题。","boundary":"N-Queens、3-SAT、图着色和填字；子问题分解由任务结构提供，不是自动发现任意问题分解。","evidence":"§3；表1 p6；§4；§5。","sources":["abductive/25_Generalizable Reasoning through Compositional Energy Minimization.pdf"],"sha256":"26f0122c9977bee78286c8587ae868a3fe2db86dc60f7dabe4a4710c6ac3f5f9","pages":22,"links":[{"label":"arXiv本地版本 2510.20607v1","url":"https://arxiv.org/abs/2510.20607v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P023","title":"Generalizable Reasoning through Compositional Energy Minimization","year":"2025","authors":"Alexandru Oarga; Yilun Du","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"组合能量景观与 Parallel Energy Minimization（PEM），支持增加约束和计算预算。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"先学习小子问题的能量函数，再在测试时组合约束求解更大、更复杂的问题。","input_conditions":"N-Queens、3-SAT、图着色和填字；子问题分解由任务结构提供，不是自动发现任意问题分解。","training_supervision":"扩散与对比损失训练局部能量函数；求和形成全局目标，用多个并行候选进行能量最小化和筛选。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"只用一个 8 皇后训练实例时，P=1024 的方法在 100 次生成中得到 97 个有效解，表1最强比较设置为 41 个。","boundary":"【作者】高斯初始化/增量限制，图着色仍未充分达到最优；【解读】并行采样成本显著，不能把 97% 视为单一低成本轨迹成功率。","evidence":"§3；表1 p6；§4；§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2510.20607v1","url":"https://arxiv.org/abs/2510.20607v1"}],"note":"p023","priority":0},"aliases":[]},{"id":"P022","title":"Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance","short":"Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance","year":"2025","authors":"Yufei He; Ruoyu Li; Alex Chen; Yue Liu; Yulin Chen; Yuan Sui; Cheng Chen; Yi Zhu; Luca Luo; Frank Yang; Bryan Hooi","collected":true,"note":"p022","scope":"本地 PDF · 既有阅读笔记","summary":"ARIA 识别知识缺口、向专家求助并维护带时间戳的知识库，以适应运行中变化的规则。","boundary":"更新主要是外部知识库；TikTok Pay 部署和用户覆盖是论文自述，不能将平台月活当作实验人数；公开 CUAD 实验用 LLM 模拟专家。","evidence":"§4；表1；§6.1–6.2/表4；Limitations。","sources":["abductive/25_Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance.pdf"],"sha256":"9a42692cacd30f0379aaa6d69bbbc4370208f53e0c08516c6d8fe84cd268ce0b","pages":30,"links":[{"label":"arXiv本地版本 2507.17131v2","url":"https://arxiv.org/abs/2507.17131v2"}],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"core"},{"rq":"X3b","role":"core"}],"annotation":{"id":"P022","title":"Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance","year":"2025","authors":"Yufei He; Ruoyu Li; Alex Chen; Yue Liu; Yulin Chen; Yuan Sui; Cheng Chen; Yi Zhu; Luca Luo; Frank Yang; Bryan Hooi","teams":[],"topics":["world_model"],"rqs":["X2c","X3b"],"collected":true,"review_status":"existing_notes","question":"将主动询问、冲突消解和时效性知识更新结合，用于动态名称筛查与合同理解。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"ARIA 识别知识缺口、向专家求助并维护带时间戳的知识库，以适应运行中变化的规则。","input_conditions":"更新主要是外部知识库；TikTok Pay 部署和用户覆盖是论文自述，不能将平台月活当作实验人数；公开 CUAD 实验用 LLM 模拟专家。","training_supervision":"自对话评估不确定性，在查询预算内请求解释/纠错；抽取知识、加时间戳，检测冲突并澄清后检索用于后续决策。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"真实序列测试为 11,846 例（156 阳性）；CUAD 在 B=2000 时 GPT-4o+ARIA 准确率 0.6358，静态模型 0.4872，RAG 0.5735。","boundary":"【作者】依赖专家反馈质量和预算，运行开销未充分评测；【解读】模拟专家与人工长期使用存在差异。","evidence":"§4；表1；§6.1–6.2/表4；Limitations。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2507.17131v2","url":"https://arxiv.org/abs/2507.17131v2"}],"note":"p022","priority":0},"aliases":[]},{"id":"P021","title":"Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events","short":"Black Swan","year":"2025","authors":"Aditya Chinchure; Sahithya Ravi; Raymond Ng; Vered Shwartz; Boyang Li; Leonid Sigal","collected":true,"note":"p021","scope":"本地 PDF · 既有阅读笔记","summary":"以反常视频事件检验模型能否解释隐藏事件，以及获得新证据后修正原先假设。","boundary":"通过遮蔽或揭示视频片段构建 Forecaster/Detective/Reporter；是评测基准，未提出训练后消除缺陷的新模型。","evidence":"§3–5；表2和 §6.1；§7–8。","sources":["abductive/25_CVPR_Chinchure_Black_Swan_Abductive_and_Defeasible_Video_Reasoning_in_Unpredictable_Events.pdf"],"sha256":"91efca47ea0eadf531cb7523e3cf6f4016d01a79de26626f2b5748c87ecfc46d","pages":10,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P021","title":"Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events","year":"2025","authors":"Aditya Chinchure; Sahithya Ravi; Raymond Ng; Vered Shwartz; Boyang Li; Leonid Sigal","teams":[],"topics":["world_model"],"rqs":["W2b","X1c"],"collected":true,"review_status":"existing_notes","question":"面对意外视频事件，模型能否推断隐藏事件，并在新证据揭示时修正解释？","question_origin":"依作者任务定义改写","summary":"以反常视频事件检验模型能否解释隐藏事件，以及获得新证据后修正原先假设。","input_conditions":"通过遮蔽或揭示视频片段构建 Forecaster/Detective/Reporter；是评测基准，未提出训练后消除缺陷的新模型。","training_supervision":"分阶段给出视觉证据，评估溯因和可撤销推理；使用选择题准确率、CLIP/LLM 生成指标及人类评价。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表2 Detective MCQ：GPT-4o 65.1%、人类 90.0%，相差 24.9 个百分点；Reporter Y/N 为 60.1% vs 92.0%。注意本地表2图注与表头存在任务名称不一致，以上按表头及正文解释。","boundary":"【解读】反常事件样本有选择偏差，感知失败与推理失败相互影响；开放式解释评价依赖参考与评价器。","evidence":"§3–5；表2和 §6.1；§7–8。","checked":"2026-09-15","links":[],"note":"p021","priority":0},"aliases":[],"research_question":{"kind":"依作者任务定义改写","text":"面对意外视频事件，模型能否推断隐藏事件，并在新证据揭示时修正解释？","location":"PDF pp.1–3；Forecaster / Detective / Reporter 设置"}},{"id":"P040","title":"Collaposer: Transforming Photo Collections into Visual Assets for Storytelling with Collages","short":"Collaposer","year":"2026","authors":"Jiayi Zhou; Liwenhan Xie; Jiaju Ma; Zheng Wei; Huamin Qu; Anyi Rao","collected":true,"note":"p040","scope":"本地 PDF · 既有阅读笔记","summary":"Collaposer 根据故事描述从照片集合中提取和组织可用于拼贴的视觉素材。","boundary":"从输入照片提取切图并由用户构图；动画属于演示延伸，不是自主生成完整视频故事。","evidence":"§3；§4；§6–7；§9。","sources":["abductive/Transforming Photo Collections into Visual Assets for Storytelling.pdf"],"sha256":"e579dd9e6132c26dbbbce515aba82204f8f109cd0a5f5c543472a6e717ae5c82","pages":19,"links":[{"label":"arXiv本地版本 2601.18428v1","url":"https://arxiv.org/abs/2601.18428v1"},{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3791160"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P040","title":"Collaposer: Transforming Photo Collections into Visual Assets for Storytelling with Collages","year":"2026","authors":"Jiayi Zhou; Liwenhan Xie; Jiaju Ma; Zheng Wei; Huamin Qu; Anyi Rao","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"把自动标注/检测/分割与故事驱动的语义选择、分层聚类展示结合。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"Collaposer 根据故事描述从照片集合中提取和组织可用于拼贴的视觉素材。","input_conditions":"从输入照片提取切图并由用户构图；动画属于演示延伸，不是自主生成完整视频故事。","training_supervision":"6 名专家形成性访谈；流水线预处理照片，LLM 选择中心及相关标签，再按语义层次布局；12 人与两种消融基线被试内比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"12 人共创作 36 个静态拼贴故事、尝试 45 个提示；使用完整系统均一次获得可用素材集，故事匹配、多样性和可用性评价优于消融。","boundary":"【作者】文字意图可能错配，选择依据透明性不足；【解读】小样本且基线为消融，不能推断相对全部专业工具的效率优势。","evidence":"§3；§4；§6–7；§9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.18428v1","url":"https://arxiv.org/abs/2601.18428v1"},{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3791160"}],"note":"p040","priority":0},"aliases":[]},{"id":"P039","title":"Make-a-Story: Visual Memory Conditioned Consistent Story Generation","short":"Make-a-Story","year":"2023","authors":"Tanzila Rahman; Hsin-Ying Lee; Jian Ren; Sergey Tulyakov; Shweta Mahajan; Leonid Sigal","collected":true,"note":"p039","scope":"本地 PDF · 既有阅读笔记","summary":"以视觉记忆支持带指代的故事可视化，保持角色与背景跨图一致。","boundary":"根据句子序列生成故事帧，主要是动画/游戏域；不是连续动作的长视频生成。","evidence":"§3；§4–5；§6。","sources":["abductive/Rahman_Make-a-Story_Visual_Memory_Conditioned_Consistent_Story_Generation_CVPR_2023_paper.pdf"],"sha256":"f15cd145c1869ec4b7661371bea534f5649cc8fa07eb39f3613b91c555c971da","pages":10,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P039","title":"Make-a-Story: Visual Memory Conditioned Consistent Story Generation","year":"2023","authors":"Tanzila Rahman; Hsin-Ying Lee; Jian Ren; Sergey Tulyakov; Shweta Mahajan; Leonid Sigal","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"自回归 Story-LDM 及句子条件记忆注意力，并扩展 MUGEN/Flintstones 的指代设置。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以视觉记忆支持带指代的故事可视化，保持角色与背景跨图一致。","input_conditions":"根据句子序列生成故事帧，主要是动画/游戏域；不是连续动作的长视频生成。","training_supervision":"潜在扩散逐帧生成，当前句子对过去图像和文本记忆做软注意力，以解析 he/she/they 等角色或背景指代。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"MUGEN、PororoSV、FlintstonesSV 上的图像质量、故事一致性和人评优于所列前作；同时演示保持一致与按情节改变背景。","boundary":"【解读】角色集合和视觉域较有限，自回归错误可能累积；一致性指标不能完整衡量故事叙事质量。","evidence":"§3；§4–5；§6。","checked":"2026-09-15","links":[],"note":"p039","priority":0},"aliases":[]},{"id":"P038","title":"“I’m Not Sure, But...”: Examining the Impact of Large Language Models’ Uncertainty Expression on User Reliance and Trust","short":"“I’m Not Sure, But...”","year":"2024","authors":"Sunnie S. Y. Kim; Q. Vera Liao; Mihaela Vorvoreanu; Stephanie Ballard; Jennifer Wortman Vaughan","collected":true,"note":"p038","scope":"本地 PDF · 既有阅读笔记","summary":"研究 LLM 用不同自然语言方式表达不确定性时，用户依赖、信任和任务表现如何变化。","boundary":"虚构 AI 搜索系统中的医学事实是非题；操控表达，不训练或校准模型的真实不确定性。","evidence":"§3 预注册设计；§4；§5.1；§6。","sources":["abductive/kim_24FAccT_Examining the Impact of Large Language Models' Uncertainty Expression on User Reliance and Trust.pdf"],"sha256":"2fe292249e998fb7c0158f8f63a30b65b9d4f560407b0625bf728ff2f7dc5f30","pages":14,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3630106.3658941"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P038","title":"“I’m Not Sure, But...”: Examining the Impact of Large Language Models’ Uncertainty Expression on User Reliance and Trust","year":"2024","authors":"Sunnie S. Y. Kim; Q. Vera Liao; Mihaela Vorvoreanu; Stephanie Ballard; Jennifer Wortman Vaughan","teams":[],"topics":["hci"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"预注册、N=404 的受控人类实验，区分第一人称、一般视角及无不确定性表达。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"研究 LLM 用不同自然语言方式表达不确定性时，用户依赖、信任和任务表现如何变化。","input_conditions":"虚构 AI 搜索系统中的医学事实是非题；操控表达，不训练或校准模型的真实不确定性。","training_supervision":"随机分组，对照有/无 AI 与不同措辞；用行为、答案正确性、信心和自报信任评价，并区分确认性/探索性分析。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"第一人称表达降低对系统信心与跟随率、提高用户准确率；一般视角效应较弱且未达显著。过度依赖仍存在，无 AI 组总体任务表现最好。","boundary":"【解读】单一任务和短期实验限制外推；谨慎措辞不是校准概率，也可能降低对正确答案的依赖。","evidence":"§3 预注册设计；§4；§5.1；§6。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3630106.3658941"}],"note":"p038","priority":0},"aliases":[]},{"id":"P037","title":"SLM-MUX: Orchestrating Small Language Models for Reasoning","short":"SLM-MUX","year":"2026","authors":"Chenyu Wang; Zishen Wan; Hao Kang; Emma Chen; Zhiqiang Xie; Tushar Krishna; Vijay Janapa Reddi; Yilun Du","collected":true,"note":"p037","scope":"本地 PDF · 既有阅读笔记","summary":"让多个小模型独立作答，用一致性选择结果，并搜索互补模型组合。","boundary":"使用固定模型组合及验证集；非模型间讨论，置信度主要以重复答案频次近似。","evidence":"§3；§4；§5 Limitation and Future Work。","sources":["abductive/26_SLM-MUX_ORCHESTRATING SMALL LANGUAGE MODELS FOR REASONING.pdf"],"sha256":"a554693e80b40655b26e8479b00deb394efbb520aa37baba4cb6fac58fd96ad1","pages":27,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P037","title":"SLM-MUX: Orchestrating Small Language Models for Reasoning","year":"2026","authors":"Chenyu Wang; Zishen Wan; Hao Kang; Emma Chen; Zhiqiang Xie; Tushar Krishna; Vijay Janapa Reddi; Yilun Du","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"SLM-MUX、模型子集搜索与配套测试时计算分配方案。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"让多个小模型独立作答，用一致性选择结果，并搜索互补模型组合。","input_conditions":"使用固定模型组合及验证集；非模型间讨论，置信度主要以重复答案频次近似。","training_supervision":"每个模型多次采样，取自身众数并比较一致性；按 union accuracy 与冲突惩罚搜索组合，平局用验证准确率处理。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"论文报告相对既有编排方法最高提升 MATH 13.4、GPQA 8.8、GSM8K 7.0 个百分点；选定两个小模型的组合可在部分任务超过 Qwen2.5-72B。","boundary":"【作者】穷举组合开销高且静态，一致性高也可能一致地错；【解读】需将多模型多次采样成本纳入比较。","evidence":"§3；§4；§5 Limitation and Future Work。","checked":"2026-09-15","links":[],"note":"p037","priority":0},"aliases":[]},{"id":"P036","title":"SimStep: Human-in-the-Loop Authoring of Interactive Educational Simulations Through Task-Level Abstractions","short":"SimStep","year":"2026","authors":"Zoe Kaputa; Anika Rajaram; Vryan Feliciano; Zhuoyue Lyu; Maneesh Agrawala; Hariharan Subramonyam","collected":true,"note":"p036","scope":"本地 PDF · 既有阅读笔记","summary":"通过可检查、可修改的任务级图表示，让教师逐步创作并调试互动教学模拟。","boundary":"实现的是模拟创作与纠错工具；没有证明学生学习成绩改善或仿真物理绝对正确。","evidence":"§3–5；§6.2；§7/表5；§8.3。","sources":["abductive/26_SimStep_Human-in-the-Loop Authoring of Interactive Educational Simulations Through Task-Level Abstractions.pdf"],"sha256":"3eca89598fa6497b0ecd0c6fd84398cfbacc158792df23ae34e5e85bdc3ed648","pages":34,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3791514"}],"verified":"2026-09-15","mappings":[{"rq":"W3d","role":"core"},{"rq":"X4a","role":"core"}],"annotation":{"id":"P036","title":"SimStep: Human-in-the-Loop Authoring of Interactive Educational Simulations Through Task-Level Abstractions","year":"2026","authors":"Zoe Kaputa; Anika Rajaram; Vryan Feliciano; Zhuoyue Lyu; Maneesh Agrawala; Hariharan Subramonyam","teams":[],"topics":["world_model"],"rqs":["W3d","X4a"],"collected":true,"review_status":"existing_notes","question":"Chain-of-Abstractions 及 inverse correction，将概念、场景、学习目标、UI 与代码衔接。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过可检查、可修改的任务级图表示，让教师逐步创作并调试互动教学模拟。","input_conditions":"实现的是模拟创作与纠错工具；没有证明学生学习成绩改善或仿真物理绝对正确。","training_supervision":"教师在抽象图上验证和编辑，Claude 生成/修改代码；自动测试和图形回溯定位隐含假设；进行教师使用与抽象保真度研究。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"11 名教师体验研究的 1–6 分可用性均值 4.66（SD 0.36）；66 个模拟由 162 名 Prolific 参与者评价抽象保真度，概念图完整/连贯性 2.61/3。","boundary":"【作者】Prolific 评价者学科/教龄等信息未收集；【解读】短期创作体验不等于课堂效果，自动修复仍需人工核查。","evidence":"§3–5；§6.2；§7/表5；§8.3。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3791514"}],"note":"p036","priority":0},"aliases":[]},{"id":"P035","title":"Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation","short":"Mind-Brush","year":"2026","authors":"Jun He; Junyan Ye; Zilong Huang; Dongzhi Jiang; Chenjue Zhang; Leqi Zhu; Renrui Zhang; Xiang Zhang; Weijia Li","collected":true,"note":"p035","scope":"本地 PDF · 既有阅读笔记","summary":"以意图分析、主动搜索和显式推理补全图像生成所需的知识与隐含约束。","boundary":"调用既有搜索、推理与生成模型；输出符合事实的程度受检索资料和生成器制约。","evidence":"§3；§4；§5.3–5.4；§6。","sources":["abductive/26_Mind-Brush_Integrating Agentic Cognitive Search and Reasoning into Image Generation.pdf"],"sha256":"7b438d417f55156c2f8657fb74afedd81786a23c05c2bdb5b5a99b9385794488","pages":36,"links":[{"label":"arXiv本地版本 2602.01756v1","url":"https://arxiv.org/abs/2602.01756v1"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P035","title":"Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation","year":"2026","authors":"Jun He; Junyan Ye; Zilong Huang; Dongzhi Jiang; Chenjue Zhang; Leqi Zhu; Renrui Zhang; Xiang Zhang; Weijia Li","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"训练无需新增的 Mind-Brush 编排框架，以及含 500 个动态知识/推理样本的 Mind-Bench。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以意图分析、主动搜索和显式推理补全图像生成所需的知识与隐含约束。","input_conditions":"调用既有搜索、推理与生成模型；输出符合事实的程度受检索资料和生成器制约。","training_supervision":"检测认知缺口，搜索多模态证据、补充约束后生成；用 checklist-based strict accuracy（全部清单项通过）和 WISE/RISEBench 评价。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"完整框架在 Mind-Bench 的消融中比仅 reasoning agent 高 0.17、比仅 search agent 高 0.06 的准确率；另在 WISE/RISE 上取得所报改进。","boundary":"【解读】多模型调用成本高，清单覆盖和 MLLM 评价器可能漏检；“无需训练”只针对框架新增训练。","evidence":"§3；§4；§5.3–5.4；§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2602.01756v1","url":"https://arxiv.org/abs/2602.01756v1"}],"note":"p035","priority":0},"aliases":[]},{"id":"P034","title":"Lost in Transmission: When and Why LLMs Fail to Reason Globally","short":"Lost in Transmission","year":"2025 / 2026","authors":"Tobias Schnabel; Kiran Tomlinson; Adith Swaminathan; Jennifer Neville","collected":true,"note":"p034","scope":"本地 PDF · 既有阅读笔记","summary":"用注意力通信带宽受限模型解释 LLM 在跨输入全局推理上的失败。","boundary":"理论结论对所定义 BAPO 模型成立；经验结果支持带宽假说，未证明真实 Transformer 只有同样的严格上限。","evidence":"§2–3；§4；§6–7。","sources":["abductive/26_lost in transmission_when and why llm fail to reason.pdf"],"sha256":"9967dd46b0d1933065336b5d9d1ae994f04713da134b0099999ee7978a12e2d9","pages":39,"links":[{"label":"arXiv本地版本 2505.08140v5","url":"https://arxiv.org/abs/2505.08140v5"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P034","title":"Lost in Transmission: When and Why LLMs Fail to Reason Globally","year":"2025 / 2026","authors":"Tobias Schnabel; Kiran Tomlinson; Adith Swaminathan; Jennifer Neville","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"提出 Bounded Attention Prefix Oracle（BAPO），证明可达性等问题的带宽下界，并分析 CoT 如何缓解限制。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用注意力通信带宽受限模型解释 LLM 在跨输入全局推理上的失败。","input_conditions":"理论结论对所定义 BAPO 模型成立；经验结果支持带宽假说，未证明真实 Transformer 只有同样的严格上限。","training_supervision":"用 prefix/attention oracle 抽象信息流，区分 BAPO-easy/hard；在受控和现实任务上比较模型与 CoT 条件。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"GPT-4o、Claude、Gemini 对 easy 任务较强、对小规模 hard 任务也会失败；适当分解的 CoT 在理论模型中可把 hard 计算转化为逐步 easy 计算。","boundary":"【作者】真实有效带宽成因尚不清楚，部分下界较松；【解读】存在可用分解不保证模型会自动找到并可靠执行它。","evidence":"§2–3；§4；§6–7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2505.08140v5","url":"https://arxiv.org/abs/2505.08140v5"}],"note":"p034","priority":0},"aliases":[]},{"id":"P033","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","short":"Gen-Searcher","year":"2026","authors":"Kaituo Feng; Manyuan Zhang; Shawn Chen; Yunlong Lin; Kaixuan Fan; Yilei Jiang; Hongyu Li; Dian Zheng; Chenyang Wang; Xiangyu Yue（首页为 Shawn Chen，PDF 元数据为 Shuang Chen）","collected":true,"note":"p033","scope":"本地 PDF · 既有阅读笔记","summary":"为知识密集的图像生成训练多步搜索智能体，先找文字知识与参考图，再调用生成器。","boundary":"搜索代理增强已有图像生成器；输出仍受搜索质量、网页时效和生成器能力限制。","evidence":"§3 数据与训练；§4.1–4.4、表1–3；§5。","sources":["abductive/26_Gen-Searcher_Reinforcing Agentic Search for Image Generation.pdf"],"sha256":"26f20d758c0536cd6839012347e0f7bccc94a0add0d978870236cd6d5ad3343a","pages":20,"links":[{"label":"arXiv本地版本 2603.28767v2","url":"https://arxiv.org/abs/2603.28767v2"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P033","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","year":"2026","authors":"Kaituo Feng; Manyuan Zhang; Shawn Chen; Yunlong Lin; Kaixuan Fan; Yilei Jiang; Hongyu Li; Dian Zheng; Chenyang Wang; Xiangyu Yue（首页为 Shawn Chen，PDF 元数据为 Shuang Chen）","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"Gen-Searcher-SFT-10k/RL-6k 数据、KnowGen 基准和结合文字/图像反馈的 RL。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"为知识密集的图像生成训练多步搜索智能体，先找文字知识与参考图，再调用生成器。","input_conditions":"搜索代理增强已有图像生成器；输出仍受搜索质量、网页时效和生成器能力限制。","training_supervision":"Qwen3-VL-8B 先 SFT 再 agentic RL；工具执行搜索/浏览，双奖励评价知识正确性与生成图的实际符合度。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"KnowGen、WISE 上相对所列生成器和代理基线获得提升，并展示跨生成器迁移；训练设置还需图像生成和网页摘要辅助模型，不能把代理 8B 视为全部计算规模。","boundary":"【解读】外部来源可能错误，评价器及合成训练图可能带偏；多跳搜索和图像 rollout 的计算/服务成本高。","evidence":"§3 数据与训练；§4.1–4.4、表1–3；§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2603.28767v2","url":"https://arxiv.org/abs/2603.28767v2"}],"note":"p033","priority":0},"aliases":[]},{"id":"P032","title":"Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation","short":"Autoregressive, Yet Revisable","year":"2026","authors":"Chengran Yang; Zichao Wei; Heminghao Deng; Jinfeng Jiang; Zhensu Sun; Ting Zhang; Tianyi Wu; Ming Wen; David Lo","collected":true,"note":"p032","scope":"本地 PDF · 既有阅读笔记","summary":"让自回归模型在生成过程中输出编辑指令，从而及时修改已经构造的代码。","boundary":"token 流仍单调自回归，改变的是渲染后的代码；主要在 C/C++ 安全对齐和 CSE2 检测器上评价。","evidence":"§3；§4–6、表2；§7.3、表5；§9。","sources":["abductive/26_Autoregressive, Yet Revisable In Decoding Revision for Secure Code Generation.pdf"],"sha256":"c9b7c702d280df7d23ac4f1133a46a1725bb3ccf82b0b77b70db469d9b05c775","pages":21,"links":[{"label":"arXiv本地版本 2602.01187v2","url":"https://arxiv.org/abs/2602.01187v2"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P032","title":"Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation","year":"2026","authors":"Chengran Yang; Zichao Wei; Heminghao Deng; Jinfeng Jiang; Zhensu Sun; Ting Zhang; Tianyi Wu; Ming Wen; David Lo","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"Stream of Revision 以虚拟光标、编辑 token 和确定性渲染器把生成流转换为可修订程序。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"让自回归模型在生成过程中输出编辑指令，从而及时修改已经构造的代码。","input_conditions":"token 流仍单调自回归，改变的是渲染后的代码；主要在 C/C++ 安全对齐和 CSE2 检测器上评价。","training_supervision":"从真实 CVE 修复对构造训练数据，学习编辑动作及普通代码；用安全检查通过率、HumanEval 功能测试和 AST 解析率分别验证。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"相较多种修复/对齐基线改善 CSE2 安全通过率；叠加 ProSec 后文中报告 C +1.16、C++ +4.15 个百分点。","boundary":"【解读】静态检查通过不等于无漏洞；需修改训练与渲染执行协议，仍可能生成语法/语义错误，跨语言效果有条件。","evidence":"§3；§4–6、表2；§7.3、表5；§9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2602.01187v2","url":"https://arxiv.org/abs/2602.01187v2"}],"note":"p032","priority":0},"aliases":[]},{"id":"P031","title":"Agentic Reasoning for Large Language Models","short":"Agentic Reasoning for Large Language Models","year":"2026","authors":"Tianxin Wei; Ting-Wei Li; Zhining Liu; Xuying Ning; Ze Yang; Jiaru Zou; Zhichen Zeng; Ruizhong Qiu; Xiao Lin; Dongqi Fu; Zihao Li; Mengting Ai; Duo Zhou; Wenxuan Bao; Yunzhe Li; Gaotang Li; Cheng Qian; Yu Wang; Xiangru Tang; Yin Xiao; Liri Fang; Hui Liu; Xianfeng Tang; Yuji Zhang; Chi Wang; Jiaxuan You; Heng Ji; Hanghang Tong; Jingrui He","collected":true,"note":"p031","scope":"本地 PDF · 既有阅读笔记","summary":"系统梳理将推理与行动连接的语言智能体研究，覆盖基础能力、自我演化和多智能体协作。","boundary":"135 页综述，正文说明汇总截至 2025 年的进展；没有训练或统一重测一个新模型。","evidence":"摘要；§2–5；应用 §6；基准 §7；开放问题 §8。","sources":["abductive/26_Agentic Reasoning for Large Language Models.pdf"],"sha256":"edc82b75fe0496cb13bf8288aac941e4437dc136a82b2dce4a7ab55d130db916","pages":135,"links":[{"label":"arXiv本地版本 2601.12538v1","url":"https://arxiv.org/abs/2601.12538v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P031","title":"Agentic Reasoning for Large Language Models","year":"2026","authors":"Tianxin Wei; Ting-Wei Li; Zhining Liu; Xuying Ning; Ze Yang; Jiaru Zou; Zhichen Zeng; Ruizhong Qiu; Xiao Lin; Dongqi Fu; Zihao Li; Mengting Ai; Duo Zhou; Wenxuan Bao; Yunzhe Li; Gaotang Li; Cheng Qian; Yu Wang; Xiangru Tang; Yin Xiao; Liri Fang; Hui Liu; Xianfeng Tang; Yuji Zhang; Chi Wang; Jiaxuan You; Heng Ji; Hanghang Tong; Jingrui He","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"按环境动态、优化方式与协作范围组织统一分类及应用/基准地图。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"系统梳理将推理与行动连接的语言智能体研究，覆盖基础能力、自我演化和多智能体协作。","input_conditions":"135 页综述，正文说明汇总截至 2025 年的进展；没有训练或统一重测一个新模型。","training_supervision":"分别梳理规划/工具/搜索、反馈/记忆/适应、角色/分工/协作演化，区分上下文编排与 SFT/RL 后训练，并整理跨领域基准。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"产出研究分类、方法对照表和开放问题：个性化、长时交互、世界模型、潜在推理与协作治理；没有可归于本文新算法的单一准确率。","boundary":"【解读】文献选择和分类含作者判断，跨论文成绩并非同条件比较，快速发展的领域需要持续更新。","evidence":"摘要；§2–5；应用 §6；基准 §7；开放问题 §8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.12538v1","url":"https://arxiv.org/abs/2601.12538v1"}],"note":"p031","priority":0},"aliases":[]},{"id":"P050","title":"Distributionally Robust Feature Selection","short":"Distributionally Robust Feature Selection","year":"2025","authors":"Maitreyi Swaroop; Tamar Krishnamurti; Bryan Wilder","collected":true,"note":"p050","scope":"本地 PDF · 既有阅读笔记","summary":"在观测特征预算下选择对多个子群体都有用的特征，以支持分别训练高质量模型。","boundary":"选择共享特征，但下游允许各群体自己的模型；理论推导核心为 MSE，不能当作已证明所有损失适用。","evidence":"§3；§4.3/图3；§5。","sources":["bryan wilder/NeurIPS-2025-distributionally-robust-feature-selection-Paper-Conference.pdf"],"sha256":"cac9cafdc4deee05eb02c15751e5836ebb631d2b2dc2cfdc711c559e78b23cb1","pages":30,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"support"}],"annotation":{"id":"P050","title":"Distributionally Robust Feature Selection","year":"2025","authors":"Maitreyi Swaroop; Tamar Krishnamurti; Bryan Wilder","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"噪声连续松弛和 Bayes 最优预测方差目标，避免反传穿过训练过程。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在观测特征预算下选择对多个子群体都有用的特征，以支持分别训练高质量模型。","input_conditions":"选择共享特征，但下游允许各群体自己的模型；理论推导核心为 MSE，不能当作已证明所有损失适用。","training_supervision":"对特征加可控噪声，估计各组目标并最小化最差组损失，用重参数化和核估计做梯度优化。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"合成及 ACS/UCI 试验中优于所列 Lasso、XGBoost 和 DRO 改编基线；ACS 设置报告 MSE 数量级下降，UCI 分类也有经验收益。","boundary":"【作者】插件估计在小群体可能偏，非 MSE 理论待扩展；【解读】依赖已知群体及代表性训练数据。","evidence":"§3；§4.3/图3；§5。","checked":"2026-09-15","links":[],"note":"p050","priority":0},"aliases":[]},{"id":"P049","title":"Decision-Focused Learning without Differentiable Optimization: Learning Locally Optimized Decision Losses","short":"Decision-Focused Learning without Differentiable Optimization","year":"2022","authors":"Sanket Shah; Kai Wang; Bryan Wilder; Andrew Perrault; Milind Tambe","collected":true,"note":"p049","scope":"本地 PDF · 既有阅读笔记","summary":"通过学习局部决策损失，让预测训练适应下游优化而无需对求解器求导。","boundary":"仍需大量调用黑盒求解器来拟合损失；“without differentiable optimization”并非完全不做优化。","evidence":"§4；§5/表1–3；§6。","sources":["bryan wilder/NeurIPS-2022-decision-focused-learning-without-decision-making-learning-locally-optimized-decision-losses-Paper-Conference.pdf"],"sha256":"07b280867fab39304c2cddf0d2c056e09cce4810f27d2c1fa7395b6ecf454ccf","pages":13,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"support"}],"annotation":{"id":"P049","title":"Decision-Focused Learning without Differentiable Optimization: Learning Locally Optimized Decision Losses","year":"2022","authors":"Sanket Shah; Kai Wang; Bryan Wilder; Andrew Perrault; Milind Tambe","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"LODL 用黑盒优化器生成监督，学习可凸的任务相关损失。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过学习局部决策损失，让预测训练适应下游优化而无需对求解器求导。","input_conditions":"仍需大量调用黑盒求解器来拟合损失；“without differentiable optimization”并非完全不做优化。","training_supervision":"在真实标签附近扰动预测，用决策质量作为目标，拟合加权 MSE/方向二次型等局部损失，再用于训练预测网络。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"三个资源分配域均优于任务无关的两阶段训练，部分超过手工可微代理；样本增多通常提高表现，损失学习可并行/复用。","boundary":"【作者】局部邻域/损失族选择影响泛化和成本；【解读】关于损失的凸性不使整个神经网络训练全局凸。","evidence":"§4；§5/表1–3；§6。","checked":"2026-09-15","links":[],"note":"p049","priority":0},"aliases":[]},{"id":"P048","title":"Utility-Directed Conformal Prediction: A Decision-Aware Framework for Actionable Uncertainty Quantification","short":"Utility-Directed Conformal Prediction","year":"2025","authors":"Santiago Cortes-Gomez; Carlos Patiño; Yewon Byun; Zhiwei Steven Wu; Eric Horvitz; Bryan Wilder","collected":true,"note":"p048","scope":"本地 PDF · 既有阅读笔记","summary":"把下游成本纳入保形预测，使具有覆盖保证的预测集合更适合实际决策。","boundary":"标准覆盖依赖校准/测试交换性等条件，通常是边际保证；皮肤诊断为数据集示例，未做临床试验。","evidence":"§3；§4/图3及附录表4–6；§5、Reproducibility Statement。","sources":["bryan wilder/ICLR-2025-utility-directed-conformal-prediction-a-decision-aware-framework-for-actionable-uncertainty-quantification-Paper-Conference.pdf"],"sha256":"014cd623273d23418cf34a7100f3f8741e56e4c4ca3ad9442505448e46e2df75","pages":20,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"support"}],"annotation":{"id":"P048","title":"Utility-Directed Conformal Prediction: A Decision-Aware Framework for Actionable Uncertainty Quantification","year":"2025","authors":"Santiago Cortes-Gomez; Carlos Patiño; Yewon Byun; Zhiwei Steven Wu; Eric Horvitz; Bryan Wilder","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"针对可分/不可分效用构造 nonconformity score 与集合选择方法，并证明保留标准覆盖。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把下游成本纳入保形预测，使具有覆盖保证的预测集合更适合实际决策。","input_conditions":"标准覆盖依赖校准/测试交换性等条件，通常是边际保证；皮肤诊断为数据集示例，未做临床试验。","training_supervision":"利用标签或集合成本构造惩罚比率/保形分数，再做校准；在分类层级中偏好临床或语义更一致的集合。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"CIFAR-100、iNaturalist、ImageNet、Fitzpatrick 的所测效用成本均低于标准保形基线，并经验保持覆盖率。","boundary":"【解读】需预先定义有意义的效用，分布变化影响保证；成本低不必然代表所有用户或群体都受益。PDF 代码链接仍写 [hidden]。","evidence":"§3；§4/图3及附录表4–6；§5、Reproducibility Statement。","checked":"2026-09-15","links":[],"note":"p048","priority":0},"aliases":[]},{"id":"P047","title":"Can LLMs Propose Instrumental Variables for Causal Reasoning?","short":"Can LLMs Propose Instrumental Variables for Causal Reasoning?","year":"2025","authors":"本地稿匿名；官方 CISPA 记录补充：Ivaxi Sheth; Zhijing Jin; Bryan Wilder; Dominik Janzing; Mario Fritz","collected":true,"note":"p047","scope":"本地 PDF · 既有阅读笔记","summary":"用 LLM 提议并批判工具变量，探索观察数据中候选工具的发现。","boundary":"只能辅助提出候选；高 F 统计量只支持相关性，不能验证排除限制/独立性，内部一致也不等于因果有效。","evidence":"摘要；§2.1–2.2/表1；附录 C、H；CISPA 作者记录。","sources":["bryan wilder/38_Can_LLMs_Propose_Instrument.pdf"],"sha256":"c93595a135d3c4e837633d1fd4b30fe3f47805aa52e29411a4ef9dcbc6fa53c5","pages":18,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P047","title":"Can LLMs Propose Instrumental Variables for Causal Reasoning?","year":"2025","authors":"本地稿匿名；官方 CISPA 记录补充：Ivaxi Sheth; Zhijing Jin; Bryan Wilder; Dominik Janzing; Mario Fritz","teams":[],"topics":["world_model"],"rqs":["W2c","W4c"],"collected":true,"review_status":"existing_notes","question":"IV Co-Scientist 多角色流程，以及无真值时的内部一致性比较。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用 LLM 提议并批判工具变量，探索观察数据中候选工具的发现。","input_conditions":"只能辅助提出候选；高 F 统计量只支持相关性，不能验证排除限制/独立性，内部一致也不等于因果有效。","training_supervision":"先测试恢复文献工具和拒绝已被推翻的工具；代理提议处理—结果—工具组合并批判假设，再比较第一阶段强度与估计一致性。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"5 个自动发现案例中多种候选表现出较强相关及高于随机代理的内部一致性；论文未建立所有新工具的真实有效性。","boundary":"【解读】语义批评共享模型偏差；缺乏真值时一致性不足以排除共同混杂，候选须领域知识进一步审核。","evidence":"摘要；§2.1–2.2/表1；附录 C、H；CISPA 作者记录。","checked":"2026-09-15","links":[],"note":"p047","priority":0},"aliases":[]},{"id":"P046","title":"Explaining Concept Shift with Interpretable Feature Attribution","short":"Explaining Concept Shift with Interpretable Feature Attribution","year":"2025","authors":"Ruiqi Lyu; Alistair Turcan; Bryan Wilder","collected":true,"note":"p046","scope":"本地 PDF · 既有阅读笔记","summary":"SGShift 将预测失效归因到条件标签分布发生变化的少数特征。","boundary":"表格数据的概念漂移，需源/目标域信息和标注；被选特征不是必然的干预因果变量。","evidence":"§4；§5–6/表2；§7。","sources":["bryan wilder/2505.20634v1.pdf"],"sha256":"b06c08edda94ada5d2c1566b92694110d440fab9c921c2fad4806ad9c010bcbc","pages":25,"links":[{"label":"arXiv本地版本 2505.20634v1","url":"https://arxiv.org/abs/2505.20634v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4c","role":"support"}],"annotation":{"id":"P046","title":"Explaining Concept Shift with Interpretable Feature Attribution","year":"2025","authors":"Ruiqi Lyu; Alistair Turcan; Bryan Wilder","teams":[],"topics":["world_model"],"rqs":["W4c"],"collected":true,"review_status":"existing_notes","question":"稀疏 GAM 归因、吸收模型误设项和 knockoff 错误发现控制扩展。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"SGShift 将预测失效归因到条件标签分布发生变化的少数特征。","input_conditions":"表格数据的概念漂移，需源/目标域信息和标注；被选特征不是必然的干预因果变量。","training_supervision":"在原模型输出上拟合带 L1 惩罚的加性修正，结合两域共享误设项；用 knockoffs 筛选发生变化的特征。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在糖尿病再入院、COVID 和 SUPPORT2 的半合成实验中，knockoff 变体多次获得 AUC&gt;0.9；召回率按 FPR=10% 评价，不能与任意阈值召回混用。","boundary":"【作者】假设变化稀疏，密集变化难解释；【解读】GAM 加性结构和有限目标域标签限制复杂交互漂移识别。","evidence":"§4；§5–6/表2；§7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2505.20634v1","url":"https://arxiv.org/abs/2505.20634v1"}],"note":"p046","priority":0},"aliases":[]},{"id":"P045","title":"Failure Modes of LLMs for Causal Reasoning on Narratives","short":"Failure Modes of LLMs for Causal Reasoning on Narratives","year":"2025","authors":"Khurram Yamin; Shantanu Gupta; Gaurav Ghosal; Zachary Lipton; Bryan Wilder","collected":true,"note":"p045","scope":"本地 PDF · 既有阅读笔记","summary":"研究语言模型在叙事因果理解中的失效模式，是 P042 的早期版本。","boundary":"因果关系识别/图抽取；本文明确把反事实案例留作未来工作。","evidence":"§3–4；§5.1；与 P042 对照。","sources":["bryan wilder/2410.23884v5.pdf"],"sha256":"49a0e206675337354ceff5c93faef9493f58048c70a0088fde01fd9b9c3647b0","pages":23,"links":[{"label":"arXiv本地版本 2410.23884v5","url":"https://arxiv.org/abs/2410.23884v5"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"}],"annotation":{"id":"P045","title":"Failure Modes of LLMs for Causal Reasoning on Narratives","year":"2025","authors":"Khurram Yamin; Shantanu Gupta; Gaurav Ghosal; Zachary Lipton; Bryan Wilder","teams":[],"topics":["world_model"],"rqs":["W2a"],"collected":true,"review_status":"existing_notes","question":"明确事件顺序、参数知识一致性和叙事结构复杂度三类影响。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"研究语言模型在叙事因果理解中的失效模式，是 P042 的早期版本。","input_conditions":"因果关系识别/图抽取；本文明确把反事实案例留作未来工作。","training_supervision":"构造可控合成叙事并使用 CauseNet 的半合成/真实语句，比较多种模型和先抽图提示。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"事件拓扑顺序一致时较好，知识冲突及长链时较差；显式抽取因果图改善推理。本条按 v5 总结，不把后续 ICLR 附录结果回填为早期结果。","boundary":"【作者】其他类型因果推理未测；【解读】叙事中识别给定因果并不等同从混杂观测中识别因果。","evidence":"§3–4；§5.1；与 P042 对照。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2410.23884v5","url":"https://arxiv.org/abs/2410.23884v5"}],"note":"p045","priority":0},"family":{"ids":["P042","P045"],"reason":"同一叙事因果研究的后续/早期版本，题名不同"},"aliases":[]},{"id":"P044","title":"Orthogonal Causal Calibration","short":"Orthogonal Causal Calibration","year":"2025","authors":"Justin Whitehouse; Christopher Jung; Vasilis Syrgkanis; Bryan Wilder; Zhiwei Steven Wu","collected":true,"note":"p044","scope":"本地 PDF · 既有阅读笔记","summary":"用正交损失把异质性因果效应估计的校准转化为较标准的预测校准。","boundary":"结论依赖识别条件、正交性、损失正则性和 nuisance 估计；重点是 L2 校准，不保证个体反事实准确或决策最优。","evidence":"摘要；§3–4；§5 图1–2；§6。","sources":["bryan wilder/2406.01933v2.pdf"],"sha256":"b80516dff71d6e559774e8c2192764cc4d0f0108448bff43f2114cbf85526080","pages":49,"links":[{"label":"arXiv本地版本 2406.01933v2","url":"https://arxiv.org/abs/2406.01933v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P044","title":"Orthogonal Causal Calibration","year":"2025","authors":"Justin Whitehouse; Christopher Jung; Vasilis Syrgkanis; Bryan Wilder; Zhiwei Steven Wu","teams":[],"topics":["world_model"],"rqs":["W2c","W4c"],"collected":true,"review_status":"existing_notes","question":"对 universal/conditional orthogonality 给出误差分解、样本切分和交叉校准算法及收敛保证。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用正交损失把异质性因果效应估计的校准转化为较标准的预测校准。","input_conditions":"结论依赖识别条件、正交性、损失正则性和 nuisance 估计；重点是 L2 校准，不保证个体反事实准确或决策最优。","training_supervision":"构造广义伪结果或条件损失，在独立样本上校准；把误差分为 nuisance 估计误差与假想已知 nuisance 下的校准误差。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"401(k) 观察数据和合成条件分位数实验中降低校准误差，部分同时降低平均损失；理论提供高概率收敛及条件性的 do-no-harm 结果。","boundary":"【作者】其他 Lp 校准及最终决策效用仍待研究；【解读】真实观察数据无法直接观测全部个体处理效应。","evidence":"摘要；§3–4；§5 图1–2；§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2406.01933v2","url":"https://arxiv.org/abs/2406.01933v2"}],"note":"p044","priority":0},"aliases":[]},{"id":"P043","title":"LLMs Struggle to Perform Counterfactual Reasoning with Parametric Knowledge","short":"LLMs Struggle to Perform Counterfactual Reasoning with Parametric Knowledge","year":"2025","authors":"Khurram Yamin, Gaurav Ghosal, Bryan Wilder","collected":true,"note":"p043","scope":"本地 PDF · 既有阅读笔记","summary":"测试模型能否将新反事实前提与已存知识结合，而不是继续沿用默认知识。","boundary":"受控知识图和短链因果查询；不是现实因果效应估计。","evidence":"§3；§4；§5–6；附录训练细节。","sources":["bryan wilder/22_LLMs_Struggle_to_Perform_Co.pdf"],"sha256":"ba93aa93e6f55f736903bae8c7fb437ddf9783864e2d8fa6c9ecf4aa06c7d579","pages":10,"links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2506.15732"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"}],"annotation":{"id":"P043","title":"LLMs Struggle to Perform Counterfactual Reasoning with Parametric Knowledge","year":"2025","authors":"Khurram Yamin, Gaurav Ghosal, Bryan Wilder","teams":[],"topics":["world_model"],"rqs":["W2a"],"collected":true,"review_status":"existing_notes","question":"区分强化、添加、冲突与无关上下文的知识整合任务，并研究微调的副作用。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"测试模型能否将新反事实前提与已存知识结合，而不是继续沿用默认知识。","input_conditions":"受控知识图和短链因果查询；不是现实因果效应估计。","training_supervision":"在 GPT-4o/Llama3.1 与玩具模型上比较直接提示、CoT、160 条反事实示例微调及预训练干预。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"强化既有知识时 GPT-4o 直接提示约 85%、CoT 超过 95%；添加/冲突条件困难，简单微调可能仍依赖捷径或损害原有知识。","boundary":"【作者】玩具前提多为单边编辑、两跳查询；【解读】少量训练与模型范围限制结论，不可说微调普遍无效。","evidence":"§3；§4；§5–6；附录训练细节。","checked":"2026-09-15","links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2506.15732"}],"note":"p043","priority":0},"aliases":[]},{"id":"P042","title":"LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding","short":"LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding","year":"2026","authors":"Khurram Yamin; Shantanu Gupta; Gaurav Ghosal; Zachary Lipton; Bryan Wilder","collected":true,"note":"p042","scope":"本地 PDF · 既有阅读笔记","summary":"分析 LLM 在叙事因果理解中如何受事件顺序、已有知识和图结构复杂度影响。","boundary":"主要判断事件间因果关系和抽取图；未涵盖完整反事实或干预推理。","evidence":"§3–4；§5；与 P045 封面、摘要比对。","sources":["bryan wilder/22578_LLMs_Struggle_to_Balance.pdf"],"sha256":"0264b3dec2f81a06f3272ce9328b2324bea065f9d9a77f4733091cb48ca9595d","pages":28,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"}],"annotation":{"id":"P042","title":"LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding","year":"2026","authors":"Khurram Yamin; Shantanu Gupta; Gaurav Ghosal; Zachary Lipton; Bryan Wilder","teams":[],"topics":["world_model"],"rqs":["W2a"],"collected":true,"review_status":"existing_notes","question":"受控的合成、半合成和真实叙事评测，定位常识捷径与顺序偏差。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"分析 LLM 在叙事因果理解中如何受事件顺序、已有知识和图结构复杂度影响。","input_conditions":"主要判断事件间因果关系和抽取图；未涵盖完整反事实或干预推理。","training_supervision":"从链、fork、collider 和 CauseNet 构造叙事，操控叙述顺序/知识一致性/长度；比较直接回答与先抽因果图。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"模型倾向按叙事顺序推断因果、以参数知识覆盖上下文；图更长/复杂时下降。先显式识别因果图可改善稳定性。","boundary":"【作者】未覆盖其他因果任务；【解读】CauseNet 是文本声称的因果关系，受控叙事不等于真实科学因果发现。","evidence":"§3–4；§5；与 P045 封面、摘要比对。","checked":"2026-09-15","links":[],"note":"p042","priority":0},"family":{"ids":["P042","P045"],"reason":"同一叙事因果研究的后续/早期版本，题名不同"},"aliases":[]},{"id":"P041","title":"Learning to Complement Humans","short":"Learning to Complement Humans","year":"2020","authors":"Bryan Wilder; Eric Horvitz; Ece Kamar","collected":true,"note":"p041","scope":"本地 PDF · 既有阅读笔记","summary":"联合训练预测模型和求助策略，以人机团队的整体效用而非机器独立准确率为目标。","boundary":"Galaxy Zoo 和 CAMELYON 的离线人类标注数据；交互主要为是否查询一个人类答案。","evidence":"§2–3；§4/表1；§5。","sources":["bryan wilder/20_learning to complement humans.pdf"],"sha256":"f2db8ece3b71eb3c52f40b5398ed32992f5d032a2a1a5bcf4ab054ff4cf68f9d","pages":8,"links":[{"label":"arXiv本地版本 2005.00582v1","url":"https://arxiv.org/abs/2005.00582v1"}],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"core"}],"annotation":{"id":"P041","title":"Learning to Complement Humans","year":"2020","authors":"Bryan Wilder; Eric Horvitz; Ece Kamar","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"能否联合学习预测器和求助策略，让人机整体效用优于各自独立优化？","question_origin":"依作者研究目标改写","summary":"联合训练预测模型和求助策略，以人机团队的整体效用而非机器独立准确率为目标。","input_conditions":"Galaxy Zoo 和 CAMELYON 的离线人类标注数据；交互主要为是否查询一个人类答案。","training_supervision":"建模标签、人类响应及条件预测；同时优化分类和查询决策，将求助成本/非对称错误代价纳入期望损失。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1中 Galaxy Zoo 一层 VOI 的平均损失改善 38.9%（跨查询成本），不同容量/任务收益差异很大，部分设置存在负改善。","boundary":"【解读】需可靠的人类响应模型和代表性数据；未覆盖人类因 AI 建议而改变行为的长期双向协作。","evidence":"§2–3；§4/表1；§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2005.00582v1","url":"https://arxiv.org/abs/2005.00582v1"}],"note":"p041","priority":0},"aliases":[],"research_question":{"kind":"依作者研究目标改写","text":"能否联合学习预测器和求助策略，让人机整体效用优于各自独立优化？","location":"PDF p.1 问题与架构，p.7 交互边界"}},{"id":"P060","title":"XR Blocks: Accelerating Human-centered AI + XR Innovation","short":"XR Blocks","year":"2025","authors":"David Li; Nels Numan; Xun Qian; Yanhe Chen; Zhongyi Zhou; Evgenii Alekseev; Geonsun Lee; Alex Cooper; Min Xia; Scott Chung; Jeremy Nelson; Xiuxiu Yuan; Jolica Dias; Tim Bettridge; Benjamin Hersh; Michelle Huynh; Konrad Piascik; Ricardo Cabello; David Kim; Ruofei Du","collected":true,"note":"p060","scope":"本地 PDF · 既有阅读笔记","summary":"提出跨桌面模拟器与XR设备的模块化Web框架，统一感知、渲染、交互和AI服务，以减少AI+XR原型开发的集成工作。","boundary":"作者明确说agents、peers、context等概念原语仅初步实现；不是完整通用多代理/持久记忆/跨设备协作平台。","evidence":"PDF §4–6，尤其§6.2 pp.6–7。","sources":["hci_du/Li_XRBlocks-AcceleratingHuman-centeredAI+XRInnovation_2025.pdf"],"sha256":"e55cf9cd2a2e2651019cb9926d88c8c242fdda9c1df4e3e29b8c1bf375ec6f08","pages":9,"links":[{"label":"arXiv本地版本 2509.25504v1","url":"https://arxiv.org/abs/2509.25504v1"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"core"}],"annotation":{"id":"P060","title":"XR Blocks: Accelerating Human-centered AI + XR Innovation","year":"2025","authors":"David Li; Nels Numan; Xun Qian; Yanhe Chen; Zhongyi Zhou; Evgenii Alekseev; Geonsun Lee; Alex Cooper; Min Xia; Scott Chung; Jeremy Nelson; Xiuxiu Yuan; Jolica Dias; Tim Bettridge; Benjamin Hersh; Michelle Huynh; Konrad Piascik; Ricardo Cabello; David Kim; Ruofei Du","teams":[],"topics":["hci"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"Reality Model与可插拔Core引擎，提供用户、世界、交互及AI模板和演示。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出跨桌面模拟器与XR设备的模块化Web框架，统一感知、渲染、交互和AI服务，以减少AI+XR原型开发的集成工作。","input_conditions":"作者明确说agents、peers、context等概念原语仅初步实现；不是完整通用多代理/持久记忆/跨设备协作平台。","training_supervision":"WebXR、three.js、TensorFlow及Gemini之上封装相机/深度/音频、物理、手势与智能模块，同一高层脚本在模拟器和设备运行。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"展示遮挡/重照明、虚实物理交互、手势控制和情境助手等开源样例；本白皮书未报告受控开发效率实验或通用基准提升数值。","boundary":"【作者】设计愿景尚未全部实现，Web性能低于原生引擎、云延迟、复杂用户与情境模型待完善。","evidence":"PDF §4–6，尤其§6.2 pp.6–7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2509.25504v1","url":"https://arxiv.org/abs/2509.25504v1"}],"note":"p060","priority":0},"aliases":[]},{"id":"P059","title":"Sensible Agent: A Framework for Unobtrusive Interaction with Proactive AR Agents","short":"Sensible Agent","year":"2025","authors":"Geonsun Lee; Min Xia; Nels Numan; Xun Qian; David Li; Yanhe Chen; Achin Kulshrestha; Ishan Chatterjee; Yinda Zhang; Dinesh Manocha; David Kim; Ruofei Du","collected":true,"note":"p059","scope":"本地 PDF · 既有阅读笔记","summary":"结合多模态情境感知决定主动AR助手提供什么帮助，以及用语音、视觉、头/手/注视等何种方式交互，从而降低打扰和主观操作负担。","boundary":"当前没有长期用户偏好建模，也未求解精确的介入时机；测试为有限AR和360°视频场景。","evidence":"PDF pp.14–16，§7.4、图8、§9。","sources":["hci_du/Lee_SensibleAgent-AFrameworkForUnobtrusiveInteractionWithProactiveARAgent_UIST2025.pdf"],"sha256":"f5caf04876cd2886402ba5aaff888b582997be5298e87724d8a715a334b73344","pages":22,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3746059.3747748"}],"verified":"2026-09-15","mappings":[{"rq":"X2b","role":"core"}],"annotation":{"id":"P059","title":"Sensible Agent: A Framework for Unobtrusive Interaction with Proactive AR Agents","year":"2025","authors":"Geonsun Lee; Min Xia; Nels Numan; Xun Qian; David Li; Yanhe Chen; Achin Kulshrestha; Ishan Chatterjee; Yinda Zhang; Dinesh Manocha; David Kim; Ruofei Du","teams":[],"topics":["hci"],"rqs":["X2b"],"collected":true,"review_status":"existing_notes","question":"主动 AR 助手应提供什么帮助，又应在何种情境下用什么低干扰方式递送？","question_origin":"依作者引言问题改写","summary":"结合多模态情境感知决定主动AR助手提供什么帮助，以及用语音、视觉、头/手/注视等何种方式交互，从而降低打扰和主观操作负担。","input_conditions":"当前没有长期用户偏好建模，也未求解精确的介入时机；测试为有限AR和360°视频场景。","training_supervision":"第一视角相机/传感器与LMM推断活动和约束，选择图标、二选一或多选建议及可用输入模态；与语音提问基线做被试内比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"N=10：Raw-TLX均值20.55对43.27，主观负担降低；偏好6.00对3.80/7；但交互更慢，28.54秒对16.43秒（p&lt;.001）。SUS81.33对76.67，差异不显著（p=.11）。","boundary":"【作者】小样本、探索统计未校正多重比较，缺少常显多选界面对照；无长期个性化/时机模型。【解读】不能由较低主观负担推断客观效率提高。","evidence":"PDF pp.14–16，§7.4、图8、§9。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3746059.3747748"}],"note":"p059","priority":0},"aliases":[],"research_question":{"kind":"依作者引言问题改写","text":"主动 AR 助手应提供什么帮助，又应在何种情境下用什么低干扰方式递送？","location":"PDF pp.2–3；§4 what/how 双模块"}},{"id":"P058","title":"How Well Can 3D Accessibility Guidelines Support XR Development? An Interview Study with XR Practitioners in Industry","short":"How Well Can 3D Accessibility Guidelines Support XR Development? An Interview Study with XR Practitioners in Industry","year":"2026","authors":"Daniel Killough; Tiger F. Ji; Kexin Zhang; Yaxin Hu; Yu Huang; Ruofei Du; Yuhang Zhao","collected":true,"note":"p058","scope":"本地 PDF · 既有阅读笔记","summary":"访谈25位XR行业从业者，检查六套资源中的20项3D无障碍指南能否支持XR开发，分析指南含糊、场景不匹配和落实责任问题。","boundary":"评估对象是从业者对指南的解释和可行性判断；没有实现并测量全套辅助功能，也没有证明残障用户效果改善。","evidence":"PDF §3–4、表2–3、§5.3；pp.3–11。","sources":["hci_du/Killough_HowWellCan3DAccessibilityGuidelinesSupportXRDevelopmentAnInterviewStudyWithXRPractitionersInIndustry_CHI2026.pdf"],"sha256":"f35c8a8c027b4841c09d5f2ae8da50f5844ff810285a9c4c4eef92710867daf9","pages":15,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3790520"}],"verified":"2026-09-15","mappings":[{"rq":"X4b","role":"core"}],"annotation":{"id":"P058","title":"How Well Can 3D Accessibility Guidelines Support XR Development? An Interview Study with XR Practitioners in Industry","year":"2026","authors":"Daniel Killough; Tiger F. Ji; Kexin Zhang; Yaxin Hu; Yu Huang; Ruofei Du; Yuhang Zhao","teams":[],"topics":["hci"],"rqs":["X4b"],"collected":true,"review_status":"existing_notes","question":"给出跨视觉、运动、认知、言语、听觉的指南适用性分析与开发责任/实施建议；强调指南应提供可操作示例。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"访谈25位XR行业从业者，检查六套资源中的20项3D无障碍指南能否支持XR开发，分析指南含糊、场景不匹配和落实责任问题。","input_conditions":"评估对象是从业者对指南的解释和可行性判断；没有实现并测量全套辅助功能，也没有证明残障用户效果改善。","training_supervision":"半结构访谈、指南排序/讨论、主题分析，将优先级、开发阶段和责任组织成矩阵。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"25人均提出可结合其项目的实现思路；12人报告沉浸与无障碍的张力，20人希望补充具体案例/实现；发现即时安全、平台依赖、需情境调整等不同优先级。","boundary":"【作者/解读】样本规模和行业背景限制概括性，25人中23男2女；自述意愿不等于真实落地，残障最终用户的直接验证仍不足。","evidence":"PDF §3–4、表2–3、§5.3；pp.3–11。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3790520"}],"note":"p058","priority":0},"aliases":[]},{"id":"P057","title":"Thing2Reality: Enabling Spontaneous Creation of 3D Objects from 2D Content using Generative AI in XR Meetings","short":"Thing2Reality","year":"2025","authors":"Erzhen Hu, Mingyi Li, Jungtaek Hong, Xun Qian, Alex Olwal, David Kim, Seongkook Heo, and Ruofei Du","collected":true,"note":"p057","scope":"本地 PDF · 既有阅读笔记","summary":"在远程XR会议中把物理物体、网页图片转成可共同操作的3D表示，并在3D对象与2D白板快照间切换，支持即时讨论。","boundary":"生成的是条件多视图/3D Gaussian近似表示，不保证精确几何、尺寸或不可见表面；研究为探索性原型评估，未设置2D屏幕共享基线。","evidence":"PDF pp.4–7：实现、研究1；pp.8–12：研究2；§8.3。","sources":["hci_du/Hu_Thing2Reality-EnablingSpontaneousCreationOf3DObjectsFrom2DImagesUsingGenerativeAIInDistributedXRMeetings_UIST2025.pdf"],"sha256":"76717358341146a96d67837248e800d3852cdff07b304ccea212e53a425ff561","pages":16,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3746059.3747621"}],"verified":"2026-09-15","mappings":[{"rq":"X1a","role":"core"}],"annotation":{"id":"P057","title":"Thing2Reality: Enabling Spontaneous Creation of 3D Objects from 2D Content using Generative AI in XR Meetings","year":"2025","authors":"Erzhen Hu, Mingyi Li, Jungtaek Hong, Xun Qian, Alex Olwal, David Kim, Seongkook Heo, and Ruofei Du","teams":[],"topics":["hci"],"rqs":["X1a"],"collected":true,"review_status":"existing_notes","question":"实现Thing2Reality的物体级2D→3D→2D交互链，研究多种表示在协作不同阶段的互补用途。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在远程XR会议中把物理物体、网页图片转成可共同操作的3D表示，并在3D对象与2D白板快照间切换，支持即时讨论。","input_conditions":"生成的是条件多视图/3D Gaussian近似表示，不保证精确几何、尺寸或不可见表面；研究为探索性原型评估，未设置2D屏幕共享基线。","training_supervision":"用户圈选对象→MobileSAM分割→条件多视图扩散与LGM Gaussian重建→Unity多人XR；支持缩放、移动、正交视图和白板投影。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"单人研究N=12均完成任务，工作流评分4.9/5、参与感5/5；双人研究18人/9对观察到2D组织叙事、3D空间解释及混合/顺序使用策略；7/9对准备演示时主动生成多个2D快照。","boundary":"【作者】小样本、单次实验，缺少基线和长期使用；专业精度不足，抽象概念难以实体化；生成误差、尺寸理解与格式切换认知负担。","evidence":"PDF pp.4–7：实现、研究1；pp.8–12：研究2；§8.3。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3746059.3747621"}],"note":"p057","priority":0},"aliases":[]},{"id":"P056","title":"Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini","short":"Vibe Coding XR","year":"待核实","authors":"Ruofei Du; Benjamin Hersh; David Li; Nels Numan; Xun Qian; Yanhe Chen; Zhongyi Zhou; Jiahao Ren; Xingyue Chen; Robert Timothy Bettridge; Faraz Faruqi; Xiang ‘Anthony’ Chen; Steve Toh; David Kim","collected":true,"note":"p056","scope":"本地 PDF · 既有阅读笔记","summary":"通过XR Blocks的高层空间交互API与Gemini，将自然语言需求生成可运行WebXR原型，并提供60条提示的初步技术评测。","boundary":"60提示来自20人四次工作坊；pass@1仅指桌面模拟器无运行错误，不衡量视觉质量、需求满足或真机交互正确性。“一分钟内”不是所有配置的结果。","evidence":"PDF pp.3–5：框架、表1及§4–5。","sources":["hci_du/Du_VibeCodingXR-AcceleratingAI+XRPrototypingWithXRBlocksAndGemini_2026.pdf"],"sha256":"eeb4f0c125281216f66235077762dabb3a17831374fc227303153c7d33c50ed3","pages":10,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"core"}],"annotation":{"id":"P056","title":"Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini","year":"待核实","authors":"Ruofei Du; Benjamin Hersh; David Li; Nels Numan; Xun Qian; Yanhe Chen; Zhongyi Zhou; Jiahao Ren; Xingyue Chen; Robert Timothy Bettridge; Faraz Faruqi; Xiang ‘Anthony’ Chen; Steve Toh; David Kim","teams":[],"topics":["hci"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"整合提示、代码生成、人工检查与即时XR运行的工作流；发布XR Blocks及VCXR60试点任务。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过XR Blocks的高层空间交互API与Gemini，将自然语言需求生成可运行WebXR原型，并提供60条提示的初步技术评测。","input_conditions":"60提示来自20人四次工作坊；pass@1仅指桌面模拟器无运行错误，不衡量视觉质量、需求满足或真机交互正确性。“一分钟内”不是所有配置的结果。","training_supervision":"Reality Model封装用户、物理场景、感知/交互组件；Gemini生成脚本；XR Blocks v0.11.0通过Playwright无头Chromium监控错误，四种配置各运行5轮。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1：Gemini3.1Pro高思考pass@1=95.5%，时间中位86.02秒；低思考94.1%/33.39秒；3Flash高87.8%/22.26秒、低87.4%/17.30秒。每条提示5次中至少一次无错误。","boundary":"【作者】Web性能与云延迟、模型幻觉API及复杂空间逻辑错误；【解读】开发时基于该试点反复修复框架，独立留出集与任务语义/真机评测不足。","evidence":"PDF pp.3–5：框架、表1及§4–5。","checked":"2026-09-15","links":[],"note":"p056","priority":0},"aliases":[]},{"id":"P055","title":"Principles of Mixed-Initiative User Interfaces","short":"Principles of Mixed-Initiative User Interfaces","year":"1999","authors":"Eric Horvitz","collected":true,"note":"p055","scope":"本地 PDF · 既有阅读笔记","summary":"讨论如何将直接操作与自动化代理结合，提出处理用户意图不确定性、打扰成本和人机共同修正结果的设计原则，以Lookout邮件日程助手说明。","boundary":"实现是叠加在Outlook上的邮件时间解析和日程建议原型；不是通用任务代理，也不是对12条原则的全面因果验证。","evidence":"PDF pp.1–2：12条原则；pp.2–7：Lookout实现、概率/效用及注意力模型；pp.7–8：总结。","sources":["eric horvitz/99_eric_Principles of Mixed-Initiative User Interfaces.pdf"],"sha256":"d242048fb0ad4247cd2b0f4a1872c94f319ae8b311fa18df6195fb5361331348","pages":8,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X2b","role":"core"},{"rq":"X4b","role":"support"}],"annotation":{"id":"P055","title":"Principles of Mixed-Initiative User Interfaces","year":"1999","authors":"Eric Horvitz","teams":[],"topics":["hci"],"rqs":["X2b","X4b"],"collected":true,"review_status":"existing_notes","question":"归纳12条混合主动权界面原则，并将不确定性与动作效用引入“等待／询问／主动执行”的选择。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"讨论如何将直接操作与自动化代理结合，提出处理用户意图不确定性、打扰成本和人机共同修正结果的设计原则，以Lookout邮件日程助手说明。","input_conditions":"实现是叠加在Outlook上的邮件时间解析和日程建议原型；不是通用任务代理，也不是对12条原则的全面因果验证。","training_supervision":"SVM文本分类并校准意图概率；按收益、误操作及打扰成本设置决策阈值；结合阅读停留时间选择介入时机；允许手动调用、取消、降级到日历范围及编辑建议。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"展示Lookout自动提取会议日期、创建待确认预约、低置信度询问和时机建模；文中主要证据是系统与概率/效用曲线，未提供现代意义的大样本随机对照效率提升结果。","boundary":"【解读】依赖领域解析规则、意图概率与主观成本模型；意图识别错误和不适当打断仍可能发生，原则能否跨任务成立需另行评估。","evidence":"PDF pp.1–2：12条原则；pp.2–7：Lookout实现、概率/效用及注意力模型；pp.7–8：总结。","checked":"2026-09-15","links":[],"note":"p055","priority":0},"aliases":[]},{"id":"P054","title":"Melding the Data-Decisions Pipeline: Decision-Focused Learning for Combinatorial Optimization","short":"Melding the Data-Decisions Pipeline","year":"2019","authors":"Bryan Wilder, Bistra Dilkina, Milind Tambe","collected":true,"note":"p054","scope":"本地 PDF · 既有阅读笔记","summary":"把预测与组合优化端到端连接，直接按最终决策质量训练预测器。","boundary":"适用所分析的优化结构和松弛条件；不是用户建模或计算机使用日志研究。","evidence":"首页/元数据；技术框架及实验；图2讨论，PDF p7–8。","sources":["eric horvitz/25_Creating General User Models from Computer Use.pdf"],"sha256":"a7997e4591c5b639447f6fed81bd226792d743fe767781af22f9ce39b112a3fc","pages":9,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X2c","role":"support"}],"annotation":{"id":"P054","title":"Melding the Data-Decisions Pipeline: Decision-Focused Learning for Combinatorial Optimization","year":"2019","authors":"Bryan Wilder, Bistra Dilkina, Milind Tambe","teams":[],"topics":["hci"],"rqs":["X2c"],"collected":true,"review_status":"existing_notes","question":"为线性规划和子模最大化提供可反传的连续松弛框架。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把预测与组合优化端到端连接，直接按最终决策质量训练预测器。","input_conditions":"适用所分析的优化结构和松弛条件；不是用户建模或计算机使用日志研究。","training_supervision":"将离散优化连续化，计算决策目标对预测参数的梯度；以优化效用训练模型并与两阶段 MSE 训练比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"多种决策问题上提高最终效用，即使预测 MSE 更差；示例中决策训练模型的通道总权重与真值相关 r²=0.94，解释了正确排序的重要性。","boundary":"【解读】松弛与整数决策存在差距，依赖优化器和任务结构；牺牲预测校准后的输出不宜直接当真实量。","evidence":"首页/元数据；技术框架及实验；图2讨论，PDF p7–8。","checked":"2026-09-15","links":[],"note":"p054","priority":0},"aliases":[]},{"id":"P053","title":"Superhuman performance of a large language model on the reasoning tasks of a physician","short":"Superhuman performance of a large language model on the reasoning tasks of a physician","year":"2026","authors":"Peter G. Brodeur; Thomas A. Buckley; Zahir Kanjee; Ethan Goh; Evelyn Bin Ling; Priyank Jain; Stephanie Cabral; Raja-Elie Abdulnour; Adrian D. Haimovich; Jason A. Freed; Andrew Olson; Daniel J. Morgan; Jason Hom; Robert Gallo; Liam G. McCoy; Haadi Mombini; Christopher Lucas; Misha Fotoohi; Matthew Gwiazdon; Daniele Restifo; Daniel Restrepo; Eric Horvitz; Jonathan Chen; Arjun K. Manrai; Adam Rodman","collected":true,"note":"p053","scope":"本地 PDF · 既有阅读笔记","summary":"用医生评分的复杂病例、诊断/管理任务及急诊第二意见场景评价 OpenAI o1 系列。","boundary":"主要为离线病例及预定义时间点第二意见；未证明真实部署改善患者结局，也未实证人机团队优于医生。","evidence":"摘要 PDF p2；结果 p3–5；讨论 p5–6；方法 p6 起。","sources":["eric horvitz/24_Science_Superhuman performance of a llm on the reasoning tasks of a physician.pdf"],"sha256":"4e1cb616b98899043525e3ff7dc712029af55202ad46371e676e7f2d52ac471f","pages":25,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1126/science.adz4433"}],"verified":"2026-09-15","mappings":[{"rq":"X3c","role":"support"}],"annotation":{"id":"P053","title":"Superhuman performance of a large language model on the reasoning tasks of a physician","year":"2026","authors":"Peter G. Brodeur; Thomas A. Buckley; Zahir Kanjee; Ethan Goh; Evelyn Bin Ling; Priyank Jain; Stephanie Cabral; Raja-Elie Abdulnour; Adrian D. Haimovich; Jason A. Freed; Andrew Olson; Daniel J. Morgan; Jason Hom; Robert Gallo; Liam G. McCoy; Haadi Mombini; Christopher Lucas; Misha Fotoohi; Matthew Gwiazdon; Daniele Restifo; Daniel Restrepo; Eric Horvitz; Jonathan Chen; Arjun K. Manrai; Adam Rodman","teams":[],"topics":["hci"],"rqs":["X3c"],"collected":true,"review_status":"existing_notes","question":"把评价扩展到临床推理过程和真实病历，而不局限选择题考试。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用医生评分的复杂病例、诊断/管理任务及急诊第二意见场景评价 OpenAI o1 系列。","input_conditions":"主要为离线病例及预定义时间点第二意见；未证明真实部署改善患者结局，也未实证人机团队优于医生。","training_supervision":"五类病例推理实验加急诊研究，专家使用 Bond/R-IDEA 等量表评分，与历史和医生基线比较；分别考察 o1-preview 与 o1。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"143 个 NEJM 病例中鉴别列表含正确诊断 78.3%（95%CI 70.7–84.8），首位诊断正确 52%；80 份 Healer 回答中 78 份 R-IDEA 满分；“不可漏诊”覆盖未显著优于对照。","boundary":"【作者】领域/病例有限，需前瞻试验及协作研究；【解读】量表满分和候选列表命中不是独立临床胜任，历史对照与数据泄漏风险需保留。","evidence":"摘要 PDF p2；结果 p3–5；讨论 p5–6；方法 p6 起。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1126/science.adz4433"}],"note":"p053","priority":0},"aliases":[]},{"id":"P052","title":"Valid Inference with Imperfect Synthetic Data","short":"Valid Inference with Imperfect Synthetic Data","year":"2025","authors":"Yewon Byun; Shantanu Gupta; Zachary C. Lipton; Rachel Leah Childers; Bryan Wilder","collected":true,"note":"p052","scope":"本地 PDF · 既有阅读笔记","summary":"以广义矩估计整合真实、代理及完全合成数据，提高有限真实数据下的统计效率。","boundary":"仍需要真实数据与可识别的矩条件；理论有效性是渐近的，不能保证极少样本时精确覆盖。","evidence":"§4.5；§5.3/图1–2；§6 Limitations。","sources":["bryan wilder/NeurIPS-2025-valid-inference-with-imperfect-synthetic-data-Paper-Conference.pdf"],"sha256":"f36995c8bce9d2c778ff92294498365045028b0df617164756664c6fa99ce9b8","pages":40,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4c","role":"support"}],"annotation":{"id":"P052","title":"Valid Inference with Imperfect Synthetic Data","year":"2025","authors":"Yewon Byun; Shantanu Gupta; Zachary C. Lipton; Rachel Leah Childers; Bryan Wilder","teams":[],"topics":["world_model"],"rqs":["W4c"],"collected":true,"review_status":"existing_notes","question":"无需超参数的 GMM 估计器及一致性/渐近推断理论。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以广义矩估计整合真实、代理及完全合成数据，提高有限真实数据下的统计效率。","input_conditions":"仍需要真实数据与可识别的矩条件；理论有效性是渐近的，不能保证极少样本时精确覆盖。","training_supervision":"联合真实与合成矩残差，利用它们的预测相关性，估计权重和协方差构造参数与置信区间。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"8/8 个下游任务获得最低 MSE，7/8 的置信区间更窄；少标注设置多次 MSE 降幅超过 50%，并经验保持覆盖。","boundary":"【作者】劣质合成数据可能无收益，极低数据量可欠覆盖；【解读】不能用模型模拟受试者完全替代真实样本。","evidence":"§4.5；§5.3/图1–2；§6 Limitations。","checked":"2026-09-15","links":[],"note":"p052","priority":0},"aliases":[]},{"id":"P051","title":"Fostering the Ecosystem of AI for Social Impact Requires Expanding and Strengthening Evaluation Standards","short":"Fostering the Ecosystem of AI for Social Impact Requires Expanding and Strengthening Evaluation Standards","year":"2025","authors":"Bryan Wilder; Angela Zhou","collected":true,"note":"p051","scope":"本地 PDF · 既有阅读笔记","summary":"主张扩大社会影响贡献的认可范围，同时提高真实部署影响评价的严谨性。","boundary":"立场论文，提出评价建议；没有新预测模型、受控干预结果或统一算法排行榜。","evidence":"§2–5；§6 Alternative views；§7。","sources":["bryan wilder/NeurIPS-2025-fostering-the-ecosystem-of-ai-for-social-impact-requires-expanding-and-strengthening-evaluation-standards-Paper-Position_Paper_Track.pdf"],"sha256":"6b56fdf0a819fde5506ab115474a0b52b77b5cb85fb93651b35c2f8a3e26a794","pages":12,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4c","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P051","title":"Fostering the Ecosystem of AI for Social Impact Requires Expanding and Strengthening Evaluation Standards","year":"2025","authors":"Bryan Wilder; Angela Zhou","teams":[],"topics":["world_model"],"rqs":["W4c","X3c"],"collected":true,"review_status":"existing_notes","question":"区分方法创新、伙伴能力建设及部署贡献，讨论评审激励如何影响研究生态。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"主张扩大社会影响贡献的认可范围，同时提高真实部署影响评价的严谨性。","input_conditions":"立场论文，提出评价建议；没有新预测模型、受控干预结果或统一算法排行榜。","training_supervision":"分析既有评审标准和应用研究案例，分别讨论试点、随机与非随机部署、反方意见。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"建议作者明确影响机制、评审按贡献类型要求证据，并对部署研究采用更清晰和严格的效果评价。","boundary":"【解读】观点依赖案例和规范性判断，尚无证据量化采用这些评审规则后的长期生态效果。","evidence":"§2–5；§6 Alternative views；§7。","checked":"2026-09-15","links":[],"note":"p051","priority":0},"aliases":[]},{"id":"P070","title":"Impossible Videos","short":"Impossible Videos","year":"2025","authors":"Zechen Bai; Hai Ci; Mike Zheng Shou","collected":true,"note":"p070","scope":"本地 PDF · 既有阅读笔记","summary":"构建违背物理、生物、地理或社会常识的视频生成/理解基准，检查模型能否遵循不可能情景提示并识别视频异常。","boundary":"目标是按提示生成反现实内容，不能把高分解读为更准确模拟物理；“不可能”包括语境化社会/地理常识，非全是严格物理定律。","evidence":"PDF §3–5，表2、§4.1 p.8。","sources":["Reasoning/2503.14378v1.pdf"],"sha256":"5b6d3239d06f838dbbfd470e42f62eeea8a74a38479c99979b2fc1a3edf6918e","pages":26,"links":[{"label":"arXiv本地版本 2503.14378v1","url":"https://arxiv.org/abs/2503.14378v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"core"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P070","arxiv_id":"2503.14378","title":"Impossible Videos","year":"2025","authors":"Zechen Bai; Hai Ci; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","evaluation"],"rqs":["W2a","W2d"],"collected":true,"review_status":"existing_notes","question":"视频模型能否识别和生成违背常识的情境？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Impossible Videos 建立不可能事件分类和 IPV-Bench，分别测试理解与生成。","input_conditions":"摘要初读：Impossible Videos 建立不可能事件分类和 IPV-Bench，分别测试理解与生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"生成反常情境与遵循一套可执行新物理规律是不同任务。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；已有全文笔记可继续查阅，本轮未据此声称重核。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.14378"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.14378v1"}],"note":"p070","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P069","title":"VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning","short":"VideoMind","year":"2026","authors":"Ye Liu; Kevin Qinghong Lin; Chang Wen Chen; Mike Zheng Shou","collected":true,"note":"p069","scope":"本地 PDF · 既有阅读笔记","summary":"用规划、时刻定位、验证、回答四个角色进行带时间证据的视频问答，以共享骨干上的多个LoRA切换角色。","boundary":"各角色有专门训练数据/优化，并非零训练工具链；定位证据不代表严格因果解释，尚未结合音频。","evidence":"PDF §3–4、表7 p.9、结论局限。","sources":["Reasoning/2503.13444v3.pdf"],"sha256":"7e5ba7dcd966c8bd72980a005b98027b8f67c0a05fb6f778f241a2a0bf09e666","pages":26,"links":[{"label":"arXiv本地版本 2503.13444v3","url":"https://arxiv.org/abs/2503.13444v3"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P069","arxiv_id":"2503.13444","title":"VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning","year":"2025","authors":"Ye Liu; Kevin Qinghong Lin; Chang Wen Chen; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_reasoning","agent"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"视频问答如何通过时间定位和核查保持视觉依据？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VideoMind 用规划、定位、核查和回答角色组成工作流，以 Chain-of-LoRA 在共享骨干上切换角色。","input_conditions":"摘要初读：VideoMind 用规划、定位、核查和回答角色组成工作流，以 Chain-of-LoRA 在共享骨干上切换角色。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是视频语言 agent 推理，不是视频生成模型内生推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；已有全文笔记可继续查阅，本轮未据此声称重核。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.13444"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.13444v3"}],"note":"p069","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P068","title":"TPDiff: Temporal Pyramid Video Diffusion Model","short":"TPDiff","year":"2025","authors":"Lingmin Ran; Mike Zheng Shou","collected":true,"note":"p068","scope":"本地 PDF · 既有阅读笔记","summary":"利用扩散前期高噪声下的帧冗余，以低帧率起步并逐阶段增加帧率，配合分阶段扩散训练降低视频生成成本。","boundary":"需要相应训练/适配；验证以MiniFlux-vid、AnimateDiff等配置为主，不是任意预训练视频模型的无损即插即用加速。","evidence":"PDF §3–4、表1–2、图5 pp.6–8。","sources":["Reasoning/2503.09566v1.pdf"],"sha256":"6b838eac12b8bc1270dcdc00e5c80b63d18971a73a7554cd9d0f9f90206ced06","pages":11,"links":[{"label":"arXiv本地版本 2503.09566v1","url":"https://arxiv.org/abs/2503.09566v1"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P068","arxiv_id":"2503.09566","title":"TPDiff: Temporal Pyramid Video Diffusion Model","year":"2025","authors":"Lingmin Ran; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"扩散早期能否减少时间分辨率以降低训练和推理成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"TPDiff 在扩散过程中逐级提高帧率，并设计阶段式训练目标。","input_conditions":"摘要初读：TPDiff 在扩散过程中逐级提高帧率，并设计阶段式训练目标。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"速度收益与数据、骨干和实现有关；需另测小显存和物理任务保真。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；已有全文笔记可继续查阅，本轮未据此声称重核。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.09566"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.09566v1"}],"note":"p068","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P067","title":"τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","short":"τ-bench","year":"2024","authors":"Shunyu Yao; Noah Shinn; Pedram Razavi; Karthik Narasimhan","collected":true,"note":"p067","scope":"本地 PDF · 既有阅读笔记","summary":"用模拟用户、领域规则和API数据库交互评估语言代理，检查最终数据库是否达成目标，并衡量多次执行都成功的可靠性。","boundary":"用户由LLM模拟，后端为受控数据库；pass^k指k次都成功，和至少一次成功的pass@k相反；数据库结果匹配无法穷尽所有对话品质/规则违规。","evidence":"PDF §2–5、表2、图4。","sources":["humanintheloop/24_A Benchmark for Tool-Agent-User Interaction in Real-World Domains.pdf"],"sha256":"0ce66a1763d698c61bb311c3c874bf593d1e9a5bfff11bb35f6f72b981f6da56","pages":50,"links":[{"label":"arXiv本地版本 2406.12045v1","url":"https://arxiv.org/abs/2406.12045v1"}],"verified":"2026-09-15","mappings":[{"rq":"X3c","role":"core"}],"annotation":{"id":"P067","title":"τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","year":"2024","authors":"Shunyu Yao; Noah Shinn; Pedram Razavi; Karthik Narasimhan","teams":[],"topics":["hci"],"rqs":["X3c"],"collected":true,"review_status":"existing_notes","question":"零售/航空服务任务及pass^k一致性指标，补充静态工具调用基准。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用模拟用户、领域规则和API数据库交互评估语言代理，检查最终数据库是否达成目标，并衡量多次执行都成功的可靠性。","input_conditions":"用户由LLM模拟，后端为受控数据库；pass^k指k次都成功，和至少一次成功的pass@k相反；数据库结果匹配无法穷尽所有对话品质/规则违规。","training_supervision":"给代理政策与工具、模拟用户给需求，通过交互完成状态改变；匹配最终状态并重复运行估计一致成功率。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表2 GPT-4o pass^1零售61.2%、航空35.2%，按领域平均48.2%；零售pass^8低于25%。因此摘要“&lt;50%”是跨领域平均，不是每个域都低于50%。","boundary":"【解读】两域、模拟用户和有限任务影响外部效度；成功依赖模型版本/提示/工具实现，最终状态评估也可能漏掉过程中错误。","evidence":"PDF §2–5、表2、图4。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2406.12045v1","url":"https://arxiv.org/abs/2406.12045v1"}],"note":"p067","priority":0},"aliases":[]},{"id":"P066","title":"Let’s Verify Step by Step","short":"Let’s Verify Step by Step","year":"2024","authors":"Hunter Lightman; Vineet Kosaraju; Yura Burda; Harri Edwards; Bowen Baker; Teddy Lee; Jan Leike; John Schulman; Ilya Sutskever; Karl Cobbe","collected":true,"note":"p066","scope":"本地 PDF · 既有阅读笔记","summary":"比较对每一步推理给反馈的过程监督与只标记最终答案的结果监督，在数学推理中过程奖励模型更适合挑选可靠解答，并发布PRM800K人工标注。","boundary":"主要训练奖励/排序模型，固定生成器进行best-of-N选择；作者明确没有用奖励模型对生成器做RL。78%是在代表性MATH测试子集、较大采样预算下的结果。","evidence":"PDF §2、§3–5、图3、§8；方法边界p.3。","sources":["Reasoning/23_openai_Lets_Verify_Step_by_Step.pdf"],"sha256":"af32cabec7d40ca2d5b6bfc8ea28d6b5fdcf987eabb0843ca9a5a6f2371fdfaf","pages":29,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X3b","role":"core"}],"annotation":{"id":"P066","title":"Let’s Verify Step by Step","year":"2024","authors":"Hunter Lightman; Vineet Kosaraju; Yura Burda; Harri Edwards; Bowen Baker; Teddy Lee; Jan Leike; John Schulman; Ilya Sutskever; Karl Cobbe","teams":[],"topics":["world_model"],"rqs":["X3b"],"collected":true,"review_status":"existing_notes","question":"系统对比PRM/ORM、主动学习收集步骤标注及约80万条反馈数据集。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"比较对每一步推理给反馈的过程监督与只标记最终答案的结果监督，在数学推理中过程奖励模型更适合挑选可靠解答，并发布PRM800K人工标注。","input_conditions":"主要训练奖励/排序模型，固定生成器进行best-of-N选择；作者明确没有用奖励模型对生成器做RL。78%是在代表性MATH测试子集、较大采样预算下的结果。","training_supervision":"人类逐步判断正确/错误/中性，训练步骤奖励模型；与自动最终答案标签训练的ORM和多数投票比较；主动选择高价值错误样本。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"最佳过程监督系统在所评MATH子集解出约78%；PRM随N增加优于ORM和多数投票；主动学习带来约2.6倍数据效率提升。","boundary":"【作者/解读】数学域和可检查答案限制泛化；大规模PRM/ORM训练数据并非完全可比，小规模实验补充控制；人工步骤标注昂贵，多样本排序增加推理成本。","evidence":"PDF §2、§3–5、图3、§8；方法边界p.3。","checked":"2026-09-15","links":[],"note":"p066","priority":0},"aliases":[]},{"id":"P065","title":"Human-in-the-Loop through Chain-of-Thought","short":"Human-in-the-Loop through Chain-of-Thought","year":"2023","authors":"Zefan Cai; Baobao Chang; Wenjuan Han","collected":true,"note":"p065","scope":"本地 PDF · 既有阅读笔记","summary":"通过人类局部修改LLM推理链提升多步推理，并用成本—效用模型分析人工纠错投入的取舍。","boundary":"使用text-davinci-002及12个推理数据集；改善包含额外人工信息，不能等同模型自主推理提升；经济模型最优性仅相对其成本/效用假设。","evidence":"PDF §3–4、表2–3、§5–6。","sources":["Reasoning/23_Human-in-the-Loop through Chain-of-Thought.pdf"],"sha256":"0a48c6cfe64884bc4292a0b31e6fd639697b72ad6161f55fcdbc5369721205f6","pages":20,"links":[{"label":"arXiv本地版本 2306.07932v2","url":"https://arxiv.org/abs/2306.07932v2"}],"verified":"2026-09-15","mappings":[{"rq":"X3b","role":"core"}],"annotation":{"id":"P065","title":"Human-in-the-Loop through Chain-of-Thought","year":"2023","authors":"Zefan Cai; Baobao Chang; Wenjuan Han","teams":[],"topics":["world_model"],"rqs":["X3b"],"collected":true,"review_status":"existing_notes","question":"Manual Correction System（MCS）与CAMLOP成本效用模型，将中间逻辑修正和人工成本一起评估。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过人类局部修改LLM推理链提升多步推理，并用成本—效用模型分析人工纠错投入的取舍。","input_conditions":"使用text-davinci-002及12个推理数据集；改善包含额外人工信息，不能等同模型自主推理提升；经济模型最优性仅相对其成本/效用假设。","training_supervision":"人工检查并修正推理子步骤，继续生成；可结合self-consistency；以Cobb–Douglas式效用与预算分析纠错策略。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"8个算术数据集MCS比CoT平均+4.68个百分点，结合self-consistency平均+6.39；GSM8K56.48→61.56→62.92（5次运行中位）；还评估常识/符号任务。","boundary":"【解读】人工知识、纠错质量及时间计价会影响结论；旧单一骨干和有限任务限制对现今模型与真实人机协作的外推。","evidence":"PDF §3–4、表2–3、§5–6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2306.07932v2","url":"https://arxiv.org/abs/2306.07932v2"}],"note":"p065","priority":0},"aliases":[]},{"id":"P064","title":"Causality Model for Semantic Understanding on Videos","short":"Causality Model for Semantic Understanding on Videos","year":"2025","authors":"Yicong Li（李逸聪；学位作者）；导师Tat-Seng Chua","collected":true,"note":"p064","scope":"本地 PDF · 既有阅读笔记","summary":"围绕视频关系检测与视频问答中的长尾、背景混淆和复杂时空结构，依次提出IVRD、IGV、EIGV和STR/TranSTR，研究因果建模与视觉证据选择。","boundary":"针对具体监督视频理解任务的结构建模与正则化；没有证实任意现实因果发现。作者明确缺少人类因果场景定位标注，主要由QA准确率间接验证定位质量。","evidence":"摘要PDF pp.9–11；表3.2 p.46、表4.2–3 p.71、表5.2 p.91、表6.3–4 p.114；结论pp.120–123。","sources":["Reasoning/23_Causality Model for Semantic Understanding on Videos.pdf"],"sha256":"f9114bfd9eae7a7dc8539edb63337135da99bd93a5bc3319fd7cf0c0e06ad626","pages":139,"links":[{"label":"arXiv本地版本 2503.12447v1","url":"https://arxiv.org/abs/2503.12447v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"support"}],"annotation":{"id":"P064","title":"Causality Model for Semantic Understanding on Videos","year":"2025","authors":"Yicong Li（李逸聪；学位作者）；导师Tat-Seng Chua","teams":[],"topics":["world_model"],"rqs":["W2c"],"collected":true,"review_status":"existing_notes","question":"四部分：关系原型与干预去偏；问题关键场景的不变定位；结合等变性的可解释定位；复杂长视频中关键帧和对象的时空选择。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"围绕视频关系检测与视频问答中的长尾、背景混淆和复杂时空结构，依次提出IVRD、IGV、EIGV和STR/TranSTR，研究因果建模与视觉证据选择。","input_conditions":"针对具体监督视频理解任务的结构建模与正则化；没有证实任意现实因果发现。作者明确缺少人类因果场景定位标注，主要由QA准确率间接验证定位质量。","training_supervision":"IVRD以对象轨迹和关系原型降低对象—关系偏置；IGV置换环境保持答案不变；EIGV再要求因果场景/问题语义变化引发答案等变；TranSTR可微选择时刻/对象并改进候选答案解码。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表3.2 ImageNet-VidVRD：mAP22.97对基线21.24，零样本mAP1.47对0.60；表4.2 IGV NExT-QA51.34对HGA50.01；表5.2 EIGV跨骨干/数据集提升1.3–5.2个百分点；表6.3 TranSTR NExT-QA61.5、MSVD47.1、MSRVTT43.1，表6.4 Causal-VidQA62.2对VGT55.4。不同章的骨干/设置不同，不能视为单一连续受控消融。","boundary":"【作者】缺乏直接视觉因果定位评估、迁移到大型VLM计算开销高、3D与现实复杂场景待探索；【解读】背景置换和因果图是建模假设，QA改进本身不证明识别真实因果机制。","evidence":"摘要PDF pp.9–11；表3.2 p.46、表4.2–3 p.71、表5.2 p.91、表6.3–4 p.114；结论pp.120–123。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2503.12447v1","url":"https://arxiv.org/abs/2503.12447v1"}],"note":"p064","priority":0},"aliases":[]},{"id":"P063","title":"Large Language Models and Causal Inference in Collaboration: A Comprehensive Survey","short":"Large Language Models and Causal Inference in Collaboration","year":"2025","authors":"Xiaoyu Liu; Paiheng Xu; Junda Wu; Jiaxin Yuan; Yifan Yang; Yuhang Zhou; Fuxiao Liu; Tianrui Guan; Haoliang Wang; Tong Yu; Julian McAuley; Wei Ai; Furong Huang","collected":true,"note":"p063","scope":"本地 PDF · 既有阅读笔记","summary":"从双向关系综述因果推断与LLM：因果方法帮助推理、公平安全、可解释性和多模态建模；LLM知识与生成能力帮助因果发现和效应估计。","boundary":"综述，没有提出统一因果求解器或新实验排行榜；文献中的因果保证依赖各自识别假设。","evidence":"PDF §2–5、p.9 Limitations。","sources":["Reasoning/2025.finding_LLMs and Causal Inference in Collaboration.pdf"],"sha256":"c65902b8d31e407e95a5902d022c21236bf54757c131aea82c03d264e43e73ee","pages":17,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P063","title":"Large Language Models and Causal Inference in Collaboration: A Comprehensive Survey","year":"2025","authors":"Xiaoyu Liu; Paiheng Xu; Junda Wu; Jiaxin Yuan; Yifan Yang; Yuhang Zhou; Fuxiao Liu; Tianrui Guan; Haoliang Wang; Tong Yu; Julian McAuley; Wei Ai; Furong Huang","teams":[],"topics":["world_model"],"rqs":["W2c","W4c"],"collected":true,"review_status":"existing_notes","question":"提供双向任务分类与方法梳理，组织因果视角下的LLM评测、干预和知识辅助推断。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"从双向关系综述因果推断与LLM：因果方法帮助推理、公平安全、可解释性和多模态建模；LLM知识与生成能力帮助因果发现和效应估计。","input_conditions":"综述，没有提出统一因果求解器或新实验排行榜；文献中的因果保证依赖各自识别假设。","training_supervision":"按“因果推断→LLM”和“LLM→因果推断”组织研究，人工筛选相关论文/预印本并归纳挑战。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"主要产出为分类、研究对照和开放问题：因果知识、可识别性、模型偏差和评估可靠性仍需结合；无统一效应量可报告。","boundary":"【作者】领域快速发展，侧重关键工作覆盖而非穷尽检索，预印本质量由人工判断；【解读】不同因果任务与数据假设之间的结果不可直接横比。","evidence":"PDF §2–5、p.9 Limitations。","checked":"2026-09-15","links":[],"note":"p063","priority":0},"aliases":[]},{"id":"P062","title":"InstructPipe: Generating Visual Blocks Pipelines with Human Instructions and LLMs","short":"InstructPipe","year":"2025","authors":"Zhongyi Zhou; Jing Jin; Vrushank Phadnis; Xiuxiu Yuan; Jun Jiang; Xun Qian; Kristen Wright; Mark Sherwood; Jason Mayes; Jingtao Zhou; Yiyi Huang; Zheng Xu; Yinda Zhang; Johnny Lee; Alex Olwal; David Kim; Ram Iyengar; Na Li; Ruofei Du","collected":true,"note":"p062","scope":"本地 PDF · 既有阅读笔记","summary":"用自然语言生成Visual Blocks的ML可视化流水线，再由用户检查和编辑节点图，减少从空白画布寻找和连接节点的工作。","boundary":"生成范围受已支持节点/API和解释器约束；不保证流水线语义完全正确，用户仍需理解和调试。","evidence":"PDF §3–5、§6.5、表2 p.9、§7–8。","sources":["hci_du/Zhou_InstructPipe-BuildingVisualProgrammingPipelinesInVisualBlocksWithHumanInstructionsUsingLLMs_CHI2025.pdf"],"sha256":"1c79bb8d2488e8d95ccebbb3496de4af2ac61c9a35d52e479d9b7237d307b410","pages":22,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3706598.3713905"}],"verified":"2026-09-15","mappings":[{"rq":"W1a","role":"support"},{"rq":"X4a","role":"core"}],"annotation":{"id":"P062","title":"InstructPipe: Generating Visual Blocks Pipelines with Human Instructions and LLMs","year":"2025","authors":"Zhongyi Zhou; Jing Jin; Vrushank Phadnis; Xiuxiu Yuan; Jun Jiang; Xun Qian; Kristen Wright; Mark Sherwood; Jason Mayes; Jingtao Zhou; Yiyi Huang; Zheng Xu; Yinda Zhang; Johnny Lee; Alex Olwal; David Kim; Ram Iyengar; Na Li; Ruofei Du","teams":[],"topics":["hci"],"rqs":["W1a","X4a"],"collected":true,"review_status":"existing_notes","question":"节点选择器、伪代码生成器与纠错编译器的模块化助手，结合技术评测及N=16用户研究。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用自然语言生成Visual Blocks的ML可视化流水线，再由用户检查和编辑节点图，减少从空白画布寻找和连接节点的工作。","input_conditions":"生成范围受已支持节点/API和解释器约束；不保证流水线语义完全正确，用户仍需理解和调试。","training_supervision":"LLM按指令选择节点→依据节点文档生成伪代码→解释器修复并编译JSON节点图→Visual Blocks交互修改。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"用户研究表2：完成时间中位203.5秒对304.5秒；交互次数中位5对16，均p&lt;.001；NASA-TLX六项中五项改善，心理需求未显著下降。论文“5倍”交互缩减来自其他评测条件，不能代替该用户研究的3.2倍。","boundary":"【作者】生成结果的理解与调试、精确提示编写会增加心理负担；语言与视觉思考切换有成本；有限节点及用户任务限制外推。","evidence":"PDF §3–5、§6.5、表2 p.9、§7–8。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3706598.3713905"}],"note":"p062","priority":0},"aliases":[]},{"id":"P061","title":"AgentHands: Generating Interactive Hand Gestures for Spatially Grounded Agent Conversations in XR","short":"AgentHands","year":"2026","authors":"Ziyi Liu; David Li; Zhongyi Zhou; David Kim; Ruofei Du; Xun Qian","collected":true,"note":"p061","scope":"本地 PDF · 既有阅读笔记","summary":"让XR会话助手以与语音同步、指向真实场景的虚拟手势解释对象、动作和位置，缩小语言指令与空间理解之间的差距。","boundary":"依赖轻量预扫描对象注册表，主要适合静态场景；手势实例来自人工编写的有限集合，并非任意动作生成或物理机器人操作。","evidence":"PDF §4.5、§6、图8 p.13、§7 pp.14–15。","sources":["hci_du/Liu_AgentHands-GeneratingInteractiveHandsGesturesForSpatiallyGroundedAgentConversationsInXR_CHI2026.pdf"],"sha256":"4e70cdb316ca2322b9d9f88e65c0f61e7650371854027fe51de20c96b656225c","pages":24,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3790938"}],"verified":"2026-09-15","mappings":[{"rq":"X1a","role":"core"}],"annotation":{"id":"P061","title":"AgentHands: Generating Interactive Hand Gestures for Spatially Grounded Agent Conversations in XR","year":"2026","authors":"Ziyi Liu; David Li; Zhongyi Zhou; David Kim; Ruofei Du; Xun Qian","teams":[],"topics":["hci"],"rqs":["X1a"],"collected":true,"review_status":"existing_notes","question":"RQ1：在什么 XR 情境中，文字/语音回应会妨碍空间理解与参与？RQ2：手部具身智能体应具有什么属性，才能协调时机、表现和交互？","question_origin":"作者明确 RQ 的中文转述","summary":"让XR会话助手以与语音同步、指向真实场景的虚拟手势解释对象、动作和位置，缩小语言指令与空间理解之间的差距。","input_conditions":"依赖轻量预扫描对象注册表，主要适合静态场景；手势实例来自人工编写的有限集合，并非任意动作生成或物理机器人操作。","training_supervision":"N=10形成性研究→LLM生成按词对齐的手势类型/参数→解析为时间戳姿态→Unity/OpenXR渲染；Galaxy XR、Gemini2.5Flash与语音识别/合成。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"N=12被试内研究，定位对象评分6.50对4.58/7，参与感6.08对4.58，理解困难1.83对3.58；数值信息理解差异不显著。主要指标是体验问卷，未证明长期记忆或实际任务正确率提升。","boundary":"【作者】预注册静态场景、有限手势库、细粒度操作精度、文化和个性化适配不足；【解读】小样本短时语音基线比较，不能分离所有视觉/同步因素。","evidence":"PDF §4.5、§6、图8 p.13、§7 pp.14–15。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3772318.3790938"}],"note":"p061","priority":0},"aliases":[],"research_question":{"kind":"作者明确 RQ 的中文转述","text":"RQ1：在什么 XR 情境中，文字/语音回应会妨碍空间理解与参与？RQ2：手部具身智能体应具有什么属性，才能协调时机、表现和交互？","location":"PDF p.4 §3 Formative Study"}},{"id":"P080","title":"Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning","short":"Vis-CoT","year":"2025","authors":"Kaviraj Pather; Elena Hadjigeorgiou; Arben Krasniqi; Claire Schmit; Irina Rusu; Marc Pons; Kabir Khan","collected":true,"note":"p080","scope":"本地 PDF · 既有阅读笔记","summary":"将线性CoT转换成交互图，由用户标记、剪除错误分支并补充前提，再继续生成，报告人机协作正确率和体验提升。","boundary":"结果包含用户新增知识和纠错，不是Llama2-70B独立解题能力；图是CoT的结构化展示，不保证忠实反映内部推理。","evidence":"PDF pp.6–8，算法1、实验设置、表I–III。","sources":["Reasoning/25_Vis-CoT_A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning.pdf"],"sha256":"7ac33fd5fafb7173409dd79467e23080aeebc87bb5f9a9874e66c02df4d9ec78","pages":10,"links":[{"label":"arXiv本地版本 2509.01412v2","url":"https://arxiv.org/abs/2509.01412v2"}],"verified":"2026-09-15","mappings":[{"rq":"X3b","role":"core"}],"annotation":{"id":"P080","title":"Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning","year":"2025","authors":"Kaviraj Pather; Elena Hadjigeorgiou; Arben Krasniqi; Claire Schmit; Irina Rusu; Marc Pons; Kabir Khan","teams":[],"topics":["world_model"],"rqs":["X3b"],"collected":true,"review_status":"existing_notes","question":"Vis-CoT图结构、pruning/grafting干预流程与用户研究。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"将线性CoT转换成交互图，由用户标记、剪除错误分支并补充前提，再继续生成，报告人机协作正确率和体验提升。","input_conditions":"结果包含用户新增知识和纠错，不是Llama2-70B独立解题能力；图是CoT的结构化展示，不保证忠实反映内部推理。","training_supervision":"Llama2-70B-Chat、React/D3界面与FastAPI，24名相关专业参与者；GSM8K/StrategyQA及100项自建规划任务，人工评价部分任务的答案与有效推理链。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"作者报告CoT→Vis-CoT：GSM8K74.8→91.7%，StrategyQA79.5→94.1%，规划68→92%；平均时间410.5→285.2秒，2.1次干预/题；SUS65.5→88.2。","boundary":"【解读】正文对全测试集评测与24人用户实验的样本分配、统计不确定性及复现材料交代有限，数值应作作者报告；参与者有专业背景，需独立复现及更广泛人群验证。","evidence":"PDF pp.6–8，算法1、实验设置、表I–III。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2509.01412v2","url":"https://arxiv.org/abs/2509.01412v2"}],"note":"p080","priority":0},"aliases":[]},{"id":"P079","title":"Thinking in 360°: Humanoid Visual Search in the Wild","short":"Thinking in 360°","year":"2025","authors":"Heyang Yu; Yinan Han; Xiangyu Zhang; Baiqiao Yin; Bowen Chang; Xiangyu Han; Xinhao Liu; Jing Zhang; Marco Pavone; Chen Feng; Saining Xie; Yiming Li","collected":true,"note":"p079","scope":"本地 PDF · 既有阅读笔记","summary":"在360°全景中通过头部转动主动寻找目标物体或路径，构建公共复杂环境H*Bench并训练视觉搜索代理。","boundary":"环境由单张全景表示，主要动作是头部视角旋转/对准；没有真实行走、避障、动态环境或完整机器人部署验证。","evidence":"PDF §3–4、表1与训练结果、图5。","sources":["humanintheloop/25_Thinking in 360_Humanoid Visual Search in the Wild.pdf"],"sha256":"864de2cd0e517e00859e476929d6b7381cda259798222181b6e00f4b44c92e02","pages":23,"links":[{"label":"arXiv本地版本 2511.20351v2","url":"https://arxiv.org/abs/2511.20351v2"}],"verified":"2026-09-15","mappings":[{"rq":"X1c","role":"core"}],"annotation":{"id":"P079","title":"Thinking in 360°: Humanoid Visual Search in the Wild","year":"2025","authors":"Heyang Yu; Yinan Han; Xiangyu Zhang; Baiqiao Yin; Bowen Chang; Xiangyu Han; Xinhao Liu; Jing Zhang; Marco Pavone; Chen Feng; Saining Xie; Yiming Li","teams":[],"topics":["hci"],"rqs":["X1c"],"collected":true,"review_status":"existing_notes","question":"对象搜索HOS/路径搜索HPS任务、全景感知—动作闭环与SFT+RL训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在360°全景中通过头部转动主动寻找目标物体或路径，构建公共复杂环境H*Bench并训练视觉搜索代理。","input_conditions":"环境由单张全景表示，主要动作是头部视角旋转/对准；没有真实行走、避障、动态环境或完整机器人部署验证。","training_supervision":"从全景渲染当前视角，根据图像/历史选择头部动作；Qwen2.5-VL-3B全参数SFT后RL优化搜索成功。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"对象搜索14.83%→47.38%，路径6.44%→24.94%；Gemini2.5Pro基线HOS31.96%、HPS33.00%，故训练模型并非在路径上超过最佳闭源模型。","boundary":"【作者/解读】物理/社会空间常识和视觉—动作转化困难；静态全景不含真实移动、视差和传感误差，路径任务仍远未解决。","evidence":"PDF §3–4、表1与训练结果、图5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2511.20351v2","url":"https://arxiv.org/abs/2511.20351v2"}],"note":"p079","priority":0},"aliases":[]},{"id":"P078","title":"Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs","short":"Seeing but Not Believing","year":"2025","authors":"Zhining Liu; Ziyi Chen; Hui Liu; Chen Luo; Xianfeng Tang; Suhang Wang; Joy Zeng; Zhenwei Dai; Zhan Shi; Tianxin Wei; Benoit Dumoulin; Hanghang Tong","collected":true,"note":"p078","scope":"本地 PDF · 既有阅读笔记","summary":"分析视觉注意力与答对之间的分离，发现模型错误回答时也可能关注正确证据，提出测试时视觉证据增强VEA。","boundary":"“看到”用注意力定位代理衡量，不等于模型完整理解或证据对答案有因果作用；需要开放权重/注意力访问。","evidence":"PDF §3–4、表1–2、§6。","sources":["Reasoning/25_SEEING BUT NOT BELIEVING_PROBING THE DISCONNECT BETWEEN VISUAL ATTENTION AND ANSWER CORRECTNESS IN VLMS.pdf"],"sha256":"b8bec5569aa162e20a84ec3ff8ad4d9f9b33d37157fed6b7feadd35bd121ea22","pages":21,"links":[{"label":"arXiv本地版本 2510.17771v1","url":"https://arxiv.org/abs/2510.17771v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P078","title":"Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs","year":"2025","authors":"Zhining Liu; Ziyi Chen; Hui Liu; Chen Luo; Xianfeng Tang; Suhang Wang; Joy Zeng; Zhenwei Dai; Zhan Shi; Tianxin Wei; Benoit Dumoulin; Hanghang Tong","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"层间注意力诊断与按深层注意力选择/突出证据区域的无需训练干预。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"分析视觉注意力与答对之间的分离，发现模型错误回答时也可能关注正确证据，提出测试时视觉证据增强VEA。","input_conditions":"“看到”用注意力定位代理衡量，不等于模型完整理解或证据对答案有因果作用；需要开放权重/注意力访问。","training_supervision":"定位视觉grounding层，提取证据分数，选择性遮罩/突出图像区域后重推理；跨4个系列8个VLM比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1平均Exact Match+5.67个百分点（最高11.1），Token F1+6.83（最高17.3）；跨LLaVA、Qwen、Gemma、InternVL收益较一致，小模型收益更大。","boundary":"【解读】关注区域也可能错误，遮罩会丢失上下文；额外推理成本及架构依赖，本文定位为诊断与干预研究而非部署完备系统。","evidence":"PDF §3–4、表1–2、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2510.17771v1","url":"https://arxiv.org/abs/2510.17771v1"}],"note":"p078","priority":0},"aliases":[]},{"id":"P077","title":"Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens","short":"Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens","year":"2026","authors":"Chengshuai Zhao; Zhen Tan; Pingchuan Ma; Dawei Li; Bohan Jiang; Yancheng Wang; Yingzhen Yang; Huan Liu","collected":true,"note":"p077","scope":"本地 PDF · 既有阅读笔记","summary":"以可控合成环境研究CoT在训练与测试分布的任务、长度和格式差异下何时失败，解释推理链与最终答案可能不一致。","boundary":"合成符号转化任务中的受控证据，不是证明所有自然语言推理仅为记忆；大模型训练语料不透明。","evidence":"PDF §3–8、表1–2 p.7、Limitations p.11。","sources":["Reasoning/25_Is CoT Reasoning of LLMs a Mirage A Data Distribution Lens.pdf"],"sha256":"a039bae82027a21ab7d38f00228c4d1e549f5b543ad1ad172b9b6c656cf05c6f","pages":38,"links":[{"label":"arXiv本地版本 2508.01191v6","url":"https://arxiv.org/abs/2508.01191v6"}],"verified":"2026-09-15","mappings":[{"rq":"W2a","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P077","title":"Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens","year":"2026","authors":"Chengshuai Zhao; Zhen Tan; Pingchuan Ma; Dawei Li; Bohan Jiang; Yancheng Wang; Yingzhen Yang; Huan Liu","teams":[],"topics":["world_model"],"rqs":["W2a","W4a"],"collected":true,"review_status":"existing_notes","question":"DataAlchemy精确控制分布偏移，分离推理过程、答案与完整链正确性，检验由训练分布形成的归纳偏置。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以可控合成环境研究CoT在训练与测试分布的任务、长度和格式差异下何时失败，解释推理链与最终答案可能不一致。","input_conditions":"合成符号转化任务中的受控证据，不是证明所有自然语言推理仅为记忆；大模型训练语料不透明。","training_supervision":"控制训练变换组合、链长度和表达格式，训练/微调多架构规模模型并对比ID、组合迁移和OOD；分别评估链与答案exact match。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"指定变换实验中完整链ID100%，CMP0.01%、POOD/OOD0%；可出现推理100%但答案0.01%，或推理0%但答案100%的分离。数值只适用于该受控任务。","boundary":"【作者】合成环境无法覆盖自然语言丰富性，真实预训练分布难度量；【解读】特定分布外失败支持脆弱性，不能直接推出不存在任何系统泛化能力。","evidence":"PDF §3–8、表1–2 p.7、Limitations p.11。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2508.01191v6","url":"https://arxiv.org/abs/2508.01191v6"}],"note":"p077","priority":0},"aliases":[]},{"id":"P076","title":"Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models","short":"Interactive Reasoning","year":"2025","authors":"Rock Yuren Pang; K. J. Kevin Feng; Shangbin Feng; Chu Li; Weijia Shi; Yulia Tsvetkov; Jeffrey Heer; Katharina Reinecke","collected":true,"note":"p076","scope":"本地 PDF · 既有阅读笔记","summary":"Hippo将长推理文本组织成可交互的主题树，允许用户删除、添加、修改假设并重新生成，支持有权衡的日常决策。","boundary":"可视化的是生成的CoT及其整理结果，不是模型真实内部计算图；作者明确没有声称反馈使推理或答案更准确/更个性化。","evidence":"PDF §4.3、§5.3、§8 p.11。","sources":["Reasoning/25_Interactive Reasoning_Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models.pdf"],"sha256":"f659a7c8bfc4836d0491888233347daea905380b2a73283dc5f7305cfd0ce316","pages":15,"links":[{"label":"arXiv本地版本 2506.23678v1","url":"https://arxiv.org/abs/2506.23678v1"}],"verified":"2026-09-15","mappings":[{"rq":"X3b","role":"core"}],"annotation":{"id":"P076","title":"Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models","year":"2025","authors":"Rock Yuren Pang; K. J. Kevin Feng; Shangbin Feng; Chu Li; Weijia Shi; Yulia Tsvetkov; Jeffrey Heer; Katharina Reinecke","teams":[],"topics":["hci"],"rqs":["X3b"],"collected":true,"review_status":"existing_notes","question":"提出Interactive Reasoning界面与原型，展示在输出最终答案前介入推理内容的人机协作。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"Hippo将长推理文本组织成可交互的主题树，允许用户删除、添加、修改假设并重新生成，支持有权衡的日常决策。","input_conditions":"可视化的是生成的CoT及其整理结果，不是模型真实内部计算图；作者明确没有声称反馈使推理或答案更准确/更个性化。","training_supervision":"DeepSeek-R1生成推理，GPT-4o负责整理树、澄清和连接节点；反馈节点/直接编辑后续写；16人被试内比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"感知控制评分Hippo5.75对基线4.19，p=.003；用户报告更易理解结构和察觉假设，观察到更有针对性的反馈；没有客观准确率提升结论。","boundary":"【作者】N=16且较熟悉LLM，两项日常两难任务；没有系统验证反馈后的模型行为或CoT忠实性，知识密集任务需外部证据。","evidence":"PDF §4.3、§5.3、§8 p.11。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2506.23678v1","url":"https://arxiv.org/abs/2506.23678v1"}],"note":"p076","priority":0},"aliases":[]},{"id":"P075","title":"Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization","short":"Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization","year":"2025","authors":"Mengshi Qi; Hongwei Ji; Wulian Yun; Xianlin Zhang; Huadong Ma","collected":true,"note":"p075","scope":"本地 PDF · 既有阅读笔记","summary":"将视频与由VLM/LLM生成的Chain-of-Evidence文本结合，在少样本条件下定位未见动作类别的时间范围。","boundary":"few-shot针对新动作类别，基础VLM/LLM和特征器已有预训练；文本生成后有自动过滤、一致性校验、迭代及人工审核，不是无需人工的通用因果定位。","evidence":"PDF §III–IV、表I/III、图6 pp.6–8。","sources":["Reasoning/25_Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization.pdf"],"sha256":"b7cc35891863b534350013194741c2b2bdb2484992030b98ef52a200fee69b5c","pages":22,"links":[{"label":"arXiv本地版本 2504.13460v5","url":"https://arxiv.org/abs/2504.13460v5"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P075","title":"Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization","year":"2025","authors":"Mengshi Qi; Hongwei Ji; Wulian Yun; Xianlin Zhang; Huadong Ma","teams":[],"topics":["world_model"],"rqs":["W4b","X1c"],"collected":true,"review_status":"existing_notes","question":"层次文本—视觉对齐、逐阶段证据链生成和Human-related Anomaly Localization（HAL）数据集。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"将视频与由VLM/LLM生成的Chain-of-Evidence文本结合，在少样本条件下定位未见动作类别的时间范围。","input_conditions":"few-shot针对新动作类别，基础VLM/LLM和特征器已有预训练；文本生成后有自动过滤、一致性校验、迭代及人工审核，不是无需人工的通用因果定位。","training_supervision":"从视频产生事件证据描述，逐层精化时间/动作关系；对齐query/support视觉及语义特征，联合建模动作共同性与差异。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"ActivityNet1.3单实例1-shot mAP@0.5=71.5，多实例5-shot=58.7；在THUMOS14多实例设置改善，但单实例1-shot下降，作者归因于短且不完整动作片段妨碍完整CoE生成。","boundary":"【作者/解读】依赖生成文本质量、验证成本和完整动作语境；HAL及少样本划分的提升不能直接外推到开放世界长视频；证据链提及因果关系并不构成因果识别。","evidence":"PDF §III–IV、表I/III、图6 pp.6–8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2504.13460v5","url":"https://arxiv.org/abs/2504.13460v5"}],"note":"p075","priority":0},"aliases":[]},{"id":"P074","title":"Beyond Single-Sentence Prompts: Upgrading Value Alignment Benchmarks with Dialogues and Stories","short":"Beyond Single-Sentence Prompts","year":"2025","authors":"Yazhou Zhang; Qimeng Liu; Qiuchi Li; Peng Zhang; Jing Qin","collected":true,"note":"p074","scope":"本地 PDF · 既有阅读笔记","summary":"把单句中文价值观评测改写成多轮对话与伦理故事，检验更复杂上下文中的价值对齐与责任判断。","boundary":"中文语境和定义的伦理评分；分数并非客观普世道德质量，也不等于已改善模型安全性。","evidence":"PDF §2–5，§5.2–3 p.13、Limitations p.15。","sources":["Reasoning/25_Beyond Single-Sentence Prompts Upgrading Value Alignment.pdf"],"sha256":"f87a1db46bf43589966d1bf5fd3334cc597bee27afaab611b70859c0073e3b08","pages":24,"links":[{"label":"arXiv本地版本 2503.22115v1","url":"https://arxiv.org/abs/2503.22115v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3c","role":"support"}],"annotation":{"id":"P074","title":"Beyond Single-Sentence Prompts: Upgrading Value Alignment Benchmarks with Dialogues and Stories","year":"2025","authors":"Yazhou Zhang; Qimeng Liu; Qiuchi Li; Peng Zhang; Jing Qin","teams":[],"topics":["world_model"],"rqs":["W3c"],"collected":true,"review_status":"existing_notes","question":"基于CVALUES构建C-Plus Values/CVALUES PLUS数据及分层评估框架，暴露单轮直接问题不易发现的失误。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把单句中文价值观评测改写成多轮对话与伦理故事，检验更复杂上下文中的价值对齐与责任判断。","input_conditions":"中文语境和定义的伦理评分；分数并非客观普世道德质量，也不等于已改善模型安全性。","training_supervision":"自动/人工清洗原始问题，生成对话陷阱与故事，组合人工和自动评分，比较不同模型在对话/叙事场景的表现。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"本地报告Claude3.5对话得分83.7、故事65.3；许多模型在故事任务下降，但各模型并非一致，Llama3.1-405B对话49.4、故事55.2。","boundary":"【作者】文化和场景覆盖有限，评分主观，复杂伦理标准难统一；【解读】合成改写及自动评判可能引入系统偏差。","evidence":"PDF §2–5，§5.2–3 p.13、Limitations p.15。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2503.22115v1","url":"https://arxiv.org/abs/2503.22115v1"}],"note":"p074","priority":0},"aliases":[]},{"id":"P073","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","short":"The Illusion of Thinking","year":"2025","authors":"Parshin Shojaee; Iman Mirzadeh; Keivan Alizadeh; Maxwell Horton; Samy Bengio; Mehrdad Farajtabar","collected":true,"note":"p073","scope":"本地 PDF · 既有阅读笔记","summary":"在可调复杂度的谜题中比较推理模型与普通LLM，分析准确率与思考token随复杂度变化的规律。","boundary":"测量有限模型在给定提示、完整动作序列输出和预算下的谜题表现；不能据此证明模型完全没有推理能力，或所有未来架构存在同一不可逾越上限。","evidence":"PDF §4、图4–8、§5及Limitations p.11。","sources":["Reasoning/25_apple_the-illusion-of-thinking.pdf"],"sha256":"cb4c72f922d3eb75d5fa10c371818027374bf8b592453fc569003a0dfff12a0d","pages":30,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P073","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","year":"2025","authors":"Parshin Shojaee; Iman Mirzadeh; Keivan Alizadeh; Maxwell Horton; Samy Bengio; Mehrdad Farajtabar","teams":[],"topics":["world_model"],"rqs":["W2d","W4a"],"collected":true,"review_status":"existing_notes","question":"使用汉诺塔、棋子交换、过河及积木等可模拟验证任务，识别低、中、高复杂度的不同表现区间并检查推理轨迹。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在可调复杂度的谜题中比较推理模型与普通LLM，分析准确率与思考token随复杂度变化的规律。","input_conditions":"测量有限模型在给定提示、完整动作序列输出和预算下的谜题表现；不能据此证明模型完全没有推理能力，或所有未来架构存在同一不可逾越上限。","training_supervision":"调节任务规模、以模拟器验证逐步动作，每实例25次采样；匹配推理预算比较pass@k，分析解答出现位置及token使用。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"低复杂度普通模型常较有效，中复杂度推理模型占优，高复杂度二者可降至0；临界复杂度附近思考token反而下降，即使仍有预算；给出算法也未稳定解决精确执行。","boundary":"【作者】谜题领域窄、主要黑箱API、确定性逐步验证难推广；【解读】输出长度、任务可解性/表示和执行协议均影响阈值，不能把经验失败解释为普遍理论结论。","evidence":"PDF §4、图4–8、§5及Limitations p.11。","checked":"2026-09-15","links":[],"note":"p073","priority":0},"aliases":[]},{"id":"P072","title":"Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance","short":"Wan-Move","year":"2025","authors":"Ruihang Chu; Yefei He; Zhekai Chen; Shiwei Zhang; Xiaogang Xu; Bin Xia; Dingdong Wang; Hongwei Yi; Xihui Liu; Hengshuang Zhao; Yu Liu; Yingya Zhang; Yujiu Yang","collected":true,"note":"p072","scope":"本地 PDF · 既有阅读笔记","summary":"用密集点轨迹移动首帧潜特征，直接作为图生视频条件，实现无需额外运动编码器的精细运动控制，并提出MoveBench。","boundary":"无架构变化不等于无需训练；需要首帧及运动轨迹，主要展示5秒480p生成，不保证长期遮挡下的可控性。","evidence":"PDF §3、§5表1–2、§6 p.10。","sources":["Reasoning/2512.08765v1.pdf"],"sha256":"d9a58b9d2755593daeac68fd1ff16c24e6acf21b605077b53c9a007c14d384d3","pages":22,"links":[{"label":"arXiv本地版本 2512.08765v1","url":"https://arxiv.org/abs/2512.08765v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3d","role":"support"}],"annotation":{"id":"P072","title":"Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance","year":"2025","authors":"Ruihang Chu; Yefei He; Zhekai Chen; Shiwei Zhang; Xiaogang Xu; Bin Xia; Dingdong Wang; Hongwei Yi; Xihui Liu; Hengshuang Zhao; Yu Liu; Yingya Zhang; Yujiu Yang","teams":[],"topics":["world_model"],"rqs":["W3d"],"collected":true,"review_status":"existing_notes","question":"latent trajectory guidance与运动控制评测集，保持Wan-I2V架构并进行规模化训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用密集点轨迹移动首帧潜特征，直接作为图生视频条件，实现无需额外运动编码器的精细运动控制，并提出MoveBench。","input_conditions":"无架构变化不等于无需训练；需要首帧及运动轨迹，主要展示5秒480p生成，不保证长期遮挡下的可控性。","training_supervision":"将点轨迹投影到VAE潜空间，沿轨迹复制首帧特征，形成时空条件图，对基础I2V模型微调。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"MoveBench/DAVIS上取得较低轨迹EPE和较高PSNR/SSIM；192个多物体样例继续评估；用户研究认为运动控制可与Kling1.5Pro Motion Brush相比，比较限定于所评设置。","boundary":"【作者】长时间遮挡、轨迹缺失可使控制丢失；【解读】质量和控制受基础模型、轨迹准确性及训练分布限制，用户偏好不等同所有指标领先。","evidence":"PDF §3、§5表1–2、§6 p.10。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2512.08765v1","url":"https://arxiv.org/abs/2512.08765v1"}],"note":"p072","priority":0},"aliases":[]},{"id":"P071","title":"Counterfactual World Models via Digital Twin-conditioned Video Diffusion","short":"Counterfactual World Models via Digital Twin-conditioned Video Diffusion","year":"2025","authors":"Yiqing Shen; Aiza Maksutova; Chenjia Li; Mathias Unberath","collected":true,"note":"p071","scope":"本地 PDF · 既有阅读笔记","summary":"把视频转为显式对象与关系的数字孪生描述，LLM修改干预后的时间演化，再条件生成反事实视频。","boundary":"数字孪生为结构化文本/轨迹描述，不是经过物理验证的仿真器；LLM预测的反事实合理性不等于识别真实因果效应。","evidence":"PDF §3–4 pp.3–8；附录A表4 p.10。","sources":["Reasoning/25_Yiqing_Shen_CVPR_Counterfactual World Models via Digital Twin-conditioned Video Diffusion.pdf"],"sha256":"7f7d56e5b755149cc609ad0acdf0b5e58ccdf160a388465ebd8c1f1b9d83044e","pages":14,"links":[{"label":"arXiv本地版本 2511.17481v1","url":"https://arxiv.org/abs/2511.17481v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"core"}],"annotation":{"id":"P071","title":"Counterfactual World Models via Digital Twin-conditioned Video Diffusion","year":"2025","authors":"Yiqing Shen; Aiza Maksutova; Chenjia Li; Mathias Unberath","teams":[],"topics":["world_model"],"rqs":["W2c"],"collected":true,"review_status":"existing_notes","question":"CWMDT将感知、干预传播和视频合成分开，提供可编辑结构条件。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把视频转为显式对象与关系的数字孪生描述，LLM修改干预后的时间演化，再条件生成反事实视频。","input_conditions":"数字孪生为结构化文本/轨迹描述，不是经过物理验证的仿真器；LLM预测的反事实合理性不等于识别真实因果效应。","training_supervision":"提取场景摘要、对象帧描述、深度/面积/质心轨迹→LLM生成干预后的表示→视频扩散条件合成；每个干预采样3条孪生轨迹。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在RVEBench及另一反事实视频基准报告优于比较方法；补充CausalVQA debug评估中Qwen2.5VL+CWMDT反事实准确率70.0%，比基础模型+17.5个百分点，anticipation62.5%、hypothetical72.5%。这些是小型debug集结果。","boundary":"【解读】感知、结构化与LLM推断错误可逐级传播；小规模反事实QA不能证明真实部署或物理约束严格满足；生成成本和多候选选择影响效果。","evidence":"PDF §3–4 pp.3–8；附录A表4 p.10。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2511.17481v1","url":"https://arxiv.org/abs/2511.17481v1"}],"note":"p071","priority":0},"aliases":[]},{"id":"P090","title":"From <Answer> to <Think>: Multi-Dimensional Supervision of Reasoning Process for LLM Optimization","short":"From <Answer> to <Think>","year":"未注明（匿名稿）","authors":"Anonymous authors（本地双盲稿未署名）","collected":true,"note":"p090","scope":"本地 PDF · 既有阅读笔记","summary":"用置信度、相关性与连贯性三个维度评价完整推理过程，作为无需逐步切分或标准答案的奖励，支持偏好优化和RL。","boundary":"评分不要求答案真值，但仍借助预训练相关性/奖励模型及训练数据；不等于没有任何监督或能保证逻辑正确。","evidence":"PDF §2–3、表4–5、§6；首页匿名状态。","sources":["Reasoning/26_From_Answer_to_Think_Mult.pdf"],"sha256":"ffe9f19fb7c2282d7818de1e63fbceaacdcd600c34e4b357d03e839a8c20605a","pages":33,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"support"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P090","title":"From &lt;Answer&gt; to &lt;Think&gt;: Multi-Dimensional Supervision of Reasoning Process for LLM Optimization","year":"未注明（匿名稿）","authors":"Anonymous authors（本地双盲稿未署名）","teams":[],"topics":["world_model"],"rqs":["W4b","X3b"],"collected":true,"review_status":"existing_notes","question":"Dimension-level Reward Model（DRM）及DPO/GRPO训练应用，补充仅最终正确性或逐步PRM监督。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用置信度、相关性与连贯性三个维度评价完整推理过程，作为无需逐步切分或标准答案的奖励，支持偏好优化和RL。","input_conditions":"评分不要求答案真值，但仍借助预训练相关性/奖励模型及训练数据；不等于没有任何监督或能保证逻辑正确。","training_supervision":"置信度校准、Qwen3-8B-Reranker语义相关性及Nemotron70B奖励模型连贯性组成分数，构造偏好对或在线奖励，可与可验证答案奖励组合。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在Llama3.1-8B、R1-Distill-Llama8B及Qwen3-8B上报告数学、QA、代码执行与谜题的ID/OOD收益；DRM能区分答案均对或均错的样本，DRM@ANY在表4优于对应只看答案的偏好构造。","boundary":"【解读】高置信/相关/流畅不保证事实与逻辑正确，存在奖励投机；外部评判模型较大，评分和优化成本不可忽略；匿名稿元数据与公开复现状态未确认。","evidence":"PDF §2–3、表4–5、§6；首页匿名状态。","checked":"2026-09-15","links":[],"note":"p090","priority":0},"aliases":[]},{"id":"P089","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","short":"Fill the GAP","year":"2026","authors":"Yanting Miao; Yutao Sun; Dexin Wang; Mengyu Zhou; Pascal Poupart; Lei Lv; Li Xu; Qi Zhao; Li Wang; Hao Li; Xiaoxi Jiang; Guanjun Jiang","collected":true,"note":"p089","scope":"本地 PDF · 既有阅读笔记","summary":"诊断连续视觉潜推理将decoder隐状态直接反馈到输入时的特征尺度失配，提出特征、数据/上下文及难度分配的多粒度对齐。","boundary":"在Qwen2.5VL-7B等所评设置微调；辅助图像用于监督构造，不是推理时外部图像生成；前作系统对比训练配方不同，不能全部归因为架构。","evidence":"PDF §3–5、表2–5、§6；作者p.1。","sources":["Reasoning/26_Fill the GAP_A Granular Alignment Paradigm for Visual Reasoning in Multimodal LLM.pdf"],"sha256":"4c3611e580ebef4d36d768a4b052d534b7185aab603c5bdce7e121eed47cd053","pages":23,"links":[{"label":"arXiv本地版本 2605.12374v4","url":"https://arxiv.org/abs/2605.12374v4"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P089","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","year":"2026","authors":"Yanting Miao; Yutao Sun; Dexin Wang; Mengyu Zhou; Pascal Poupart; Lei Lv; Li Xu; Qi Zhao; Li Wang; Hao Li; Xiaoxi Jiang; Guanjun Jiang","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"GAP的PCA对齐latent head、可检查辅助图像监督与按难度选择潜token训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"诊断连续视觉潜推理将decoder隐状态直接反馈到输入时的特征尺度失配，提出特征、数据/上下文及难度分配的多粒度对齐。","input_conditions":"在Qwen2.5VL-7B等所评设置微调；辅助图像用于监督构造，不是推理时外部图像生成；前作系统对比训练配方不同，不能全部归因为架构。","training_supervision":"构造49,309个图像—问题—辅助图像样本，学习映射回视觉输入子空间，选择基础模型困难题应用潜监督，并控制latent token预算。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"相对Monet，平均感知+1.74、平均推理+5.98个百分点；相对LVR+0.57/+6.31；基础Qwen Avg-R52.62，而前两者47.99/47.66，说明潜推理也可能退化。","boundary":"【作者/解读】结果主要是均值点估计，潜目标质量/子空间和难度阈值影响收益；更多潜token不必然更好，泛化到其他架构仍需验证。","evidence":"PDF §3–5、表2–5、§6；作者p.1。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2605.12374v4","url":"https://arxiv.org/abs/2605.12374v4"}],"note":"p089","priority":0},"aliases":[]},{"id":"P088","title":"V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval","short":"V-Retrver","year":"2026","authors":"Dongyang Chen; Chaoyang Wang; Dezhao Su; Xi Xiao; Zeyu Zhang; Jing Xiong; Qing Li; Yuzhang Shang; Shichao Kan","collected":true,"note":"p088","scope":"本地 PDF · 既有阅读笔记","summary":"在多模态检索候选重排时主动调用视觉工具查看细节，以交替假设与验证代替只依赖固定图像编码的文字推理。","boundary":"在给定候选池上检索/重排，依赖初始召回及视觉工具；不是无成本全库端到端搜索。","evidence":"PDF §3–4、表2 pp.6–7。","sources":["Reasoning/26_Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval.pdf"],"sha256":"5ad4ffde63f37dc3ccae679a3335edcf4126775661e934ae8201ab65dfcb18b5","pages":26,"links":[{"label":"arXiv本地版本 2602.06034v2","url":"https://arxiv.org/abs/2602.06034v2"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P088","title":"V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval","year":"2026","authors":"Dongyang Chen; Chaoyang Wang; Dezhao Su; Xi Xiao; Zeyu Zhang; Jing Xiong; Qing Li; Yuzhang Shang; Shichao Kan","teams":[],"topics":["world_model"],"rqs":["W4b","X1c"],"collected":true,"review_status":"existing_notes","question":"V-Retrver代理式视觉检索推理及三阶段课程训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在多模态检索候选重排时主动调用视觉工具查看细节，以交替假设与验证代替只依赖固定图像编码的文字推理。","input_conditions":"在给定候选池上检索/重排，依赖初始召回及视觉工具；不是无成本全库端到端搜索。","training_supervision":"监督激活推理→拒绝采样精炼→证据对齐RL，学习针对模糊候选进行选择性图像检查。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"M-BEIR平均Recall69.7%，U-MARVEL-7B64.8%（+4.9个百分点）；FIQ51.2对38.2、CIRR73.5对63.2。各子任务Recall@K的K不同；摘要“平均23%”不能替代这里的同表绝对差。","boundary":"【解读】多轮工具调用与候选数量增加成本，局部检查错误可传入重排，外部检索分布变化及规模化延迟仍需验证。","evidence":"PDF §3–4、表2 pp.6–7。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2602.06034v2","url":"https://arxiv.org/abs/2602.06034v2"}],"note":"p088","priority":0},"aliases":[]},{"id":"P087","title":"Don't Blink: Evidence Collapse during Multimodal Reasoning","short":"Don't Blink","year":"2026","authors":"Suresh Raghu; Satwik Pandey","collected":true,"note":"p087","scope":"本地 PDF · 既有阅读笔记","summary":"发现推理过程中视觉证据注意力下降，但其与出错的关系取决于任务；结合熵和视觉信号进行选择性拒答风险控制。","boundary":"3个2B–8B模型、2模型家族、每数据集约300题；注意力是相关性信号，不能证明证据衰减导致错误。","evidence":"PDF §3–5、Limitations p.8、附录B。","sources":["Reasoning/26_Don't Blink_Evidence Collapse during Multimodal Reasoning.pdf"],"sha256":"d4c05386de217c426af7adda5962f890cb31635e3ba957b26c4a18e7442825f9","pages":18,"links":[{"label":"arXiv本地版本 2604.04207v1","url":"https://arxiv.org/abs/2604.04207v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P087","title":"Don't Blink: Evidence Collapse during Multimodal Reasoning","year":"2026","authors":"Suresh Raghu; Satwik Pandey","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"证据衰减诊断、熵—视觉交互模型及任务条件的vision veto。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"发现推理过程中视觉证据注意力下降，但其与出错的关系取决于任务；结合熵和视觉信号进行选择性拒答风险控制。","input_conditions":"3个2B–8B模型、2模型家族、每数据集约300题；注意力是相关性信号，不能证明证据衰减导致错误。","training_supervision":"用标注证据区域选视觉grounding层，分析推理前后注意力、输出熵和正确性，拟合跨任务交互并在固定覆盖率筛除高风险回答。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"视觉证据注意力常下降超过一半；持续视觉参考任务中的低熵/低视觉关注更危险，符号任务未必；针对性veto在90%覆盖率下最多降低1.9个百分点选择性风险，全局线性融合可能恶化迁移。","boundary":"【作者】模型/数据规模有限、极端象限每格仅2–8样本；分析假定任务类型已知，真实部署还需自动分类；待做激活干预检验因果性。","evidence":"PDF §3–5、Limitations p.8、附录B。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2604.04207v1","url":"https://arxiv.org/abs/2604.04207v1"}],"note":"p087","priority":0},"aliases":[]},{"id":"P086","title":"See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs","short":"See It, Say It, Sorted","year":"2026","authors":"Yongchang Zhang; Oliver Ma; Tianyi Liu; Guangquan Zhou; Yang Chen","collected":true,"note":"p086","scope":"本地 PDF · 既有阅读笔记","summary":"ECRD在推理过程中维护文字视觉证据池，将基础生成概率与证据引导分布结合，不足时再次观察图片补充证据。","boundary":"需要访问token概率并多次视觉查询；证据池来自模型描述，不是已验证真值，“每个token有视觉依据”是设计目标而非形式保证。","evidence":"PDF §2–3、表1 p.4、§4。","sources":["Reasoning/26_An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs.pdf"],"sha256":"f0cf8bcf783bce9a16ed1d4e2b2f7637ef9fb33b402e6646d2012dee7de1f46c","pages":10,"links":[{"label":"arXiv本地版本 2602.21497v2","url":"https://arxiv.org/abs/2602.21497v2"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P086","title":"See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs","year":"2026","authors":"Yongchang Zhang; Oliver Ma; Tianyi Liu; Guangquan Zhou; Yang Chen","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"无需训练的证据条件解码与动态visual decider，尝试抑制推理中视觉幻觉传播。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"ECRD在推理过程中维护文字视觉证据池，将基础生成概率与证据引导分布结合，不足时再次观察图片补充证据。","input_conditions":"需要访问token概率并多次视觉查询；证据池来自模型描述，不是已验证真值，“每个token有视觉依据”是设计目标而非形式保证。","training_supervision":"改进VDGD的候选词和KL证据偏好，融合基础置信度，按当前上下文决定是否追加图像证据并继续解码。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"TreeBench Qwen2.5VL-7B总体37.0→47.9（+10.9个百分点，约29.5%相对提升）；32B42.5→48.6、72B42.2→49.9。摘要16.5–29.5%不应全部写成百分点；RH-Bench另报告RH-AUC收益。","boundary":"【解读】证据生成错误仍可能循环强化；推理延迟、超参数和决策器可靠性影响实际收益，部分子项不变。","evidence":"PDF §2–3、表1 p.4、§4。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2602.21497v2","url":"https://arxiv.org/abs/2602.21497v2"}],"note":"p086","priority":0},"aliases":[]},{"id":"P085","title":"SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models","short":"SolarWM","year":"2026","authors":"Junchao Huang; Guian Fang; Shengju Qian; Xianghao Kong; Zhuoran Zhao; Wei Huang; Yihua Du; Zixin Zhang; Justin Cui; Yuchao Gu; Yukang Chen; Xinting Hu; Tianyu He; Shaoshuai Shi; Zhuotao Tian; Xin Wang; Mike Zheng Shou; Li Jiang","collected":true,"note":"p085","scope":"本地 PDF · 方法条件已核查","summary":"统一多源视频、相机几何、字幕和质量记录，跨视频骨干实施三阶段训练，支持相机可控的长时自回归视频生成。","boundary":"长时展示主要为5B-fast学生；固定场景文本、预定相机轨迹是控制条件，不是任意任务代理或经过验证的物理仿真；发布矩阵含作者承诺，未逐项验证下载。","evidence":"PDF §4–6、表1/4/5；§7 pp.15–20、图10–11。","sources":["Reasoning/2609.02886v1.pdf"],"sha256":"b11f376c90bdd340cfe8f64953858ffa142ddee989d8b5bfc237400650418115","pages":26,"links":[{"label":"arXiv本地版本 2609.02886v1","url":"https://arxiv.org/abs/2609.02886v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3a","role":"core"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P085","arxiv_id":"2609.02886","title":"SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models","year":"2026","authors":"Junchao Huang; Guian Fang; Shengju Qian; Xianghao Kong; Zhuoran Zhao; Wei Huang; Yihua Du; Zixin Zhang; Justin Cui; Yuchao Gu; Yukang Chen; Xinting Hu; Tianyu He; Shaoshuai Shi; Zhuotao Tian; Xin Wang; Mike Zheng Shou; Li Jiang","teams":["mike-zheng-shou"],"topics":["video_gen","world_model"],"rqs":["W1c","W3a"],"collected":true,"review_status":"method_checked","question":"怎样统一异构数据和不同视频骨干的长程交互世界模型训练？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SolarWM 提供多源数据引擎和保留骨干原生结构的适配框架，统一相机控制与长程推理接口。","input_conditions":"多源真实、合成、游戏视频，统一相机条件；四种 5B–33B 骨干共享适配接口。","training_supervision":"双向相机条件训练 → AnyFlow 自回归适配 → DMD 少步因果训练；保留各骨干的原生表示。","inference_support":"面向相机可控的长程滚动；小时级生成可运行不等于全部物理状态在小时尺度正确。","evaluation":"本条核查了跨骨干配方与公开材料矩阵；没有将长程展示解读为严格的机制一致率。","boundary":"论文 p.5 明确其自身的开放材料一栏含发布承诺；本轮下载论文不等于已验证全部数据和权重可取得。长程效率与物体干预正确性仍需分开。","observed_failures":"","evidence":"PDF pp.3–5：范围、三阶段配方、Table 1 的发布承诺说明。方法接口已核查，未复现训练或核查全部发布资产。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2609.02886"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2609.02886v1"}],"note":"p085","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":80,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P084","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","short":"CRONOS","year":"2026","authors":"León Begiristain; Olaf Dünkel; Adam Kortylewski","collected":true,"note":"p084","scope":"本地 PDF · 既有阅读笔记","summary":"在Unreal Engine中保持物理事件类别并系统改变视角、场景、对象类别和外观，测量视频世界模型预测是否稳定符合物理。","boundary":"主要衡量视觉条件变化下的物理一致性，非现实因果效应估计；I2V首帧无法唯一确定未来，采用best-of-three缓解而未完全解决。","evidence":"PDF §3–4、§4.1 p.6、§5 p.9。","sources":["Reasoning/2605.23699v1.pdf"],"sha256":"c2a65989b5dce1061ecdafc430424d43a388220cfd38a6c9f5721e5ab8678137","pages":27,"links":[{"label":"arXiv本地版本 2605.23699v1","url":"https://arxiv.org/abs/2605.23699v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2d","role":"core"}],"annotation":{"id":"P084","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","year":"2026","authors":"León Begiristain; Olaf Dünkel; Adam Kortylewski","teams":[],"topics":["world_model"],"rqs":["W2d"],"collected":true,"review_status":"existing_notes","question":"可匹配干预的CRONOS基准与经人评校验的物体稳定/物理合理性指标。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在Unreal Engine中保持物理事件类别并系统改变视角、场景、对象类别和外观，测量视频世界模型预测是否稳定符合物理。","input_conditions":"主要衡量视觉条件变化下的物理一致性，非现实因果效应估计；I2V首帧无法唯一确定未来，采用best-of-three缓解而未完全解决。","training_supervision":"生成碰撞、跌落、遮挡等受控视频；比较Cosmos2.5、CogVideoX1.5、MAGI1、Wan2.2；部分支持5帧V2V；结合规则、视觉模型和VLM评判。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"所评最强模型成功率仍仅22%；视角变化尤其破坏结果；报告的多种得分从3次采样中按参考运动相似度挑选，不能作单次成功率理解。","boundary":"【作者】合成—真实域差、单参考未来、仅开放模型；【解读】评判模型误差和选优协议影响绝对分数。","evidence":"PDF §3–4、§4.1 p.6、§5 p.9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2605.23699v1","url":"https://arxiv.org/abs/2605.23699v1"}],"note":"p084","priority":0},"aliases":[]},{"id":"P083","title":"Causal-JEPA: Learning World Models through Object-Level Latent Masking","short":"Causal-JEPA","year":"2026","authors":"Heejeong Nam; Quentin Le Lidec; Lucas Maes; Yann LeCun; Randall Balestriero","collected":true,"note":"p083","scope":"本地 PDF · 既有阅读笔记","summary":"将JEPA掩码预测从图像patch移到对象潜变量，通过遮住部分对象迫使模型利用交互关系，改善反事实问答与规划效率。","boundary":"object masking是“counterfactual-like”预测，不直接等同do干预；没有用显式时间因果图验证影响邻域。","evidence":"PDF §4–6、表2 p.6、§7 p.9。","sources":["Reasoning/2602.11389v2.pdf"],"sha256":"956e136d92c4c944a53e3c2d9cd826aebc96b06af542cd767a0a213e47fb609b","pages":25,"links":[{"label":"arXiv本地版本 2602.11389v2","url":"https://arxiv.org/abs/2602.11389v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"},{"rq":"W2c","role":"support"}],"annotation":{"id":"P083","arxiv_id":"2602.11389","title":"Causal-JEPA: Learning World Models through Object-Level Latent Masking","year":"2026","authors":"Heejeong Nam; Quentin Le Lidec; Lucas Maes; Yann LeCun; Randall Balestriero","teams":["yann-lecun"],"topics":["world_model","physics"],"rqs":["W1c","W2c"],"collected":true,"review_status":"existing_notes","question":"对象组织方式和可观测条件怎样影响潜空间因果预测？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Causal-JEPA 以对象为中心进行掩码潜状态预测，研究更结构化的世界建模。","input_conditions":"摘要初读：Causal-JEPA 以对象为中心进行掩码潜状态预测，研究更结构化的世界建模。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"对象分解本身不足以证明因果可辨识；干预数据和观测假设需单独检查。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；已有全文笔记可继续查阅，本轮未据此声称重核。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.11389"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.11389v2"}],"note":"p083","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P081","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","short":"Olaf-World","year":"2026","authors":"Yuxin Jiang; Yuchao Gu; Ivor W. Tsang; Mike Zheng Shou","collected":true,"note":"p081","scope":"本地 PDF · 方法条件已核查","summary":"针对无标签视频中潜动作与场景纠缠的问题，用冻结视频表征的时间变化为潜动作提供跨场景共享语义参考，训练可迁移世界模型。","boundary":"潜动作是从视频变化学习的控制表示，非保证唯一可识别真实动作；“1分钟”是特定新控制空间的少量标注适配，不是完整机器人任务训练时间。","evidence":"PDF §3–4、图4–5、§5及附录E。","sources":["Reasoning/2602.10104v2.pdf"],"sha256":"f108f25fdbcf882621692aef27c19b0b06a75a4405abffef226cbe130019e983","pages":18,"links":[{"label":"arXiv本地版本 2602.10104v2","url":"https://arxiv.org/abs/2602.10104v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P081","arxiv_id":"2602.10104","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","year":"2026","authors":"Yuxin Jiang; Yuchao Gu; Ivor W. Tsang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","world_model"],"rqs":["W1c"],"collected":true,"review_status":"method_checked","question":"无标签视频中的潜动作怎样获得跨场景一致的语义？","question_origin":"依作者 p.5 明列的 RQ1–RQ3 改写：潜动作结构、零样本动作迁移、控制适配数据效率。","summary":"Olaf-World 用冻结视频编码器的时间特征差对齐潜动作效果，再预训练动作条件视频世界模型。","input_conditions":"大量无动作标签的视频；跨场景共享动作效果由冻结自监督视频编码器的时间特征变化提供参照。","training_supervision":"SeqΔ-REPA 对齐序列潜动作和效果；先训练潜动作模型，再冻结并提取潜动作，预训练动作条件视频模型。","inference_support":"使用学习到的潜动作；迁移到显式新控制接口时需要单独考察适配数据。","evaluation":"作者以动作空间结构、跨场景零样本转移、下游控制适配效率分别评价三个 RQ。","boundary":"控制效果对齐是未知机制学习的邻近路线，但不能由此推出潜动作具有唯一因果解释或支持任意规则编辑。","observed_failures":"","evidence":"PDF pp.3–5：SeqΔ-REPA、两阶段流程；p.5 明列实验 RQ。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.10104"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.10104v2"}],"note":"p081","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":95,"mapping_roles":{"W1c":"core"},"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":["P082"]},{"id":"P100","title":"When Thinking Drifts: Evidential Grounding for Robust Video Reasoning","short":"When Thinking Drifts","year":"待核实","authors":"Mi Luo; Zihui Xue; Alex Dimakis; Kristen Grauman","collected":true,"note":"p100","scope":"本地 PDF · 既有阅读笔记","summary":"分析视频CoT可能因语言先验而偏离视觉内容，提出Visual Evidence Reward，用RL促使推理过程保持可验证的视频证据。","boundary":"主要在选择题等封闭答案任务构造规则奖励；开放式QA明确列为未来工作；Bayesian解释不构成所有漂移的因果证明。","evidence":"PDF §3–5、表1、§6 p.10。","sources":["Reasoning/26_When_Thinking_Drifts_Evid.pdf"],"sha256":"2ae02aa04e836398b722dd92b870b3c1937e7f102f2a6a84be28ff44e7e04e26","pages":32,"links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2510.06077"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P100","title":"When Thinking Drifts: Evidential Grounding for Robust Video Reasoning","year":"待核实","authors":"Mi Luo; Zihui Xue; Alex Dimakis; Kristen Grauman","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"Visual Thinking Drift诊断及Video-VER证据奖励训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"分析视频CoT可能因语言先验而偏离视觉内容，提出Visual Evidence Reward，用RL促使推理过程保持可验证的视频证据。","input_conditions":"主要在选择题等封闭答案任务构造规则奖励；开放式QA明确列为未来工作；Bayesian解释不构成所有漂移的因果证明。","training_supervision":"将答案正确、视觉证据、格式和长度奖励结合GRPO（证据权重0.3），训练模型产生与问题相关视频内容一致的推理。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"10基准中所比较开放模型9项排名第一，VSI-Bench由Video-R1更强；TempCompass74.0%、TVBench52.8%。多基础模型直接CoT会下降，证据训练后较稳定。","boundary":"【作者】开放式推理证据奖励待扩展；【解读】受奖励验证器、封闭答案及基础视频感知限制，长而有格式的推理仍可能不忠实。","evidence":"PDF §3–5、表1、§6 p.10。","checked":"2026-09-15","links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2510.06077"}],"note":"p100","priority":0},"aliases":[]},{"id":"P099","title":"VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs","short":"VGS-Decoding","year":"2026","authors":"Govinda Kolli; Adinath Madhavrao Dukre; Behzad Bozorgtabar; Dwarikanath Mahapatra; Imran Razzak","collected":true,"note":"p099","scope":"本地 PDF · 既有阅读笔记","summary":"通过原图与加噪图条件下词概率的差异估计视觉依赖，按token自适应调整医疗VLM解码以减少幻觉。","boundary":"医疗影像问答离线评测，不是临床验证；视觉依赖分数不保证医学正确性；代码在稿中仅承诺录用后发布。","evidence":"PDF §2–3、表1–2、§4 p.9。","sources":["Reasoning/26_Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs.pdf"],"sha256":"cbffff846249c3568249b13ebeb8e15d339fece08618710efe4eaecd716e4206","pages":11,"links":[{"label":"arXiv本地版本 2603.20314v1","url":"https://arxiv.org/abs/2603.20314v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P099","title":"VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs","year":"2026","authors":"Govinda Kolli; Adinath Madhavrao Dukre; Behzad Bozorgtabar; Dwarikanath Mahapatra; Imran Razzak","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"Visual Grounding Score与VGS-Decoding，区别于固定权重对比解码。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过原图与加噪图条件下词概率的差异估计视觉依赖，按token自适应调整医疗VLM解码以减少幻觉。","input_conditions":"医疗影像问答离线评测，不是临床验证；视觉依赖分数不保证医学正确性；代码在稿中仅承诺录用后发布。","training_supervision":"向原图加Gaussian/Poisson噪声，双路得到token分布，以视觉退化后的概率变化定义VGS并重加权候选。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"LLaVA-Med、CheXagent、MedGemma在VQA-RAD和MIMIC-Diff-VQA六组合均报告改善；MedGemma总体分别+8.16/+9.12个百分点，CheXagent在MIMIC仅+0.12；约2倍推理开销。","boundary":"【解读】加噪反应未必等同病灶依据，可能损伤细微信号；仅两个数据集，缺乏临床安全/外部验证，摘要“适合临床部署”超出实验已证实范围。","evidence":"PDF §2–3、表1–2、§4 p.9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2603.20314v1","url":"https://arxiv.org/abs/2603.20314v1"}],"note":"p099","priority":0},"aliases":[]},{"id":"P098","title":"First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models","short":"First Logit Boosting","year":"2026","authors":"Jiwoo Ha; Jongwoo Baek; Jinhyun So","collected":true,"note":"p098","scope":"本地 PDF · 既有阅读笔记","summary":"保存首次生成时的整条词表logit向量，并在后续解码中加权补回，缓解长文本生成时视觉约束减弱造成的对象幻觉。","boundary":"复用的是第一步完整logits，不是重复第一个词；不增加额外模型或双路逐token推理，但不能动态重新读取新证据。","evidence":"PDF §4–6、§7及Limitations p.8。","sources":["Reasoning/26_Visual Grounding Method to Mitigate Object Hallucination in Large VLM.pdf"],"sha256":"ab4f4c867fb503cf82a5beed05b964b90cb445abb3ee0729e0fdc4b4857665d3","pages":19,"links":[{"label":"arXiv本地版本 2604.00455v1","url":"https://arxiv.org/abs/2604.00455v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P098","title":"First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models","year":"2026","authors":"Jiwoo Ha; Jongwoo Baek; Jinhyun So","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"First Logit Boosting（FLB）轻量解码方法，并分析初始视觉信号与“The”等词的间接稳定作用。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"保存首次生成时的整条词表logit向量，并在后续解码中加权补回，缓解长文本生成时视觉约束减弱造成的对象幻觉。","input_conditions":"复用的是第一步完整logits，不是重复第一个词；不增加额外模型或双路逐token推理，但不能动态重新读取新证据。","training_supervision":"缓存l₀，在每一步对当前logits加入加权初始分布后采样；跨对象幻觉任务、模型及基准比较。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"报告在多LVLM和幻觉基准上减少虚构对象，且推理开销接近基线；改进来自静态早期信号补偿，并非消除位置编码导致的长期衰减。","boundary":"【作者】无法充分处理上下文变化的视觉语义，未根治RoPE衰减；【解读】首步不可靠或任务需新证据时，静态强化也可能引入偏差。","evidence":"PDF §4–6、§7及Limitations p.8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2604.00455v1","url":"https://arxiv.org/abs/2604.00455v1"}],"note":"p098","priority":0},"aliases":[]},{"id":"P097","title":"Useful Memories Become Faulty When Continuously Updated by LLMs","short":"Useful Memories Become Faulty When Continuously Updated by LLMs","year":"2026","authors":"Dylan Zhang; Yanshan Lin; Zhengkun Wu; Yihang Sun; Bingxuan Li; Dianqi Li; Hao Peng","collected":true,"note":"p097","scope":"本地 PDF · 既有阅读笔记","summary":"持续把经验压缩改写成文字记忆可能先有帮助再逐渐损坏，即使输入是有用轨迹或标准答案，抽象/合并过程仍会积累失真。","boundary":"研究自然语言外部记忆及当前LLM整理器，不涉及权重更新或所有结构化记忆；不能推出记忆本身必然有害。","evidence":"PDF pp.1–3、§4–6、图1–2/4、§8 p.11；摘要与正文数值冲突。","sources":["Reasoning/26_Useful Memories Become Faulty when continuous update.pdf"],"sha256":"16613d73b3dfe8de8dd73d42c4fb7b2e803b84a78d7ecf748c9e23a7e3b4aa92","pages":69,"links":[{"label":"arXiv本地版本 2605.12978v1","url":"https://arxiv.org/abs/2605.12978v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3a","role":"core"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P097","title":"Useful Memories Become Faulty When Continuously Updated by LLMs","year":"2026","authors":"Dylan Zhang; Yanshan Lin; Zhengkun Wu; Yihang Sun; Bingxuan Li; Dianqi Li; Hao Peng","teams":[],"topics":["world_model"],"rqs":["W3a","X3b"],"collected":true,"review_status":"existing_notes","question":"多代理基准的连续记忆退化诊断，控制更新顺序/分组及原始情节保留，并构建ARC-AGI Stream记忆动作环境。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"持续把经验压缩改写成文字记忆可能先有帮助再逐渐损坏，即使输入是有用轨迹或标准答案，抽象/合并过程仍会积累失真。","input_conditions":"研究自然语言外部记忆及当前LLM整理器，不涉及权重更新或所有结构化记忆；不能推出记忆本身必然有害。","training_supervision":"固定经验池比较Static-All、Static-Group、Stream与只保留episodic轨迹；允许Retain/Delete/Consolidate；分析错分组、过度概括和窄分布过拟合。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"WebShop AWM随经验从8增至128，成功率0.64→0.20（无记忆0.20）；19题已被GPT5.4无记忆全部解出的ARC切片，在带真值合并后正文报告准确率降至约54%；原始轨迹对照仍有竞争力。","boundary":"【作者】文本代理/受控ARC环境、少数模型家族，重复次数少且未报正式误差条；真实具身、多模态及其他记忆格式待验证。","evidence":"PDF pp.1–3、§4–6、图1–2/4、§8 p.11；摘要与正文数值冲突。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2605.12978v1","url":"https://arxiv.org/abs/2605.12978v1"}],"note":"p097","priority":0},"aliases":[]},{"id":"P096","title":"TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models","short":"TSRBench","year":"2026","authors":"Fangxu Yu; Xingang Guo; Lingzhi Yuan; Haoqiang Kang; Hongyu Zhao; Lianhui Qin; Furong Huang; Bin Hu; Tianyi Zhou","collected":true,"note":"p096","scope":"本地 PDF · 既有阅读笔记","summary":"用文本、图形时间序列评估通用模型在感知、推理、预测与决策上的能力，并分析规模和模态组合效应。","boundary":"基准得分衡量所构造任务，不能直接代表真实预测收益、临床/金融决策质量；“scaling规律失效”是该样本上的经验现象。","evidence":"PDF §3–4、表2、图3–4、§5。","sources":["Reasoning/26_TSRBENCH_A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models.pdf"],"sha256":"25dea52cdcb7c8a0a3177586f33d7cd35d7ea00f89222942859987d2928ea700","pages":32,"links":[{"label":"arXiv本地版本 2601.18744v2","url":"https://arxiv.org/abs/2601.18744v2"}],"verified":"2026-09-15","mappings":[{"rq":"W4c","role":"support"}],"annotation":{"id":"P096","title":"TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models","year":"2026","authors":"Fangxu Yu; Xingang Guo; Lingzhi Yuan; Haoqiang Kang; Hongyu Zhao; Lianhui Qin; Furong Huang; Bin Hu; Tianyi Zhou","teams":[],"topics":["world_model"],"rqs":["W4c"],"collected":true,"review_status":"existing_notes","question":"14领域、4,125题、15任务的TSRBench及30余种LLM/VLM/TSLLM比较。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用文本、图形时间序列评估通用模型在感知、推理、预测与决策上的能力，并分析规模和模态组合效应。","input_conditions":"基准得分衡量所构造任务，不能直接代表真实预测收益、临床/金融决策质量；“scaling规律失效”是该样本上的经验现象。","training_supervision":"统一时间序列多模态输入和任务定义，比较文本/视觉/合并输入、模型规模及子任务关联。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"GPT5文本+视觉总体55.6%；开放LLM Qwen2.5-72B42.4%，开放VLM Qwen3VL-32B44.9%。推理/感知随规模改善，预测关联较弱或负；多模态互补未被稳定利用。","boundary":"【解读】文本序列编码、绘图格式和答案评分均影响结果，有限领域题库与模型快照不能建立普遍规模定律。","evidence":"PDF §3–4、表2、图3–4、§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.18744v2","url":"https://arxiv.org/abs/2601.18744v2"}],"note":"p096","priority":0},"aliases":[]},{"id":"P095","title":"TIR-Flow: Active Video Search and Reasoning with Frozen VLMs","short":"TIR-Flow","year":"2026","authors":"Hongbo Jin; Siyi Xie; Jiayu Ding; Kuanwei Lin; Ge Li","collected":true,"note":"p095","scope":"本地 PDF · 既有阅读笔记","summary":"冻结视频VLM，通过分解问题、主动局部观察与持久证据工作区迭代进行视频搜索和推理。","boundary":"不更新模型参数，但使用多轮推理/视频片段访问；所谓“严格逻辑一致”无形式证明，受基础模型规划能力限制。","evidence":"PDF §3–4、表1、Limitations p.9。","sources":["Reasoning/26_TIR-Flow_Active Video Search and Reasoning with Frozen VLMs.pdf"],"sha256":"55c6f57cdd9fd2a838d7f75df0e26eee001942e0b8bebe7806c901f85b182dc2","pages":14,"links":[{"label":"arXiv本地版本 2601.06176v1","url":"https://arxiv.org/abs/2601.06176v1"}],"verified":"2026-09-15","mappings":[{"rq":"X1c","role":"core"}],"annotation":{"id":"P095","title":"TIR-Flow: Active Video Search and Reasoning with Frozen VLMs","year":"2026","authors":"Hongbo Jin; Siyi Xie; Jiayu Ding; Kuanwei Lin; Ge Li","teams":[],"topics":["hci"],"rqs":["X1c"],"collected":true,"review_status":"existing_notes","question":"HDD任务分解、HAP高保真主动感知、EBA证据仲裁组成TIR-Flow。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"冻结视频VLM，通过分解问题、主动局部观察与持久证据工作区迭代进行视频搜索和推理。","input_conditions":"不更新模型参数，但使用多轮推理/视频片段访问；所谓“严格逻辑一致”无形式证明，受基础模型规划能力限制。","training_supervision":"把问题拆成可验证子任务，针对假设搜索/放大视频证据，累积修订线索再回答。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"7个基准报告平均约5.9个百分点收益；Qwen2.5VL-7B EgoSchema69.2%，较基线+10.5个百分点；推理类子集平均约6.7，两个平均不能混用。","boundary":"【作者】仅重点评估7B级LLaVA-Video/Qwen2.5VL，错误初始分解可传播，多轮主动感知降低速度。","evidence":"PDF §3–4、表1、Limitations p.9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.06176v1","url":"https://arxiv.org/abs/2601.06176v1"}],"note":"p095","priority":0},"aliases":[]},{"id":"P094","title":"SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?","short":"SaaS-Bench","year":"2026","authors":"Kean Shi; Zihang Li; Tianyi Ma; Zengji Tu; Jialong Wu; Wendong Xu; Xinbo Xu; Qingyao Yang; Ruoyu Wu; Weichu Xie; Ming Wu; Jason Zeng; Michael Heinrich; Elvis Zhang; Liang Chen; Kuan Li; Baobao Chang","collected":true,"note":"p094","scope":"本地 PDF · 既有阅读笔记","summary":"在23个可部署SaaS系统、6个职业领域中设置106个跨应用长流程任务，以加权检查点衡量部分进度和完整完成。","boundary":"是受控部署的SaaS工作流评测，成绩依赖给定工具/步数/模型版本；部分纯文本模型只评文本域，分母不同。","evidence":"PDF §3–4、表2 pp.7–9、§6。","sources":["humanintheloop/26_SaaS-Bench_Can Computer-Use.pdf"],"sha256":"99ec0f81715a715fb4709c1810e1537ba5cad294c9a1878bd63531abdfc9a8ed","pages":24,"links":[{"label":"arXiv本地版本 2605.15777v2","url":"https://arxiv.org/abs/2605.15777v2"}],"verified":"2026-09-15","mappings":[{"rq":"X3c","role":"core"}],"annotation":{"id":"P094","title":"SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?","year":"2026","authors":"Kean Shi; Zihang Li; Tianyi Ma; Zengji Tu; Jialong Wu; Wendong Xu; Xinbo Xu; Qingyao Yang; Ruoyu Wu; Weichu Xie; Ming Wu; Jason Zeng; Michael Heinrich; Elvis Zhang; Liang Chen; Kuan Li; Baobao Chang","teams":[],"topics":["hci"],"rqs":["X3c"],"collected":true,"review_status":"existing_notes","question":"可部署真实软件环境及长流程多模态评测，区分checkpoint score与resolved rate。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在23个可部署SaaS系统、6个职业领域中设置106个跨应用长流程任务，以加权检查点衡量部分进度和完整完成。","input_conditions":"是受控部署的SaaS工作流评测，成绩依赖给定工具/步数/模型版本；部分纯文本模型只评文本域，分母不同。","training_supervision":"提供任务、应用入口和凭据，代理操作浏览器/GUI；检查各中间状态和最终目标，分析阶段衰减与错误类型。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表2最高总体检查点分43.9%，最高全流程完成率3.8%；GPT5.5High等头部检查点约43–44%，不代表完成同等比例任务；模型在后续阶段持续衰减。","boundary":"【解读】有限任务及应用配置不能穷尽专业工作，检查点权重和预算影响排名；多次尝试提升部分表现但未解决完整流程可靠性。","evidence":"PDF §3–4、表2 pp.7–9、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2605.15777v2","url":"https://arxiv.org/abs/2605.15777v2"}],"note":"p094","priority":0},"aliases":[]},{"id":"P093","title":"Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning","short":"Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning","year":"2026","authors":"Yashwant Pravinrao Bangde; Debaditya Roy","collected":true,"note":"p093","scope":"本地 PDF · 既有阅读笔记","summary":"分别以任务指令和严格视觉证据提示计算两条token分布，用分歧自适应门控融合，降低语言先验驱动的幻觉。","boundary":"推理时双流概率，依赖开放模型logits和证据提示；两流均来自模型，证据流不是真实标签。","evidence":"PDF §3–4、表1、§5 p.10。","sources":["Reasoning/26_Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning.pdf"],"sha256":"68ff3ed3e82e6fec964e338c9348812bd24878ec360a421ddff61a154b9fab90","pages":14,"links":[{"label":"arXiv本地版本 2604.25809v2","url":"https://arxiv.org/abs/2604.25809v2"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P093","title":"Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning","year":"2026","authors":"Yashwant Pravinrao Bangde; Debaditya Roy","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"Instruction-Evidence Contrastive Dual-Stream Decoding（IECD²）的双流及对称KL门控。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"分别以任务指令和严格视觉证据提示计算两条token分布，用分歧自适应门控融合，降低语言先验驱动的幻觉。","input_conditions":"推理时双流概率，依赖开放模型logits和证据提示；两流均来自模型，证据流不是真实标签。","training_supervision":"每步计算instruction/evidence两分布；一致时保留表达性，分歧大时抑制仅语言流偏好的token；跨caption/VQA/对象幻觉评估。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在LLaVA1.5和InstructBLIP的POPE、AMBER、VQAv2、MME及COCO报告改善，尤其POPE adversarial；各指标与骨干详见表1及生成评测表，不能把所有子项概括为同一提升幅度。","boundary":"【作者】视觉证据不足时收益受限、提示分离与KL门控超参数跨任务/架构变化；【解读】双流增加推理成本，一致但错误仍难检测。","evidence":"PDF §3–4、表1、§5 p.10。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2604.25809v2","url":"https://arxiv.org/abs/2604.25809v2"}],"note":"p093","priority":0},"aliases":[]},{"id":"P092","title":"Improving Visual Reasoning with Iterative Evidence Refinement","short":"Improving Visual Reasoning with Iterative Evidence Refinement","year":"2026","authors":"Zeru Shi; Kai Mei; Yihao Quan; Dimitris N. Metaxas; Ruixiang Tang","collected":true,"note":"p092","scope":"本地 PDF · 既有阅读笔记","summary":"SIEVE通过模型内部显著图像区域的embedding重复访问证据，以RL学习何时以及取哪些区域，避免外部裁剪与重新编码。","boundary":"需要RL训练和隐状态访问，不是training-free；复用已有视觉编码不能恢复首次编码完全丢失的细节。","evidence":"PDF §3–4、表1 pp.7–8；正文与表格例外已注明。","sources":["Reasoning/26_Improving Visual Reasoning with Iterative Evidence Refinement.pdf"],"sha256":"90f64b8dd352647c94fd531a6da25b2f0ddbc909fd3c6c949eb59f10a351edb2","pages":21,"links":[{"label":"arXiv本地版本 2603.14117v1","url":"https://arxiv.org/abs/2603.14117v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4b","role":"core"}],"annotation":{"id":"P092","title":"Improving Visual Reasoning with Iterative Evidence Refinement","year":"2026","authors":"Zeru Shi; Kai Mei; Yihao Quan; Dimitris N. Metaxas; Ruixiang Tang","teams":[],"topics":["world_model"],"rqs":["W4b"],"collected":true,"review_status":"existing_notes","question":"内生视觉重访和证据嵌入插入推理链的训练框架。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"SIEVE通过模型内部显著图像区域的embedding重复访问证据，以RL学习何时以及取哪些区域，避免外部裁剪与重新编码。","input_conditions":"需要RL训练和隐状态访问，不是training-free；复用已有视觉编码不能恢复首次编码完全丢失的细节。","training_supervision":"依据文本锚点和视觉显著性抽取区域表示，在生成中触发重访并注入embedding，按回答奖励学习调用策略。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1 Qwen3VL-4B V*78.01→85.86%（+7.85个百分点/约10.06%相对），HR4K77.75→81.25、HR8K72.38→76.13；但ZoomEye的4B V*为90.05，高于SIEVE，正文“所有基线均胜出”的概括不完全符合表格。","boundary":"【解读】既有表征、显著性定位错误和RL奖励限制证据质量；不同工具方法速度/输入预算需一起比较，不能只看平均得分。","evidence":"PDF §3–4、表1 pp.7–8；正文与表格例外已注明。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2603.14117v1","url":"https://arxiv.org/abs/2603.14117v1"}],"note":"p092","priority":0},"aliases":[]},{"id":"P091","title":"Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces","short":"Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces","year":"2026","authors":"Runtao Zhou; Giang Nguyen; Nikita Kharya; Anh Nguyen; Chirag Agarwal","collected":true,"note":"p091","scope":"本地 PDF · 既有阅读笔记","summary":"比较传统CoT与可交互文本、程序和图形解释，研究用户能否更准确核查数学解答及定位推理错误。","boundary":"优化的是人类核查模型解释的表现，不是LLM自主解题；10道实验题中正确/错误解释比例1:9，结果受错误高基率影响。","evidence":"PDF §3–5、图5–7、§7 p.10。","sources":["Reasoning/26_Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces.pdf"],"sha256":"9ec925e6e875d9130a70e08ff8777481680bd097aad8d78aacbca46319149bf2","pages":18,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3742413.3789134"}],"verified":"2026-09-15","mappings":[{"rq":"X3b","role":"core"}],"annotation":{"id":"P091","title":"Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces","year":"2026","authors":"Runtao Zhou; Giang Nguyen; Nikita Kharya; Anh Nguyen; Chirag Agarwal","teams":[],"topics":["hci"],"rqs":["X3b"],"collected":true,"review_status":"existing_notes","question":"RQ1：交互解释能否提高核查准确率？RQ2：怎样影响核查时间和努力？RQ3：用户是否更偏好交互解释？","question_origin":"作者明确 RQ 的中文转述","summary":"比较传统CoT与可交互文本、程序和图形解释，研究用户能否更准确核查数学解答及定位推理错误。","input_conditions":"优化的是人类核查模型解释的表现，不是LLM自主解题；10道实验题中正确/错误解释比例1:9，结果受错误高基率影响。","training_supervision":"保持解释底层内容，改变结构、渐进展示、变量高亮和依赖关系；被试组间比较正确性核验、错误定位、时间及体验。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"核验准确率iGraph85.6%、iPoT82.5%、iCoT80.6%、普通CoT73.5%；平均响应时间57.9、约60、约60、64.7秒。","boundary":"【作者】1:9不平衡是为覆盖9类错误并控制疲劳；图复杂度、代码语法和顺序文本各有成本；【解读】有限数学任务不能代表长期学习提升或真实低错误率审核。","evidence":"PDF §3–5、图5–7、§7 p.10。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3742413.3789134"}],"note":"p091","priority":0},"aliases":[],"research_question":{"kind":"作者明确 RQ 的中文转述","text":"RQ1：交互解释能否提高核查准确率？RQ2：怎样影响核查时间和努力？RQ3：用户是否更偏好交互解释？","location":"PDF p.2 研究问题段落"}},{"id":"P110","title":"Understanding the Sources of Uncertainty for Large Language and Multimodal Models","short":"Understanding the Sources of Uncertainty for Large Language and Multimodal Models","year":"2025","authors":"Ziran Yang; Shibo Hao; Hao Sun; Lai Jiang; Qiyue Gao; Yian Ma; Zhiting Hu","collected":true,"note":"p110","scope":"本地 PDF · 既有阅读笔记","summary":"将模型输出不确定性按提示措辞、上下文和视觉预处理等因素分解，识别与错误率更相关的分量以用于幻觉检测和自训练筛选。","boundary":"分量含义依赖选定扰动因素与采样分布；与错误相关不意味着识别真正因果来源，也不保证概率校准。","evidence":"PDF §2、表1、§3–4 pp.6–9。","sources":["shibo hao/25_Understanding_the_Sources_o.pdf"],"sha256":"2cd60cc497dacba53d97c7c56ccb153e879d408445af64b57ed24429940e268c","pages":20,"links":[],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P110","title":"Understanding the Sources of Uncertainty for Large Language and Multimodal Models","year":"2025","authors":"Ziran Yang; Shibo Hao; Hao Sun; Lai Jiang; Qiyue Gao; Yian Ma; Zhiting Hu","teams":[],"topics":["hci"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"超出传统epistemic/aleatoric二分的信息论分解框架及effective calibrator概念。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"将模型输出不确定性按提示措辞、上下文和视觉预处理等因素分解，识别与错误率更相关的分量以用于幻觉检测和自训练筛选。","input_conditions":"分量含义依赖选定扰动因素与采样分布；与错误相关不意味着识别真正因果来源，也不保证概率校准。","training_supervision":"用条件熵与互信息逐层分解总熵，对提示/输入变体采样，比较分量与错误关联；用于VQA及SVAMP自训练。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"部分分量比总不确定性更能指示幻觉；在视觉QA和数学推理展示检测/筛选收益；SVAMP采用Gemma2-9B、6种实体改写和6种CoT模板，结论受该扰动空间约束。","boundary":"【解读】需多次查询和语义等价改写，改写错误可污染分解；有效分量跨域/模型是否稳定尚无通用保证。","evidence":"PDF §2、表1、§3–4 pp.6–9。","checked":"2026-09-15","links":[],"note":"p110","priority":0},"aliases":[]},{"id":"P108","title":"Flow of Reasoning: Training LLMs for Divergent Problem Solving with Minimal Examples","short":"Flow of Reasoning","year":"未注明（匿名稿）","authors":"Anonymous authors（本地双盲稿）","collected":true,"note":"p108","scope":"本地 PDF · 既有阅读笔记","summary":"用GFlowNet式训练让LLM按奖励比例采样不同有效推理路径，在少量问题示例下同时提高正确性和解法多样性。","boundary":"“15示例”是部分任务的问题数，不代表只有15次训练交互；依赖任务奖励/模拟器，创造性是任务定义的解法多样性指标。","evidence":"PDF §3–4、表1–3、§4.4 p.8。","sources":["shibo hao/25_Flow_of_Reasoning_Trainin.pdf"],"sha256":"938263956875f85c04bb18094173c51bb5da27b8f308b3a4ccec5dc96e60e47b","pages":32,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P108","title":"Flow of Reasoning: Training LLMs for Divergent Problem Solving with Minimal Examples","year":"未注明（匿名稿）","authors":"Anonymous authors（本地双盲稿）","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"Flow of Reasoning（FOR）把多步推理表示为DAG上的概率流，优化多样高奖励轨迹。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用GFlowNet式训练让LLM按奖励比例采样不同有效推理路径，在少量问题示例下同时提高正确性和解法多样性。","input_conditions":"“15示例”是部分任务的问题数，不代表只有15次训练交互；依赖任务奖励/模拟器，创造性是任务定义的解法多样性指标。","training_supervision":"以Markov推理状态与路径奖励构造流匹配/轨迹训练，从有限问题反复探索高质量路径并微调LLM。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"五类谜题评测；Rubik四步183题、15训练示例时FOR准确率10.87±1.18%，SFT1.82%，XoT4.92%；FOR多样性1.29、创造性82.61%。Game24仍落后GPT4o/o1-mini等更强基础模型。","boundary":"【解读】奖励设计和有限可验证环境限制一般开放创意任务；魔方绝对成功率仍低，更多样不等同更正确或更有实际创新价值。","evidence":"PDF §3–4、表1–3、§4.4 p.8。","checked":"2026-09-15","links":[],"note":"p108","priority":0},"aliases":[]},{"id":"P107","title":"Offline Reinforcement Learning for LLM Multi-step Reasoning","short":"Offline Reinforcement Learning for LLM Multi-step Reasoning","year":"2025","authors":"Huaijie Wang; Shibo Hao; Hanze Dong; Shenao Zhang; Yilin Bao; Ziran Yang; Yi Wu","collected":true,"note":"p107","scope":"本地 PDF · 既有阅读笔记","summary":"OREO用离线轨迹联合学习策略与价值函数，以soft Bellman方程进行细粒度信用分配，减少对成对偏好数据的依赖。","boundary":"不需要偏好对不等于不需要带奖励数据；价值模型可直接复用不代表搜索没有额外算力成本。","evidence":"PDF §3–5、表1–2 p.7、§7 p.9。","sources":["shibo hao/25.acl_Offline Reinforcement Learning for LLM Multi-step Reasoning.pdf"],"sha256":"54bc06c0e9082ca1d952447839dd3ba3a39d109632f75bd5f0e1b4818d9458b2","pages":13,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P107","title":"Offline Reinforcement Learning for LLM Multi-step Reasoning","year":"2025","authors":"Huaijie Wang; Shibo Hao; Hanze Dong; Shenao Zhang; Yilin Bao; Ziran Yang; Yi Wu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"离线推理优化目标，可复用学到的价值函数指导测试时树搜索。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"OREO用离线轨迹联合学习策略与价值函数，以soft Bellman方程进行细粒度信用分配，减少对成对偏好数据的依赖。","input_conditions":"不需要偏好对不等于不需要带奖励数据；价值模型可直接复用不代表搜索没有额外算力成本。","training_supervision":"最大熵RL下优化策略/价值的Bellman一致性，支持token或响应层次目标、迭代数据更新和价值引导搜索。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Qwen1.5B GSM8K77.3%、MATH52.5%，SFT73.5/47.5；DeepSeekMath7B85.9/49.2；ALFWorld unseen79.1%、seen80.7%，SFT67.2/62.9。","boundary":"【作者】部分消融/搜索仅1.5B，任务主要数学与ALFWorld，代码/浏览待验证；【解读】离线分布覆盖与价值误差会限制策略改进。","evidence":"PDF §3–5、表1–2 p.7、§7 p.9。","checked":"2026-09-15","links":[],"note":"p107","priority":0},"aliases":[]},{"id":"P106","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","short":"Pandora","year":"待核实","authors":"Jiannan Xiang; Guangyi Liu; Yi Gu; Qiyue Gao; Yuting Ning; Yuheng Zha; Zeyu Feng; Tianhua Tao; Shibo Hao; Yemin Shi; Zhengzhong Liu; Eric P. Xing; Zhiting Hu","collected":true,"note":"p106","scope":"本地 PDF · 既有阅读笔记","summary":"把语言自回归模型与视频扩散生成器结合，按自由文本动作连续生成下一段世界状态视频。","boundary":"世界状态为视频片段，动作跟随和物理一致性可能失败；通用世界模型是目标，“实时控制”不等于每帧物理实时仿真。","evidence":"PDF §2、§3示例与§3.4 p.14、§5。","sources":["shibo hao/24_Pandora_Towards general world model with natural language actions and video states.pdf"],"sha256":"11a16778bc562baf9abab2aa90a8b8b32c0827fa034d9510da76779a515c401d","pages":21,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P106","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","year":"待核实","authors":"Jiannan Xiang; Guangyi Liu; Yi Gu; Qiyue Gao; Yuting Ning; Yuheng Zha; Zeyu Feng; Tianhua Tao; Shibo Hao; Yemin Shi; Zhengzhong Liu; Eric P. Xing; Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"混合自回归—扩散架构与复用预训练模型的分阶段对齐/指令微调。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把语言自回归模型与视频扩散生成器结合，按自由文本动作连续生成下一段世界状态视频。","input_conditions":"世界状态为视频片段，动作跟随和物理一致性可能失败；通用世界模型是目标，“实时控制”不等于每帧物理实时仿真。","training_supervision":"Vicuna7B接收历史视觉状态与动作，输出条件embedding供DynamiCrafter生成下一段，额外使用上一段末4帧维持连续性。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"展示室内外、人类/机器人、2D/3D等跨域可控生成；扩大训练规模后动作跟随改善；§3.4明确展示语义、运动、常识和时序一致性失败。","boundary":"【作者】公共视频字幕噪声影响控制，高质量仿真数据域更容易；【解读】主要视觉演示不能证明长程决策可靠性，后续大模型扩展仍为设想。","evidence":"PDF §2、§3示例与§3.4 p.14、§5。","checked":"2026-09-15","links":[],"note":"p106","priority":0},"aliases":[]},{"id":"P105","title":"New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models","short":"New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models","year":"2024","authors":"Shibo Hao; Yi Gu; Haotian Luo; Tianyang Liu; Xiyan Shao; Xinyuan Wang; Shuhua Xie; Haodi Ma; Adithya Samavedhi; Qiyue Gao; Zhen Wang; Zhiting Hu","collected":true,"note":"p105","scope":"本地 PDF · 既有阅读笔记","summary":"提出自动生成任务特定评价标准的AutoRace与统一搜索、奖励、世界模型组件的LLM Reasoners库，系统比较多步推理策略。","boundary":"AutoRace以GPT4为评判者，自动不等于无误；评判是否符合标准，不保证推理链忠实反映内部过程。","evidence":"PDF §3–5、表1 p.5、§5.2 p.10。","sources":["shibo hao/24_LLM Reasoners_New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models.pdf"],"sha256":"e76d095d0dd17d3c7c502650e2f93035e3bc9f9a914df1c72075b73cd9a35f32","pages":24,"links":[{"label":"arXiv本地版本 2404.05221v2","url":"https://arxiv.org/abs/2404.05221v2"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"core"}],"annotation":{"id":"P105","title":"New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models","year":"2024","authors":"Shibo Hao; Yi Gu; Haotian Luo; Tianyang Liu; Xiyan Shao; Xinyuan Wang; Shuhua Xie; Haodi Ma; Adithya Samavedhi; Qiyue Gao; Zhen Wang; Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"推理链自动评测、模块化库与搜索因素实验分析。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出自动生成任务特定评价标准的AutoRace与统一搜索、奖励、世界模型组件的LLM Reasoners库，系统比较多步推理策略。","input_conditions":"AutoRace以GPT4为评判者，自动不等于无误；评判是否符合标准，不保证推理链忠实反映内部过程。","training_supervision":"自动归纳任务错误/规则形成rubric，再评估链；将CoT、ToT、RAP统一为搜索/奖励/转移，研究宽度、深度和提示。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"6任务推理链评判平均准确率0.86，SocREval0.82、直接整链判断0.56；搜索奖励可减少“答案对但推理错”，部分任务广度优于深度。","boundary":"【解读】评判依赖GPT4及自动rubric质量，搜索比较受预算与提示影响；结论依任务，不能证明所有场景BFS或RAP最优。","evidence":"PDF §3–5、表1 p.5、§5.2 p.10。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2404.05221v2","url":"https://arxiv.org/abs/2404.05221v2"}],"note":"p105","priority":0},"aliases":[]},{"id":"P104","title":"Reasoning with Language Model is Planning with World Model","short":"Reasoning with Language Model is Planning with World Model","year":"2023","authors":"Shibo Hao; Yi Gu; Haodi Ma; Joshua Jiahua Hong; Zhen Wang; Daisy Zhe Wang; Zhiting Hu","collected":true,"note":"p104","scope":"本地 PDF · 既有阅读笔记","summary":"RAP让LLM分别提出推理动作和预测状态变化，再用蒙特卡洛树搜索规划较高价值的推理路径。","boundary":"世界模型是语言预测状态，不是真实环境模拟器；搜索增加多次模型调用，效果受转移/奖励错误限制。","evidence":"PDF §2–4、表1、Limitations p.10。","sources":["shibo hao/2023.emnlp_Reasoning with Language Model is Planning with World Model.pdf"],"sha256":"f67d075c889d885db80355f6d398fb2aa6830406340c365140e234af05056dc3","pages":20,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"core"}],"annotation":{"id":"P104","title":"Reasoning with Language Model is Planning with World Model","year":"2023","authors":"Shibo Hao; Yi Gu; Haodi Ma; Joshua Jiahua Hong; Zhen Wang; Daisy Zhe Wang; Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"统一推理为规划，将LLM世界模型和MCTS用于积木规划、数学及逻辑任务。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"RAP让LLM分别提出推理动作和预测状态变化，再用蒙特卡洛树搜索规划较高价值的推理路径。","input_conditions":"世界模型是语言预测状态，不是真实环境模拟器；搜索增加多次模型调用，效果受转移/奖励错误限制。","training_supervision":"定义状态、动作和奖励，MCTS选择/扩展/回传，LLM模拟后果并评估中间收益，输出一个选定计划。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Blocksworld RAP20在2/4/6步任务成功率1.00/0.88/0.42，GPT4-CoT0.50/0.63/0.40；6步优势很小，33%相对提升是特定汇总口径，不代表每项。","boundary":"【作者】冻结模型受预训练能力限制；【解读】搜索预算、任务特定提示/奖励及不可靠状态预测影响扩展到开放现实问题。","evidence":"PDF §2–4、表1、Limitations p.10。","checked":"2026-09-15","links":[],"note":"p104","priority":0},"aliases":[]},{"id":"P103","title":"Training Large Language Models to Reason in a Continuous Latent Space","short":"Training Large Language Models to Reason in a Continuous Latent Space","year":"2025","authors":"Shibo Hao; Sainbayar Sukhbaatar; DiJia Su; Xian Li; Zhiting Hu; Jason Weston; Yuandong Tian","collected":true,"note":"p103","scope":"本地 PDF · 既有阅读笔记","summary":"Coconut把LLM最后隐状态直接作为下一个输入embedding，在连续潜空间进行中间推理，以课程训练逐步取代文本CoT。","boundary":"以小模型和合成逻辑/数学任务验证，潜状态类似BFS的观察不等于通用、严格或无限宽搜索；数学表现仍低于文本CoT。","evidence":"PDF §3–5、表1 p.9、§5.3–6。","sources":["Reasoning/Training Large Language Models to Reason in a Continuous Latent Space.pdf"],"sha256":"6eb32c71eaa571b727ee95bce20396243fd70dc1ee8a37f91a7de717790d5b46","pages":18,"links":[{"label":"arXiv本地版本 2412.06769v3","url":"https://arxiv.org/abs/2412.06769v3"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P103","title":"Training Large Language Models to Reason in a Continuous Latent Space","year":"2025","authors":"Shibo Hao; Sainbayar Sukhbaatar; DiJia Su; Xian Li; Zhiting Hu; Jason Weston; Yuandong Tian","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"Chain of Continuous Thought架构及课程，展示某些任务中潜状态可同时容纳备选路径的行为。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"Coconut把LLM最后隐状态直接作为下一个输入embedding，在连续潜空间进行中间推理，以课程训练逐步取代文本CoT。","input_conditions":"以小模型和合成逻辑/数学任务验证，潜状态类似BFS的观察不等于通用、严格或无限宽搜索；数学表现仍低于文本CoT。","training_supervision":"逐阶段用连续thought替代更多文本步骤，回馈隐状态，再生成文字答案；比较无CoT、iCoT、pause token等。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1 GSM8K34.1±1.5%对CoT42.9±0.2%，但高于无CoT16.5%；ProsQA97.0对CoT77.5，仍低于iCoT98.2；GSM8K平均生成位置8.2对25.0（包含潜步骤的效率定义须遵循论文）。","boundary":"【作者/解读】课程与已有CoT监督重要、规模和任务有限，难解释/检查潜过程；减少显式token不自动等于同比例实际速度提升。","evidence":"PDF §3–5、表1 p.9、§5.3–6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2412.06769v3","url":"https://arxiv.org/abs/2412.06769v3"}],"note":"p103","priority":0},"family":{"ids":["P026","P103"],"reason":"Coconut 的不同本地版本"},"aliases":["P109","P026"]},{"id":"P101","title":"Computational Understanding of Narratives: A Survey","short":"Computational Understanding of Narratives","year":"2022","authors":"Priyanka Ranade; Sanorita Dey; Anupam Joshi; Tim Finin","collected":true,"note":"p101","scope":"本地 PDF · 既有阅读笔记","summary":"综述叙事的计算理解，特别是在线多源碎片化叙事的构建、抽取、演化、生成、表示与评估。","boundary":"综述及概念整理，不是统一实现系统；涵盖到2022年前后的技术，不能作为后续LLM叙事研究全景。","evidence":"PDF §§II–V、图2、表1/3、§VI p.16。","sources":["Reasoning/Computational_Understanding_of_Narratives_A_Survey.pdf"],"sha256":"976245eb5b4ee27353330a79987c9c069803301b597c0adbedf36e2ae4e9318c","pages":20,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1109/ACCESS.2022.3205314"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"support"}],"annotation":{"id":"P101","title":"Computational Understanding of Narratives: A Survey","year":"2022","authors":"Priyanka Ranade; Sanorita Dey; Anupam Joshi; Tim Finin","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"整理叙事结构组成、语义/时间关系和研究任务层次，汇集资源与开放挑战。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"综述叙事的计算理解，特别是在线多源碎片化叙事的构建、抽取、演化、生成、表示与评估。","input_conditions":"综述及概念整理，不是统一实现系统；涵盖到2022年前后的技术，不能作为后续LLM叙事研究全景。","training_supervision":"围绕实体/事件、主题、意图和关系组织IR/NLU工作，比较自包含故事与跨来源演化叙事。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"产出研究分类图、语义关系示例和代表项目/挑战表，强调跨源连接、时间演化、意图/修辞及一致评估不足；无新模型准确率结果。","boundary":"【解读】叙事定义与粒度跨学科不统一，在线数据偏差/噪声和标准真值缺乏使方法难公平比较；综述选取本身非穷尽。","evidence":"PDF §§II–V、图2、表1/3、§VI p.16。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1109/ACCESS.2022.3205314"}],"note":"p101","priority":0},"aliases":[]},{"id":"P120","title":"Imagine This! Scripts to Compositions to Videos","short":"Imagine This! Scripts to Compositions to Videos","year":"2018","authors":"Tanmay Gupta; Dustin Schwenk; Ali Farhadi; Derek Hoiem; Aniruddha Kembhavi","collected":true,"note":"p120","scope":"本地 PDF · 既有阅读笔记","summary":"CRAFT先从文本预测实体的时空布局，再检索视频实体片段并合成视频，利用组合式表示提高语义匹配和视觉一致性。","boundary":"主要动画域和已有视频片段重组，不能任意合成库中不存在的对象/运动；不同模块评测有使用前序真值布局/外观的条件。","evidence":"PDF §3–5、表1–3与§5.3；ECVA用于会议信息。","sources":["VideoGeneration/18_cvpr_scripts to compositions.pdf"],"sha256":"aeae85082dd70d12d6744a5045231e6a74fa98947a26e4fc29249b04339f83e9","pages":22,"links":[{"label":"arXiv本地版本 1804.03608v1","url":"https://arxiv.org/abs/1804.03608v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P120","title":"Imagine This! Scripts to Compositions to Videos","year":"2018","authors":"Tanmay Gupta; Dustin Schwenk; Ali Farhadi; Derek Hoiem; Aniruddha Kembhavi","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"Composition/Retrieval/Fusion网络、布局与外观联合建模及超过25,000视频的Flintstones标注数据。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"CRAFT先从文本预测实体的时空布局，再检索视频实体片段并合成视频，利用组合式表示提高语义匹配和视觉一致性。","input_conditions":"主要动画域和已有视频片段重组，不能任意合成库中不存在的对象/运动；不同模块评测有使用前序真值布局/外观的条件。","training_supervision":"逐实体布局预测、联合文本/场景/位置检索，triplet与辅助分类学习检索空间，融合时空片段。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在语义名词/形容词/动词召回、布局与人评视觉质量上优于直接像素生成基线；可组合未见描述并转移到无字幕视频库。","boundary":"【解读】依赖精细实体标注与候选片段覆盖，检索组合易产生接缝/动态不一致；动画证据不能外推写实长视频。","evidence":"PDF §3–5、表1–3与§5.3；ECVA用于会议信息。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 1804.03608v1","url":"https://arxiv.org/abs/1804.03608v1"}],"note":"p120","priority":0},"aliases":[]},{"id":"P119","title":"Reasoning Models Know When They’re Right: Probing Hidden States for Self-Verification","short":"Reasoning Models Know When They’re Right","year":"2025","authors":"Anqi Zhang; Yulin Chen; Jane Pan; Chen Zhao; Aurojit Panda; Jinyang Li; He He","collected":true,"note":"p119","scope":"本地 PDF · 既有阅读笔记","summary":"训练隐状态探针识别中间答案正确性，发现答案形成前已有可预测信号，并用高置信提前结束降低过度推理。","boundary":"需要带正确性标签训练探针、访问隐状态；标题“知道”指可解码统计信号，并非意识或无监督自证。","evidence":"PDF §3–5、§5.2 p.8、图5。","sources":["uncertainty/25_probing hidden states for Self-Verification.pdf"],"sha256":"c32a216f1eb0d49db8a1c6873e465b0a52e3c67fb15dc3961361cc6edf700504","pages":18,"links":[{"label":"arXiv本地版本 2504.05419v1","url":"https://arxiv.org/abs/2504.05419v1"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P119","title":"Reasoning Models Know When They’re Right: Probing Hidden States for Self-Verification","year":"2025","authors":"Anqi Zhang; Yulin Chen; Jane Pan; Chen Zhao; Aurojit Panda; Jinyang Li; He He","teams":[],"topics":["hci"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"中间/未来答案正确性探测、校准分析和动态早退出。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"训练隐状态探针识别中间答案正确性，发现答案形成前已有可预测信号，并用高置信提前结束降低过度推理。","input_conditions":"需要带正确性标签训练探针、访问隐状态；标题“知道”指可解码统计信号，并非意识或无监督自证。","training_supervision":"收集中间答案隐状态与标签，训练MLP探针，验证集调参/校准，推理中达到阈值时退出并输出答案。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"阈值0.85约节省24%token，准确率88.2对不退出88.6%，是近似保持并非完全相等；0.9阈值节省19%，准确率同为88.6%；同预算胜固定退出约5个百分点。","boundary":"【解读】探针迁移/校准可能随模型任务改变；阈值越低越可能提前接受错误，token减少不必然线性缩短端到端延迟。","evidence":"PDF §3–5、§5.2 p.8、图5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2504.05419v1","url":"https://arxiv.org/abs/2504.05419v1"}],"note":"p119","priority":0},"aliases":[]},{"id":"P118","title":"Calibrating Reasoning in Language Models with Internal Consistency","short":"Calibrating Reasoning in Language Models with Internal Consistency","year":"2024","authors":"Zhihui Xie; Jizhou Guo; Tong Yu; Shuai Li","collected":true,"note":"p118","scope":"本地 PDF · 既有阅读笔记","summary":"解码中间层对答案的潜在预测，以层间一致性衡量置信度，并优先选择内部更一致的推理路径。","boundary":"需要隐状态访问和可定义答案的任务；内部一致不保证正确，也不是标准概率意义的普遍校准保证。","evidence":"PDF §3–4、§4.1–3、§6 p.10。","sources":["uncertainty/24_calibrating reasoning.pdf"],"sha256":"ab6abe3fc5cdc39c45c1f877d6426ca7303d79f918e3f8d84f9ca2e84d783661","pages":23,"links":[{"label":"arXiv本地版本 2405.18711v2","url":"https://arxiv.org/abs/2405.18711v2"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P118","title":"Calibrating Reasoning in Language Models with Internal Consistency","year":"2024","authors":"Zhihui Xie; Jizhou Guo; Tong Yu; Shuai Li","teams":[],"topics":["hci"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"Internal consistency无需训练置信信号、推理路径加权与attention/FFN跨层分析。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"解码中间层对答案的潜在预测，以层间一致性衡量置信度，并优先选择内部更一致的推理路径。","input_conditions":"需要隐状态访问和可定义答案的任务；内部一致不保证正确，也不是标准概率意义的普遍校准保证。","training_supervision":"用中间层潜预测与末层比较，计算一致性；对多条CoT/L2M路径加权，提高更可信答案的权重。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"跨模型/数据发现错误CoT常有更低内部一致性，加权后推理表现改善；实验使用二分类50/50平衡的calibrated accuracy，不能当作原始类别比例下准确率。","boundary":"【作者】主要decoder-only、基础CoT，其他架构/推理方式待扩展；【解读】需要多路径采样，任务格式及层选择影响可靠性。","evidence":"PDF §3–4、§4.1–3、§6 p.10。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2405.18711v2","url":"https://arxiv.org/abs/2405.18711v2"}],"note":"p118","priority":0},"aliases":[]},{"id":"P117","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","short":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","year":"2025","authors":"Zhoujun Cheng; Shibo Hao; Tianyang Liu; Fan Zhou; Yutao Xie; Feng Yao; Yuexin Bian; Yonghao Zhuang; Nilabjo Dey; Yuheng Zha; Yi Gu; Kun Zhou; Yuqi Wang; Yuan Li; Richard Fan; Jianshu She; Chengqian Gao; Abulhair Saparov; Haonan Li; Taylor W. Killian; Mikhail Yurochkin; Zhengzhong Liu; Eric P. Xing; Zhiting Hu","collected":true,"note":"p117","scope":"本地 PDF · 既有阅读笔记","summary":"构建92K条六域可验证推理数据GURU，研究RL跨域迁移及难度影响，并训练7B/32B多域推理模型。","boundary":"只覆盖可构造验证奖励的领域；混合训练并非每项都优于专用模型，难源域还可能负迁移到简单任务。","evidence":"PDF §2–4、表3 p.8、§6。","sources":["shibo hao/NeurIPS-2025-revisiting-reinforcement-learning-for-llm-reasoning-from-a-cross-domain-perspective-Paper-Datasets_and_Benchmarks_Track.pdf"],"sha256":"47973c5ee52be94e5c210f58fa1f1df7f9a775538d9752decff760f7ba8d31e5","pages":21,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P117","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","year":"2025","authors":"Zhoujun Cheng; Shibo Hao; Tianyang Liu; Fan Zhou; Yutao Xie; Feng Yao; Yuexin Bian; Yonghao Zhuang; Nilabjo Dey; Yuheng Zha; Yi Gu; Kun Zhou; Yuqi Wang; Yuan Li; Richard Fan; Jianshu She; Chengqian Gao; Abulhair Saparov; Haonan Li; Taylor W. Killian; Mikhail Yurochkin; Zhengzhong Liu; Eric P. Xing; Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"数学、代码、科学、逻辑、仿真、表格数据与验证器，跨域训练分析和17任务评估套件。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"构建92K条六域可验证推理数据GURU，研究RL跨域迁移及难度影响，并训练7B/32B多域推理模型。","input_conditions":"只覆盖可构造验证奖励的领域；混合训练并非每项都优于专用模型，难源域还可能负迁移到简单任务。","training_supervision":"来源清洗去重、领域/难度过滤，Qwen2.5-Base上GRPO训练，控制域混合和难度研究迁移。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表3平均GURU7B41.17对ORZ7B33.90（+7.27）；32B52.68对ORZ46.95（+5.73）。32B AIME24为32.29，低于ORZ47.50，说明总体更均衡不等于数学全面领先。","boundary":"【解读】任务平均权重、验证器可靠性和混合比例影响结论，数据规模/在线混合未充分研究；摘要提升数值存在口径冲突。","evidence":"PDF §2–4、表3 p.8、§6。","checked":"2026-09-15","links":[],"note":"p117","priority":0},"aliases":[]},{"id":"P116","title":"Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought","short":"Reasoning by Superposition","year":"2025","authors":"Hanlin Zhu; Shibo Hao; Zhiting Hu; Jiantao Jiao; Stuart Russell; Yuandong Tian","collected":true,"note":"p116","scope":"本地 PDF · 既有阅读笔记","summary":"构造两层Transformer在连续CoT中并行编码多个搜索前沿，以图直径D步解决有向图可达，并用训练实验观察相似潜表示。","boundary":"与离散CoT的O(n²)是对比已有最好构造，不是已证明离散CoT必需Ω(n²)；严格分离的下界明确留作未来。","evidence":"PDF 定理及§3–4、§5图4、§6 p.10。","sources":["shibo hao/NeurIPS-2025-reasoning-by-superposition-a-theoretical-perspective-on-chain-of-continuous-thought-Paper-Conference.pdf"],"sha256":"d40150700bdbfbb721e65bc728c473fc266d716cba5479f5e1387d5a88870849","pages":33,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P116","title":"Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought","year":"2025","authors":"Hanlin Zhu; Shibo Hao; Zhiting Hu; Jiantao Jiao; Stuart Russell; Yuandong Tian","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"连续thought并行BFS的表达能力构造及经验对应分析。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"构造两层Transformer在连续CoT中并行编码多个搜索前沿，以图直径D步解决有向图可达，并用训练实验观察相似潜表示。","input_conditions":"与离散CoT的O(n²)是对比已有最好构造，不是已证明离散CoT必需Ω(n²)；严格分离的下界明确留作未来。","training_supervision":"在连续向量中叠加搜索前沿，用两层注意力迭代扩展；ProsQA合成子集上课程训练与潜态/注意力分析。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"2层Coconut在所评ProsQA接近满分，CoT/无CoT约75%，12层CoT约83%；理论需D个连续步骤，条件和数值精度按构造。","boundary":"【作者/解读】离散CoT下界未建立，结论局限图可达和构造假设；训练动力学与更广任务的充分解释仍需研究（P113进一步分析）。","evidence":"PDF 定理及§3–4、§5图4、§6 p.10。","checked":"2026-09-15","links":[],"note":"p116","priority":0},"aliases":[]},{"id":"P115","title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings","short":"ToolkenGPT","year":"2023","authors":"Shibo Hao; Tianyang Liu; Zhen Wang; Zhiting Hu","collected":true,"note":"p115","scope":"本地 PDF · 既有阅读笔记","summary":"把工具当作词表里的特殊token，仅学习工具embedding，使冻结LLM能选择大量工具，再通过提示生成参数并执行。","boundary":"冻结骨干不等于无训练；每个新工具仍需embedding学习/示范，参数生成及执行错误未被消除。","evidence":"PDF §3–4、表2 p.6、§5。","sources":["shibo hao/NeurIPS-2023-toolkengpt-augmenting-frozen-language-models-with-massive-tools-via-tool-embeddings-Paper-Conference.pdf"],"sha256":"052e79422c205ba6f4155a8f06c22ad1766da376e8077be3a75cf45c7efe88e3","pages":25,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P115","title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings","year":"2023","authors":"Shibo Hao; Tianyang Liu; Zhen Wang; Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"toolken表示及低参数工具学习，支持扩展工具集合并利用示范数据。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把工具当作词表里的特殊token，仅学习工具embedding，使冻结LLM能选择大量工具，再通过提示生成参数并执行。","input_conditions":"冻结骨干不等于无训练；每个新工具仍需embedding学习/示范，参数生成及执行错误未被消除。","training_supervision":"把工具embedding矩阵拼到输出词表，联合选择文字/工具；触发工具后切参数提示，执行结果回填上下文。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"GSM8K-XL（568题）ToolkenGPT33%对ReAct32%；FuncQA13工具单跳73%对57%，多跳15%对6%，多跳绝对成功率仍低；另有知识库与具身规划实验。","boundary":"【解读】工具数量扩展的选择质量依赖演示分布，复杂组合与参数泛化困难；不是任意未知工具零样本使用保证。","evidence":"PDF §3–4、表2 p.6、§5。","checked":"2026-09-15","links":[],"note":"p115","priority":0},"aliases":[]},{"id":"P114","title":"LLM Pretraining with Continuous Concepts","short":"LLM Pretraining with Continuous Concepts","year":"2026 / 2025","authors":"Jihoon Tack; Jack Lanchantin; Jane Yu; Andrew Cohen; Ilia Kulikov; Janice Lan; Shibo Hao; Yuandong Tian; Jason Weston; Xian Li","collected":true,"note":"p114","scope":"本地 PDF · 既有阅读笔记","summary":"CoCoMix在下一token预训练之外预测来自稀疏自编码器的连续概念，并与token表示交错输入，以提高样本效率及一定程度的可控性。","boundary":"需要预训练模型/SAE提供概念目标；概念可解释性依赖SAE，不能保证全模型透明；主要模型规模69M–1.38B。","evidence":"PDF §2–3、表1 p.6、§5；首页日期。","sources":["shibo hao/iclr26_LLM Pretraining with Continuous Concepts.pdf"],"sha256":"02442c5e0d6a0156893b45222b6d2ce4089a8eb5414986bac6760a7f82781f59","pages":17,"links":[{"label":"arXiv本地版本 2502.08524v1","url":"https://arxiv.org/abs/2502.08524v1"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P114","title":"LLM Pretraining with Continuous Concepts","year":"2026 / 2025","authors":"Jihoon Tack; Jack Lanchantin; Jane Yu; Andrew Cohen; Ilia Kulikov; Janice Lan; Shibo Hao; Yuandong Tian; Jason Weston; Xian Li","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"连续概念预测+混合的端到端预训练方案，比较NTP、蒸馏和pause tokens。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"CoCoMix在下一token预训练之外预测来自稀疏自编码器的连续概念，并与token表示交错输入，以提高样本效率及一定程度的可控性。","input_conditions":"需要预训练模型/SAE提供概念目标；概念可解释性依赖SAE，不能保证全模型透明；主要模型规模69M–1.38B。","training_supervision":"从教师隐状态经SAE提取稀疏概念，学生同时预测token和概念，将压缩概念向量插入隐状态流。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"200B token实验中1.38B模型平均下游准确率49.7对NTP48.7、KD49.1%；报告达到NTP同等性能所需token减少21.5%；124M概念教师也可帮助更大模型。","boundary":"【解读】总体提升温和且不保证逐任务领先；教师概念提取有额外成本，token节省不直接等于总训练算力同比下降。","evidence":"PDF §2–3、表1 p.6、§5；首页日期。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2502.08524v1","url":"https://arxiv.org/abs/2502.08524v1"}],"note":"p114","priority":0},"aliases":[]},{"id":"P113","title":"Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought","short":"Emergence of Superposition","year":"2026","authors":"Hanlin Zhu; Shibo Hao; Zhiting Hu; Jiantao Jiao; Stuart Russell; Yuandong Tian","collected":true,"note":"p113","scope":"本地 PDF · 既有阅读笔记","summary":"分析连续CoT隐式并行搜索如何在训练中形成，针对简化两层Transformer的有向图可达任务刻画关键注意力logit动态。","boundary":"定理依赖简化两层模型、任务结构与对称等假设，不适用于任意大模型训练；superposition是向量多路径编码，不是量子计算。","evidence":"PDF §3–5、§5训练细节p.9、§6及附录E。","sources":["shibo hao/iclr26_Emergence of superposition_Unveiling the training dynamics of chain of continuous thought.pdf"],"sha256":"0618e8beba581d69a8b8483fc36d8930855935373137d66090116eebb07bb01e","pages":32,"links":[{"label":"arXiv本地版本 2509.23365v3","url":"https://arxiv.org/abs/2509.23365v3"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P113","title":"Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought","year":"2026","authors":"Hanlin Zhu; Shibo Hao; Zhiting Hu; Jiantao Jiao; Stuart Russell; Yuandong Tian","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"在思考生成和答案预测两阶段分析index-matching logit先增长再有界，从而保留多个可能前沿的理论机制。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"分析连续CoT隐式并行搜索如何在训练中形成，针对简化两层Transformer的有向图可达任务刻画关键注意力logit动态。","input_conditions":"定理依赖简化两层模型、任务结构与对称等假设，不适用于任意大模型训练；superposition是向量多路径编码，不是量子计算。","training_supervision":"推导梯度训练下局部搜索logit变化，用课程训练跟踪注意力及潜状态，检验理论预测。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"受控图任务测试准确率96.2%，训练logit轨迹与有界假设一致；部分候选提升通路随设置/随机种子改变，并不总经同一&lt;R&gt; token。","boundary":"【解读】简化参数化和合成图数据限制一般性，多层大模型、预训练/不同优化器的机制仍需检验。","evidence":"PDF §3–5、§5训练细节p.9、§6及附录E。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2509.23365v3","url":"https://arxiv.org/abs/2509.23365v3"}],"note":"p113","priority":0},"aliases":[]},{"id":"P112","title":"Vision-G1: Towards General Reasoning Vision-Language Models via Reinforcement Learning","short":"Vision-G1","year":"2026","authors":"Yuheng Zha, Kun Zhou, Yujia Wu, Yushu Wang, Jie Feng, Zhi Xu, Shibo Hao, Zhengzhong Liu, Eric P. Xing, Zhiting Hu","collected":true,"note":"p112","scope":"本地 PDF · 既有阅读笔记","summary":"汇集多域视觉推理可验证奖励数据，结合影响函数筛选与难度课程，多轮RL训练通用视觉推理模型。","boundary":"“general”限于涵盖的图像任务；视频和3D是未来方向；正文对评测数量有9/18/17三种表述，按具体表格任务阅读。","evidence":"PDF Approach、Main Results、表1–3、Conclusion p.7；指标例外见表2。","sources":["shibo hao/AAAI26.ZhaY-Vision-G1-Towards General Reasoning Vision-Language Models via Reinforcement Learning.pdf"],"sha256":"244c5846a1bf20d1a4a57c0c793e431a075dbeaa5279de26c5b3664d63cb9753","pages":9,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1609/aaai.v40i33.40039"}],"verified":"2026-09-15","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P112","title":"Vision-G1: Towards General Reasoning Vision-Language Models via Reinforcement Learning","year":"2026","authors":"Yuheng Zha, Kun Zhou, Yujia Wu, Yushu Wang, Jie Feng, Zhi Xu, Shibo Hao, Zhengzhong Liu, Eric P. Xing, Zhiting Hu","teams":[],"topics":["world_model"],"rqs":["W4a"],"collected":true,"review_status":"existing_notes","question":"46数据集、5域13维度的RL-ready数据及Vision-G1-7B训练方案。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"汇集多域视觉推理可验证奖励数据，结合影响函数筛选与难度课程，多轮RL训练通用视觉推理模型。","input_conditions":"“general”限于涵盖的图像任务；视频和3D是未来方向；正文对评测数量有9/18/17三种表述，按具体表格任务阅读。","training_supervision":"统一题目/奖励格式，影响函数过滤低价值样本，再按中等难度及类别平衡进行多轮GRPO。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"数学表2平均42.1%，基础Qwen2.5VL-7B39.0，但Vision-R1-7B42.5%、GPT4o45.7%更高；因此不能将摘要领先描述套到每个数学指标。跨综合/专业任务另有收益。","boundary":"【作者/解读】数据/奖励质量、任务均衡及影响近似影响结果；数据混合收益不等于全面推理泛化，需防跨基准数据重叠。","evidence":"PDF Approach、Main Results、表1–3、Conclusion p.7；指标例外见表2。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1609/aaai.v40i33.40039"}],"note":"p112","priority":0},"aliases":[]},{"id":"P111","title":"CocoaBench: Evaluating Unified Digital Agents in the Wild","short":"CocoaBench","year":"2026","authors":"CocoaBench Team; Shibo Hao; Zhining Zhang; Zhiqi Liang; Tianyang Liu; Yuheng Zha; Qiyue Gao; Jixuan Chen; Zilong Wang; Zhoujun Cheng; Haoxiang Zhang; Junli Wang; Hexi Jin; Boyuan Zheng; Kun Zhou; Yu Wang; Feng Yao; Licheng Liu; Yijiang Li; Zhifei Li; Zhengtao Han; Pracha Promthaw; Tommaso Cerruti; Xiaohan Fu; Ziqiao Ma; Jingbo Shang; Lianhui Qin; Julian McAuley; Eric P. Xing; Zhengzhong Liu; Rupesh Kumar Srivastava; Zhiting Hu","collected":true,"note":"p111","scope":"本地 PDF · 既有阅读笔记","summary":"用同时需要视觉、搜索和编程的长流程任务评估统一数字代理，以最终输出自动评测，并提供轻量共享Cocoa-Agent框架。","boundary":"完整代理系统和共享框架的成绩不可混为纯模型能力；“in the wild”仍是人工设计、有自动验证器的任务样本。","evidence":"PDF §3–5、图4、§6。","sources":["shibo hao/26_COCOABENCH_Evaluating unified digital agents in the wild.pdf"],"sha256":"2832e5b0a617129a2f6de538b03da95a3b71e29e4f4d9fdce9996040d7423fe4","pages":26,"links":[{"label":"arXiv本地版本 2604.11201v2","url":"https://arxiv.org/abs/2604.11201v2"}],"verified":"2026-09-15","mappings":[{"rq":"X3c","role":"core"}],"annotation":{"id":"P111","title":"CocoaBench: Evaluating Unified Digital Agents in the Wild","year":"2026","authors":"CocoaBench Team; Shibo Hao; Zhining Zhang; Zhiqi Liang; Tianyang Liu; Yuheng Zha; Qiyue Gao; Jixuan Chen; Zilong Wang; Zhoujun Cheng; Haoxiang Zhang; Junli Wang; Hexi Jin; Boyuan Zheng; Kun Zhou; Yu Wang; Feng Yao; Licheng Liu; Yijiang Li; Zhifei Li; Zhengtao Han; Pracha Promthaw; Tommaso Cerruti; Xiaohan Fu; Ziqiao Ma; Jingbo Shang; Lianhui Qin; Julian McAuley; Eric P. Xing; Zhengzhong Liu; Rupesh Kumar Srivastava; Zhiting Hu","teams":[],"topics":["hci"],"rqs":["X3c"],"collected":true,"review_status":"existing_notes","question":"CocoaBench跨能力组合任务及控制模型骨干差异的统一实验支架。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用同时需要视觉、搜索和编程的长流程任务评估统一数字代理，以最终输出自动评测，并提供轻量共享Cocoa-Agent框架。","input_conditions":"完整代理系统和共享框架的成绩不可混为纯模型能力；“in the wild”仍是人工设计、有自动验证器的任务样本。","training_supervision":"只给任务说明，以最终产物函数判定成功；分别测完整系统和相同Cocoa-Agent下的模型，分析规划/执行/视觉错误。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"GPT5.4在Codex/OpenClaw中45.1%，共享Cocoa-Agent36.6%；ClaudeSonnet4.6在OpenClaw34.0%、ClaudeCode25.5%、Cocoa-Agent15.7%，显示框架影响显著。","boundary":"【解读】评估函数覆盖范围、基础设施与外部环境变化影响可复现性，成功率不能代替所有产物质量；所测任务离可靠全能代理仍有差距。","evidence":"PDF §3–5、图4、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2604.11201v2","url":"https://arxiv.org/abs/2604.11201v2"}],"note":"p111","priority":0},"aliases":[]},{"id":"P130","title":"CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models","short":"CounterVid","year":"2026","authors":"Tobia Poppi; Burak Uzkent; Amanmeet Garg; Lucas Porto; Garin Kessler; Yezhou Yang; Marcella Cornia; Lorenzo Baraldi; Rita Cucchiara; Florian Schiffers","collected":true,"note":"p130","scope":"本地 PDF · 既有阅读笔记","summary":"生成保留场景但改变短时动作/顺序的反事实视频硬负例，以文字和视觉偏好联合DPO减少视频VLM动作与时间幻觉。","boundary":"反事实主要是<2秒动作的语义替换，不是严格结构因果模型干预；生成数据质量不完美，评估中只有68%标为good。","evidence":"PDF §3–4、表1–2 p.6、Limitations p.9。","sources":["VideoGeneration/26_CounterVid_Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models.pdf"],"sha256":"473d1665bbd2a82bfbf319b6598336ea9023c21145d6fc9bf9d750622bb9b610","pages":16,"links":[{"label":"arXiv本地版本 2601.04778v1","url":"https://arxiv.org/abs/2601.04778v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"core"}],"annotation":{"id":"P130","title":"CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models","year":"2026","authors":"Tobia Poppi; Burak Uzkent; Amanmeet Garg; Lucas Porto; Garin Kessler; Yezhou Yang; Marcella Cornia; Lorenzo Baraldi; Rita Cucchiara; Florian Schiffers","teams":[],"topics":["world_model"],"rqs":["W2c"],"collected":true,"review_status":"existing_notes","question":"约26K偏好对CounterVid与MixDPO，面向语言先验导致的时间/动作错误。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"生成保留场景但改变短时动作/顺序的反事实视频硬负例，以文字和视觉偏好联合DPO减少视频VLM动作与时间幻觉。","input_conditions":"反事实主要是&lt;2秒动作的语义替换，不是严格结构因果模型干预；生成数据质量不完美，评估中只有68%标为good。","training_supervision":"多模态LLM提出替代动作/编辑指导，图像与视频扩散合成负例，过滤并构造文字/视觉偏好，冻结视觉编码器进行参数高效优化。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"留出集Qwen2.5VL7B平均57.8→66.2%；顺序列表16.5→43.8%；3B平均36.9→45.2%。样本审核7%视觉质量差，部分任务有约17%歧义。","boundary":"【作者】过滤和生成质量、短动作限制、冻结视觉编码器；【解读】合成负例收益需关注跨真实域迁移而非只看内部留出集。","evidence":"PDF §3–4、表1–2 p.6、Limitations p.9。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2601.04778v1","url":"https://arxiv.org/abs/2601.04778v1"}],"note":"p130","priority":0},"aliases":[]},{"id":"P129","title":"StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation","short":"StoryReasoning Dataset","year":"2025","authors":"Daniel A. P. Oliveira; David Martins de Matos","collected":true,"note":"p129","scope":"本地 PDF · 既有阅读笔记","summary":"为电影图像序列生成带跨帧实体链接的场景分析和故事，建立StoryReasoning并微调Qwen Storyteller，减少人物/物体指代幻觉。","boundary":"输出以多图到文字故事为主，不是生成视频；创造性/幻觉主要由LLM评判，不能等同人类创意评估。","evidence":"PDF §3–5、表1–2 p.8、§6。","sources":["VideoGeneration/25_StoryReasoning Dataset.pdf"],"sha256":"ba6b37f97eb4e938f932a69fc2e4f6572cdd454f72329fffc733ac3dedb43ca1","pages":31,"links":[{"label":"arXiv本地版本 2505.10292v2","url":"https://arxiv.org/abs/2505.10292v2"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P129","title":"StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation","year":"2025","authors":"Daniel A. P. Oliveira; David Martins de Matos","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"4,178故事、52,016图像的结构化分析/grounded叙事数据，跨帧重识别和基线模型。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"为电影图像序列生成带跨帧实体链接的场景分析和故事，建立StoryReasoning并微调Qwen Storyteller，减少人物/物体指代幻觉。","input_conditions":"输出以多图到文字故事为主，不是生成视频；创造性/幻觉主要由LLM评判，不能等同人类创意评估。","training_supervision":"视觉相似性与人脸识别匹配对象，表格组织跨帧场景，CoT生成并将词语链接到实体，微调Qwen2.5VL7B。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"平均每故事幻觉4.06→3.56（相对−12.3%）；创造性评分2.58→3.38/5（+31%）；描述准确评分2.69→2.76，收益较小。","boundary":"【作者】外观相似实体如双胞胎可混淆、电影构图偏差、对话第一人称难grounding；LLM评判偏差和文本相似指标可能惩罚合理创作。","evidence":"PDF §3–5、表1–2 p.8、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2505.10292v2","url":"https://arxiv.org/abs/2505.10292v2"}],"note":"p129","priority":0},"aliases":[]},{"id":"P128","title":"StoryMem: Multi-shot Long Video Storytelling with Memory","short":"StoryMem","year":"2025","authors":"Kaiwen Zhang; Liming Jiang; Angtian Wang; Jacob Zhiyuan Fang; Tiancheng Zhi; Qing Yan; Hao Kang; Xin Lu; Xingang Pan","collected":true,"note":"p128","scope":"本地 PDF · 既有阅读笔记","summary":"用动态历史关键帧记忆把单镜头视频扩散改造成逐镜头长叙事生成，并通过语义/审美选择维持紧凑记忆。","boundary":"需微调单镜头骨干；分钟级逐镜头生成不是无限记忆，纯视觉记忆可能混淆多角色；平滑过渡和提示跟随有取舍。","evidence":"PDF §3–4、表1–2、图7、§5。","sources":["VideoGeneration/25_StoryMem_Multi-shot Long Video Storytelling with Memory.pdf"],"sha256":"893eb41d0811d6480248c118b3146657400c5b93dfc5ae1c4ff1a62b75d116af","pages":20,"links":[{"label":"arXiv本地版本 2512.19539v1","url":"https://arxiv.org/abs/2512.19539v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P128","title":"StoryMem: Multi-shot Long Video Storytelling with Memory","year":"2025","authors":"Kaiwen Zhang; Liming Jiang; Angtian Wang; Jacob Zhiyuan Fang; Tiancheng Zhi; Qing Yan; Hao Kang; Xin Lu; Xingang Pan","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"Memory-to-Video（M2V）、负RoPE位置与latent拼接、LoRA训练及ST-Bench。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用动态历史关键帧记忆把单镜头视频扩散改造成逐镜头长叙事生成，并通过语义/审美选择维持紧凑记忆。","input_conditions":"需微调单镜头骨干；分钟级逐镜头生成不是无限记忆，纯视觉记忆可能混淆多角色；平滑过渡和提示跟随有取舍。","training_supervision":"历史镜头选相关美观关键帧写入记忆，潜空间拼接注入模型；MI2V/MR2V支持过渡和定制。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"ST-Bench总体跨镜头一致性0.5065，报告比基础模型相对提高28.7%、比HoloCine提高9.4%；用户成对偏好更高；单镜头提示跟随略下降。","boundary":"【作者】复杂多角色和大运动差异过渡困难；【解读】视觉一致性/审美不证明事件链完成，记忆选择会过滤重要但不美观的状态。","evidence":"PDF §3–4、表1–2、图7、§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2512.19539v1","url":"https://arxiv.org/abs/2512.19539v1"}],"note":"p128","priority":0},"aliases":[]},{"id":"P127","title":"MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequences","short":"MovieDreamer","year":"2025","authors":"Canyu Zhao; Mingyu Liu; Wen Wang; Weihua Chen; Fan Wang; Hao Chen; Bo Zhang; Chunhua Shen","collected":true,"note":"p127","scope":"本地 PDF · 既有阅读笔记","summary":"用自回归模型规划长序列关键帧token，再以扩散渲染图像和视频，以多模态剧本和人脸身份条件维持跨场景角色一致。","boundary":"“叙事一致”主要由脚本对齐和角色视觉指标代理；关键帧及短片段组装不保证每项事件真实发生或长时物理因果一致。","evidence":"PDF §3–4、表1–2 p.9、§5。","sources":["VideoGeneration/25_ICLR_MOVIEDREAMER_HIERARCHICAL GENERATION FOR COHERENT LONG VISUAL SEQUENCES.pdf"],"sha256":"19dcbd7282b7ec5eab617b7d97a0aaaa42d43b765a7c7d57a866b1f88d22f93a","pages":31,"links":[{"label":"arXiv本地版本 2407.16655v3","url":"https://arxiv.org/abs/2407.16655v3"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P127","title":"MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequences","year":"2025","authors":"Canyu Zhao; Mingyu Liu; Wen Wang; Weihua Chen; Fan Wang; Hao Chen; Bo Zhang; Chunhua Shen","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"叙事/渲染分层框架、包含角色及风格的剧本和身份保持渲染。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用自回归模型规划长序列关键帧token，再以扩散渲染图像和视频，以多模态剧本和人脸身份条件维持跨场景角色一致。","input_conditions":"“叙事一致”主要由脚本对齐和角色视觉指标代理；关键帧及短片段组装不保证每项事件真实发生或长时物理因果一致。","training_supervision":"扩散自动编码器产生紧凑关键帧token，自回归预测下一个keyframe，文本/FaceID条件解码，再生成帧间视频。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1无参考Ours长期一致LT0.814对StoryDiffusion0.596，FID2.043对4.643；审美6.093略低于6.134，非逐项最佳；有参考Ours-ref LT0.893但使用额外条件。","boundary":"【解读】人脸身份覆盖、长时错误累积和剧本粒度影响结果；参考/无参考条件需分开比较，电影域指标不等于人类叙事理解。","evidence":"PDF §3–4、表1–2 p.9、§5。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2407.16655v3","url":"https://arxiv.org/abs/2407.16655v3"}],"note":"p127","priority":0},"family":{"ids":["P127","P134"],"reason":"MovieDreamer 的不同本地版本"},"aliases":["P134"]},{"id":"P126","title":"Diffusion-Based Visual Art Creation: A Survey and New Perspectives","short":"Diffusion-Based Visual Art Creation","year":"2025","authors":"Bingyuan Wang; Qifeng Chen; Zeyu Wang","collected":true,"note":"p126","scope":"本地 PDF · 既有阅读笔记","summary":"从艺术需求和技术方法共同审视扩散视觉艺术创作，系统编码相关论文，建立应用、理解和生成的分析框架及人机协作展望。","boundary":"综述，不是新的图像/视频生成模型；PDF封面的2026-01-31为下载日期，不是发表日。","evidence":"PDF封面元数据；§4–6、图4、§7–8（正文到PDF p.30）。","sources":["VideoGeneration/25_Diffusion-Based VisualArt Creation.pdf"],"sha256":"18c343dc471df6180c288a6b3bc1c30e4075f42475deec95b9f059a3c5981f6e","pages":38,"links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3728459"}],"verified":"2026-09-15","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P126","title":"Diffusion-Based Visual Art Creation: A Survey and New Perspectives","year":"2025","authors":"Bingyuan Wang; Qifeng Chen; Zeyu Wang","teams":[],"topics":["generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"existing_notes","question":"四阶段文献筛选、七维编码和场景—模态—任务—方法框架，连接艺术要求与计算问题。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"从艺术需求和技术方法共同审视扩散视觉艺术创作，系统编码相关论文，建立应用、理解和生成的分析框架及人机协作展望。","input_conditions":"综述，不是新的图像/视频生成模型；PDF封面的2026-01-31为下载日期，不是发表日。","training_supervision":"明确研究问题和纳入条件，结构/时间分析论文编码，归纳技术与人机协作趋势。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"识别视觉艺术的风格控制、内容编辑、跨模态与多场景生成热点，提出技术能力与艺术家参与方式共同演化的研究方向；无统一新实验排名。","boundary":"【解读】文献筛选/编码有解释性，领域更新快；创作质量和创造性没有跨艺术门类统一客观标准。","evidence":"PDF封面元数据；§4–6、图4、§7–8（正文到PDF p.30）。","checked":"2026-09-15","links":[{"label":"DOI正式记录","url":"https://doi.org/10.1145/3728459"}],"note":"p126","priority":0},"aliases":[]},{"id":"P125","title":"Causally Steered Diffusion for Automated Video Counterfactual Generation","short":"Causally Steered Diffusion for Automated Video Counterfactual Generation","year":"2025","authors":"Nikos Spyrou; Athanasios Vlontzos; Paraskevas Pegios; Thomas Melistas; Nefeli Gkouti; Yannis Panagakis; Giorgos Papanastasiou; Sotirios A. Tsaftaris","collected":true,"note":"p125","scope":"本地 PDF · 既有阅读笔记","summary":"给定属性因果图，把干预及其应保留/改变的关系写入提示，用VLM文字反馈反复优化视频编辑以生成更符合指定因果关系的反事实。","boundary":"依赖先验因果图，主要真实人脸年龄/性别/胡须/秃发等属性编辑；不是从视频发现因果结构，基于外观标签的假设不等于生物学因果真值。","evidence":"PDF §3–5、表1、§6。","sources":["VideoGeneration/25_Causally Steered Diffusion for Automated Video Counterfactual Generation.pdf"],"sha256":"6d89932cdf6a8eceef98e749d795c15861c7334d7a30d7bc4f32914e6c72bd67","pages":23,"links":[{"label":"arXiv本地版本 2506.14404v2","url":"https://arxiv.org/abs/2506.14404v2"}],"verified":"2026-09-15","mappings":[{"rq":"W2c","role":"core"}],"annotation":{"id":"P125","title":"Causally Steered Diffusion for Automated Video Counterfactual Generation","year":"2025","authors":"Nikos Spyrou; Athanasios Vlontzos; Paraskevas Pegios; Thomas Melistas; Nefeli Gkouti; Yannis Panagakis; Giorgos Papanastasiou; Sotirios A. Tsaftaris","teams":[],"topics":["world_model"],"rqs":["W2c"],"collected":true,"review_status":"existing_notes","question":"黑箱可接入的CSVC提示级因果引导，评估有效性、最小性和时序质量。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"给定属性因果图，把干预及其应保留/改变的关系写入提示，用VLM文字反馈反复优化视频编辑以生成更符合指定因果关系的反事实。","input_conditions":"依赖先验因果图，主要真实人脸年龄/性别/胡须/秃发等属性编辑；不是从视频发现因果结构，基于外观标签的假设不等于生物学因果真值。","training_supervision":"因果目标/解耦提示→TokenFlow/FLATTEN/Tune-A-Video等编辑器→VLM评估损失→语言提示迭代，核心框架不需改编辑器内部。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1中CSVC通常提高各编辑后端的目标属性有效性，加入因果解耦提示效果更佳；通过LPIPS、VLM、DOVER、FVD及帧间CLIP检查最小性/质量。","boundary":"【解读】评估和优化共享VLM语义偏差，有限属性图与人脸域限制因果解释；基础编辑器若需one-shot适配，整体并非完全无训练。","evidence":"PDF §3–5、表1、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2506.14404v2","url":"https://arxiv.org/abs/2506.14404v2"}],"note":"p125","priority":0},"aliases":[]},{"id":"P124","title":"iVideoGPT: Interactive VideoGPTs are Scalable World Models","short":"iVideoGPT","year":"2024","authors":"Jialong Wu; Shaofeng Yin; Ningya Feng; Xu He; Dong Li; Jianye Hao; Mingsheng Long","collected":true,"note":"p124","scope":"本地 PDF · 既有阅读笔记","summary":"把视觉、动作与奖励统一为token序列，使用压缩视频tokenizer及自回归Transformer预训练，适配预测、规划与模型式RL。","boundary":"主要机器人操作/视觉控制任务；未经适配在新机器人上会生成旧机器人外观，少样本tokenizer适配仍重要。","evidence":"PDF §3–4，图6–8、§4.4 p.8。","sources":["VideoGeneration/24_Interactive VideoGPTs are Scalable World Models.pdf"],"sha256":"1e2d26119085edcf56158c4a199484aba285e21059fae3de0815d87574ff80e6","pages":25,"links":[{"label":"arXiv本地版本 2405.15223v1","url":"https://arxiv.org/abs/2405.15223v1"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P124","title":"iVideoGPT: Interactive VideoGPTs are Scalable World Models","year":"2024","authors":"Jialong Wu; Shaofeng Yin; Ningya Feng; Xu He; Dong Li; Jianye Hao; Mingsheng Long","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"交互VideoGPT框架、上下文条件压缩tokenization及大规模人类/机器人轨迹预训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"把视觉、动作与奖励统一为token序列，使用压缩视频tokenizer及自回归Transformer预训练，适配预测、规划与模型式RL。","input_conditions":"主要机器人操作/视觉控制任务；未经适配在新机器人上会生成旧机器人外观，少样本tokenizer适配仍重要。","training_supervision":"用上下文帧帮助大幅压缩后续帧token，将动作奖励交错建模；下游微调模型/编码器，并以模型生成经验供策略学习。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在所评连续控制上改善相对无模型方法的样本效率，与DreamerV3相当或更高；100/1000轨迹时预训练优势更明显，全量数据时较小；压缩方案按自回归forward次数计约16倍降低。","boundary":"【解读】16倍是token/调用计数，不是端到端硬件实测速比；预训练机器人多样性不足，模型误差与合成轨迹偏差仍影响策略。","evidence":"PDF §3–4，图6–8、§4.4 p.8。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2405.15223v1","url":"https://arxiv.org/abs/2405.15223v1"}],"note":"p124","priority":0},"aliases":[]},{"id":"P123","title":"Genie: Generative Interactive Environments","short":"Genie","year":"2024","authors":"Jake Bruce; Michael Dennis; Ashley Edwards; Jack Parker-Holder; Yuge (Jimmy) Shi; Edward Hughes; Matthew Lai; Aditi Mavalankar; Richie Steigerwald; Chris Apps; Yusuf Aytar; Sarah Bechtle; Feryal Behbahani; Stephanie Chan; Nicolas Heess; Lucy Gonzalez; Simon Osindero; Sherjil Ozair; Scott Reed; Jingwei Zhang; Konrad Zolna; Jeff Clune; Nando de Freitas; Satinder Singh; Tim Rocktäschel","collected":true,"note":"p123","scope":"本地 PDF · 既有阅读笔记","summary":"从无动作标签的互联网视频学习潜动作和动态，用图像、照片或草图初始化可逐帧控制的生成式环境。","boundary":"文字提示经图像生成可间接初始化，模型本体主要图像提示/潜动作控制；主要平台游戏等域，非任意真实世界高保真模拟。","evidence":"PDF §2–4、§5 p.11。","sources":["VideoGeneration/2402_Generative Interactive Environments.pdf"],"sha256":"94c63a5ced89355326706c88236591c2972ced12f3dece4f8982f020110c81f3","pages":27,"links":[{"label":"arXiv本地版本 2402.15391v1","url":"https://arxiv.org/abs/2402.15391v1"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P123","title":"Genie: Generative Interactive Environments","year":"2024","authors":"Jake Bruce; Michael Dennis; Ashley Edwards; Jack Parker-Holder; Yuge (Jimmy) Shi; Edward Hughes; Matthew Lai; Aditi Mavalankar; Richie Steigerwald; Chris Apps; Yusuf Aytar; Sarah Bechtle; Feryal Behbahani; Stephanie Chan; Nicolas Heess; Lucy Gonzalez; Simon Osindero; Sherjil Ozair; Scott Reed; Jingwei Zhang; Konrad Zolna; Jeff Clune; Nando de Freitas; Satinder Singh; Tim Rocktäschel","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"11B生成式交互环境，时空tokenizer、潜动作模型与自回归动态模型联合支持视频到可控世界。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"从无动作标签的互联网视频学习潜动作和动态，用图像、照片或草图初始化可逐帧控制的生成式环境。","input_conditions":"文字提示经图像生成可间接初始化，模型本体主要图像提示/潜动作控制；主要平台游戏等域，非任意真实世界高保真模拟。","training_supervision":"潜动作模型从相邻帧推断离散控制，ST-transformer编码视频token，动态模型根据历史与动作预测下一帧；不需真实动作标签训练。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"展示未见图片/手绘初始化、潜动作可控性和从视频模仿策略；模型约1fps、记忆仅16帧，作者明确长时一致与交互速度待提升。","boundary":"【作者】可幻觉不合理未来、上下文短、速度低；【解读】无监督动作语义在所有情境并不保证一致，视觉可玩不等于任务可用。","evidence":"PDF §2–4、§5 p.11。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2402.15391v1","url":"https://arxiv.org/abs/2402.15391v1"}],"note":"p123","priority":0},"aliases":[]},{"id":"P122","title":"Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions","short":"Phenaki","year":"2023","authors":"Ruben Villegas; Mohammad Babaeizadeh; Pieter-Jan Kindermans; Hernan Moraldo; Han Zhang; Mohammad Taghi Saffar; Santiago Castro; Julius Kunze; Dumitru Erhan","collected":true,"note":"p122","scope":"本地 PDF · 既有阅读笔记","summary":"通过因果视频tokenizer与文本条件掩码Transformer，从随时间改变的文字提示生成可延续的视频。","boundary":"“任意长”是可反复延长的机制，不保证任意时长保持质量/角色记忆；训练短片与展示长片之间没有无限泛化保证。","evidence":"PDF §2–4、tokenizer及生成实验、附录；首页摘要。","sources":["VideoGeneration/23_ICLR_phenaki_variable_length_video_.pdf"],"sha256":"176243b1066c4db80df9b1f3de4de6fb8d6f9631fd65726c3e19015eaff5e4e2","pages":14,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P122","title":"Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions","year":"2023","authors":"Ruben Villegas; Mohammad Babaeizadeh; Pieter-Jan Kindermans; Hernan Moraldo; Han Zhang; Mohammad Taghi Saffar; Santiago Castro; Julius Kunze; Dumitru Erhan","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"C-ViViT变长视频离散表示、图文与视频文本联合训练、随故事提示自回归延续。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"通过因果视频tokenizer与文本条件掩码Transformer，从随时间改变的文字提示生成可延续的视频。","input_conditions":"“任意长”是可反复延长的机制，不保证任意时长保持质量/角色记忆；训练短片与展示长片之间没有无限泛化保证。","training_supervision":"因果时间注意力压缩视频token，T5文本条件下迭代补全被掩token，解码后以已有帧/新提示生成后续片段。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"相较逐帧编码减少约40%或更多视频token并改善时空重建一致性；训练1.4秒、8fps片段后展示分钟级变提示生成；图文联合数据帮助覆盖视频训练中未见概念组合。","boundary":"【解读】长期误差积累、低分辨率/细节和精确动作控制限制；token效率和视觉演示不能等同电影级叙事/物理可靠性。","evidence":"PDF §2–4、tokenizer及生成实验、附录；首页摘要。","checked":"2026-09-15","links":[],"note":"p122","priority":0},"aliases":[]},{"id":"P121","title":"World Models","short":"World Models","year":"2018","authors":"David Ha, Jürgen Schmidhuber","collected":true,"note":"p121","scope":"本地 PDF · 既有阅读笔记","summary":"用生成式模型压缩视觉并预测时间动态，训练小控制器，展示在学到的梦境中学习策略后迁移回真实游戏环境。","boundary":"CarRacing和VizDoom等游戏；CarRacing控制器并非全部仅在梦中训练，梦中转移主要由Doom实验展示；不能保证学到完整物理因果结构。","evidence":"PDF §3表1、§4梦境实验及讨论。","sources":["VideoGeneration/18_david_worldmodels.pdf"],"sha256":"b0c1e30aab53efd28ddf61d661f680150918d4d03b77bae62bc52d62dbd76cce","pages":21,"links":[{"label":"arXiv本地版本 1803.10122v4","url":"https://arxiv.org/abs/1803.10122v4"}],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P121","title":"World Models","year":"2018","authors":"David Ha, Jürgen Schmidhuber","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"VAE视觉模型、MDN-RNN记忆模型和简洁控制器的模块化世界模型，区分表征学习与控制优化。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用生成式模型压缩视觉并预测时间动态，训练小控制器，展示在学到的梦境中学习策略后迁移回真实游戏环境。","input_conditions":"CarRacing和VizDoom等游戏；CarRacing控制器并非全部仅在梦中训练，梦中转移主要由Doom实验展示；不能保证学到完整物理因果结构。","training_supervision":"无监督学习V和M，控制器用z及RNN隐状态选动作，由进化策略优化；在随机梦境模型中训练并调温防利用模型缺陷。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"CarRacing100随机试验906±21，视觉表示单独632±251、加隐藏层788±141；展示Doom梦境训练后的真实环境迁移。","boundary":"【作者/解读】代理可利用世界模型错误，温度和数据覆盖影响转移；简单低分辨率游戏与独立模块训练不代表普遍开放环境控制。","evidence":"PDF §3表1、§4梦境实验及讨论。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 1803.10122v4","url":"https://arxiv.org/abs/1803.10122v4"}],"note":"p121","priority":0},"aliases":[]},{"id":"P140","title":"VideoAuteur: Towards Long Narrative Video Generation","short":"VideoAuteur","year":"2025","authors":"Junfei Xiao; Feng Cheng; Lu Qi; Liangke Gui; Yang Zhao; Shanchuan Lin; Jiepeng Cen; Zhibei Ma; Alan Yuille; Lu Jiang","collected":true,"note":"p140","scope":"本地 PDF · 既有阅读笔记","summary":"面向烹饪长叙事视频构建数据和分层生成流程，交错语言/视觉导演规划步骤，滚动关键帧渲染再生成视频。","boundary":"实证集中烹饪域；自动VLM检查和人评不保证食谱正确/操作安全；不是任意电影场景通用导演。","evidence":"PDF §3–5、表3 pp.6–7、§6。","sources":["VideoGeneration/Xiao_VideoAuteur_Towards_Long_Narrative_Video_Generation_ICCV_2025_paper.pdf"],"sha256":"e4087daed3ec8e414c07c7654a84cad474d99d436bbe67eaa7f5e1ae5f857671","pages":11,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P140","title":"VideoAuteur: Towards Long Narrative Video Generation","year":"2025","authors":"Junfei Xiao; Feng Cheng; Lu Qi; Liangke Gui; Yang Zhao; Shanchuan Lin; Jiepeng Cen; Zhibei Ma; Alan Yuille; Lu Jiang","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"烹饪数据整理、Long Narrative Video Director、滚动历史条件渲染及视觉embedding对齐。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"面向烹饪长叙事视频构建数据和分层生成流程，交错语言/视觉导演规划步骤，滚动关键帧渲染再生成视频。","input_conditions":"实证集中烹饪域；自动VLM检查和人评不保证食谱正确/操作安全；不是任意电影场景通用导演。","training_supervision":"导演交替生成语言状态与视觉embedding，以滚动参考图条件DiT渲染关键帧，正则化视觉embedding驱动视频模型。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表3 YouCook2 CLIP-T25.9→26.4、FVD557.7→512.6；HowTo100M26.6→27.3、541.1→520.7；去掉embedding正则反而更差，说明对齐是必要因素。","boundary":"【解读】域特定数据、阶段间误差累积、角色/步骤的长程一致仍受基础生成器限制，需更广题材和事件完成验证。","evidence":"PDF §3–5、表3 pp.6–7、§6。","checked":"2026-09-15","links":[],"note":"p140","priority":0},"aliases":[]},{"id":"P139","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","short":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","year":"2025","authors":"Yiping Wang; Xuehai He; Kuan Wang; Luyao Ma; Jianwei Yang; Shuohang Wang; Simon Shaolei Du; Yelong Shen","collected":true,"note":"p139","scope":"本地 PDF · 既有阅读笔记","summary":"用2–4个连续事件的短故事提示测量视频模型是否完成所要求事件，补充审美与时空一致性等细节指标。","boundary":"completion rate是已完成事件比例，不是全故事全对比例；视频时长有限，不能直接代表分钟级长叙事表现。","evidence":"PDF §2–3、表1–2、§3.1 pp.7–8。","sources":["VideoGeneration/Wang_Is_Your_World_Simulator_a_Good_Story_Presenter_A_Consecutive_CVPR_2025_paper.pdf"],"sha256":"cba490f9ce2d4f8ebd0372826b3fcca803dbd37770ce22a2f3df199f55bac24b","pages":10,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W2d","role":"core"},{"rq":"W3b","role":"core"}],"annotation":{"id":"P139","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","year":"2025","authors":"Yiping Wang; Xuehai He; Kuan Wang; Luyao Ma; Jianwei Yang; Shuohang Wang; Simon Shaolei Du; Yelong Shen","teams":[],"topics":["world_model"],"rqs":["W2d","W3b"],"collected":true,"review_status":"existing_notes","question":"StoryEval423提示、7类场景，逐事件自动核验与一致投票。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"用2–4个连续事件的短故事提示测量视频模型是否完成所要求事件，补充审美与时空一致性等细节指标。","input_conditions":"completion rate是已完成事件比例，不是全故事全对比例；视频时长有限，不能直接代表分钟级长叙事表现。","training_supervision":"检索真实视频/人工构思提示，VLM如GPT4o和LLaVAOV72B核验每一事件并投票，与人工评价检查一致性。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"11模型无一平均事件完成率超过50%，hard类无一超过20%；Kling1.5总体40.1%，Pika1.5为19.4%；高传统时间一致性分数仍可伴随低事件完成。","boundary":"【解读】VLM评分存在误判，一致投票也可能共同偏差；可生成时长/动作复杂度、提示类别和模型版本影响排名。","evidence":"PDF §2–3、表1–2、§3.1 pp.7–8。","checked":"2026-09-15","links":[],"note":"p139","priority":0},"aliases":[]},{"id":"P138","title":"StoryGAN: A Sequential Conditional GAN for Story Visualization","short":"StoryGAN","year":"2019","authors":"Yitong Li, Zhe Gan, Yelong Shen, Jingjing Liu, Yu Cheng, Yuexin Wu, Lawrence Carin, David Carlson, Jianfeng Gao","collected":true,"note":"p138","scope":"本地 PDF · 既有阅读笔记","summary":"每句话生成一张图，把故事可视化为有角色和场景一致性的图片序列。","boundary":"是句子到图片序列，不是连续视频生成；重点为全局一致而非帧间运动平滑；主要合成/动画小域。","evidence":"PDF §3–4、表1 p.6、表3–4 p.8。","sources":["VideoGeneration/StoryGAN_CVPR_2019_paper.pdf"],"sha256":"f81df8beff3dd5f58ca33af45475b7e70b19fff4e47d9c08a4b3016e5e2f32bc","pages":10,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P138","title":"StoryGAN: A Sequential Conditional GAN for Story Visualization","year":"2019","authors":"Yitong Li, Zhe Gan, Yelong Shen, Jingjing Liu, Yu Cheng, Yuexin Wu, Lawrence Carin, David Carlson, Jianfeng Gao","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"StoryGAN顺序条件GAN、动态Context Encoder/Text2Gist、图像级与故事级判别器，以及CLEVR-SV/Pororo-SV数据。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"每句话生成一张图，把故事可视化为有角色和场景一致性的图片序列。","input_conditions":"是句子到图片序列，不是连续视频生成；重点为全局一致而非帧间运动平滑；主要合成/动画小域。","training_supervision":"故事编码初始化状态，Text2Gist融合当前句与历史，逐图生成；两级对抗损失约束单图和全序列。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"CLEVR-SV SSIM0.672，ImageGAN0.596、SVC0.641、SVFN0.654；用户排序平均名次1.94优于ImageGAN2.91（越低越好）。","boundary":"【解读】低分辨率、数据域窄，角色细节和长故事能力有限；SSIM仅在该合成布局约束下具可比性，非通用故事质量指标。","evidence":"PDF §3–4、表1 p.6、表3–4 p.8。","checked":"2026-09-15","links":[],"note":"p138","priority":0},"aliases":[]},{"id":"P137","title":"Long-Context State-Space Video World Models","short":"Long-Context State-Space Video World Models","year":"2025","authors":"Ryan Po; Yotam Nitzan; Richard Zhang; Berlin Chen; Tri Dao; Eli Shechtman; Gordon Wetzstein; Xun Huang","collected":true,"note":"p137","scope":"本地 PDF · 既有阅读笔记","summary":"以块级SSM扫描存储较长视频历史，结合局部注意力维持局部连贯，降低动作条件世界模型长上下文计算。","boundary":"每帧推理成本不随历史增长，但作者明确尚不支持交互帧率，无法有效超训练长度记忆；仅低分辨率合成环境。","evidence":"PDF §4–5、表3 p.6、§6 p.8。","sources":["VideoGeneration/Po_Long-Context_State-Space_Video_World_Models_ICCV_2025_paper.pdf"],"sha256":"fe20255bf4824c5ed9d408c9963ac7efce53b1f043971ba20e541fd658969a2c","pages":12,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3a","role":"core"}],"annotation":{"id":"P137","title":"Long-Context State-Space Video World Models","year":"2025","authors":"Ryan Po; Yotam Nitzan; Richard Zhang; Berlin Chen; Tri Dao; Eli Shechtman; Gordon Wetzstein; Xun Huang","teams":[],"topics":["world_model"],"rqs":["W3a"],"collected":true,"review_status":"existing_notes","question":"因果视频SSM架构、训练策略及长时空间记忆测试。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以块级SSM扫描存储较长视频历史，结合局部注意力维持局部连贯，降低动作条件世界模型长上下文计算。","input_conditions":"每帧推理成本不随历史增长，但作者明确尚不支持交互帧率，无法有效超训练长度记忆；仅低分辨率合成环境。","training_supervision":"Mamba状态压缩长历史，block-wise扫描与frame-local attention结合，逐帧扩散生成。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"576历史帧/224预测帧任务PSNR28.2、LPIPS0.099、SSIM0.855；接近全历史Transformer28.8/0.089/0.860并优于较低复杂度比较方法。","boundary":"【作者】速度、长度外推和高分辨率真实视频扩展待解决；【解读】压缩状态对长期精细记忆仍有容量约束。","evidence":"PDF §4–5、表3 p.6、§6 p.8。","checked":"2026-09-15","links":[],"note":"p137","priority":0},"family":{"ids":["P102","P137"],"reason":"Long-Context State-Space Video World Models 的不同文件"},"aliases":["P102"]},{"id":"P136","title":"StoryBench: A Multifaceted Benchmark for Continuous Story Visualization","short":"StoryBench","year":"2023","authors":"Emanuele Bugliarello; Hernan Moraldo; Ruben Villegas; Mohammad Babaeizadeh; Mohammad Taghi Saffar; Han Zhang; Dumitru Erhan; Vittorio Ferrari; Pieter-Jan Kindermans; Paul Voigtlaender","collected":true,"note":"p136","scope":"本地 PDF · 既有阅读笔记","summary":"在三个既有视频数据集上增加带时间戳的多句故事标注，评估动作执行、故事续写和纯文本故事视频生成。","boundary":"多数为较短、单镜头用户视频，不能代表长电影多镜头；虽为“continuous story”不意味着无限时长评测。","evidence":"PDF §3–6、表4–7、§7–8。","sources":["VideoGeneration/NeurIPS-2023-storybench-a-multifaceted-benchmark-for-continuous-story-visualization-Paper-Datasets_and_Benchmarks.pdf"],"sha256":"1d7fde670c781d256bb4a41b4ad1375c75af97ae3941b4fa447725078a20c2f5","pages":31,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P136","title":"StoryBench: A Multifaceted Benchmark for Continuous Story Visualization","year":"2023","authors":"Emanuele Bugliarello; Hernan Moraldo; Ruben Villegas; Mohammad Babaeizadeh; Mohammad Taghi Saffar; Han Zhang; Dumitru Erhan; Vittorio Ferrari; Pieter-Jan Kindermans; Paul Voigtlaender","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"Oops/UVO/DiDeMo的连续故事基准、不同训练设置及视频人评指南。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在三个既有视频数据集上增加带时间戳的多句故事标注，评估动作执行、故事续写和纯文本故事视频生成。","input_conditions":"多数为较短、单镜头用户视频，不能代表长电影多镜头；虽为“continuous story”不意味着无限时长评测。","training_supervision":"人工标注时间段/动作及诊断标签；用小型Phenaki基线进行零样本、单任务、多任务微调；比较自动指标与人类评价。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"续写专门微调改善动作与上下文一致；Oops动作执行FVD：GEN-ZS416、CONT-ST350；但自动分数与人评存在偏离，作者强调仍需人工核查。","boundary":"【作者】视频不长、以单镜头非专业内容为主、自动指标不足；【解读】少数小基线不能穷尽所有生成模型能力。","evidence":"PDF §3–6、表4–7、§7–8。","checked":"2026-09-15","links":[],"note":"p136","priority":0},"aliases":[]},{"id":"P135","title":"WorldMem: Long-term Consistent World Simulation with Memory","short":"WorldMem","year":"2025","authors":"Zeqi Xiao; Yushi Lan; Yifan Zhou; Wenqi Ouyang; Shuai Yang; Yanhong Zeng; Xingang Pan","collected":true,"note":"p135","scope":"本地 PDF · 既有阅读笔记","summary":"以过去帧、位姿和时间戳组成记忆库，通过状态相关的memory attention重建之前去过的地方并表达世界随时间演化。","boundary":"Minecraft主要实验使用模拟器提供的真值位姿；现实只给动作时位姿需预测，误差条件不同；记忆增强并不证明完整3D世界模型。","evidence":"PDF §3–4、§4.1 pp.6–7、表1–2。","sources":["VideoGeneration/Long-term Consistent World Simulation with Memory.pdf"],"sha256":"f1c77acf725e4d4c657bb11fa04abd75c418854abb04e6d8a7b2477c6c0ead78","pages":14,"links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2504.12369"}],"verified":"2026-09-15","mappings":[{"rq":"W3a","role":"core"}],"annotation":{"id":"P135","title":"WorldMem: Long-term Consistent World Simulation with Memory","year":"2025","authors":"Zeqi Xiao; Yushi Lan; Yifan Zhou; Wenqi Ouyang; Shuai Yang; Yanhong Zeng; Xingang Pan","teams":[],"topics":["world_model"],"rqs":["W3a"],"collected":true,"review_status":"existing_notes","question":"显式状态帧记忆与检索式世界生成，扩展有限上下文的视频模拟。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以过去帧、位姿和时间戳组成记忆库，通过状态相关的memory attention重建之前去过的地方并表达世界随时间演化。","input_conditions":"Minecraft主要实验使用模拟器提供的真值位姿；现实只给动作时位姿需预测，误差条件不同；记忆增强并不证明完整3D世界模型。","training_supervision":"为帧存姿态/时间，按当前目标状态检索并注意历史视图；扩散模型结合当前上下文与记忆生成。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"超上下文Minecraft PSNR25.32对DiffusionForcing18.04，LPIPS0.1429对0.4376；RealEstate10K回访PSNR20.19对DFoT8.396。主要是回到已见视角的重建任务。","boundary":"【解读】真值位姿和已访问参考带来条件优势，未知位姿、动态遮挡和记忆容量扩张仍有风险；回访重建好不等于开放新场景因果预测准确。","evidence":"PDF §3–4、§4.1 pp.6–7、表1–2。","checked":"2026-09-15","links":[{"label":"arXiv论文记录","url":"https://arxiv.org/abs/2504.12369"}],"note":"p135","priority":0},"aliases":[]},{"id":"P133","title":"OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory","short":"OneStory","year":"2025","authors":"Zhaochong An; Menglin Jia; Haonan Qiu; Zijian Zhou; Xiaoke Huang; Zhiheng Liu; Weiming Ren; Kumara Kahatapitiya; Ding Liu; Sen He; Chenyang Zhang; Tao Xiang; Fanny Yang; Serge Belongie; Tian Xie","collected":true,"note":"p133","scope":"本地 PDF · 既有阅读笔记","summary":"OneStory把多镜头生成视为下一镜头预测，从全局历史挑选相关帧并自适应压缩为紧凑条件，保持角色/环境一致。","boundary":"历史经选择压缩，不能保留所有事件状态；依赖预训练I2V模型和相应训练，并非无需训练的记忆外挂。","evidence":"PDF §3–5、表2 p.8、§6。","sources":["VideoGeneration/Coherent Multi-Shot Video Generation with Adaptive Memory.pdf"],"sha256":"31338f0d7ecd2fa06661eb61cdcf6e0c6af71ad9266062b66478796afd0ce453","pages":17,"links":[{"label":"arXiv本地版本 2512.07802v1","url":"https://arxiv.org/abs/2512.07802v1"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P133","title":"OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory","year":"2025","authors":"Zhaochong An; Menglin Jia; Haonan Qiu; Zijian Zhou; Xiaoke Huang; Zhiheng Liu; Weiming Ren; Kumara Kahatapitiya; Ding Liu; Sen He; Chenyang Zhang; Tao Xiang; Fanny Yang; Serge Belongie; Tian Xie","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"Frame Selection、Adaptive Conditioner、带指代字幕的多镜头数据及shot inflation/解耦条件训练。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"OneStory把多镜头生成视为下一镜头预测，从全局历史挑选相关帧并自适应压缩为紧凑条件，保持角色/环境一致。","input_conditions":"历史经选择压缩，不能保留所有事件状态；依赖预训练I2V模型和相应训练，并非无需训练的记忆外挂。","training_supervision":"按当前镜头字幕检索历史信息帧，重要性引导patchification压缩上下文，直接条件注入下一镜头视频生成器。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表2无AC/FS时角色/环境一致0.5153/0.5112，完整0.5874/0.5752；语义对齐0.1814→0.2389。增加至3帧等价上下文后角色/环境0.5926/0.5863，说明预算仍有影响。","boundary":"【解读】历史选择失误、对象混淆和累积漂移仍可能发生；指标主要衡量视觉/语义一致，不能保证复杂故事事件因果完整。","evidence":"PDF §3–5、表2 p.8、§6。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2512.07802v1","url":"https://arxiv.org/abs/2512.07802v1"}],"note":"p133","priority":0},"aliases":[]},{"id":"P132","title":"Pre-trained Video Generative Models as World Simulators","short":"Pre-trained Video Generative Models as World Simulators","year":"2025","authors":"Haoran He; Yang Zhang; Liang Lin; Zhongwen Xu; Ling Pan","collected":true,"note":"p132","scope":"本地 PDF · 既有阅读笔记","summary":"DWS在预训练视频生成器上添加动作条件模块和运动强化损失，获得可按动作轨迹生成的动态模型，再通过优先想象改进模型式RL。","boundary":"需要任务动作数据和微调；“任何模型通用”仅在所测架构证实，主要游戏/机器人域，非现实通用仿真。","evidence":"PDF §3–5、§5.2图6–7、§5.3。","sources":["VideoGeneration/77_Pre_Trained_Video_Generativ.pdf"],"sha256":"dce93f666b6f970e5163c61fe1c0ead37843cbe44eaebd66be8bedc4d76dee43","pages":17,"links":[],"verified":"2026-09-15","mappings":[{"rq":"W1c","role":"core"}],"annotation":{"id":"P132","title":"Pre-trained Video Generative Models as World Simulators","year":"2025","authors":"Haoran He; Yang Zhang; Liang Lin; Zhongwen Xu; Ling Pan","teams":[],"topics":["world_model"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"适配扩散/自回归骨干的动作接口、动态转移训练与prioritized imagination。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"DWS在预训练视频生成器上添加动作条件模块和运动强化损失，获得可按动作轨迹生成的动态模型，再通过优先想象改进模型式RL。","input_conditions":"需要任务动作数据和微调；“任何模型通用”仅在所测架构证实，主要游戏/机器人域，非现实通用仿真。","training_supervision":"轻量动作模块对齐动作与视觉变化，以运动损失强化动态；按价值选想象轨迹供PPO/离线策略训练。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Procgen/Atari展示较PPO及部分模型式RL的样本效率收益；Breakout报告约7倍分数提升，限定具体预算/基线；另用合成经验增强离线策略。","boundary":"【解读】模型动态误差、动作覆盖和想象优先级可造成偏差；Procgen策略训练中世界模型仍需继续微调，不能当作一次预训练后通吃。","evidence":"PDF §3–5、§5.2图6–7、§5.3。","checked":"2026-09-15","links":[],"note":"p132","priority":0},"aliases":[]},{"id":"P131","title":"Controllable Video Generation: A Survey","short":"Controllable Video Generation","year":"2025 / 2026","authors":"Yue Ma; Kunyu Feng; Zhongyuan Hu; Xinyu Wang; Yucheng Wang; Mingzhe Zheng; Bingyuan Wang; Qinghe Wang; Xuanhua He; Hongfa Wang; Chenyang Zhu; Hongyu Liu; Yingqing He; Zeyu Wang; Zhifeng Li; Xiu Li; Sirui Han; Yike Guo; Wei Liu; Dan Xu; Linfeng Zhang; Qifeng Chen","collected":true,"note":"p131","scope":"本地 PDF · 既有阅读笔记","summary":"系统梳理文本之外的姿态、深度、轨迹、相机、音频、身份等视频生成控制，比较单条件、多条件和通用控制机制。","boundary":"综述，列出的生成分辨率、速度和代码状态属于原文时点/原实验配置；不是同硬件复现实验排行榜。","evidence":"PDF §3检索流程、§4–7、§8 p.26。","sources":["VideoGeneration/26_survey_Controllable Video Generation.pdf"],"sha256":"a14847ae33974419f181f58ca0c4df227f2c1fdafdeb7b9910470cd15a236f86","pages":41,"links":[{"label":"arXiv本地版本 2507.16869v3","url":"https://arxiv.org/abs/2507.16869v3"}],"verified":"2026-09-15","mappings":[{"rq":"W3b","role":"support"}],"annotation":{"id":"P131","title":"Controllable Video Generation: A Survey","year":"2025 / 2026","authors":"Yue Ma; Kunyu Feng; Zhongyuan Hu; Xinyu Wang; Yucheng Wang; Mingzhe Zheng; Bingyuan Wang; Qinghe Wang; Xuanhua He; Hongfa Wang; Chenyang Zhu; Hongyu Liu; Yingqing He; Zeyu Wang; Zhifeng Li; Xiu Li; Sirui Han; Yike Guo; Wei Liu; Dan Xu; Linfeng Zhang; Qifeng Chen","teams":[],"topics":["world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"控制信号/注入方式分类、基础视频模型及文献资源汇集。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"系统梳理文本之外的姿态、深度、轨迹、相机、音频、身份等视频生成控制，比较单条件、多条件和通用控制机制。","input_conditions":"综述，列出的生成分辨率、速度和代码状态属于原文时点/原实验配置；不是同硬件复现实验排行榜。","training_supervision":"PRISMA式四阶段筛选，按基础模型、条件类型、去噪注入方式和应用分析研究。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"形成控制分类与模型对照，指出多条件协调、精确局部控制、时序一致、通用接口和评估标准的挑战；无新模型统一提升数值。","boundary":"【解读】快速更新导致覆盖时点有限，各论文预算/数据/控制难度不同，列表不可直接作为质量排名。","evidence":"PDF §3检索流程、§4–7、§8 p.26。","checked":"2026-09-15","links":[{"label":"arXiv本地版本 2507.16869v3","url":"https://arxiv.org/abs/2507.16869v3"}],"note":"p131","priority":0},"aliases":[]},{"id":"P150","title":"WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment","short":"WorldCoder","year":"2024","authors":"Hao Tang; Darren Key; Kevin Ellis","collected":true,"note":"p150","scope":"本地 PDF · 既有阅读笔记","summary":"让LLM根据与环境的少量交互，编写可执行Python转移与奖励函数作为世界模型，再由规划器选择行动。模型既要解释已有经历，也应允许找到正收益计划；新证据揭示错误时修改代码，支持环境和目标迁移。","boundary":"确定性、符号离散状态；Sokoban/MiniGrid及转成符号MDP的ALFWorld。是从既有环境的观测学习模型，不是从任意创作者规则生成完整世界；代码可编辑不意味着已经评测规则编辑的局部保持、合法多样性或全部反事实后果。","evidence":"PDF pp.2–5：表示、约束与算法；pp.6–8图3–5：Sokoban、MiniGrid、ALFWorld结果；pp.9–10：局限；附录D/E：生成代码。","sources":["Reasoning/24_Hao Tang_WorldCoder a Model-Based LLM Agent.pdf"],"sha256":"55c47b1df146967ecab1933518783059885b693460d3ebbc7554aaec0eeb101f","pages":65,"links":[{"label":"论文/发表记录 1","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/820c61a0cd419163ccbd2c33b268816e-Abstract-Conference.html"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2402.12275v3"}],"verified":"2026-09-15","mappings":[{"rq":"W1b","role":"core"}],"annotation":{"id":"P150","title":"WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment","year":"2024","authors":"Hao Tang; Darren Key; Kevin Ellis","teams":[],"topics":["world_model"],"rqs":["W1b"],"collected":true,"review_status":"existing_notes","question":"能否用少量环境交互编写可执行世界模型，并通过乐观约束驱动探索与跨环境迁移？","question_origin":"依作者问题与方法改写","summary":"让LLM根据与环境的少量交互，编写可执行Python转移与奖励函数作为世界模型，再由规划器选择行动。模型既要解释已有经历，也应允许找到正收益计划；新证据揭示错误时修改代码，支持环境和目标迁移。","input_conditions":"确定性、符号离散状态；Sokoban/MiniGrid及转成符号MDP的ALFWorld。是从既有环境的观测学习模型，不是从任意创作者规则生成完整世界；代码可编辑不意味着已经评测规则编辑的局部保持、合法多样性或全部反事实后果。","training_supervision":"分离Python转移函数与目标条件奖励函数。模型需满足对所有已收集transition的拟合约束，以及存在可达正奖励轨迹的乐观约束。GPT-4根据不一致样本修补代码，REx决定优先改哪个候选；配合有限深度值迭代/MCTS规划、经验回放和少量随机探索。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Sokoban约前50个动作即可建立基本世界模型；ReAct在基础关卡仅15%±8%成功。示例模型前置约40万LLM token后可用程序规划继续行动；预训练知识贡献被作者明确承认。加入传送门规则后仍能学习阻塞行为；MiniGrid迁移及稀疏奖励任务受益于乐观约束。ALFWorld可合成250余行模型，代表任务通常首个episode约20步探索后获得奖励（3 seeds），不是完整ALFWorld榜单成功率。","boundary":"作者明确限制为确定性、符号离散环境；长程困难还受规划器限制（例如更难的5箱以上Sokoban）。程序合成和前置LLM计算成本较高，依赖预训练程序/游戏先验；拟合已见数据只验证样本覆盖部分，不能保证全状态正确。","evidence":"PDF pp.2–5：表示、约束与算法；pp.6–8图3–5：Sokoban、MiniGrid、ALFWorld结果；pp.9–10：局限；附录D/E：生成代码。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/820c61a0cd419163ccbd2c33b268816e-Abstract-Conference.html"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2402.12275v3"}],"note":"p150","priority":0},"aliases":[],"research_question":{"kind":"依作者问题与方法改写","text":"能否用少量环境交互编写可执行世界模型，并通过乐观约束驱动探索与跨环境迁移？","location":"PDF pp.1–3 §1、§2.1–2.2"}},{"id":"P149","title":"Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training","short":"Learning to Clarify","year":"2025 / 2024","authors":"Maximillian Chen; Ruoxi Sun; Tomas Pfister; Sercan Ö. Arık（按本地v2顺序）","collected":true,"note":"p149","scope":"本地 PDF · 既有阅读笔记","summary":"针对LLM在歧义请求中直接猜测或含糊回答的问题，提出ACT，用询问澄清与直接回答等不同对话动作构造偏好对，再结合当前策略采样和多轮用户模拟训练，使少量对话数据也能教会模型何时澄清及如何完成任务。","boundary":"实验为PACIFIC表格QA、Abg-CoQA阅读QA、AmbigSQL；澄清依赖文本用户模拟器、动作分类器和任务结果判据。无动作标签版本仍使用伪标签及任务数据，不是无需监督。用户回答主要提供信息，不涉及执行物理动作以生成新证据。","evidence":"PDF pp.4–7：设定和ACT算法；p.8表1：PACIFIC；p.10表3：AmbigSQL；pp.11–12表4/5：无标签设置与消融；附录：模拟器和提示。","sources":["Reasoning/24_Google_Maximillian_Learning to Clarify_Multi-turn Conversations.pdf"],"sha256":"22efec0f1c73fc160254b68a9119b9cbfeee39649e6ed035f38fc7530a10da82","pages":45,"links":[{"label":"论文/发表记录 1","url":"https://openreview.net/forum?id=SIE6VFps9x"},{"label":"论文/发表记录 2","url":"https://research.google/pubs/learning-to-clarify-multi-turn-conversations-with-action-based-contrastive-self-training/"},{"label":"论文/发表记录 3","url":"https://arxiv.org/abs/2406.00222v2"}],"verified":"2026-09-15","mappings":[{"rq":"X2a","role":"core"}],"annotation":{"id":"P149","title":"Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training","year":"2025 / 2024","authors":"Maximillian Chen; Ruoxi Sun; Tomas Pfister; Sercan Ö. Arık（按本地v2顺序）","teams":[],"topics":["hci"],"rqs":["X2a"],"collected":true,"review_status":"existing_notes","question":"歧义请求出现时，怎样用有限数据让助手学会澄清，而不是猜测或过度罗列？","question_origin":"依作者引言改写","summary":"针对LLM在歧义请求中直接猜测或含糊回答的问题，提出ACT，用询问澄清与直接回答等不同对话动作构造偏好对，再结合当前策略采样和多轮用户模拟训练，使少量对话数据也能教会模型何时澄清及如何完成任务。","input_conditions":"实验为PACIFIC表格QA、Abg-CoQA阅读QA、AmbigSQL；澄清依赖文本用户模拟器、动作分类器和任务结果判据。无动作标签版本仍使用伪标签及任务数据，不是无需监督。用户回答主要提供信息，不涉及执行物理动作以生成新证据。","training_supervision":"先根据正确/错误对话动作产生winning/losing响应；训练中从当前模型采样，识别动作是否正确。对正确动作继续模拟用户和助手对话，按最终语义/SQL执行结果更新偏好对，再进行DPO式优化。主模型Zephyr-7B，比较50/100/250条对话下的SFT、IRPO及提示基线。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"PACIFIC 50对话、相同Zephyr模型：动作Macro-F1从SFT 69.0升至ACT 82.2，澄清后F1从43.5升至57.2，trajectory F1从61.3升至61.9。AmbigSQL相同50对话设置，execution match由21.9升至43.6，澄清后由13.9升至38.1；但50对话的动作准确率仍低于IRPO（80.8 vs 91.0）。消融支持on-policy采样与多轮模拟的作用，不能概括为所有指标全面最佳。","boundary":"研究判断：效果依赖模拟用户、动作伪标签及任务启发式的质量；对话数据效率不能等同于总体训练计算效率。未验证真实用户多轮体验、错误/拒答用户、行动代价与后续感知反馈；跨任务泛化应进一步检验。","evidence":"PDF pp.4–7：设定和ACT算法；p.8表1：PACIFIC；p.10表3：AmbigSQL；pp.11–12表4/5：无标签设置与消融；附录：模拟器和提示。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://openreview.net/forum?id=SIE6VFps9x"},{"label":"论文/发表记录 2","url":"https://research.google/pubs/learning-to-clarify-multi-turn-conversations-with-action-based-contrastive-self-training/"},{"label":"论文/发表记录 3","url":"https://arxiv.org/abs/2406.00222v2"}],"note":"p149","priority":0},"aliases":[],"research_question":{"kind":"依作者引言改写","text":"歧义请求出现时，怎样用有限数据让助手学会澄清，而不是猜测或过度罗列？","location":"PDF pp.1–2 Introduction、Figure 1"}},{"id":"P148","title":"Detecting Hallucinations in Large Language Models Using Semantic Entropy","short":"Detecting Hallucinations in Large Language Models Using Semantic Entropy","year":"2024","authors":"Sebastian Farquhar; Jannik Kossen; Lorenz Kuhn; Yarin Gal（前三位共同贡献）","collected":true,"note":"p148","scope":"本地 PDF · 既有阅读笔记","summary":"研究幻觉中的一种特定机制：同一提示下随机产生不同且错误的事实性回答。通过聚合同义表达后的语义熵识别这种confabulation，并设计不依赖输出概率的离散版本和长段落事实拆分流程，支持跨任务判断何时不宜直接信任回答。","boundary":"定位的是随采样变化的confabulations，不能保证事实正确，也不处理所有训练错误、欺骗或系统性推理失误。方法为生成后的检测/选择性回答；没有自动获取新环境证据或学习交互式取证策略。","evidence":"PDF p.1：confabulation定义、发表日期与边界；pp.2–5：实验、30组合均值及长文本结果；pp.7–10：方法细节；p.11：代码地址。","sources":["Reasoning/24_Detecting hallucinations in large language models using semantic entropy.pdf"],"sha256":"52e7ad2740b25cc7697b69e12d69ca0dde844eca9f79dfa304a79be5b0e99c1a","pages":12,"links":[{"label":"论文/发表记录 1","url":"https://doi.org/10.1038/s41586-024-07421-0"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P148","title":"Detecting Hallucinations in Large Language Models Using Semantic Entropy","year":"2024","authors":"Sebastian Farquhar; Jannik Kossen; Lorenz Kuhn; Yarin Gal（前三位共同贡献）","teams":[],"topics":["generative_foundation"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"明确区分随机编造与稳定的系统性错误；将语义不确定性扩展到不同模型、QA/数学任务及GPT-4传记段落，并支持只有文本输出的黑箱接口。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"研究幻觉中的一种特定机制：同一提示下随机产生不同且错误的事实性回答。通过聚合同义表达后的语义熵识别这种confabulation，并设计不依赖输出概率的离散版本和长段落事实拆分流程，支持跨任务判断何时不宜直接信任回答。","input_conditions":"定位的是随采样变化的confabulations，不能保证事实正确，也不处理所有训练错误、欺骗或系统性推理失误。方法为生成后的检测/选择性回答；没有自动获取新环境证据或学习交互式取证策略。","training_supervision":"对同一问题多次采样，用双向蕴含判断将回答按含义聚类；有概率时聚合语义概率，无概率时用簇的样本频率估计离散语义熵。长文本先拆分事实陈述，再围绕陈述生成问题、重采样回答并汇总不确定性；以AUROC和拒答—准确率曲线等评估。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"30个模型×任务组合的平均AUROC：语义熵0.790，naive entropy 0.691，P(True) 0.698，embedding regression 0.687。离散版本总体接近有概率版本；GPT-4长篇传记实验的错误检测AUROC/AURAC也优于比较基线，但拒绝20%以上高风险回答后，P(True)在剩余回答准确率上略占优。上述指标不是模型本身的QA准确率。","boundary":"作者明确不保证系统性错误的事实性；需要多次采样与语义判定，有推理成本及判定误差。研究判断：对于架空创作，多个合法结局的语义分歧应作为设计多样性，不应直接标记为幻觉；需区分规则违反和合法分支。","evidence":"PDF p.1：confabulation定义、发表日期与边界；pp.2–5：实验、30组合均值及长文本结果；pp.7–10：方法细节；p.11：代码地址。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://doi.org/10.1038/s41586-024-07421-0"}],"note":"p148","priority":0},"aliases":[]},{"id":"P147","title":"DreamGarden: A Designer Assistant for Growing Games from a Single Prompt","short":"DreamGarden","year":"2025 / 2024","authors":"Sam Earle; Samyak Parajuli; Andrzej Banburski-Fahey","collected":true,"note":"p147","scope":"本地 PDF · 既有阅读笔记","summary":"从一个开放的梦境、场景或游戏构想出发，LLM规划器逐层分解任务，调用代码和素材子模块在Unreal Engine内构建环境。用户通过可视化计划树扩展、剪枝、查看中间产物及编辑反馈，与自主生成过程协作。","boundary":"实现C++ Actor、场景布局、素材生成/检索与UE内运行；实验主要限制为无需玩家的0-player模拟。修改节点会撤回相关实现及顺序上后续任务，并重新执行；不是精确因果依赖分析，也没有证明任意规则编辑后的最小后果更新。视觉自动评估只看启动后前6秒的6张截图。","evidence":"PDF pp.6–10：模块、代码循环、剪枝与实验设计；p.8：6秒视觉评价边界；pp.11–15：系统结果、用户主题与耗时；pp.15–16：讨论。","sources":["Reasoning/24_CHI_DreamGarden A Designer Assistant for Growing Games from a Single Prompt.pdf"],"sha256":"e1a2ce4f52bc1ddbb0c9a63c70c4e9fd95901acae67ae9ffe86f4ae447e0e8a6","pages":30,"links":[{"label":"论文/发表记录 1","url":"https://www.microsoft.com/en-us/research/publication/dreamgarden-a-designer-assistant-for-growing-games-from-a-single-prompt/?lang=ko-kr"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2410.01791v2"}],"verified":"2026-09-15","mappings":[{"rq":"W3d","role":"core"},{"rq":"X4a","role":"core"}],"annotation":{"id":"P147","title":"DreamGarden: A Designer Assistant for Growing Games from a Single Prompt","year":"2025 / 2024","authors":"Sam Earle; Samyak Parajuli; Andrzej Banburski-Fahey","teams":[],"topics":["world_model"],"rqs":["W3d","X4a"],"collected":true,"review_status":"existing_notes","question":"LLM 游戏开发工具怎样适配创作者工作流，并支持不同程度的自主生成和人工介入？","question_origin":"依作者引言问题改写","summary":"从一个开放的梦境、场景或游戏构想出发，LLM规划器逐层分解任务，调用代码和素材子模块在Unreal Engine内构建环境。用户通过可视化计划树扩展、剪枝、查看中间产物及编辑反馈，与自主生成过程协作。","input_conditions":"实现C++ Actor、场景布局、素材生成/检索与UE内运行；实验主要限制为无需玩家的0-player模拟。修改节点会撤回相关实现及顺序上后续任务，并重新执行；不是精确因果依赖分析，也没有证明任意规则编辑后的最小后果更新。视觉自动评估只看启动后前6秒的6张截图。","training_supervision":"GPT-4o将seed prompt递归展开为计划树，叶节点分派给代码/素材模块；代码经历编译、布局加载、运行、截图评价的反复修正。GUI允许变更叶节点状态、直接改代码或反馈，再继续生成。N=10、每次最多45分钟的形成性可用性研究记录访谈、操作与系统日志。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"研究参与者认可规划和原型用途，部分人认为计划树本身就有价值；观察到剪枝、扩展与自定义反馈能够改变后续产物。但对复杂游戏机制的能力仍持保留态度。默认超参数下完整流程约1小时，情绪体验有正负两面。论文以定性系统观察和小样本可用性研究为主，没有受控比较的规则正确率或开发效率增益。","boundary":"作者报告过度分解、请求超出模块能力的任务、代码/素材失败、等待长以及中间结果难以消化等问题；骨骼动画不在当前能力范围。研究判断：这已覆盖创作计划补全、可视化与人工修改，后续AI贡献需要独立评测约束满足、改动传播或有用多样性。","evidence":"PDF pp.6–10：模块、代码循环、剪枝与实验设计；p.8：6秒视觉评价边界；pp.11–15：系统结果、用户主题与耗时；pp.15–16：讨论。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://www.microsoft.com/en-us/research/publication/dreamgarden-a-designer-assistant-for-growing-games-from-a-single-prompt/?lang=ko-kr"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2410.01791v2"}],"note":"p147","priority":0},"aliases":[],"research_question":{"kind":"依作者引言问题改写","text":"LLM 游戏开发工具怎样适配创作者工作流，并支持不同程度的自主生成和人工介入？","location":"PDF p.1 Abstract / Introduction、Figure 1"}},{"id":"P146","title":"ExpertAF: Expert Actionable Feedback from Video","short":"ExpertAF","year":"2025 / 2024","authors":"Kumar Ashutosh; Tushar Nagarajan; Georgios Pavlakos; Kris Kitani; Kristen Grauman","collected":true,"note":"p146","scope":"本地 PDF · 既有阅读笔记","summary":"从学习者执行体育动作的视频和3D姿态生成可操作的指导，包括指出优缺点的专家式文字反馈、检索正确示范，以及生成修正后的3D姿态。利用Ego-Exo4D专家评论构建弱监督错误—正确动作配对，训练统一视频、姿态与文本模型。","boundary":"实际评估篮球、足球、攀岩三类身体技能；主设置输入包含ego/exo视频与3D姿态，假定一个主要动作执行者。输出视频是检索已有示范，生成的是姿态序列；新专家视频生成留作未来。没有进行长期训练者技能提升或实时XR闭环试验。","evidence":"PDF pp.3–6：任务、配对数据、编码器及训练；p.7表1：三类输出结果及特权输入说明；p.8：人评和失败案例。","sources":["Reasoning/24_Ashutosh_ExpertAF.pdf"],"sha256":"cf0af650338c144587b2147b95007535684c74908d1499a87c87f67266954b56","pages":18,"links":[{"label":"论文/发表记录 1","url":"https://openaccess.thecvf.com/content/CVPR2025/papers/Ashutosh_ExpertAF_Expert_Actionable_Feedback_from_Video_CVPR_2025_paper.pdf"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2408.00672v3"}],"verified":"2026-09-15","mappings":[{"rq":"X1b","role":"core"}],"annotation":{"id":"P146","title":"ExpertAF: Expert Actionable Feedback from Video","year":"2025 / 2024","authors":"Kumar Ashutosh; Tushar Nagarajan; Georgios Pavlakos; Kris Kitani; Kristen Grauman","teams":[],"topics":["hci"],"rqs":["X1b"],"collected":true,"review_status":"existing_notes","question":"将技能评价从单一分数推进到具体纠正建议与示范；贡献弱监督配对数据和支持三类输出的多模态自回归模型。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"从学习者执行体育动作的视频和3D姿态生成可操作的指导，包括指出优缺点的专家式文字反馈、检索正确示范，以及生成修正后的3D姿态。利用Ego-Exo4D专家评论构建弱监督错误—正确动作配对，训练统一视频、姿态与文本模型。","input_conditions":"实际评估篮球、足球、攀岩三类身体技能；主设置输入包含ego/exo视频与3D姿态，假定一个主要动作执行者。输出视频是检索已有示范，生成的是姿态序列；新专家视频生成留作未来。没有进行长期训练者技能提升或实时XR闭环试验。","training_supervision":"Llama3-70B压缩专家评论并标注身体部位/正确性；按技能等级匹配错误与正确演示，用PA-MPJPE对齐时间并过滤。InternVideo2视频特征、姿态codebook和文本映射至Llama3-8B，联合学习评论、示范检索与姿态token生成。训练25,505个tuple，人工核验测试1,272个。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1：ExpertAF的BLEU-4/METEOR/ROUGE-L为44.9/49.6/54.6；示范检索recall@50为19.1%、median rank 158，优于LLaVA-FT w/pose的18.0%/172；姿态误差PA-MPJPE由该基线150mm降至135mm。每场景5名评价者的1–4分质量评分也优于基线。带正确示范等特权输入的full-sup行不可与主设置混用。","boundary":"作者指出对疲劳等不可直接见到的状态较弱，自动提取姿态有噪声；配对真值只覆盖可能错误中的一部分。研究判断：质量偏好与姿态距离未证明建议能在实际交互中改善技能，也未评估提示导致的注意分配或后续观察变化。","evidence":"PDF pp.3–6：任务、配对数据、编码器及训练；p.7表1：三类输出结果及特权输入说明；p.8：人评和失败案例。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://openaccess.thecvf.com/content/CVPR2025/papers/Ashutosh_ExpertAF_Expert_Actionable_Feedback_from_Video_CVPR_2025_paper.pdf"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2408.00672v3"}],"note":"p146","priority":0},"aliases":[]},{"id":"P145","title":"Generative Agent-Based Modeling with Actions Grounded in Physical, Social, or Digital Space Using Concordia","short":"Concordia","year":"2023","authors":"Alexander Sasha Vezhnevets; John P. Agapiou; Avia Aharon; Ron Ziv; Jayd Matyas; Edgar A. Duéñez-Guzmán; William A. Cunningham; Simon Osindero; Danny Karmon; Joel Z. Leibo","collected":true,"note":"p145","scope":"本地 PDF · 既有阅读笔记","summary":"Concordia是构建生成式多智能体模拟的框架。智能体以组件和关联记忆组织行为，由Game Master维护环境并将自然语言动作转为情境后果或结构化/API操作，从而连接社会互动、模拟物理状态和数字服务。论文讨论应用场景及验证模拟可信度的方法。","boundary":"自然语言GM对物理合理性的判断属于语言模型模拟；只有明确接入程序/状态变量的部分拥有相应执行语义。论文包含已实现案例与潜在应用设想，不能把法律/规范涌现、真实用户预测、所有外部应用接入都视为已验证功能。","evidence":"PDF pp.5–10：组件、GM及实验设计；pp.10–11：模拟验证边界；pp.16–19：数字服务实例与明确标为潜在的应用；后续章节：讨论。","sources":["Reasoning/23_Vezhnevets_Generative agent-based modeling with actions grounded in physical, social, or digital space using Concordia.pdf"],"sha256":"ac0a23ef187ebef1820b8aebc19d2610035b1f234527b9f854151cb77ad966fb","pages":32,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2312.03664v2"}],"verified":"2026-09-15","mappings":[{"rq":"W3c","role":"core"},{"rq":"W3e","role":"support"}],"annotation":{"id":"P145","title":"Generative Agent-Based Modeling with Actions Grounded in Physical, Social, or Digital Space Using Concordia","year":"2023","authors":"Alexander Sasha Vezhnevets; John P. Agapiou; Avia Aharon; Ron Ziv; Jayd Matyas; Edgar A. Duéñez-Guzmán; William A. Cunningham; Simon Osindero; Danny Karmon; Joel Z. Leibo","teams":[],"topics":["world_model"],"rqs":["W3c","W3e"],"collected":true,"review_status":"existing_notes","question":"以可组合组件统一LLM调用、记忆检索、角色行为和Game Master环境更新；支持将自然语言社会行为接到明确的外部状态变量与数字操作，提供开放实现与建模讨论。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"Concordia是构建生成式多智能体模拟的框架。智能体以组件和关联记忆组织行为，由Game Master维护环境并将自然语言动作转为情境后果或结构化/API操作，从而连接社会互动、模拟物理状态和数字服务。论文讨论应用场景及验证模拟可信度的方法。","input_conditions":"自然语言GM对物理合理性的判断属于语言模型模拟；只有明确接入程序/状态变量的部分拥有相应执行语义。论文包含已实现案例与潜在应用设想，不能把法律/规范涌现、真实用户预测、所有外部应用接入都视为已验证功能。","training_supervision":"每个智能体用长期关联记忆与工作记忆组件回答身份、情境、适当行动等问题；GM解析尝试动作、更新状态并向不同角色发送其可见观察。数字案例通过嵌套PhoneGameMaster和PhoneUniverse选择app、函数和参数，再更新应用状态及通知。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"主要结果为框架与定性案例：展示多智能体叙事、数字手机/日历操作的调用流程，以及可接入确定性状态更新的模拟方式。本地报告未提供统一任务集上的成功率、基线消融或真实人类行为预测误差，不能据此声称社会模拟已达真实预测精度。","boundary":"作者强调必须针对具体研究问题检验泛化和algorithmic fidelity，LLM可能呈现刻板印象；用同一模型生成并解释模拟亦不能替代外部验证。研究判断：语言层一致性不保证长期因果正确性或改规则后的局部更新，开放动作解析也可能产生累积状态错误。","evidence":"PDF pp.5–10：组件、GM及实验设计；pp.10–11：模拟验证边界；pp.16–19：数字服务实例与明确标为潜在的应用；后续章节：讨论。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2312.03664v2"}],"note":"p145","priority":0},"aliases":[]},{"id":"P144","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","short":"Semantic Uncertainty","year":"2023","authors":"Lorenz Kuhn; Yarin Gal; Sebastian Farquhar","collected":true,"note":"p144","scope":"本地 PDF · 既有阅读笔记","summary":"针对同一含义可有多种语言表达的问题，将LLM输出不确定性从token序列层提升到语义层：采样多个答案，将语义等价答案聚类，再对含义的概率分布计算熵。无需重新训练被测生成模型，在自由回答QA上更有效预测答案是否可靠。","boundary":"实验以OPT 2.7B–30B、CoQA开放书QA和TriviaQA闭卷QA为主；需要多次生成、序列概率以及用于双向蕴含判断的DeBERTa模型。无监督指无需该任务的正确性标签训练不确定性估计器，不表示系统完全没有经过监督训练的组件。","evidence":"PDF pp.4–6：语义熵与双向蕴含；p.7：模型、数据及评价；p.8表2及p.9：结果、采样敏感性与讨论。","sources":["Reasoning/23_ICLR_Linguistic Invariances for Uncertainty Estimation in Natural Language Generation.pdf"],"sha256":"0cc1c0b189dbe6ccdf12deb2f11761ff183ee4813a04f7add8b28ec35375f330","pages":19,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2302.09664v3"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P144","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","year":"2023","authors":"Lorenz Kuhn; Yarin Gal; Sebastian Farquhar","teams":[],"topics":["generative_foundation"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"提出semantic entropy及基于双向蕴含的语义聚类；分析采样温度、表达长度、样本数如何影响语言不确定性估计，避免把措辞差异误当作事实分歧。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"针对同一含义可有多种语言表达的问题，将LLM输出不确定性从token序列层提升到语义层：采样多个答案，将语义等价答案聚类，再对含义的概率分布计算熵。无需重新训练被测生成模型，在自由回答QA上更有效预测答案是否可靠。","input_conditions":"实验以OPT 2.7B–30B、CoQA开放书QA和TriviaQA闭卷QA为主；需要多次生成、序列概率以及用于双向蕴含判断的DeBERTa模型。无监督指无需该任务的正确性标签训练不确定性估计器，不表示系统完全没有经过监督训练的组件。","training_supervision":"对同一问题采样M个答案；将问题与答案一起输入NLI模型，在两个方向均为entailment时聚为同一含义；聚合簇内序列概率并估计语义熵。对照普通/长度归一化预测熵、词面相似度和p(True)，用错误检测AUROC评价。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表2中30B设置：CoQA语义熵AUROC 0.77，单纯不同含义数量为0.66；TriviaQA分别0.83/0.79。人工核对聚类等价判断准确率为CoQA 95.5%、TriviaQA 92.7%。更多样本和合适的中间温度通常有利，文中主要采样温度0.5；AUROC衡量排序辨别能力，不能当作答案正确率。","boundary":"语义聚类会出错，最坏情况下需要O(M²)对比较；多次生成增加推理成本。作者指出不防止模型欺骗，长篇摘要等任务还需更强语义等价判断。研究判断：稳定重复的错误可能低熵；创作中多个均合规则的答案也可能高熵，不能直接等同于需要纠错。","evidence":"PDF pp.4–6：语义熵与双向蕴含；p.7：模型、数据及评价；p.8表2及p.9：结果、采样敏感性与讨论。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2302.09664v3"}],"note":"p144","priority":0},"aliases":[]},{"id":"P143","title":"Interactive Visual Reasoning under Uncertainty","short":"Interactive Visual Reasoning under Uncertainty","year":"2023 / 2022","authors":"Manjie Xu; Guangyuan Jiang; Wei Liang; Chi Zhang; Yixin Zhu（Xu与Jiang共同一作）","collected":true,"note":"p143","scope":"本地 PDF · 既有阅读笔记","summary":"IVRE把Blicket检测变成主动视觉推理任务：仅凭初始场景不能知道所有物体是否会使机器激活，智能体必须提出新实验、根据结果更新belief，并在有限次数内解除不确定性。对符号、像素、LLM和人类基线的比较显示，实验选择和证据整合均构成明显瓶颈。","boundary":"9个物体、其中1–4个Blicket，4个初始context面板，总时步上限T=10；机制为至少一个Blicket出现即激活的OR规则，且告知Blicket总数。行动简化为选取物体集合，不含机器人运动控制、用户代执行、空间提示或注意力中断。","evidence":"PDF pp.4–5：环境及奖励；pp.6–7：基线和人类设置；p.8表2：结果；pp.9–10：分析与明确局限。","sources":["Reasoning/22_NeurIPS_Manjie Xu_IVRE Interactive Visual REasoning under Uncertainty.pdf"],"sha256":"033de0d7f6d538c695e793bd8cf3786452225117d3899019655999dc8a7ea5cc","pages":24,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2206.09203v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"core"},{"rq":"X1c","role":"core"}],"annotation":{"id":"P143","title":"Interactive Visual Reasoning under Uncertainty","year":"2023 / 2022","authors":"Manjie Xu; Guangyuan Jiang; Wei Liang; Chi Zhang; Yixin Zhu（Xu与Jiang共同一作）","teams":[],"topics":["hci"],"rqs":["W1d","X1c"],"collected":true,"review_status":"existing_notes","question":"当现有视觉观察不足以确定因果关系时，智能体能否主动实验以减少不确定性？","question_origin":"依作者任务定义改写","summary":"IVRE把Blicket检测变成主动视觉推理任务：仅凭初始场景不能知道所有物体是否会使机器激活，智能体必须提出新实验、根据结果更新belief，并在有限次数内解除不确定性。对符号、像素、LLM和人类基线的比较显示，实验选择和证据整合均构成明显瓶颈。","input_conditions":"9个物体、其中1–4个Blicket，4个初始context面板，总时步上限T=10；机制为至少一个Blicket出现即激活的OR规则，且告知Blicket总数。行动简化为选取物体集合，不含机器人运动控制、用户代执行、空间提示或注意力中断。","training_supervision":"智能体同时输出下一实验的物体选择与各物体Blicketness belief；观测为二进制向量或160×120合成图。奖励联合全体识别成功、每步成本及与搜索oracle belief的Jensen–Shannon距离。对比随机/Bayes/逐个测试/NOTEARS/搜索组合、actor-critic RL与GPT-3.5/4。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"PDF表2的episode全物体识别准确率：人类98.15%，Search-Naive 83.80%，符号DDPG-Re 46.03%，GPT-4 26%，GPT-3.5 11%；像素DDPG与TD3仅0.72%/0.31%。机器基线通常评估10,000个随机episode，LLM评估100个，不能把这些值视作等样本量对照；人类为单独实验。","boundary":"作者明确指出合成场景和简单因果结构的限制；最佳启发式依赖OR机制先验及逐个实验策略。研究判断：该基准已经覆盖主动取证，XR研究需进一步处理行动由用户执行、观察受到提示影响与任务成本，不能只把同一任务搬进头显。","evidence":"PDF pp.4–5：环境及奖励；pp.6–7：基线和人类设置；p.8表2：结果；pp.9–10：分析与明确局限。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2206.09203v2"}],"note":"p143","priority":0},"aliases":[],"research_question":{"kind":"依作者任务定义改写","text":"当现有视觉观察不足以确定因果关系时，智能体能否主动实验以减少不确定性？","location":"PDF pp.2–4 IVRE 的交互任务定义"}},{"id":"P142","title":"Alchemy: A Benchmark and Analysis Toolkit for Meta-Reinforcement Learning Agents","short":"Alchemy","year":"2021","authors":"Jane X. Wang; Michael King; Nicolas Porcel; Zeb Kurth-Nelson; Tina Zhu; Charlie Deck; Peter Choy; Mary Cassin; Malcolm Reynolds; Francis Song; Gavin Buttimore; David P. Reichert; Neil Rabinowitz; Loic Matthey; Demis Hassabis; Alexander Lerchner; Matthew Botvinick（Wang与King共同一作）","collected":true,"note":"p142","scope":"本地 PDF · 既有阅读笔记","summary":"提出具有可分析潜在因果结构的元强化学习环境Alchemy。智能体通过试用药水、改变石头属性来发现每个episode的化学规则，并利用跨trial知识提高收益；同时提供符号版本、理想观察者和行为诊断工具，定位强化学习未能学会哪些抽象规律。","boundary":"每个episode包含10个trial；机制在episode内固定，跨episode重新采样，共167,424种预设化学配置。它研究已有真值机制的发现，不是创作者尚未定义规则的开放补全。理想观察者仅对当前trial做精确前瞻，并非对整个10-trial episode进行全局最优规划。","evidence":"PDF pp.4–5：任务机制、规模与表1；p.5脚注6：理想观察者的trial内边界；pp.6–10：训练、诊断和讨论。","sources":["Reasoning/21_NeurIPS_Jane X. Wang_Alchemy A benchmark and analysis toolkit for metareinforcement learning agent.pdf"],"sha256":"af6e9cd02d6a8d10c3a76e30b09c56e39b10fc4f265338f8e3b7142a15dedf9d","pages":24,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2102.02926v3"}],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"core"},{"rq":"W1e","role":"support"}],"annotation":{"id":"P142","title":"Alchemy: A Benchmark and Analysis Toolkit for Meta-Reinforcement Learning Agents","year":"2021","authors":"Jane X. Wang; Michael King; Nicolas Porcel; Zeb Kurth-Nelson; Tina Zhu; Charlie Deck; Peter Choy; Mary Cassin; Malcolm Reynolds; Francis Song; Gavin Buttimore; David P. Reichert; Neil Rabinowitz; Loic Matthey; Demis Hassabis; Alexander Lerchner; Matthew Botvinick（Wang与King共同一作）","teams":[],"topics":["world_model"],"rqs":["W1d","W1e"],"collected":true,"review_status":"existing_notes","question":"兼顾组合任务丰富度和机制透明性，使环境机制、belief与参考策略可计算；把总体分数拆解为结构发现、信息利用和动作执行的能力诊断。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出具有可分析潜在因果结构的元强化学习环境Alchemy。智能体通过试用药水、改变石头属性来发现每个episode的化学规则，并利用跨trial知识提高收益；同时提供符号版本、理想观察者和行为诊断工具，定位强化学习未能学会哪些抽象规律。","input_conditions":"每个episode包含10个trial；机制在episode内固定，跨episode重新采样，共167,424种预设化学配置。它研究已有真值机制的发现，不是创作者尚未定义规则的开放补全。理想观察者仅对当前trial做精确前瞻，并非对整个10-trial episode进行全局最优规划。","training_supervision":"Unity第一人称3D环境与共享机制的符号环境；药水在三维属性立方体上改变石头状态，目标是提高投入坩埚的石头价值。训练IMPALA/LSTM与VMPO/Transformer-XL基线，另实现维护可能机制集合并搜索动作的理想观察者。通过额外提供真值机制或Bayesian belief、增加预测辅助损失，诊断感知与推断瓶颈。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1在1,000个测试episode上报告均值±标准误：IMPALA 140.2±1.5，VMPO 156.2±1.6，符号VMPO 155.4±1.6，随机启发式145.7±1.5，理想观察者284.4±1.6，oracle 288.5±1.5。基线虽训练2×10^10步仍远低于参考策略；提供显式belief/机制显著改善表现，说明困难不只来自视觉控制。","boundary":"机制族人为设计，主要强调深入诊断而非跨领域覆盖；理想观察者的搜索复杂度限制更大环境。基线使用特权信息的增强实验仅用于诊断，不算解决原任务；也未证明对自然科学开放发现或用户改写规则的泛化。","evidence":"PDF pp.4–5：任务机制、规模与表1；p.5脚注6：理想观察者的trial内边界；pp.6–10：训练、诊断和讨论。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2102.02926v3"}],"note":"p142","priority":0},"aliases":[]},{"id":"P141","title":"Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration","short":"Watch-And-Help","year":"2021 / 2020","authors":"Xavier Puig; Tianmin Shu; Shuang Li; Zilin Wang; Yuan-Hong Liao; Joshua B. Tenenbaum; Sanja Fidler; Antonio Torralba","collected":true,"note":"p141","scope":"本地 PDF · 既有阅读笔记","summary":"提出先观察、后协助的两阶段家庭任务：助手从另一智能体的一次示范中推断目标，再在不同房间配置中协助完成同一目标。VirtualHome-Social支持多智能体互动，并以规划、学习基线和真人实验评估社会感知与协作效率。","boundary":"Watch阶段学习目标，Help阶段执行；本文基线使用视野内物体的真值符号状态，并非端到端像素感知。目标以预设谓词组合表示，低层动作受模拟器限制；未实现在线澄清对话、XR头显取证或持续更新目标推断。","evidence":"PDF pp.3–5：任务、输入条件与基线；pp.6–7：目标识别和协作结果；pp.8–9及附录D：真人实验与边界。","sources":["Reasoning/21_ICLR_Puig_WATCH-AND-HELP A CHALLENGE FOR SOCIAL PERCEPTION AND HUMAN-AI COLLABORATION.pdf"],"sha256":"35fd46183bb785e6f8eb0303083ca59036322f09fc4b20bea243bfc52d84486f","pages":23,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2010.09890v2"}],"verified":"2026-09-15","mappings":[{"rq":"X1b","role":"core"}],"annotation":{"id":"P141","title":"Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration","year":"2021 / 2020","authors":"Xavier Puig; Tianmin Shu; Shuang Li; Zilin Wang; Yuan-Hong Liao; Joshua B. Tenenbaum; Sanja Fidler; Antonio Torralba","teams":[],"topics":["hci"],"rqs":["X1b"],"collected":true,"review_status":"existing_notes","question":"将目标推断与跨场景协作联合纳入可复现基准；提供多智能体家庭仿真、任务划分、成功率/加速比指标，并检验仿真人类与真实参与者配合时的结论是否一致。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出先观察、后协助的两阶段家庭任务：助手从另一智能体的一次示范中推断目标，再在不同房间配置中协助完成同一目标。VirtualHome-Social支持多智能体互动，并以规划、学习基线和真人实验评估社会感知与协作效率。","input_conditions":"Watch阶段学习目标，Help阶段执行；本文基线使用视野内物体的真值符号状态，并非端到端像素感知。目标以预设谓词组合表示，低层动作受模拟器限制；未实现在线澄清对话、XR头显取证或持续更新目标推断。","training_supervision":"Transformer编码示范中的物体状态，再经LSTM与时间聚合预测目标谓词；对比层次规划HP、层次RL及学习高层策略与规划低层动作的Hybrid。规划器考虑Alice的未来计划，降低重复劳动与动作冲突。训练1,011个任务；两个测试集各100个任务，保留未见公寓及谓词组合，单轮最多250步。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Test-1目标识别precision/recall为0.85/0.96；仅看最终观察为0.79/0.75；输入Alice动作则为0.99/0.99，说明结果明显依赖输入条件。Test-2组合任务降至0.68/0.64。HP和Hybrid能提供帮助，随机目标HP在40%的回合产生目标冲突。真人单人实验6人，协作实验12人、90次试验：三种助手的总体排序与仿真评估一致。","boundary":"作者指出在线目标推断和智能体通信仍是后续方向；错误目标可能使强规划器帮倒忙。研究判断：符号真值感知、较小真人样本和有限家庭谓词空间限制向真实XR迁移，成功率不能直接代表人类注意力成本或请求行动的可接受性。","evidence":"PDF pp.3–5：任务、输入条件与基线；pp.6–7：目标识别和协作结果；pp.8–9及附录D：真人实验与边界。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2010.09890v2"}],"note":"p141","priority":0},"aliases":[]},{"id":"P160","title":"Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review","short":"Fictional Worldbuilding","year":"2026","authors":"Jingbo Chen; He Wang; Wei Yuan; Yuqiao Lai; Zhenyan Lu","collected":true,"note":"p160","scope":"本地 PDF · 方法条件已核查","summary":"AutoWorldBuilder从一两句世界设定生成地理、社会、资源与文化等概念。系统以多智能体分工、任务依赖调度、分层上下文预算和迭代审核控制规模与内部一致性；在20个设定任务、两种LLM后端上报告运行及内部评审结果。","boundary":"作者在§6.4明确：16种概念关系只完成定义，关系解析模块未实现，实验关系类型覆盖率为0%；不能称已验证完整知识图谱推理。输出是概念设定集合，未实现可执行世界演化、因果干预或规则修改后的依赖更新；接受/拒绝设定等实时人机协作列为未来工作。质量来自系统内部LLM评审，无独立外部正确性基准。","evidence":"PDF pp.12–20：概念/调度/压缩/审核；pp.21–25 Tables 6–14：20×2实验及压缩分母；pp.27–28 §5.4：非受控消融声明；p.30 §6.4：关系模块未实现及质量评估局限；p.31：人机协作列为未来工作。","sources":["Reasoning/26_Jingbo_Fictional Worldbuilding Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review.pdf"],"sha256":"e116379992778595245b5564198d216a171c7b88850d71d691789788ed2f450b","pages":36,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2607.09403v1"}],"verified":"2026-09-15","mappings":[{"rq":"W1a","role":"support"},{"rq":"W3d","role":"core"},{"rq":"W1e","role":"support"},{"rq":"W3e","role":"support"}],"annotation":{"id":"P160","title":"Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review","year":"2026","authors":"Jingbo Chen; He Wang; Wei Yuan; Yuqiao Lai; Zhenyan Lu","teams":[],"topics":["world_model"],"rqs":["W1a","W3d","W1e","W3e"],"collected":true,"review_status":"method_checked","question":"整合概念存储、DAG与语义分组调度、FAISS检索和四层上下文、专门Auditor与可配置角色。是架空世界概念扩展系统的直接前作，但其提出的数据结构与实际启用功能必须区分。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"AutoWorldBuilder从一两句世界设定生成地理、社会、资源与文化等概念。系统以多智能体分工、任务依赖调度、分层上下文预算和迭代审核控制规模与内部一致性；在20个设定任务、两种LLM后端上报告运行及内部评审结果。","input_conditions":"作者在§6.4明确：16种概念关系只完成定义，关系解析模块未实现，实验关系类型覆盖率为0%；不能称已验证完整知识图谱推理。输出是概念设定集合，未实现可执行世界演化、因果干预或规则修改后的依赖更新；接受/拒绝设定等实时人机协作列为未来工作。质量来自系统内部LLM评审，无独立外部正确性基准。","training_supervision":"将输入拆成有依赖的任务，拓扑排序后按语义与批大小分组；从已完成批次检索相关概念，按Essential/Relevant/Summary/Collaboration四层分配上下文。21种专门角色按技能配置加载，8种Auditor参与评分、修订和筛选；主要测试中文输入。20个案例覆盖5类世界，每种后端各运行20次，共40次。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Table 8中GPT-OSS 120B和DeepSeek v3.2均19/20次完成（95%）；成功世界平均56.2/103.4个概念，平均18/31分钟，内部最终通过率85.5/99.2%。作者称初轮42%经审核到85%以上，但Table 14中DeepSeek平均评分从8.40降至8.21。所谓89.9/90.7%压缩对应平均304.3/278.4 token相对3,000-token预算的未用比例，不能当作相对未压缩完整上下文的受控节省率。Auditor全部通过只说明未检出问题，不代表零冲突。","boundary":"作者在§6.4明确：16种概念关系只完成定义，关系解析模块未实现，实验关系类型覆盖率为0%；不能称已验证完整知识图谱推理。输出是概念设定集合，未实现可执行世界演化、因果干预或规则修改后的依赖更新；接受/拒绝设定等实时人机协作列为未来工作。质量来自系统内部LLM评审，无独立外部正确性基准。","evidence":"PDF pp.12–20：概念/调度/压缩/审核；pp.21–25 Tables 6–14：20×2实验及压缩分母；pp.27–28 §5.4：非受控消融声明；p.30 §6.4：关系模块未实现及质量评估局限；p.31：人机协作列为未来工作。 2026-09-19 复核相关缓存页；未重跑实验。","checked":"2026-09-19","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2607.09403v1"}],"note":"p160","priority":0,"observed_failures":"§6.4：关系类型覆盖 0%，解析模块未实现；121 次内部审核未发现问题，作者指出审核可能过宽；缺少独立标准化评测。"},"aliases":[]},{"id":"P159","title":"GPS: Graph-guided Proactive Information Seeking in Large Language Models","short":"GPS","year":"2026","authors":"Ruiqing Li; Yifeng Xu; Xinke Jiang; Zhibang Yang; Xinyu Ma; Yue Fang; Junfeng Zhao; Yasha Wang; Xu Chu","collected":true,"note":"p159","scope":"本地 PDF · 既有阅读笔记","summary":"面向检索增强问答中缺少用户条件的问题，将文档中的条件规则组织为有向无环图，沿图主动澄清缺失变量，并根据回答裁剪无关分支。通过条件路径合成训练数据和面向澄清结果的强化学习，同时改善回答正确性和提问效率。","boundary":"理论的逻辑完备性针对有限取值函数可被DAG表示，不保证LLM会从真实文档正确抽取全部规则。实验的用户模拟器回答已有条件事实；没有通过物理行动创造新证据。世界规则已给定，未知的是用户条件，并非从观察发现未知环境机制。","evidence":"PDF pp.3–7：DAG、算法、数据合成与奖励；p.8：SR/WCT/澄清需要F1定义；pp.9–10 Tables 1–2：主结果和消融；附录A/B：理论。","sources":["Reasoning/26_ICLR_Ruiqing_GPS_Graph_guided_Proacti.pdf"],"sha256":"59c114d720cc8d31d8c53fede1b4298921279d14a9bc5a59d93dfdd3b0f4c314","pages":25,"links":[{"label":"论文/发表记录 1","url":"https://proceedings.iclr.cc/paper_files/paper/2026/hash/1f49b7fbd7c7afc52c1db0d4ed1a338d-Abstract-Conference.html"}],"verified":"2026-09-15","mappings":[{"rq":"X2a","role":"core"}],"annotation":{"id":"P159","title":"GPS: Graph-guided Proactive Information Seeking in Large Language Models","year":"2026","authors":"Ruiqing Li; Yifeng Xu; Xinke Jiang; Zhibang Yang; Xinyu Ma; Yue Fang; Junfeng Zhao; Yasha Wang; Xu Chu","teams":[],"topics":["hci"],"rqs":["X2a"],"collected":true,"review_status":"existing_notes","question":"条件知识已在文档中时，怎样主动问出缺失条件，并避免无效澄清？","question_origin":"依作者问题定义改写","summary":"面向检索增强问答中缺少用户条件的问题，将文档中的条件规则组织为有向无环图，沿图主动澄清缺失变量，并根据回答裁剪无关分支。通过条件路径合成训练数据和面向澄清结果的强化学习，同时改善回答正确性和提问效率。","input_conditions":"理论的逻辑完备性针对有限取值函数可被DAG表示，不保证LLM会从真实文档正确抽取全部规则。实验的用户模拟器回答已有条件事实；没有通过物理行动创造新证据。世界规则已给定，未知的是用户条件，并非从观察发现未知环境机制。","training_supervision":"Reasoner输出条件变量、值分支与答案叶节点；Clarifier按可达路径代价选择问题，收到回答后剪枝。用ConditionalQA中的欠明确样本及DeepSeek-R1合成条件路径，筛选完整输入可答而缺失输入不可答的数据。GRPO训练Reasoner，结合正确性、轮数惩罚与结构质量奖励；在Qwen2.5-7B和Llama3-8B骨干上验证。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Table 1中Qwen-GPS在Synthetic/ConditionalQA/ShARC的成功率为60.2/73.4/79.3%，WCT为4.59/2.91/2.41；对应Clarify-DPO成功率59.2/72.0/78.5%，WCT 4.67/3.52/2.93。WCT把失败样本按最大10轮计罚，不等于原始平均提问次数；另列F1衡量是否需要澄清，不是答案F1。Llama-GPS在ShARC为75.8%，低于Clarify-DPO的82.7%，并非所有设置均最佳。Qwen在ConditionalQA移除RL后成功率73.4→67.7%。","boundary":"【解读】有限离散条件、相对固定规则库及模拟用户限制复杂开放场景；图抽取错误可系统性排除正确路径。LLM判分和模拟用户偏差仍在；轮数成本没有表达用户动作风险、注意力中断及不同取证行动对后续观察的影响。","evidence":"PDF pp.3–7：DAG、算法、数据合成与奖励；p.8：SR/WCT/澄清需要F1定义；pp.9–10 Tables 1–2：主结果和消融；附录A/B：理论。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://proceedings.iclr.cc/paper_files/paper/2026/hash/1f49b7fbd7c7afc52c1db0d4ed1a338d-Abstract-Conference.html"}],"note":"p159","priority":0},"aliases":[],"research_question":{"kind":"依作者问题定义改写","text":"条件知识已在文档中时，怎样主动问出缺失条件，并避免无效澄清？","location":"PDF p.1 Introduction；DAG 推理与动态裁剪"}},{"id":"P158","title":"RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence","short":"RULER-Bench","year":"2025","authors":"Xuming He; Zehao Fan; Hengjia Li; Fan Zhuo; Hankun Xu; Senlin Cheng; Di Weng; Haifeng Liu; Can Ye; Boxi Wu（前三位共同贡献）","collected":true,"note":"p158","scope":"本地 PDF · 方法条件已核查","summary":"为视频生成模型建立规则推理基准，要求生成的过程在科学、视觉、假设、游戏、语义与人文任务中体现隐含规则。通过人工核验的规则解释和逐项问题，将指令遵循、视觉一致性、视觉保真度与规则连贯性分开评价。","boundary":"评价短视频生成是否符合给定场景/隐含规则，包含假设性世界条件，但没有交互式创作者规则编辑或同一规则下多条演化的覆盖实验。o3按good/medium/bad映射100/50/0做问题级评分，RC是归一化评分，不是整段视频严格满足规则的比例。","evidence":"PDF p.3：分类；p.5：指标与问题构建；p.6 Tables 2–3：主结果；p.7 Table 4：提示实验；p.8：人工一致性研究。","sources":["Reasoning/25_Xuming He_RULER-Bench Probing Rule-based Reasoning Abilities of Next-level Video.pdf"],"sha256":"fab16d768eec43e7f891e6e6993e0bd77ca4f4fdffd675d5e978c408dcd9e90b","pages":30,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2512.02622v1"}],"verified":"2026-09-15","mappings":[{"rq":"W2d","role":"core"},{"rq":"W4d","role":"core"}],"annotation":{"id":"P158","title":"RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence","year":"2025","authors":"Xuming He; Zehao Fan; Hengjia Li; Fan Zhuo; Hankun Xu; Senlin Cheng; Di Weng; Haifeng Liu; Can Ye; Boxi Wu（前三位共同贡献）","teams":[],"topics":["world_model"],"rqs":["W2d","W4d"],"collected":true,"review_status":"method_checked","question":"提供622个样本、40种任务、6个大类和约6,500条核查问题，分别测试文本到视频及图像到视频模型；揭示视觉质量较高仍可能缺少正确规则后果的现象。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"为视频生成模型建立规则推理基准，要求生成的过程在科学、视觉、假设、游戏、语义与人文任务中体现隐含规则。通过人工核验的规则解释和逐项问题，将指令遵循、视觉一致性、视觉保真度与规则连贯性分开评价。","input_conditions":"评价短视频生成是否符合给定场景/隐含规则，包含假设性世界条件，但没有交互式创作者规则编辑或同一规则下多条演化的覆盖实验。o3按good/medium/bad映射100/50/0做问题级评分，RC是归一化评分，不是整段视频严格满足规则的比例。","training_supervision":"人工与GPT-5构造任务、隐含解释和核查表并复核；评测10个视频模型（6闭源、4开源），由o3逐项评分。另比较加入规则/预期结果解释的增强提示，并以80个视频、813个问题的人类标注核对自动评审。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"RULER v1：622 个样例、40 个任务、6 类规则，约 6,500 个问项。Table 3 的 Veo 3.1 RC 为 48.87/100，VF 为 86.72/100；这是该版本所测模型结果，RC 不是整段通过率，也不是 2026 最新排名。","boundary":"评价短视频生成是否符合给定场景/隐含规则，包含假设性世界条件，但没有交互式创作者规则编辑或同一规则下多条演化的覆盖实验。o3按good/medium/bad映射100/50/0做问题级评分，RC是归一化评分，不是整段视频严格满足规则的比例。","evidence":"PDF p.3：分类；p.5：指标与问题构建；p.6 Tables 2–3：主结果；p.7 Table 4：提示实验；p.8：人工一致性研究。 2026-09-19 复核相关缓存页；未重跑实验。","checked":"2026-09-19","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2512.02622v1"}],"note":"p158","priority":0},"aliases":[]},{"id":"P157","title":"Exploring Exploration with Foundation Agents in Interactive Environments","short":"Exploring Exploration","year":"2025 / 2024","authors":"Daniel P. Sawyer; Nan Rosemary Ke; Hubert Soyer; Martin Engelcke; David P. Reichert; Drew A. Hudson; John Reid; Alexander Lerchner; Danilo Jimenez Rezende; Timothy P. Lillicrap; Michael Mozer; Jane X. Wang","collected":true,"note":"p157","scope":"本地 PDF · 既有阅读笔记","summary":"考查基础模型能否在交互环境中主动收集信息、检验假设并适应隐藏机制。以文本/三维Feature World和更复杂的Alchemy实验，分析模型、先验说明及周期总结对探索质量、跨试次学习和机制突变后适应的作用。","boundary":"无需微调的模型能力研究，非新训练算法。三维试验用Gemini 1.5 Pro，由人类执行移动/放置指令；这一设置已经覆盖‘新证据需要请求人类行动’的基本形态。每个三维条件15个episode，任务结构简单，未优化人类注意力、行动可接受性或XR空间提示。","evidence":"PDF pp.5–7：Feature World与三维人类执行，p.7 Figure 3及视觉错误；pp.8–11：Alchemy、总结/先验和机制突变；p.12：局限。","sources":["Reasoning/25_Swayer_Deepmind_EXPLORING EXPLORATION WITH FOUNDATION AGENTS.pdf"],"sha256":"18991b9ca070b5bc1ca4355db21012d97ce34c4715cf6d16d738eab85b96125c","pages":30,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2412.06438v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"core"},{"rq":"X1c","role":"core"}],"annotation":{"id":"P157","title":"Exploring Exploration with Foundation Agents in Interactive Environments","year":"2025 / 2024","authors":"Daniel P. Sawyer; Nan Rosemary Ke; Hubert Soyer; Martin Engelcke; David P. Reichert; Drew A. Hudson; John Reid; Alexander Lerchner; Danilo Jimenez Rezende; Timothy P. Lillicrap; Michael Mozer; Jane X. Wang","teams":[],"topics":["world_model"],"rqs":["W1d","X1c"],"collected":true,"review_status":"existing_notes","question":"基础模型能否主动选取信息、跨试次学习隐藏机制，并适应规则突然改变？","question_origin":"依作者引言与实验改写","summary":"考查基础模型能否在交互环境中主动收集信息、检验假设并适应隐藏机制。以文本/三维Feature World和更复杂的Alchemy实验，分析模型、先验说明及周期总结对探索质量、跨试次学习和机制突变后适应的作用。","input_conditions":"无需微调的模型能力研究，非新训练算法。三维试验用Gemini 1.5 Pro，由人类执行移动/放置指令；这一设置已经覆盖‘新证据需要请求人类行动’的基本形态。每个三维条件15个episode，任务结构简单，未优化人类注意力、行动可接受性或XR空间提示。","training_supervision":"Feature World中寻找产生奖励的颜色/形状属性或属性组合，比较模型探索与随机及理想策略；将Gemini扩展到三维视频输入和人类执行。TextAlchemy比较GPT-4o、o4-mini、Claude 3.7与Gemini 2.5 Pro，控制是否给结构先验、是否每轮自总结，并在后续试次静默更换环境机制。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"三维Gemini行动条件的15个episode有8个出现视觉错误；保留这些错误时，奖励属性识别相对随机行动者的提升不显著（p=0.13），去除视觉错误后才显示优势。Alchemy在无先验且不总结时，没有模型显示显著的跨试次提升；增加总结后，除o4-mini外模型在无先验设置也能改善。机制改变后，Gemini 2.5 Pro和Claude 3.7在相应增强条件下能恢复表现，GPT-4o/o4-mini适应较弱。","boundary":"【解读】固定合成环境族及Alchemy每条件10次随机重复限制统计与开放世界结论；人类承担底层动作控制，掩盖真实部署的行动落地问题。论文没有处理取证与用户当前任务的注意力冲突、请求被拒绝、提示污染观察及人机私有信息差异。作者关于能力上限的推测不应当作无内在障碍的证明。","evidence":"PDF pp.5–7：Feature World与三维人类执行，p.7 Figure 3及视觉错误；pp.8–11：Alchemy、总结/先验和机制突变；p.12：局限。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2412.06438v2"}],"note":"p157","priority":0},"aliases":[],"research_question":{"kind":"依作者引言与实验改写","text":"基础模型能否主动选取信息、跨试次学习隐藏机制，并适应规则突然改变？","location":"PDF p.1 Abstract、Introduction；Feature World 与 Alchemy 实验"}},{"id":"P156","title":"PoE-World: Compositional World Modeling with Products of Programmatic Experts","short":"PoE-World","year":"2025","authors":"Wasu Top Piriyakulkij; Yichao Liang; Hao Tang; Adrian Weller; Marta Kryven; Kevin Ellis","collected":true,"note":"p156","scope":"本地 PDF · 既有阅读笔记","summary":"将环境动力学表示为多个小型程序专家组成的加权乘积模型，支持随机性、部分可观测性和较复杂的对象交互。LLM从少量轨迹编写与修订专家程序，优化其权重后形成可规划或用于训练策略的世界模型。","boundary":"使用OCAtari提取的结构化对象/属性，作者还按游戏修补对象检测，非从原始像素端到端学得全部机制。模型以完整历史为条件，并假设下一状态对象属性条件独立以便归一化。实验集中在Pong、Montezuma’s Revenge及其改版；没有解决通用探索、奖励学习或任意创作者世界。","evidence":"PDF pp.3–6：专家分布、权重学习、规划和对象输入；p.7 Table 1：交互预算与游戏结果；pp.8–10：预测实验和局限。","sources":["Reasoning/25_Piriyakulkij_POE_World.pdf"],"sha256":"71cf49e51a7705bb24fc0812ec7f33871ae4dfd5871021b5c954d720ad440814","pages":30,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2505.10819v4"},{"label":"论文/发表记录 2","url":"https://proceedings.neurips.cc/paper_files/paper/2025/hash/262dd62fd1bbb30d6a6b4d578f5e65ff-Abstract-Conference.html"}],"verified":"2026-09-15","mappings":[{"rq":"W1b","role":"core"}],"annotation":{"id":"P156","title":"PoE-World: Compositional World Modeling with Products of Programmatic Experts","year":"2025","authors":"Wasu Top Piriyakulkij; Yichao Liang; Hao Tang; Adrian Weller; Marta Kryven; Kevin Ellis","teams":[],"topics":["world_model"],"rqs":["W1b"],"collected":true,"review_status":"existing_notes","question":"怎样表示世界动力学，才能以少量经验学习，又支持随机性、部分可观测性和组合规划？","question_origin":"依作者引言问题改写","summary":"将环境动力学表示为多个小型程序专家组成的加权乘积模型，支持随机性、部分可观测性和较复杂的对象交互。LLM从少量轨迹编写与修订专家程序，优化其权重后形成可规划或用于训练策略的世界模型。","input_conditions":"使用OCAtari提取的结构化对象/属性，作者还按游戏修补对象检测，非从原始像素端到端学得全部机制。模型以完整历史为条件，并假设下一状态对象属性条件独立以便归一化。实验集中在Pong、Montezuma’s Revenge及其改版；没有解决通用探索、奖励学习或任意创作者世界。","training_supervision":"LLM合成短Python程序，其确定性属性预测转换为带噪专家分布，未规定属性采用均匀分布；按加权乘积组合。L-BFGS最大似然拟合权重并删去弱专家，新轨迹触发补充/修正。使用对象接触关系的高层图和低层动作搜索做分层规划，也用世界模型训练RL策略。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"少于1,000帧初始示范加最多3,000步额外交互条件下，Table 1的PoE-World+planner在原版/改版Montezuma均得100±0，WorldCoder和100k步PPO均为0；此处100分对应拿到钥匙，非通关。原版/改版Pong分别为−12.33±0.88、−13.67±0.67，虽优于相应少样本基线但仍是负分；20M步PPO在原版Pong为17±0.58，不能笼统声称超越长期训练的RL。","boundary":"【作者】未学习像素感知，也没有通用解决探索及奖励学习。【解读】条件独立、人工对象接口与两类游戏限制外推；交互样本节省不等于LLM合成及规划计算成本低。没有独立评测规则编辑后的因果影响定位、无关内容保持或多种合法世界的覆盖。","evidence":"PDF pp.3–6：专家分布、权重学习、规划和对象输入；p.7 Table 1：交互预算与游戏结果；pp.8–10：预测实验和局限。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2505.10819v4"},{"label":"论文/发表记录 2","url":"https://proceedings.neurips.cc/paper_files/paper/2025/hash/262dd62fd1bbb30d6a6b4d578f5e65ff-Abstract-Conference.html"}],"note":"p156","priority":0},"aliases":[],"research_question":{"kind":"依作者引言问题改写","text":"怎样表示世界动力学，才能以少量经验学习，又支持随机性、部分可观测性和组合规划？","location":"PDF p.1 Introduction，p.3 建模假设"}},{"id":"P155","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","short":"EgoPlan-Bench2","year":"2026 / 2025 / 2024","authors":"Lu Qiu; Yi Chen; Yuying Ge; Yixiao Ge; Ying Shan; Xihui Liu（前两位共同贡献；按本地v2署名顺序）","collected":true,"note":"p155","scope":"本地 PDF · 既有阅读笔记","summary":"以真实第一人称活动视频考查多模态LLM能否结合当前视觉状态、此前任务进度与目标选择下一步行动。构建涵盖4个领域、24种场景的1,321个问题，并用多模态CoT和自一致性改善模型的历史理解、对象定位与下一步决策。","boundary":"任务是离线四选一下一动作预测，不是执行计划的闭环智能体成功率。输入包含任务目标、历史视频与当前帧；视频时长为数秒至5分钟。筛选条件要求相关对象可见，未评测用户按请求主动改变视角来补充证据。","evidence":"PDF pp.5–7：数据构建与Table I；pp.7–12：错误分析；p.14 Table II：提示与特权输入条件；正式期刊信息见Springer页面。","sources":["Reasoning/25_Liu Qiu_EgoPlan-Bench2 A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios.pdf"],"sha256":"86d13b4d204df0eee1eec14c5a5dde9f3cdc465b7e5b96009d4d8b7f4c48f353","pages":18,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2412.04447v2"},{"label":"论文/发表记录 2","url":"https://link.springer.com/article/10.1007/s11263-026-02826-y"}],"verified":"2026-09-15","mappings":[{"rq":"X1b","role":"core"}],"annotation":{"id":"P155","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","year":"2026 / 2025 / 2024","authors":"Lu Qiu; Yi Chen; Yuying Ge; Yixiao Ge; Ying Shan; Xihui Liu（前两位共同贡献；按本地v2署名顺序）","teams":[],"topics":["hci"],"rqs":["X1b"],"collected":true,"review_status":"existing_notes","question":"从1,113段Ego4D视频建立依赖视觉信息和活动进度的规划问答，刻意剔除仅靠文字即可回答、或当前帧已经泄露下一动作的问题；分析模型对时间、对象和目标的联合理解错误。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"以真实第一人称活动视频考查多模态LLM能否结合当前视觉状态、此前任务进度与目标选择下一步行动。构建涵盖4个领域、24种场景的1,321个问题，并用多模态CoT和自一致性改善模型的历史理解、对象定位与下一步决策。","input_conditions":"任务是离线四选一下一动作预测，不是执行计划的闭环智能体成功率。输入包含任务目标、历史视频与当前帧；视频时长为数秒至5分钟。筛选条件要求相关对象可见，未评测用户按请求主动改变视角来补充证据。","training_supervision":"GPT-4辅助清理动作叙述、推断目标及生成问答；InternVL1.5与GPT-4帮助自适应选择时间点，再做循环评测与人工核查。训练自由的增强流程结合动作历史摘要、GroundingDINO对象边界框、CoT及自一致性投票。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"本地Table I中GPT-4V最高准确率32.63%，随机为25%，多数模型约23–27%。Table II是另一提示实验：基线32.80%，加入多模态CoT和自一致性达到43.04%，提升10.24个百分点；不能把这个增量加到Table I的32.63%。使用真实标注动作历史可到51.67%，属于特权输入条件。","boundary":"【作者/实验分析】动作进度、当前环境、领域知识与空间定位仍会混淆。【解读】四选一正确不等于可执行规划；模型参与筛选可能带来分布偏差，抽帧可错过短暂事件。没有测量用户注意力、取证动作代价、计划执行失败后的恢复或XR提示改变后续观察的问题。","evidence":"PDF pp.5–7：数据构建与Table I；pp.7–12：错误分析；p.14 Table II：提示与特权输入条件；正式期刊信息见Springer页面。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2412.04447v2"},{"label":"论文/发表记录 2","url":"https://link.springer.com/article/10.1007/s11263-026-02826-y"}],"note":"p155","priority":0},"aliases":[]},{"id":"P154","title":"Text2World: Benchmarking Large Language Models for Symbolic World Model Generation","short":"Text2World","year":"2025","authors":"Mengkang Hu; Tianxing Chen; Yude Zou; Yuheng Lei; Qiguang Chen; Ming Li; Yao Mu; Hongyuan Zhang; Wenqi Shao; Ping Luo（前三位共同贡献）","collected":true,"note":"p154","scope":"本地 PDF · 既有阅读笔记","summary":"研究模型能否将自然语言世界描述转成可供符号规划器使用的PDDL世界模型。通过多阶段数据筛选、人工核验及解析执行和结构指标，评价16个LLM，并比较报错修正、上下文示例、合成数据微调及智能体训练对建模能力的作用。","boundary":"输入已提供谓词/动作名称、类型或签名和高层描述；主设置刻意省略明确前置条件和效果，让模型补足。初始1,801个域经筛选剩264个，人工终检得到103个，分为2个训练示例和101个测试域；不能把中间264个当成最终测试数。EXEC主要检查解析/验证器可执行性，SIM和F1基于参考PDDL结构，不是所有轨迹的行为等价证明。","evidence":"PDF pp.2–5：任务、指标、数据过滤与103/101计数；pp.6–9：错误类型、Table 1主结果及Table 2示例实验。","sources":["Reasoning/25_ACL_Findings_Text2World Benchmarking Large Language Models for Symbolic World Model Generation.pdf"],"sha256":"516fd70c100750ff006a62c75aa772ac08bcf91cf4de4e3cbc41ff00c405e319","pages":24,"links":[{"label":"论文/发表记录 1","url":"https://aclanthology.org/2025.findings-acl.1337/"}],"verified":"2026-09-15","mappings":[{"rq":"W1a","role":"core"}],"annotation":{"id":"P154","title":"Text2World: Benchmarking Large Language Models for Symbolic World Model Generation","year":"2025","authors":"Mengkang Hu; Tianxing Chen; Yude Zou; Yuheng Lei; Qiguang Chen; Ming Li; Yao Mu; Hongyuan Zhang; Wenqi Shao; Ping Luo（前三位共同贡献）","teams":[],"topics":["world_model"],"rqs":["W1a"],"collected":true,"review_status":"existing_notes","question":"LLM 能否把自然语言世界描述补全为可执行的 PDDL 模型？","question_origin":"依作者任务定义改写","summary":"研究模型能否将自然语言世界描述转成可供符号规划器使用的PDDL世界模型。通过多阶段数据筛选、人工核验及解析执行和结构指标，评价16个LLM，并比较报错修正、上下文示例、合成数据微调及智能体训练对建模能力的作用。","input_conditions":"输入已提供谓词/动作名称、类型或签名和高层描述；主设置刻意省略明确前置条件和效果，让模型补足。初始1,801个域经筛选剩264个，人工终检得到103个，分为2个训练示例和101个测试域；不能把中间264个当成最终测试数。EXEC主要检查解析/验证器可执行性，SIM和F1基于参考PDDL结构，不是所有轨迹的行为等价证明。","training_supervision":"从已有PDDL域构造自然语言描述，多阶段自动过滤后由6位计算机背景标注者及2位复核者做质量控制。评价9个系列的16个LLM；比较零样本CoT、不做修正EC0与最多3次解析报错反馈EC3、两样本提示、601个合成域上的SFT及智能体轨迹训练。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"Table 1中DeepSeek-R1从EC0到EC3：EXEC 72.3→89.1，谓词F1 71.7→86.7、参数F1 64.0→76.3、前置条件F1 57.6→65.0、效果F1 58.8→67.3；结构SIM反而84.3→84.0。两样本提示能明显改善部分模型，但gpt-4o-mini部分指标退步。合成数据SFT使原本EXEC为0的Llama3.1模型获得可解析建模能力；不同干预没有一致改善所有指标。","boundary":"【解读】有限域规模及对单一参考实现的结构匹配，无法覆盖所有同样有效的建模选择；高层描述本身可能不完整，不能将创作补全一概判为与唯一参考不一致。没有评测交互式规则修改、影响范围内的最小更新，或同一规则下多种合理演化的覆盖度。","evidence":"PDF pp.2–5：任务、指标、数据过滤与103/101计数；pp.6–9：错误类型、Table 1主结果及Table 2示例实验。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://aclanthology.org/2025.findings-acl.1337/"}],"note":"p154","priority":0},"aliases":[],"research_question":{"kind":"依作者任务定义改写","text":"LLM 能否把自然语言世界描述补全为可执行的 PDDL 模型？","location":"正文任务定义及基准构建；输入已给谓词/动作签名"}},{"id":"P153","title":"Internal Consistency and Self-Feedback in Large Language Models: A Survey","short":"Internal Consistency and Self-Feedback in Large Language Models","year":"2024","authors":"Xun Liang; Shichao Song; Zifan Zheng; Hanyu Wang; Qingchen Yu; Xunkai Li; Rong-Hua Li; Yi Wang; Zhonghao Wang; Feiyu Xiong; Zhiyu Li","collected":true,"note":"p153","scope":"本地 PDF · 既有阅读笔记","summary":"从模型内部一致性出发，统一整理置信度估计、幻觉检测、推理、自我修正与自训练等工作。将一致性分成文本响应、token解码和潜在张量三个层次，并用自我评价—反馈—自我更新框架解释现有方法之间的关系与争议。","boundary":"属于综述和概念框架，没有提出并统一验证一个新的通用自我修正算法。文中的‘Consistency Is (Almost) Correctness’是有前提的假设，不是模型答案正确性的定理；当稳定错误来自训练知识或共享偏差时，多次一致仍可能出错。","evidence":"PDF pp.4–7：分类、标点示例与统一框架；pp.8–14：方法组织；pp.15–16：争议与一致性假设。","sources":["Reasoning/24_survey_Internal Consistency and Self-Feedback in llms.pdf"],"sha256":"41fc06755fbf77dde907801588d81aa96e0c54191ce4afe3af6e277e0be6decd","pages":20,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2407.14507v3"}],"verified":"2026-09-15","mappings":[{"rq":"X3a","role":"core"}],"annotation":{"id":"P153","title":"Internal Consistency and Self-Feedback in Large Language Models: A Survey","year":"2024","authors":"Xun Liang; Shichao Song; Zifan Zheng; Hanyu Wang; Qingchen Yu; Xunkai Li; Rong-Hua Li; Yi Wang; Zhonghao Wang; Feiyu Xiong; Zhiyu Li","teams":[],"topics":["generative_foundation"],"rqs":["X3a"],"collected":true,"review_status":"existing_notes","question":"给出跨响应、解码和潜在表示的一致性分类，以及Self-Evaluate→反馈信号→Self-Update的统一组织框架；把推理时的回答修改与训练时的参数/学生模型更新放在同一研究地图中。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"从模型内部一致性出发，统一整理置信度估计、幻觉检测、推理、自我修正与自训练等工作。将一致性分成文本响应、token解码和潜在张量三个层次，并用自我评价—反馈—自我更新框架解释现有方法之间的关系与争议。","input_conditions":"属于综述和概念框架，没有提出并统一验证一个新的通用自我修正算法。文中的‘Consistency Is (Almost) Correctness’是有前提的假设，不是模型答案正确性的定理；当稳定错误来自训练知识或共享偏差时，多次一致仍可能出错。","training_supervision":"按黑箱/灰箱/白箱访问条件，梳理不确定性、置信度、幻觉、语言批评及对比等反馈；归纳推理拓扑、迭代修改、多智能体、偏好学习、蒸馏和数据增广。以Llama3-8B-Instruct的标点计数展示三个一致性层次的区别，并讨论hourglass假说。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"主要结果是文献分类与相互矛盾发现的综合解释。p.5的示例中，同一标点计数问题5次文本回答为{5,3,3,3,3}，多数一致但错误；不同解码策略输出为{4,4,3,4,4}。这是小型说明性实验，不能外推为总体性能提升或正式基准结果。","boundary":"【作者】讨论内在反馈能否可靠纠错的争议及一致性假设的适用条件。【解读】没有统一控制模型、任务、采样预算的定量元分析；潜表示例不足以建立一般规律。架空世界的规则若与训练语料中的常识冲突，‘训练知识多数正确’这一推理前提尤其需要重新检验。","evidence":"PDF pp.4–7：分类、标点示例与统一框架；pp.8–14：方法组织；pp.15–16：争议与一致性假设。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2407.14507v3"}],"note":"p153","priority":0},"aliases":[]},{"id":"P152","title":"DiscoveryWorld: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents","short":"DiscoveryWorld","year":"2024","authors":"Peter Jansen; Marc-Alexandre Côté; Tushar Khot; Erin Bransom; Bhavana Dalvi Mishra; Bodhisattwa Prasad Majumder; Oyvind Tafjord; Peter Clark","collected":true,"note":"p152","scope":"本地 PDF · 既有阅读笔记","summary":"提出低成本虚拟科学发现环境，要求智能体完整经历提出假设、设计与执行实验、分析结果、得出解释并完成任务。涵盖蛋白质组、化学、考古、反应堆、植物营养、太空疾病、火箭科学和语言发现，用任务完成、过程与解释知识三类指标区分会操作和真正形成发现。","boundary":"8主题×3难度×5参数seed=120个发现任务实例（24个主题—难度组合），另有10类基础unit tasks。环境为抽象文本/2D模拟而非真实实验；任务机制已定义但对agent未知，适合机制发现研究，不替代创作者规则补全任务。","evidence":"PDF pp.4–6：环境、规模与指标；p.7表4/5：机器；pp.8–9表6：人类与分析；p.15附录B/C：局限、成本和动作空间。","sources":["Reasoning/24_NeurIPS_Jansen_DISCOVERYWORLD AVirtual Environment for.pdf"],"sha256":"28793ae05bbb22ed6e02fbdceb697a2b9ea8ebff6932c4dd8fb5b70bba5dde91","pages":29,"links":[{"label":"论文/发表记录 1","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/13836f251823945316ae067350a5c366-Abstract-Datasets_and_Benchmarks_Track.html"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2406.06769v2"}],"verified":"2026-09-15","mappings":[{"rq":"W1d","role":"core"}],"annotation":{"id":"P152","title":"DiscoveryWorld: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents","year":"2024","authors":"Peter Jansen; Marc-Alexandre Côté; Tushar Khot; Erin Bransom; Bhavana Dalvi Mishra; Bodhisattwa Prasad Majumder; Oyvind Tafjord; Peter Clark","teams":[],"topics":["world_model"],"rqs":["W1d"],"collected":true,"review_status":"existing_notes","question":"为端到端科学发现提供可复现、可控参数的互动基准；加入组件级unit tasks和人类科学家参照，避免只用最终成功掩盖不完整推理过程。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"提出低成本虚拟科学发现环境，要求智能体完整经历提出假设、设计与执行实验、分析结果、得出解释并完成任务。涵盖蛋白质组、化学、考古、反应堆、植物营养、太空疾病、火箭科学和语言发现，用任务完成、过程与解释知识三类指标区分会操作和真正形成发现。","input_conditions":"8主题×3难度×5参数seed=120个发现任务实例（24个主题—难度组合），另有10类基础unit tasks。环境为抽象文本/2D模拟而非真实实验；任务机制已定义但对agent未知，适合机制发现研究，不替代创作者规则补全任务。","training_supervision":"提供物体、仪器、移动/读写/操作等动作及结构化记分卡；GPT-4o实现ReAct、Plan+Execute、维护实验假设与测量记录的Hypothesizer。简单任务最多100步，普通/挑战任务1,000步；知识按预设解释要求评价。另招募11名自然科学硕士/博士背景参与者。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表4：ReAct的简单/挑战任务平均完成率38%/18%；Hypothesizer对应解释知识得分34%/8%。机器在基础unit tasks可达到60%左右完成率，仍难完成发现全流程。人类所测16个普通/挑战组合平均完成率66%、知识得分55%；人类评测的任务与seed配置不同，不能与120实例机器均值无条件直接比较。","boundary":"作者强调低保真模拟不保证真实发现迁移；完整120任务的API实验成本约3,000–10,000美元，为论文实验时期成本。空间操作、长上下文和知识评分均可能混入其他能力；研究判断：需分离找出机制、执行实验和最终动作成功，且解释评分不能当作形式化因果证明。","evidence":"PDF pp.4–6：环境、规模与指标；p.7表4/5：机器；pp.8–9表6：人类与分析；p.15附录B/C：局限、成本和动作空间。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/13836f251823945316ae067350a5c366-Abstract-Datasets_and_Benchmarks_Track.html"},{"label":"论文/发表记录 2","url":"https://arxiv.org/abs/2406.06769v2"}],"note":"p152","priority":0},"aliases":[]},{"id":"P151","title":"COMBO: Compositional World Models for Embodied Multi-Agent Cooperation","short":"COMBO","year":"2025 / 2024","authors":"Hongxin Zhang; Zeyuan Wang; Qiushi Lyu; Zheyuan Zhang; Sunli Chen; Tianmin Shu; Behzad Dariush; Kwonjoon Lee; Yilun Du; Chuang Gan（前三位共同一作）","collected":true,"note":"p151","scope":"本地 PDF · 既有阅读笔记","summary":"在各智能体只有第一人称局部观察的条件下，通过可组合视频世界模型预测联合动作后果，并配合他者意图估计与树搜索实现协作。先补全全局俯视状态，再将多智能体动作条件组合起来模拟未来，支持不同合作伙伴和人数。","boundary":"主要评估2–4个智能体的桌面拼图、食物组合、按钮取物任务；输入RGBD和相机矩阵，动作采用环境定义的操作。所谓任意人数的实验支持是4-agent训练向2/3-agent迁移，不是无限人数保证。真实机器人实验另用真实数据微调世界模型，仅5次试验。","evidence":"PDF pp.4–7：组合模型、区域损失及规划；pp.8–10表1–5：仿真结果与计算预算；pp.23–24附录D/表8：真实人机实验。","sources":["Reasoning/24_iclr_hongxin_COMBO COMPOSITIONAL WORLD MODELS FOR.pdf"],"sha256":"3fb20948b81c1acfd733970019c5bd101909824fd9d24193dbfd96ec4c2209bc","pages":24,"links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2404.10775v3"}],"verified":"2026-09-15","mappings":[{"rq":"W3c","role":"core"},{"rq":"X1b","role":"core"}],"annotation":{"id":"P151","title":"COMBO: Compositional World Models for Embodied Multi-Agent Cooperation","year":"2025 / 2024","authors":"Hongxin Zhang; Zeyuan Wang; Qiushi Lyu; Zheyuan Zhang; Sunli Chen; Tianmin Shu; Behzad Dariush; Kwonjoon Lee; Yilun Du; Chuang Gan（前三位共同一作）","teams":[],"topics":["world_model"],"rqs":["W3c","X1b"],"collected":true,"review_status":"existing_notes","question":"组合式联合动作建模、针对智能体可达区域的损失加权，以及世界状态补全—意图预测—搜索规划的模块化系统；包含仿真基准和小规模真实人机协作。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"在各智能体只有第一人称局部观察的条件下，通过可组合视频世界模型预测联合动作后果，并配合他者意图估计与树搜索实现协作。先补全全局俯视状态，再将多智能体动作条件组合起来模拟未来，支持不同合作伙伴和人数。","input_conditions":"主要评估2–4个智能体的桌面拼图、食物组合、按钮取物任务；输入RGBD和相机矩阵，动作采用环境定义的操作。所谓任意人数的实验支持是4-agent训练向2/3-agent迁移，不是无限人数保证。真实机器人实验另用真实数据微调世界模型，仅5次试验。","training_supervision":"融合历次局部RGBD为俯视点云投影并用扩散补全；通过组合各智能体动作条件的扩散预测，并按其可达区域加权学习。VLM负责动作提议、意图跟踪和结果评分，再用树搜索选择计划。对异常高预测收益设置阈值以抑制利用世界模型幻觉。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"表1在每设置20个episode上，COMBO于TDW-Game两合作伙伴成功率均1.00，TDW-Cook为0.90/1.00；移除意图跟踪后分别0.65/0.60及0.80/0.80。2D-FetchQ的60次replay评价成功率81.3%，Co-GAIL为53.3%。真实人类—XArm拼图成功4/5，成功trial平均8.4步。表4预算扩大可改善表现，但该消融样本更小。","boundary":"作者指出多次大模型推理使响应慢；状态补全、动作误解和视觉生成错误会影响规划。研究判断：共享真实空间的人机案例存在，但尚未检验头显视角、用户拒绝/延迟执行、提示改变证据分布或取证与主任务的注意力竞争。","evidence":"PDF pp.4–7：组合模型、区域损失及规划；pp.8–10表1–5：仿真结果与计算预算；pp.23–24附录D/表8：真实人机实验。","checked":"2026-09-15","links":[{"label":"论文/发表记录 1","url":"https://arxiv.org/abs/2404.10775v3"}],"note":"p151","priority":0},"aliases":[]},{"id":"P170","title":"Affordance Grounding from Demonstration Video to Target Image","short":"Affordance Grounding from Demonstration Video to Target Image","year":"2023","authors":"Joya Chen; Difei Gao; Kevin Qinghong Lin; Mike Zheng Shou","collected":true,"note":"p170","scope":"本地 PDF · 摘要初读","summary":"Afformer 逐步细化 affordance 定位，并用 MaskAHand 自监督预训练模拟上下文变化。","boundary":"可操作部位定位不能直接说明动作执行或后果预测准确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2303.14644_Affordance_Grounding_from_Demonstration_Video_to_Target_Image.pdf"],"sha256":"0a5dfa0c93ba2bb32bbb64498eaf3b5bd342d7c5e608aa22ebb8ce628066bb48","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2303.14644"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X1a","role":"support"}],"annotation":{"id":"P170","arxiv_id":"2303.14644","title":"Affordance Grounding from Demonstration Video to Target Image","year":"2023","authors":"Joya Chen; Difei Gao; Kevin Qinghong Lin; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_understanding","agent"],"rqs":["X1b","X1a"],"collected":true,"review_status":"abstract_review","question":"演示视频中的可操作部位怎样迁移定位到目标图像？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Afformer 逐步细化 affordance 定位，并用 MaskAHand 自监督预训练模拟上下文变化。","input_conditions":"摘要初读：Afformer 逐步细化 affordance 定位，并用 MaskAHand 自监督预训练模拟上下文变化。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"可操作部位定位不能直接说明动作执行或后果预测准确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2303.14644"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2303.14644"}],"note":"p170","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P169","title":"3D Video Loops from Asynchronous Input","short":"3D Video Loops from Asynchronous Input","year":"2023","authors":"Li Ma; Xiaoyu Li; Jing Liao; Pedro V. Sander","collected":true,"note":"p169","scope":"本地 PDF · 摘要初读","summary":"Multi-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。","boundary":"针对周期重放与视角变化，不能视为开放式未来预测或无限演化。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2303.05312_3D_Video_Loops_from_Asynchronous_Input.pdf"],"sha256":"65a84920eb0ccbc107fcc4c6f457c4c658fafdebf70084bac7fc72ffedb78304","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2303.05312"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P169","arxiv_id":"2303.05312","title":"3D Video Loops from Asynchronous Input","year":"2023","authors":"Li Ma; Xiaoyu Li; Jing Liao; Pedro V. Sander","teams":["jing-liao"],"topics":["geometry","video_gen","efficiency"],"rqs":["W3a","W3b"],"collected":true,"review_status":"abstract_review","question":"异步多视图视频如何重建可实时浏览的循环动态场景？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Multi-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。","input_conditions":"摘要初读：Multi-Tile Video 以稀疏时空表示和两阶段优化构建视角一致的三维循环视频。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"针对周期重放与视角变化，不能视为开放式未来预测或无限演化。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2303.05312"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2303.05312v2"}],"note":"p169","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P168","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","short":"MimicPlay","year":"2023","authors":"Chen Wang; Linxi Fan; Jiankai Sun; Ruohan Zhang; Li Fei-Fei; Danfei Xu; Yuke Zhu; Anima Anandkumar","collected":true,"note":"p168","scope":"本地 PDF · 摘要初读","summary":"MimicPlay 从人类视频学习潜计划，指导少量遥操作数据训练的低层控制。","boundary":"潜计划与真实动作仍由不同数据和模块连接，不是纯视频生成策略。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2302.12422_MimicPlay_Long-Horizon_Imitation_Learning_by_Watching_Human_Play.pdf"],"sha256":"ba6056f66abae90f12c95cc44f9b6714cf6766a6ed7eec6f19766aa0f2685ee5","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2302.12422"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P168","arxiv_id":"2302.12422","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","year":"2023","authors":"Chen Wang; Linxi Fan; Jiankai Sun; Ruohan Zhang; Li Fei-Fei; Danfei Xu; Yuke Zhu; Anima Anandkumar","teams":["fei-fei-li"],"topics":["agent","world_model"],"rqs":["X1b","W1c"],"collected":true,"review_status":"abstract_review","question":"人类自由玩耍视频怎样降低长程机器人模仿的数据需求？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MimicPlay 从人类视频学习潜计划，指导少量遥操作数据训练的低层控制。","input_conditions":"摘要初读：MimicPlay 从人类视频学习潜计划，指导少量遥操作数据训练的低层控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"潜计划与真实动作仍由不同数据和模块连接，不是纯视频生成策略。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2302.12422"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2302.12422v2"}],"note":"p168","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P167","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","short":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","year":"2023","authors":"Mahmoud Assran; Quentin Duval; Ishan Misra; Piotr Bojanowski; Pascal Vincent; Michael Rabbat; Yann LeCun; Nicolas Ballas","collected":true,"note":"p167","scope":"本地 PDF · 摘要初读","summary":"I-JEPA 用上下文预测多个目标区域的表示，研究掩码规模和上下文信息对语义学习的影响。","boundary":"静态图像表征是后续视频 JEPA 的基础，不直接处理时间演化。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2301.08243_Self-Supervised_Learning_from_Images_with_a_Joint-Embedding_Predictive_Architecture.pdf"],"sha256":"eddbdc093eb4d48662bcf4fbd1c6735ccd606205cc9070977ce317d68aff3941","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2301.08243"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P167","arxiv_id":"2301.08243","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","year":"2023","authors":"Mahmoud Assran; Quentin Duval; Ishan Misra; Piotr Bojanowski; Pascal Vincent; Michael Rabbat; Yann LeCun; Nicolas Ballas","teams":["yann-lecun"],"topics":["generative_foundation","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"能否通过预测图像块的语义表征获得高效自监督学习？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"I-JEPA 用上下文预测多个目标区域的表示，研究掩码规模和上下文信息对语义学习的影响。","input_conditions":"摘要初读：I-JEPA 用上下文预测多个目标区域的表示，研究掩码规模和上下文信息对语义学习的影响。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"静态图像表征是后续视频 JEPA 的基础，不直接处理时间演化。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2301.08243"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2301.08243v3"}],"note":"p167","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P166","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","short":"Tune-A-Video","year":"2023","authors":"Jay Zhangjie Wu; Yixiao Ge; Xintao Wang; Weixian Lei; Yuchao Gu; Yufei Shi; Wynne Hsu; Ying Shan; Xiaohu Qie; Mike Zheng Shou","collected":true,"note":"p166","scope":"本地 PDF · 摘要初读","summary":"Tune-A-Video 通过时间注意力和单样本微调学习运动，使用反演提供结构条件。","boundary":"正式发表于 2023；单样本外观运动适配不等于可泛化的物理机制学习。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2212.11565_Tune-A-Video_One-Shot_Tuning_of_Image_Diffusion_Models_for_Text-to-Video_Generation.pdf"],"sha256":"f6ccfdfda431c9df30b46b12cf3a37b998963f0bfe95c546cef8d57d172f9031","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2212.11565"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P166","arxiv_id":"2212.11565","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","year":"2023","authors":"Jay Zhangjie Wu; Yixiao Ge; Xintao Wang; Weixian Lei; Yuchao Gu; Yufei Shi; Wynne Hsu; Ying Shan; Xiaohu Qie; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency"],"rqs":["W4a","X4a"],"collected":true,"review_status":"abstract_review","question":"只有一个文本视频样本时怎样适配图像扩散生成视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Tune-A-Video 通过时间注意力和单样本微调学习运动，使用反演提供结构条件。","input_conditions":"摘要初读：Tune-A-Video 通过时间注意力和单样本微调学习运动，使用反演提供结构条件。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"正式发表于 2023；单样本外观运动适配不等于可泛化的物理机制学习。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2212.11565"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2212.11565v2"}],"note":"p166","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P165","title":"VIMA: General Robot Manipulation with Multimodal Prompts","short":"VIMA","year":"2023","authors":"Yunfan Jiang; Agrim Gupta; Zichen Zhang; Guanzhi Wang; Yongqiang Dou; Yanjun Chen; Li Fei-Fei; Anima Anandkumar; Yuke Zhu; Linxi Fan","collected":true,"note":"p165","scope":"本地 PDF · 摘要初读","summary":"VIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。","boundary":"正式发表于 2023；动作预测基准不直接评价世界视频或物理机制修订。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2210.03094_VIMA_General_Robot_Manipulation_with_Multimodal_Prompts.pdf"],"sha256":"cf849f80368749b0310b43117519ce0abff3e8ae49744e78c4a29b9d17f0695f","pages":48,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2210.03094"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P165","arxiv_id":"2210.03094","title":"VIMA: General Robot Manipulation with Multimodal Prompts","year":"2023","authors":"Yunfan Jiang; Agrim Gupta; Zichen Zhang; Guanzhi Wang; Yongqiang Dou; Yanjun Chen; Li Fei-Fei; Anima Anandkumar; Yuke Zhu; Linxi Fan","teams":["fei-fei-li"],"topics":["agent","generative_foundation"],"rqs":["X1b","W4b"],"collected":true,"review_status":"abstract_review","question":"图文交错提示能否统一多种机器人操作任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。","input_conditions":"摘要初读：VIMA 通过多模态提示、自回归动作预测和程序化桌面任务研究分层泛化。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"正式发表于 2023；动作预测基准不直接评价世界视频或物理机制修订。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2210.03094"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2210.03094v2"}],"note":"p165","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P164","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","short":"Diffusion as Shader","year":"2025","authors":"Zekai Gu; Rui Yan; Jiahao Lu; Peng Li; Zhiyang Dou; Chenyang Si; Zhen Dong; Qifeng Liu; Cheng Lin; Ziwei Liu; Wenping Wang; Yuan Liu","collected":true,"note":"p164","scope":"本地 PDF · 既有阅读笔记","summary":"DaS把具有跨帧固定颜色标识的3D点轨迹渲染成控制视频，注入CogVideoX图生视频模型，在一个架构中支持相机控制、动作迁移、网格动画转视频及物体操纵。3D轨迹既提供几何运动控制，也提供跨帧对应关系。","boundary":"输出仍是条件生成的2D视频，不是可执行的三维场景或物理世界模拟器。用户需提供与输入图像兼容的轨迹、网格动画或源视频；精细控制受深度估计、分割、跟踪及点覆盖范围限制。","evidence":"PDF p.1：作者、v2日期、训练规模；pp.4–5 §3：点编码、18块条件DiT、训练和四类控制；p.6 Table 1及p.7 Tables 2–3：定量结果；p.10 §4.5：50视频验证、推理速度；p.10 §5/Fig.11：结构不兼容和无轨迹覆盖的失败模式。","sources":["Reasoning/2501.03847v2.pdf"],"sha256":"3fe084c39a33c92f39ca27646baea338690ea65f2299ba600fd62458f5a4b71a","pages":12,"links":[{"label":"arXiv本地版本 2501.03847v2","url":"https://arxiv.org/abs/2501.03847v2"}],"verified":"2026-09-17","mappings":[{"rq":"W1c","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"P164","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","year":"2025","authors":"Zekai Gu; Rui Yan; Jiahao Lu; Peng Li; Zhiyang Dou; Chenyang Si; Zhen Dong; Qifeng Liu; Cheng Lin; Ziwei Liu; Wenping Wang; Yuan Liu","teams":[],"topics":["world_model"],"rqs":["W1c","W3d"],"collected":true,"review_status":"existing_notes","question":"以首帧相机坐标归一化后的RGB为3D点编码，保持点的颜色跨时间不变，使同一控制表示适配多类视频编辑。冻结基础去噪DiT，仅训练复制的条件分支和零初始化线性注入层。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"DaS把具有跨帧固定颜色标识的3D点轨迹渲染成控制视频，注入CogVideoX图生视频模型，在一个架构中支持相机控制、动作迁移、网格动画转视频及物体操纵。3D轨迹既提供几何运动控制，也提供跨帧对应关系。","input_conditions":"输出仍是条件生成的2D视频，不是可执行的三维场景或物理世界模拟器。用户需提供与输入图像兼容的轨迹、网格动画或源视频；精细控制受深度估计、分割、跟踪及点覆盖范围限制。","training_supervision":"从CogVideoX的42个DiT块复制前18块作为条件分支，VAE编码3D跟踪视频，逐块注入控制特征。使用MiraData真实视频和Mixamo渲染视频；真实视频用SpatialTracker跟踪4,900个点，合成视频用真值几何。训练视频为49帧720×480，2,000步、有效batch size 64；论文报告少于1万视频，在8张H800上训练3天。推理50步DDIM，生成49帧约2.5分钟/张H800。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"PDF p.6 Table 1：小幅相机运动的平移/旋转角误差为27.85/5.97度，CameraCtrl为42.31/7.82度；大幅运动为37.17/10.40度，对照66.76/29.70度。p.7 Table 2：动作迁移文本CLIP分数32.6、相邻帧CLIP一致性0.971，TokenFlow为31.9/0.956。Table 3中4,900点控制的FVD为551.3，深度图控制为645.1，基于50个验证视频的再生成比较。网格动画和物体操纵主要展示定性结果。","boundary":"【作者】控制视频与输入结构不兼容会导致不合理的场景切换；没有轨迹点覆盖的区域可能生成失控内容；高质量控制仍依赖已有动画或源视频。【解读】3D-aware不保证物理正确或任意长程一致性；相机估计误差及CLIP分数属于代理指标。49帧设置和少量验证视频不能支持长电影可靠控制的结论，也未评估创作者真实工作流中的交互成本。","evidence":"PDF p.1：作者、v2日期、训练规模；pp.4–5 §3：点编码、18块条件DiT、训练和四类控制；p.6 Table 1及p.7 Tables 2–3：定量结果；p.10 §4.5：50视频验证、推理速度；p.10 §5/Fig.11：结构不兼容和无轨迹覆盖的失败模式。","checked":"2026-09-17","links":[{"label":"arXiv本地版本 2501.03847v2","url":"https://arxiv.org/abs/2501.03847v2"}],"note":"p164","priority":0},"aliases":[]},{"id":"P163","title":"Automating the Search for Artificial Life with Foundation Models","short":"ASAL","year":"2025","authors":"Akarsh Kumar; Chris Lu; Louis Kirsch; Yujin Tang; Kenneth O. Stanley; Phillip Isola; David Ha","collected":true,"note":"p163","scope":"本地 PDF · 既有阅读笔记","summary":"ASAL利用基础视觉模型的表示空间，自动搜索能产生指定现象、持续新颖行为或多样行为集合的人工生命仿真。优化的是预先定义仿真族的参数、规则或初始状态，而不是直接生成看似生命的视频像素。","boundary":"必须先指定可执行、可渲染且参数化的仿真基底。主要使用CLIP图像嵌入评估渲染帧；模型不直接推断任意现实世界规则，也不证明搜索到真实生物机制或无限持续的开放式进化。","evidence":"PDF pp.4–6 §3和Eqs.2–4：三个搜索目标；pp.7–9 §4.1–4.3：基底、搜索和前5%结果；pp.10–13 Figs.5–8：开放性、图集和表示消融；p.14讨论；pp.20–22附录A/B：仿真步数、种群、初态数量和迭代配置。","sources":["Reasoning/2412.17799v2.pdf"],"sha256":"e5178f7c213c7b2b0b22b5fc550b5410a67e908df74cbb81b3e22db17046d549","pages":30,"links":[{"label":"arXiv本地版本 2412.17799v2","url":"https://arxiv.org/abs/2412.17799v2"}],"verified":"2026-09-17","mappings":[{"rq":"W3c","role":"core"},{"rq":"W3e","role":"support"}],"annotation":{"id":"P163","title":"Automating the Search for Artificial Life with Foundation Models","year":"2025","authors":"Akarsh Kumar; Chris Lu; Louis Kirsch; Yujin Tang; Kenneth O. Stanley; Phillip Isola; David Ha","teams":[],"topics":["world_model"],"rqs":["W3c","W3e"],"collected":true,"review_status":"existing_notes","question":"基础模型能否帮助搜索目标模拟现象、时间上的新颖性与多样人工生命形态？","question_origin":"依作者三个研究目标改写","summary":"ASAL利用基础视觉模型的表示空间，自动搜索能产生指定现象、持续新颖行为或多样行为集合的人工生命仿真。优化的是预先定义仿真族的参数、规则或初始状态，而不是直接生成看似生命的视频像素。","input_conditions":"必须先指定可执行、可渲染且参数化的仿真基底。主要使用CLIP图像嵌入评估渲染帧；模型不直接推断任意现实世界规则，也不证明搜索到真实生物机制或无限持续的开放式进化。","training_supervision":"将初始状态、动力学和渲染器表示为参数theta。单目标搜索最大化渲染图像与文本的CLIP相似度，使用Sep-CMA-ES；NCA的时序目标用截断时间反向传播和Adam。开放性目标降低当前帧与历史最近邻的相似度，对2^18=262,144种Life-like CA穷举。多样性搜索用遗传算法维护8,192个解，通过最近邻表示距离淘汰最不新颖的解。以DINOv2和像素表示做表示空间消融。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"在多个基底展示匹配文本、按时序变化和多样化的仿真；Conway's Game of Life按所定义开放性分数位于Life-like CA前5%。附录说明穷举每个CA使用256个随机初态、运行2,048步，并抽取32个时刻计算开放性；多样性搜索运行100,000次迭代。CLIP和DINOv2相较像素表示的优势主要通过定性图集展示。这些结果不等于独立人评确认的通用开放性准确率。","boundary":"【作者】基底表达能力决定可发现的现象；初步实验中Lenia/Boids难持续产生新颖性，NCA可能过度灵活，开放性搜索因此只在Life-like CA展示。视频语言模型和3D基底仍是拓展方向。【解读】CLIP新颖性是观察者相关的代理目标，不是生命、因果正确性或永续新颖性的充分条件。单目标搜索每次评估仅一个初态种子，需区分漂亮示例与跨初态稳健性；广泛的人类对齐结论缺少系统人评支持。","evidence":"PDF pp.4–6 §3和Eqs.2–4：三个搜索目标；pp.7–9 §4.1–4.3：基底、搜索和前5%结果；pp.10–13 Figs.5–8：开放性、图集和表示消融；p.14讨论；pp.20–22附录A/B：仿真步数、种群、初态数量和迭代配置。","checked":"2026-09-17","links":[{"label":"arXiv本地版本 2412.17799v2","url":"https://arxiv.org/abs/2412.17799v2"}],"note":"p163","priority":0},"aliases":[],"research_question":{"kind":"依作者三个研究目标改写","text":"基础模型能否帮助搜索目标模拟现象、时间上的新颖性与多样人工生命形态？","location":"PDF pp.1–2 三类搜索目标；pp.4–9 方法与实验"}},{"id":"P162","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","short":"TeaCache","year":"2025","authors":"Feng Liu; Shiwei Zhang; Xiaofeng Wang; Yujie Wei; Haonan Qiu; Yuzhong Zhao; Yingya Zhang; Qixiang Ye; Fang Wan","collected":true,"note":"p162","scope":"本地 PDF · 既有阅读笔记","summary":"TeaCache是一种无需更新视频扩散模型权重的推理加速方法。利用时间步嵌入调制后的输入变化估计模型输出变化，按累计差异阈值决定何时重新计算、何时复用缓存的Transformer残差，以适应去噪过程中的非均匀冗余。","boundary":"研究的是既有DiT视频生成器的去噪计算复用，不是长期记忆、世界状态建模或跨镜头剧情推理。缓存的是扩散Transformer的残差信号，不能理解为直接复用整帧视频或学习新的因果规律。","evidence":"PDF p.1：题名、作者、v2日期和摘要；pp.4–5 §3：输入/输出差异及多项式校准；p.6 §3.4和§4.1：残差缓存、70提示校准和硬件；p.7 Table 1：延迟及VBench；pp.7–8 Tables 2–4：消融和多GPU结果。","sources":["Reasoning/2411.19108v2.pdf"],"sha256":"e297f8becb2879b4a3611fa5877532a7e2db314af7e208127d6754dfc2741212","pages":11,"links":[{"label":"arXiv本地版本 2411.19108v2","url":"https://arxiv.org/abs/2411.19108v2"}],"verified":"2026-09-17","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P162","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","year":"2025","authors":"Feng Liu; Shiwei Zhang; Xiaofeng Wang; Yujie Wei; Haonan Qiu; Yuzhong Zhao; Yingya Zhang; Qixiang Ye; Fang Wan","teams":[],"topics":["generative_foundation"],"rqs":["W1c"],"collected":true,"review_status":"existing_notes","question":"把固定间隔缓存改为随输入变化的自适应缓存；用时间步调制输入的相对L1距离作代理，再经多项式校准估计输出变化。无需微调基础模型，但仍需校准样本和模型相关的阈值、拟合参数。","question_origin":"沿用既有阅读笔记；本轮未重新精读。","summary":"TeaCache是一种无需更新视频扩散模型权重的推理加速方法。利用时间步嵌入调制后的输入变化估计模型输出变化，按累计差异阈值决定何时重新计算、何时复用缓存的Transformer残差，以适应去噪过程中的非均匀冗余。","input_conditions":"研究的是既有DiT视频生成器的去噪计算复用，不是长期记忆、世界状态建模或跨镜头剧情推理。缓存的是扩散Transformer的残差信号，不能理解为直接复用整帧视频或学习新的因果规律。","training_supervision":"计算相邻时间步的调制输入相对L1距离，以多项式拟合输入差异到输出差异的尺度关系；累计估计差异未过阈值时复用残差，超过阈值则重算并清零累计值。用T2V-CompBench的70个提示、覆盖7类属性作拟合；slow/fast阈值分别为0.1/0.2。在Latte、Open-Sora 1.2、Open-Sora-Plan及A800 80GB GPU上评估速度和VBench、LPIPS、SSIM、PSNR。","inference_support":"详见既有方法笔记；本轮未重新核查。","evaluation":"PDF p.7 Table 1：Open-Sora-Plan的65帧512×512设置，原始延迟99.65秒、VBench 80.39%；TeaCache-slow为22.62秒（4.41倍）、80.32%，下降0.07个百分点；fast为14.60秒（6.83倍）、79.72%，下降0.67个百分点。Latte-fast加速3.28倍，VBench由77.40%降至76.69%；Open-Sora 1.2-fast加速2.25倍，79.22%降至78.48%。这是各自基础模型和指定硬件设置下的速度/质量权衡，不是通用无损加速保证。","boundary":"【作者】增大阈值可能损害视觉质量；极端加速时PSNR/SSIM等参考指标下降，缓存收益受模型、采样器、分辨率和帧数影响。【解读】所谓training-free不等于无需校准；70个提示和经验多项式不构成跨模型误差上界。VBench整体分数接近不能证明每个视频的语义、物理或时序行为不变。未验证创作者工作流收益或长叙事规则一致性。","evidence":"PDF p.1：题名、作者、v2日期和摘要；pp.4–5 §3：输入/输出差异及多项式校准；p.6 §3.4和§4.1：残差缓存、70提示校准和硬件；p.7 Table 1：延迟及VBench；pp.7–8 Tables 2–4：消融和多GPU结果。","checked":"2026-09-17","links":[{"label":"arXiv本地版本 2411.19108v2","url":"https://arxiv.org/abs/2411.19108v2"}],"note":"p162","priority":0},"aliases":[]},{"id":"P161","title":"Learning Long-form Movie Prior via Large Language Models","short":"Learning Long-form Movie Prior via Large Language Models","year":"2026","authors":"Jinheng Xie; Jiajun Feng; Mike Zheng Shou","collected":true,"note":"p161","scope":"本地 PDF · 既有阅读笔记","summary":"将电影中的剧本、人物身份、站位、动作和场景物体表示为可离散化的文本与空间坐标序列，使用LLaMA的下一token预测学习联合分镜先验，再通过指令微调从简短创意生成分镜。提出Storyboard20K，为跨镜头身份、边界框与全身关键点提供细粒度标注；生成结果可作为可控图像模型的布局条件，辅助视觉叙事创作。","boundary":"核心输出是剧本文本、边界框和关键点组成的稀疏分镜，不是直接生成连续像素视频。数据通常每个分镜3–10个关键帧，源片段平均33.9秒；不能据此声称已验证整部长电影的长期一致性。ROICtrl等现成图像模型用于可视化。人物身份与布局连贯不等于已学得可执行的因果世界模型；论文没有验证世界规则编辑、物理干预或规则修改后的依赖更新。","evidence":"PDF p.1：题名、3位作者、DOI和已接收作者稿声明；pp.3–4 §3及Table 1：20,310分镜、149,528帧、约400电影、平均33.9秒、标注流程；p.5 §4：坐标离散化、98/17关键点与两阶段学习；p.6 Fig.5、§5.1及Tables 2–3：数据划分、两示例对照、文本指标与布局FID；pp.6–7 §5.3及Table 4：人工评价和68%偏好率；p.8 Fig.6：ROICtrl可视化。资源状态另核对作者主页、官方仓库及arXiv旧版记录（2026-09-16）。","sources":["Reasoning/Learning_Long-form_Movie_Prior_via_Large_Language_Models.pdf"],"sha256":"5a757c4328c5277e646eb67a770d5f4e10998a3aa4469c5e04d38d6573a202eb","pages":8,"links":[{"label":"IEEE DOI（本地版本）","url":"https://doi.org/10.1109/TPAMI.2026.3729756"},{"label":"作者发表列表","url":"https://sierkinhane.github.io/"},{"label":"相关早期预印本（旧题名）","url":"https://arxiv.org/abs/2404.15909v1"}],"verified":"2026-09-16","mappings":[{"rq":"W3b","role":"core"}],"annotation":{"id":"P161","arxiv_id":"2404.15909","title":"Learning Long-form Video Prior via Generative Pre-Training","year":"2024","authors":"Jinheng Xie; Jiajun Feng; Zhaoxu Tian; Kevin Qinghong Lin; Yawen Huang; Xi Xia; Nanxu Gong; Xu Zuo; Jiaqi Yang; Yefeng Zheng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","world_model"],"rqs":["W3b"],"collected":true,"review_status":"existing_notes","question":"显式位置 token 能否高效学习长视频结构？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者以框和关键点编码视频，构建 Storyboard20K 并学习长程生成先验。","input_conditions":"摘要初读：作者以框和关键点编码视频，构建 Storyboard20K 并学习长程生成先验。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"结构序列预测不等于写实视频或可执行物理机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；已有全文笔记可继续查阅，本轮未据此声称重核。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.15909"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.15909v1"}],"note":"p161","collection_status":"existing","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"复用已有本地版本；可用 arXiv 最新版本另列，不将既有全文笔记冒充新版本复核。"},"aliases":[]},{"id":"P180","title":"Self-Supervised Learning with Lie Symmetries for Partial Differential Equations","short":"Self-Supervised Learning with Lie Symmetries for Partial Differential Equations","year":"2023","authors":"Grégoire Mialon; Quentin Garrido; Hannah Lawrence; Danyal Rehman; Yann LeCun; Bobak T. Kiani","collected":true,"note":"p180","scope":"本地 PDF · 摘要初读","summary":"作者利用 Lie 对称性构造联合嵌入自监督任务，评估方程参数回归与神经求解器时间步推进。","boundary":"已知 PDE 结构和数据条件与从真实视频发现未知规律不同。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2307.05432_Self-Supervised_Learning_with_Lie_Symmetries_for_Partial_Differential_Equations.pdf"],"sha256":"10a161ad3c09b4050275f1f1e2fdc97fc5cf057fb05d0d2e951d9fad66b86bec","pages":32,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2307.05432"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P180","arxiv_id":"2307.05432","title":"Self-Supervised Learning with Lie Symmetries for Partial Differential Equations","year":"2023","authors":"Grégoire Mialon; Quentin Garrido; Hannah Lawrence; Danyal Rehman; Yann LeCun; Bobak T. Kiani","teams":["yann-lecun"],"topics":["physics","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"偏微分方程的对称性怎样用于学习可迁移物理表示？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者利用 Lie 对称性构造联合嵌入自监督任务，评估方程参数回归与神经求解器时间步推进。","input_conditions":"摘要初读：作者利用 Lie 对称性构造联合嵌入自监督任务，评估方程参数回归与神经求解器时间步推进。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"已知 PDE 结构和数据条件与从真实视频发现未知规律不同。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2307.05432"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2307.05432v2"}],"note":"p180","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P179","title":"Dynamic-Resolution Model Learning for Object Pile Manipulation","short":"Dynamic-Resolution Model Learning for Object Pile Manipulation","year":"2023","authors":"Yixuan Wang; Yunzhu Li; Katherine Driggs-Campbell; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p179","scope":"本地 PDF · 摘要初读","summary":"作者以动态粒子分辨率和图神经网络，在效率与操作精度间选择抽象层级。","boundary":"粒状物模型有特定状态和任务条件，不是通用像素视频模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2306.16700_Dynamic-Resolution_Model_Learning_for_Object_Pile_Manipulation.pdf"],"sha256":"819257248da8260d8f28e8b84fbe26342fc10737ad6a9878c4359b435826a5da","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2306.16700"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P179","arxiv_id":"2306.16700","title":"Dynamic-Resolution Model Learning for Object Pile Manipulation","year":"2023","authors":"Yixuan Wang; Yunzhu Li; Katherine Driggs-Campbell; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["physics","world_model","efficiency"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"物体堆动力学的表示分辨率怎样按任务调节？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者以动态粒子分辨率和图神经网络，在效率与操作精度间选择抽象层级。","input_conditions":"摘要初读：作者以动态粒子分辨率和图神经网络，在效率与操作精度间选择抽象层级。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"粒状物模型有特定状态和任务条件，不是通用像素视频模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.16700"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.16700"}],"note":"p179","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P178","title":"Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence","short":"Introduction to Latent Variable Energy-Based Models","year":"2023","authors":"Anna Dawid; Yann LeCun","collected":true,"note":"p178","scope":"本地 PDF · 摘要初读","summary":"这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系，提供架构层面的研究动机。","boundary":"概念和教程性质的论述不能当成所有模块已经联合实现的实验证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2306.02572_Introduction_to_Latent_Variable_Energy-Based_Models_A_Path_Towards_Autonomous_Machine_Intelligence.pdf"],"sha256":"1f5ad87c7da931599dca22ee60612f396e8ac22306876d0a2800ced47a2f1a92","pages":29,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2306.02572"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P178","arxiv_id":"2306.02572","title":"Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence","year":"2023","authors":"Anna Dawid; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"潜变量能量模型怎样组成自主智能的预测与规划架构？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系，提供架构层面的研究动机。","input_conditions":"摘要初读：这篇介绍性论文梳理能量模型、潜变量和分层 JEPA 的关系，提供架构层面的研究动机。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"概念和教程性质的论述不能当成所有模块已经联合实现的实验证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.02572"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.02572v1"}],"note":"p178","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P177","title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects","short":"The ObjectFolder Benchmark","year":"2023","authors":"Ruohan Gao; Yiming Dou; Hao Li; Tanmay Agarwal; Jeannette Bohg; Yunzhu Li; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p177","scope":"本地 PDF · 摘要初读","summary":"ObjectFolder Benchmark 结合神经对象及真实多感官对象数据，比较识别、重建和操作任务。","boundary":"多感官数据提供额外物理证据，不能与单目视频输入忽略条件地比较。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2306.00956_The_ObjectFolder_Benchmark_Multisensory_Learning_with_Neural_and_Real_Objects.pdf"],"sha256":"c66e9cb8dac08a4f3546aa248e63f160ee0969037a34c1980017724357e6c5a4","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2306.00956"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P177","arxiv_id":"2306.00956","title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects","year":"2023","authors":"Ruohan Gao; Yiming Dou; Hao Li; Tanmay Agarwal; Jeannette Bohg; Yunzhu Li; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["physics","geometry","evaluation"],"rqs":["W1c","X1c"],"collected":true,"review_status":"abstract_review","question":"视觉、声音与触觉分别怎样帮助对象理解和操作？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ObjectFolder Benchmark 结合神经对象及真实多感官对象数据，比较识别、重建和操作任务。","input_conditions":"摘要初读：ObjectFolder Benchmark 结合神经对象及真实多感官对象数据，比较识别、重建和操作任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"多感官数据提供额外物理证据，不能与单目视频输入忽略条件地比较。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.00956"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.00956v1"}],"note":"p177","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P176","title":"Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear","short":"Sonicverse","year":"2023","authors":"Ruohan Gao; Hao Li; Gokul Dharan; Zhuzhu Wang; Chengshu Li; Fei Xia; Silvio Savarese; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p176","scope":"本地 PDF · 摘要初读","summary":"Sonicverse 将音视频模拟结合，研究多感官导航与仿真到真实迁移。","boundary":"导航和声音条件有专门目标，不直接评估可控视频后果生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2306.00923_Sonicverse_A_Multisensory_Simulation_Platform_for_Embodied_Household_Agents_that_See_and_Hear.pdf"],"sha256":"6e4d3e4ff8bd1c37c0cff3471efb422e61dd6bd2eda0a0d771f4a47bd9695968","pages":8,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2306.00923"}],"verified":"2026-09-19","mappings":[{"rq":"X1c","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P176","arxiv_id":"2306.00923","title":"Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear","year":"2023","authors":"Ruohan Gao; Hao Li; Gokul Dharan; Zhuzhu Wang; Chengshu Li; Fei Xia; Silvio Savarese; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["world_model","agent","evaluation"],"rqs":["X1c","W1c"],"collected":true,"review_status":"abstract_review","question":"听觉和视觉如何在家庭导航仿真中共同作用？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Sonicverse 将音视频模拟结合，研究多感官导航与仿真到真实迁移。","input_conditions":"摘要初读：Sonicverse 将音视频模拟结合，研究多感官导航与仿真到真实迁移。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"导航和声音条件有专门目标，不直接评估可控视频后果生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.00923"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.00923"}],"note":"p176","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P175","title":"Modeling Dynamic Environments with Scene Graph Memory","short":"Modeling Dynamic Environments with Scene Graph Memory","year":"2023","authors":"Andrey Kurenkov; Michael Lingelbach; Tanmay Agarwal; Emily Jin; Chengshu Li; Ruohan Zhang; Li Fei-Fei; Jiajun Wu; Silvio Savarese; Roberto Martín-Martín","collected":true,"note":"p175","scope":"本地 PDF · 摘要初读","summary":"Scene Graph Memory 累积对象和房间关系，以节点边预测指导动态家庭环境中的搜索。","boundary":"图中的位置预测与持续生成动态视频不同，但可作为显式记忆对照。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2305.17537_Modeling_Dynamic_Environments_with_Scene_Graph_Memory.pdf"],"sha256":"2d53eeceeb1f428adea377f985bb2769c1195956e5491806b0844d75962234f6","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2305.17537"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"}],"annotation":{"id":"P175","arxiv_id":"2305.17537","title":"Modeling Dynamic Environments with Scene Graph Memory","year":"2023","authors":"Andrey Kurenkov; Michael Lingelbach; Tanmay Agarwal; Emily Jin; Chengshu Li; Ruohan Zhang; Li Fei-Fei; Jiajun Wu; Silvio Savarese; Roberto Martín-Martín","teams":["fei-fei-li"],"topics":["world_model","agent"],"rqs":["W3a"],"collected":true,"review_status":"abstract_review","question":"物体会移动且只能部分观察时，场景记忆怎样更新？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Scene Graph Memory 累积对象和房间关系，以节点边预测指导动态家庭环境中的搜索。","input_conditions":"摘要初读：Scene Graph Memory 累积对象和房间关系，以节点边预测指导动态家庭环境中的搜索。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"图中的位置预测与持续生成动态视频不同，但可作为显式记忆对照。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2305.17537"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2305.17537"}],"note":"p175","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P174","title":"Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance Fields","short":"Text2NeRF","year":"2023","authors":"Jingbo Zhang; Xiaoyu Li; Ziyu Wan; Can Wang; Jing Liao","collected":true,"note":"p174","scope":"本地 PDF · 摘要初读","summary":"Text2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新，优化场景辐射场。","boundary":"依赖图像与深度先验的静态场景构建，没有由摘要证明可执行动态机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2305.11588_Text2NeRF_Text-Driven_3D_Scene_Generation_with_Neural_Radiance_Fields.pdf"],"sha256":"d58578f128b09a740cc3c2b866d993d17dcbb9330ee188b54f6132f508fcc872","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2305.11588"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3a","role":"support"}],"annotation":{"id":"P174","arxiv_id":"2305.11588","title":"Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance Fields","year":"2023","authors":"Jingbo Zhang; Xiaoyu Li; Ziyu Wan; Can Wang; Jing Liao","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a","W3a"],"collected":true,"review_status":"abstract_review","question":"文本生成的三维场景如何保持跨视图几何与纹理一致？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Text2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新，优化场景辐射场。","input_conditions":"摘要初读：Text2NeRF 结合文本到图像先验、单目深度与渐进场景补全更新，优化场景辐射场。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"依赖图像与深度先验的静态场景构建，没有由摘要证明可执行动态机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2305.11588"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2305.11588v2"}],"note":"p174","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P173","title":"HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single Video","short":"HOSNeRF","year":"2023","authors":"Jia-Wei Liu; Yan-Pei Cao; Tianyuan Yang; Eric Zhongcong Xu; Jussi Keppo; Ying Shan; Xiaohu Qie; Mike Zheng Shou","collected":true,"note":"p173","scope":"本地 PDF · 摘要初读","summary":"HOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。","boundary":"重建既有轨迹与生成新干预下的动力学不同。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2304.12281_HOSNeRF_Dynamic_Human-Object-Scene_Neural_Radiance_Fields_from_a_Single_Video.pdf"],"sha256":"48b71f8a7aa88e352bdcd93366a0b68be290d007e661734e1445b3e8eff02a8e","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2304.12281"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P173","arxiv_id":"2304.12281","title":"HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single Video","year":"2023","authors":"Jia-Wei Liu; Yan-Pei Cao; Tianyuan Yang; Eric Zhongcong Xu; Jussi Keppo; Ying Shan; Xiaohu Qie; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["geometry","video_understanding"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"单目视频怎样重建动态人、物和场景以自由视角观看？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。","input_conditions":"摘要初读：HOSNeRF 用对象骨骼与状态嵌入组织人体交互和场景表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"重建既有轨迹与生成新干预下的动力学不同。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2304.12281"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2304.12281"}],"note":"p173","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P172","title":"Learning Neural Duplex Radiance Fields for Real-Time View Synthesis","short":"Learning Neural Duplex Radiance Fields for Real-Time View Synthesis","year":"2023","authors":"Ziyu Wan; Christian Richardt; Aljaž Božič; Chao Li; Vijay Rengarajan; Seonghyeon Nam; Xiaoyu Xiang; Tuotuo Li; Bo Zhu; Rakesh Ranjan; Jing Liao","collected":true,"note":"p172","scope":"本地 PDF · 摘要初读","summary":"将 NeRF 蒸馏到双层网格上的神经特征，结合屏幕空间卷积和多视图优化提升渲染效率。","boundary":"加速的是给定场景的新视角渲染，不能套用为视频生成模型的推理延迟。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2304.10537_Learning_Neural_Duplex_Radiance_Fields_for_Real-Time_View_Synthesis.pdf"],"sha256":"c20cacb54144fe0da28372500b6d48be5cdb926546eaa3419bf1f03e5000e881","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2304.10537"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P172","arxiv_id":"2304.10537","title":"Learning Neural Duplex Radiance Fields for Real-Time View Synthesis","year":"2023","authors":"Ziyu Wan; Christian Richardt; Aljaž Božič; Chao Li; Vijay Rengarajan; Seonghyeon Nam; Xiaoyu Xiang; Tuotuo Li; Bo Zhu; Rakesh Ranjan; Jing Liao","teams":["jing-liao"],"topics":["geometry","efficiency"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何将辐射场转成适合实时渲染的网格特征表示？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"将 NeRF 蒸馏到双层网格上的神经特征，结合屏幕空间卷积和多视图优化提升渲染效率。","input_conditions":"摘要初读：将 NeRF 蒸馏到双层网格上的神经特征，结合屏幕空间卷积和多视图优化提升渲染效率。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"加速的是给定场景的新视角渲染，不能套用为视频生成模型的推理延迟。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2304.10537"},{"label":"官方 PDF","url":"https://openaccess.thecvf.com/content/CVPR2023/papers/Wan_Learning_Neural_Duplex_Radiance_Fields_for_Real-Time_View_Synthesis_CVPR_2023_paper.pdf"}],"note":"p172","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P171","title":"AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose Control","short":"AvatarCraft","year":"2023","authors":"Ruixiang Jiang; Can Wang; Jingbo Zhang; Menglei Chai; Mingming He; Dongdong Chen; Jing Liao","collected":true,"note":"p171","scope":"本地 PDF · 摘要初读","summary":"AvatarCraft 用扩散先验优化人体几何和纹理，再通过参数化人体间的显式变形支持动画。","boundary":"姿态可控与模型自行预测人体运动或对象互动的能力不同。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2303.17606_AvatarCraft_Transforming_Text_into_Neural_Human_Avatars_with_Parameterized_Shape_and_Pose_Control.pdf"],"sha256":"8f142c6c12c531d3f30b68000b140d8f0e5fd1a154ec8f9c5f9d9323a9dd9f88","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2303.17606"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P171","arxiv_id":"2303.17606","title":"AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose Control","year":"2023","authors":"Ruixiang Jiang; Can Wang; Jingbo Zhang; Menglei Chai; Mingming He; Dongdong Chen; Jing Liao","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"文本生成的神经人体如何同时支持身份与形状姿态控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AvatarCraft 用扩散先验优化人体几何和纹理，再通过参数化人体间的显式变形支持动画。","input_conditions":"摘要初读：AvatarCraft 用扩散先验优化人体几何和纹理，再通过参数化人体间的显式变形支持动画。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"姿态可控与模型自行预测人体运动或对象互动的能力不同。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2303.17606"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2303.17606"}],"note":"p171","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P190","title":"DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing","short":"DynVideo-E","year":"2023","authors":"Jia-Wei Liu; Yan-Pei Cao; Jay Zhangjie Wu; Weijia Mao; Yuchao Gu; Rui Zhao; Jussi Keppo; Ying Shan; Mike Zheng Shou","collected":true,"note":"p190","scope":"本地 PDF · 摘要初读","summary":"DynVideo-E 在动态 NeRF 中编辑，并通过形变场传播，结合多视角多姿态扩散先验。","boundary":"动态来自已观测视频；三维编辑一致性与未来预测分开判断。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2310.10624_DynVideo-E_Harnessing_Dynamic_NeRF_for_Large-Scale_Motion-_and_View-Change_Human-Centric_Video_Editing.pdf"],"sha256":"b86f6a0949f7613e73744327cf9a9bab79ab738a7d38e0af072a013758f36676","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2310.10624"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P190","arxiv_id":"2310.10624","title":"DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing","year":"2023","authors":"Jia-Wei Liu; Yan-Pei Cao; Jay Zhangjie Wu; Weijia Mao; Yuchao Gu; Rui Zhao; Jussi Keppo; Ying Shan; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","geometry"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"大动作和视角变化下的视频编辑怎样保持一致？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DynVideo-E 在动态 NeRF 中编辑，并通过形变场传播，结合多视角多姿态扩散先验。","input_conditions":"摘要初读：DynVideo-E 在动态 NeRF 中编辑，并通过形变场传播，结合多视角多姿态扩散先验。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动态来自已观测视频；三维编辑一致性与未来预测分开判断。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2310.10624"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2310.10624"}],"note":"p190","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P189","title":"Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI","short":"Mini-BEHAVIOR","year":"2023","authors":"Emily Jin; Jiaheng Hu; Zhuoyi Huang; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Roberto Martín-Martín","collected":true,"note":"p189","scope":"本地 PDF · 摘要初读","summary":"Mini-BEHAVIOR 以程序化环境提供日常活动式规划问题，便于扩大任务变化。","boundary":"简化环境中的规划能力不能直接外推到写实视频或真实接触动力学。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2310.01824_Mini-BEHAVIOR_A_Procedurally_Generated_Benchmark_for_Long-horizon_Decision-Making_in_Embodied_AI.pdf"],"sha256":"e333f9ebf0b31acd933099daf04712319d1f957b38d788b81884dab0ec251062","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2310.01824"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P189","arxiv_id":"2310.01824","title":"Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI","year":"2023","authors":"Emily Jin; Jiaheng Hu; Zhuoyi Huang; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Roberto Martín-Martín","teams":["fei-fei-li"],"topics":["agent","evaluation"],"rqs":["W1c","X3c"],"collected":true,"review_status":"abstract_review","question":"如何低成本生成多变的长程具身任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Mini-BEHAVIOR 以程序化环境提供日常活动式规划问题，便于扩大任务变化。","input_conditions":"摘要初读：Mini-BEHAVIOR 以程序化环境提供日常活动式规划问题，便于扩大任务变化。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"简化环境中的规划能力不能直接外推到写实视频或真实接触动力学。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2310.01824"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2310.01824v2"}],"note":"p189","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P188","title":"D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement","short":"D$^3$Fields","year":"2023","authors":"Yixuan Wang; Mingtong Zhang; Zhuoran Li; Tarik Kelestemur; Katherine Driggs-Campbell; Jiajun Wu; Li Fei-Fei; Yunzhu Li","collected":true,"note":"p188","scope":"本地 PDF · 摘要初读","summary":"D3Fields 将多视角视觉特征投影到三维描述场，用于零样本重排。","boundary":"动态描述场主要组织观测，未自动提供未知未来动力学。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2309.16118_D_3_Fields_Dynamic_3D_Descriptor_Fields_for_Zero-Shot_Generalizable_Rearrangement.pdf"],"sha256":"d6714ba076b3bc453cf4bdf8a0f95a84937362fdcbe88463b8e90e218760cbcc","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2309.16118"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P188","arxiv_id":"2309.16118","title":"D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement","year":"2023","authors":"Yixuan Wang; Mingtong Zhang; Zhuoran Li; Tarik Kelestemur; Katherine Driggs-Campbell; Jiajun Wu; Li Fei-Fei; Yunzhu Li","teams":["fei-fei-li"],"topics":["geometry","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"动态语义三维描述怎样支持跨物体的重排任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"D3Fields 将多视角视觉特征投影到三维描述场，用于零样本重排。","input_conditions":"摘要初读：D3Fields 将多视角视觉特征投影到三维描述场，用于零样本重排。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动态描述场主要组织观测，未自动提供未知未来动力学。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2309.16118"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2309.16118"}],"note":"p188","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P187","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","short":"Show-1","year":"2023","authors":"David Junhao Zhang; Jay Zhangjie Wu; Jia-Wei Liu; Rui Zhao; Lingmin Ran; Yuchao Gu; Difei Gao; Mike Zheng Shou","collected":true,"note":"p187","scope":"本地 PDF · 摘要初读","summary":"Show-1 先生成低分辨率像素视频，再以潜扩散放大并修复。","boundary":"通用视频基准主要度量生成质量，不证明物理推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2309.15818_Show-1_Marrying_Pixel_and_Latent_Diffusion_Models_for_Text-to-Video_Generation.pdf"],"sha256":"f10566e39aeaece2275387acf23a58d1815fa6f4da64242c8f8ab2978e672c55","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2309.15818"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P187","arxiv_id":"2309.15818","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","year":"2023","authors":"David Junhao Zhang; Jay Zhangjie Wu; Jia-Wei Liu; Rui Zhao; Lingmin Ran; Yuchao Gu; Difei Gao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"像素和潜空间扩散怎样结合以兼顾对齐和生成成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Show-1 先生成低分辨率像素视频，再以潜扩散放大并修复。","input_conditions":"摘要初读：Show-1 先生成低分辨率像素视频，再以潜扩散放大并修复。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"通用视频基准主要度量生成质量，不证明物理推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2309.15818"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2309.15818"}],"note":"p187","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P186","title":"MindAgent: Emergent Gaming Interaction","short":"MindAgent","year":"2023","authors":"Ran Gong; Qiuyuan Huang; Xiaojian Ma; Hoi Vo; Zane Durante; Yusuke Noda; Zilong Zheng; Song-Chun Zhu; Demetri Terzopoulos; Li Fei-Fei; Jianfeng Gao","collected":true,"note":"p186","scope":"本地 PDF · 摘要初读","summary":"MindAgent 提供 CUISINEWORLD 和协作效率评价，通过反馈进行上下文协调。","boundary":"多人协作基准与视频生成中的多主体动力学不能互相代替。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2309.09971_MindAgent_Emergent_Gaming_Interaction.pdf"],"sha256":"8f1be26ef2b9b0e0309d93cd23bdc6e1d82b5f78b8ab983d0caefdc239c2cf85","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2309.09971"}],"verified":"2026-09-19","mappings":[{"rq":"W3c","role":"support"},{"rq":"X2c","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P186","arxiv_id":"2309.09971","title":"MindAgent: Emergent Gaming Interaction","year":"2023","authors":"Ran Gong; Qiuyuan Huang; Xiaojian Ma; Hoi Vo; Zane Durante; Yusuke Noda; Zilong Zheng; Song-Chun Zhu; Demetri Terzopoulos; Li Fei-Fei; Jianfeng Gao","teams":["fei-fei-li"],"topics":["agent","hci"],"rqs":["W3c","X2c","X3c"],"collected":true,"review_status":"abstract_review","question":"语言模型怎样协调多个游戏角色并与人合作？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MindAgent 提供 CUISINEWORLD 和协作效率评价，通过反馈进行上下文协调。","input_conditions":"摘要初读：MindAgent 提供 CUISINEWORLD 和协作效率评价，通过反馈进行上下文协调。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"多人协作基准与视频生成中的多主体动力学不能互相代替。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2309.09971"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2309.09971"}],"note":"p186","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P185","title":"Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon Manipulation","short":"Sequential Dexterity","year":"2023","authors":"Yuanpei Chen; Chen Wang; Li Fei-Fei; C. Karen Liu","collected":true,"note":"p185","scope":"本地 PDF · 摘要初读","summary":"Sequential Dexterity 通过强化学习衔接多个策略，并研究新物体与真实机器人的迁移。","boundary":"技能链可执行不意味着可生成供人观看的可信后果视频。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2309.00987_Sequential_Dexterity_Chaining_Dexterous_Policies_for_Long-Horizon_Manipulation.pdf"],"sha256":"c796afe6242efc255c3cff03a2897414188372bd30550b751c35ab8886e60b4d","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2309.00987"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P185","arxiv_id":"2309.00987","title":"Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon Manipulation","year":"2023","authors":"Yuanpei Chen; Chen Wang; Li Fei-Fei; C. Karen Liu","teams":["fei-fei-li"],"topics":["physics","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"多个灵巧技能怎样串接为长程操作？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Sequential Dexterity 通过强化学习衔接多个策略，并研究新物体与真实机器人的迁移。","input_conditions":"摘要初读：Sequential Dexterity 通过强化学习衔接多个策略，并研究新物体与真实机器人的迁移。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"技能链可执行不意味着可生成供人观看的可信后果视频。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2309.00987"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2309.00987v2"}],"note":"p185","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P184","title":"Primitive Skill-based Robot Learning from Human Evaluative Feedback","short":"Primitive Skill-based Robot Learning from Human Evaluative Feedback","year":"2023","authors":"Ayano Hiranaka; Minjune Hwang; Sharon Lee; Chen Wang; Li Fei-Fei; Jiajun Wu; Ruohan Zhang","collected":true,"note":"p184","scope":"本地 PDF · 摘要初读","summary":"SEED 将参数化基础技能与人类评价强化学习结合，研究样本效率与人类负担。","boundary":"前瞻性的技能评价与视觉后果预览相邻，但并未直接验证视频分支界面。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2307.15801_Primitive_Skill-based_Robot_Learning_from_Human_Evaluative_Feedback.pdf"],"sha256":"342be141eb8391458740ccd308bd9997b00a65eb2c5a826bb37e6d0e68db1fba","pages":9,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2307.15801"}],"verified":"2026-09-19","mappings":[{"rq":"X2c","role":"support"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P184","arxiv_id":"2307.15801","title":"Primitive Skill-based Robot Learning from Human Evaluative Feedback","year":"2023","authors":"Ayano Hiranaka; Minjune Hwang; Sharon Lee; Chen Wang; Li Fei-Fei; Jiajun Wu; Ruohan Zhang","teams":["fei-fei-li"],"topics":["hci","agent"],"rqs":["X2c","X3b"],"collected":true,"review_status":"abstract_review","question":"人能否在技能执行前评价高层意图以减少反馈成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SEED 将参数化基础技能与人类评价强化学习结合，研究样本效率与人类负担。","input_conditions":"摘要初读：SEED 将参数化基础技能与人类评价强化学习结合，研究样本效率与人类负担。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"前瞻性的技能评价与视觉后果预览相邻，但并未直接验证视频分支界面。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2307.15801"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2307.15801"}],"note":"p184","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P183","title":"MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features","short":"MC-JEPA","year":"2023","authors":"Adrien Bardes; Jean Ponce; Yann LeCun","collected":true,"note":"p183","scope":"本地 PDF · 摘要初读","summary":"MC-JEPA 将光流估计与内容表征目标联合训练，评估运动和分割任务。","boundary":"光流与内容表征不直接验证多步物理预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2307.12698_MC-JEPA_A_Joint-Embedding_Predictive_Architecture_for_Self-Supervised_Learning_of_Motion_and_Content_Features.pdf"],"sha256":"a14993bb03f7aff73ba3bb26fd3090a0aef3154eb63b78903452919f916dd10a","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2307.12698"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P183","arxiv_id":"2307.12698","title":"MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features","year":"2023","authors":"Adrien Bardes; Jean Ponce; Yann LeCun","teams":["yann-lecun"],"topics":["video_understanding"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"运动和内容特征能否在同一自监督编码器中相互促进？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MC-JEPA 将光流估计与内容表征目标联合训练，评估运动和分割任务。","input_conditions":"摘要初读：MC-JEPA 将光流估计与内容表征目标联合训练，评估运动和分割任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"光流与内容表征不直接验证多步物理预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2307.12698"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2307.12698"}],"note":"p183","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P182","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","short":"VoxPoser","year":"2023","authors":"Wenlong Huang; Chen Wang; Ruohan Zhang; Yunzhu Li; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p182","scope":"本地 PDF · 摘要初读","summary":"VoxPoser 组合三维价值图进行闭环轨迹规划，并可从在线接触经验学习动力学。","boundary":"语言推理、视觉检测和规划器共同产生结果，不能归因于视频模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2307.05973_VoxPoser_Composable_3D_Value_Maps_for_Robotic_Manipulation_with_Language_Models.pdf"],"sha256":"cf1cadcf7a1ee44979908c07698f87755c9b5340a79420db509a92d6d2533d42","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2307.05973"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P182","arxiv_id":"2307.05973","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","year":"2023","authors":"Wenlong Huang; Chen Wang; Ruohan Zhang; Yunzhu Li; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["geometry","agent"],"rqs":["W1a","W4a"],"collected":true,"review_status":"abstract_review","question":"自然语言中的可供性和约束怎样变成三维动作计划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VoxPoser 组合三维价值图进行闭环轨迹规划，并可从在线接触经验学习动力学。","input_conditions":"摘要初读：VoxPoser 组合三维价值图进行闭环轨迹规划，并可从在线接触经验学习动力学。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"语言推理、视觉检测和规划器共同产生结果，不能归因于视频模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2307.05973"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2307.05973v2"}],"note":"p182","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P181","title":"EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone","short":"EgoVLPv2","year":"2023","authors":"Shraman Pramanick; Yale Song; Sayan Nag; Kevin Qinghong Lin; Hardik Shah; Mike Zheng Shou; Rama Chellappa; Pengchuan Zhang","collected":true,"note":"p181","scope":"本地 PDF · 摘要初读","summary":"EgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。","boundary":"理解表征是相邻基础，不能直接作为后果视频生成结果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2307.05463_EgoVLPv2_Egocentric_Video-Language_Pre-training_with_Fusion_in_the_Backbone.pdf"],"sha256":"1208aa31cceaa1e5f9f92539236311fdae3beed0e70dd399cfa90d69f77fd201","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2307.05463"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P181","arxiv_id":"2307.05463","title":"EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone","year":"2023","authors":"Shraman Pramanick; Yale Song; Sayan Nag; Kevin Qinghong Lin; Hardik Shah; Mike Zheng Shou; Rama Chellappa; Pengchuan Zhang","teams":["mike-zheng-shou"],"topics":["video_understanding"],"rqs":["W4b","X1b"],"collected":true,"review_status":"abstract_review","question":"第一人称视频语言预训练怎样更早融合跨模态信息？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"EgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。","input_conditions":"摘要初读：EgoVLPv2 将跨模态融合直接放入视频和语言骨干以支持不同下游任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"理解表征是相邻基础，不能直接作为后果视频生成结果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2307.05463"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2307.05463"}],"note":"p181","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P200","title":"Return of Unconditional Generation: A Self-supervised Representation Generation Method","short":"Return of Unconditional Generation","year":"2023","authors":"Tianhong Li; Dina Katabi; Kaiming He","collected":true,"note":"p200","scope":"本地 PDF · 摘要初读","summary":"RCG 先在自监督编码器的表征空间生成条件，再让图像生成器利用这些条件，降低无条件与有条件生成的差距。","boundary":"无标签图像生成并不意味着无需数据先验，也没有直接验证世界动力学。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2312.03701_Return_of_Unconditional_Generation_A_Self-supervised_Representation_Generation_Method.pdf"],"sha256":"f19b71decae5e4165f3036f78ae0e0b8ff6527670e324df9fb2c46162d3a4609","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.03701"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P200","arxiv_id":"2312.03701","title":"Return of Unconditional Generation: A Self-supervised Representation Generation Method","year":"2023","authors":"Tianhong Li; Dina Katabi; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"无条件生成能否通过先生成自监督语义表征来改善？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RCG 先在自监督编码器的表征空间生成条件，再让图像生成器利用这些条件，降低无条件与有条件生成的差距。","input_conditions":"摘要初读：RCG 先在自监督编码器的表征空间生成条件，再让图像生成器利用这些条件，降低无条件与有条件生成的差距。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"无标签图像生成并不意味着无需数据先验，也没有直接验证世界动力学。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.03701"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.03701v4"}],"note":"p200","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P199","title":"Mesh-Guided Neural Implicit Field Editing","short":"Mesh-Guided Neural Implicit Field Editing","year":"2023","authors":"Can Wang; Mingming He; Menglei Chai; Dongdong Chen; Jing Liao","collected":true,"note":"p199","scope":"本地 PDF · 摘要初读","summary":"以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场，支持不同粒度的局部编辑。","boundary":"局部几何编辑与局部机制修订不同；动态后果不在摘要任务范围内。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2312.02157_Mesh-Guided_Neural_Implicit_Field_Editing.pdf"],"sha256":"74f3a3aa9892834f94d57322f9d24fc747050094e92ada91018c753dfd29a9e1","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.02157"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"P199","arxiv_id":"2312.02157","title":"Mesh-Guided Neural Implicit Field Editing","year":"2023","authors":"Can Wang; Mingming He; Menglei Chai; Dongdong Chen; Jing Liao","teams":["jing-liao"],"topics":["geometry","hci"],"rqs":["X4a","W3d"],"collected":true,"review_status":"abstract_review","question":"显式网格如何帮助编辑隐式神经场？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场，支持不同粒度的局部编辑。","input_conditions":"摘要初读：以可微网格提取、颜色映射和八叉树优化连接易编辑网格与辐射场，支持不同粒度的局部编辑。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"局部几何编辑与局部机制修订不同；动态后果不在摘要任务范围内。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.02157"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.02157"}],"note":"p199","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P198","title":"VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence","short":"VideoSwap","year":"2023","authors":"Yuchao Gu; Yipin Zhou; Bichen Wu; Licheng Yu; Jia-Wei Liu; Rui Zhao; Jay Zhangjie Wu; David Junhao Zhang; Mike Zheng Shou; Kevin Tang","collected":true,"note":"p198","scope":"本地 PDF · 摘要初读","summary":"VideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。","boundary":"源动作已给定；编辑保持不代表新动作后果可预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2312.02087_VideoSwap_Customized_Video_Subject_Swapping_with_Interactive_Semantic_Point_Correspondence.pdf"],"sha256":"26096cae389c90d848d56454d277cdb9bf7b82b7c06225d0b72be2afd9203988","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.02087"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P198","arxiv_id":"2312.02087","title":"VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence","year":"2023","authors":"Yuchao Gu; Yipin Zhou; Bichen Wu; Licheng Yu; Jia-Wei Liu; Rui Zhao; Jay Zhangjie Wu; David Junhao Zhang; Mike Zheng Shou; Kevin Tang","teams":["mike-zheng-shou"],"topics":["video_gen","hci"],"rqs":["X4a","W3b"],"collected":true,"review_status":"abstract_review","question":"交互式语义点怎样支持形状改变的视频主体替换？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。","input_conditions":"摘要初读：VideoSwap 用稀疏语义对应及拖动、删除交互控制主体身份和运动。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"源动作已给定；编辑保持不代表新动作后果可预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.02087"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.02087"}],"note":"p198","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P197","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","short":"Ego-Exo4D","year":"2023","authors":"Kristen Grauman; Andrew Westbury; Lorenzo Torresani; Kris Kitani; Jitendra Malik; Triantafyllos Afouras; Kumar Ashutosh; Vijay Baiyya; Siddhant Bansal; Bikram Boote; Eugene Byrne; Zach Chavis; Joya Chen; Feng Cheng; Fu-Jen Chu; Sean Crane; Avijit Dasgupta; Jing Dong; Maria Escobar; Cristhian Forigua; Abrham Gebreselasie; Sanjay Haresh; Jing Huang; Md Mohaiminul Islam; Suyog Jain; Rawal Khirodkar; Devansh Kukreja; Kevin J Liang; Jia-Wei Liu; Sagnik Majumder; Yongsen Mao; Miguel Martin; Effrosyni Mavroudi; Tushar Nagarajan; Francesco Ragusa; Santhosh Kumar Ramakrishnan; Luigi Seminara; Arjun Somayazulu; Yale Song; Shan Su; Zihui Xue; Edward Zhang; Jinxu Zhang; Angela Castillo; Changan Chen; Xinzhu Fu; Ryosuke Furuta; Cristina Gonzalez; Prince Gupta; Jiabo Hu; Yifei Huang; Yiming Huang; Weslie Khoo; Anush Kumar; Robert Kuo; Sach Lakhavani; Miao Liu; Mi Luo; Zhengyi Luo; Brighid Meredith; Austin Miller; Oluwatumininu Oguntola; Xiaqing Pan; Penny Peng; Shraman Pramanick; Merey Ramazanova; Fiona Ryan; Wei Shan; Kiran Somasundaram; Chenan Song; Audrey Southerland; Masatoshi Tateno; Huiyu Wang; Yuchen Wang; Takuma Yagi; Mingfei Yan; Xitong Yang; Zecheng Yu; Shengxin Cindy Zha; Chen Zhao; Ziwei Zhao; Zhifan Zhu; Jeff Zhuo; Pablo Arbelaez; Gedas Bertasius; David Crandall; Dima Damen; Jakob Engel; Giovanni Maria Farinella; Antonino Furnari; Bernard Ghanem; Judy Hoffman; C. V. Jawahar; Richard Newcombe; Hyun Soo Park; James M. Rehg; Yoichi Sato; Manolis Savva; Jianbo Shi; Mike Zheng Shou; Michael Wray","collected":true,"note":"p197","scope":"本地 PDF · 摘要初读","summary":"Ego-Exo4D 提供第一／第三视角活动数据及技能、姿态和视角转换任务。","boundary":"观测数据与姿态任务本身不提供干预后果真值。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2311.18259_Ego-Exo4D_Understanding_Skilled_Human_Activity_from_First-_and_Third-Person_Perspectives.pdf"],"sha256":"15e31586e111eb32fe54131840b7733b095fb3b20bebb14be9610d11967e26a8","pages":99,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.18259"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P197","arxiv_id":"2311.18259","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","year":"2023","authors":"Kristen Grauman; Andrew Westbury; Lorenzo Torresani; Kris Kitani; Jitendra Malik; Triantafyllos Afouras; Kumar Ashutosh; Vijay Baiyya; Siddhant Bansal; Bikram Boote; Eugene Byrne; Zach Chavis; Joya Chen; Feng Cheng; Fu-Jen Chu; Sean Crane; Avijit Dasgupta; Jing Dong; Maria Escobar; Cristhian Forigua; Abrham Gebreselasie; Sanjay Haresh; Jing Huang; Md Mohaiminul Islam; Suyog Jain; Rawal Khirodkar; Devansh Kukreja; Kevin J Liang; Jia-Wei Liu; Sagnik Majumder; Yongsen Mao; Miguel Martin; Effrosyni Mavroudi; Tushar Nagarajan; Francesco Ragusa; Santhosh Kumar Ramakrishnan; Luigi Seminara; Arjun Somayazulu; Yale Song; Shan Su; Zihui Xue; Edward Zhang; Jinxu Zhang; Angela Castillo; Changan Chen; Xinzhu Fu; Ryosuke Furuta; Cristina Gonzalez; Prince Gupta; Jiabo Hu; Yifei Huang; Yiming Huang; Weslie Khoo; Anush Kumar; Robert Kuo; Sach Lakhavani; Miao Liu; Mi Luo; Zhengyi Luo; Brighid Meredith; Austin Miller; Oluwatumininu Oguntola; Xiaqing Pan; Penny Peng; Shraman Pramanick; Merey Ramazanova; Fiona Ryan; Wei Shan; Kiran Somasundaram; Chenan Song; Audrey Southerland; Masatoshi Tateno; Huiyu Wang; Yuchen Wang; Takuma Yagi; Mingfei Yan; Xitong Yang; Zecheng Yu; Shengxin Cindy Zha; Chen Zhao; Ziwei Zhao; Zhifan Zhu; Jeff Zhuo; Pablo Arbelaez; Gedas Bertasius; David Crandall; Dima Damen; Jakob Engel; Giovanni Maria Farinella; Antonino Furnari; Bernard Ghanem; Judy Hoffman; C. V. Jawahar; Richard Newcombe; Hyun Soo Park; James M. Rehg; Yoichi Sato; Manolis Savva; Jianbo Shi; Mike Zheng Shou; Michael Wray","teams":["mike-zheng-shou"],"topics":["video_understanding","geometry","evaluation"],"rqs":["X1b","W1c"],"collected":true,"review_status":"abstract_review","question":"多视角数据怎样支持技能理解和跨视角人体分析？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Ego-Exo4D 提供第一／第三视角活动数据及技能、姿态和视角转换任务。","input_conditions":"摘要初读：Ego-Exo4D 提供第一／第三视角活动数据及技能、姿态和视角转换任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"观测数据与姿态任务本身不提供干预后果真值。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.18259"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2311.18259"}],"note":"p197","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P196","title":"HumanRef: Single Image to 3D Human Generation via Reference-Guided Diffusion","short":"HumanRef","year":"2023","authors":"Jingbo Zhang; Xiaoyu Li; Qi Zhang; Yanpei Cao; Ying Shan; Jing Liao","collected":true,"note":"p196","scope":"本地 PDF · 摘要初读","summary":"HumanRef 采用参考引导的分数蒸馏和区域注意力，让生成的人体与输入外观对应。","boundary":"主要目标是静态三维人体生成，不能直接证明运动或接触物理正确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2311.16961_HumanRef_Single_Image_to_3D_Human_Generation_via_Reference-Guided_Diffusion.pdf"],"sha256":"aeeeb93da8df3e5cf86952c1dc8b3818959acfec9b65c989996d9e4bd04a7fdb","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.16961"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P196","arxiv_id":"2311.16961","title":"HumanRef: Single Image to 3D Human Generation via Reference-Guided Diffusion","year":"2023","authors":"Jingbo Zhang; Xiaoyu Li; Qi Zhang; Yanpei Cao; Ying Shan; Jing Liao","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"单张参考图如何约束三维人体的几何、纹理和跨视角身份？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HumanRef 采用参考引导的分数蒸馏和区域注意力，让生成的人体与输入外观对应。","input_conditions":"摘要初读：HumanRef 采用参考引导的分数蒸馏和区域注意力，让生成的人体与输入外观对应。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要目标是静态三维人体生成，不能直接证明运动或接触物理正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.16961"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2311.16961"}],"note":"p196","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P195","title":"XAGen: 3D Expressive Human Avatars Generation","short":"XAGen","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Jiashi Feng; Mike Zheng Shou","collected":true,"note":"p195","scope":"本地 PDF · 摘要初读","summary":"XAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。","boundary":"人体表示可控不等同于物理运动或多对象交互建模。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2311.13574_XAGen_3D_Expressive_Human_Avatars_Generation.pdf"],"sha256":"dc7d97561315665ee49faf83ef9df7a2631491d6276bd85e0b4f8d192a6b13eb","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.13574"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P195","arxiv_id":"2311.13574","title":"XAGen: 3D Expressive Human Avatars Generation","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Jiashi Feng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["geometry"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"三维人体生成怎样细粒度控制脸、手和身体？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"XAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。","input_conditions":"摘要初读：XAGen 采用多尺度、多部位表示与渲染、判别设计实现表情和姿态控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"人体表示可控不等同于物理运动或多对象交互建模。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.13574"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2311.13574v1"}],"note":"p195","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P194","title":"GAIA: a benchmark for General AI Assistants","short":"GAIA","year":"2023","authors":"Grégoire Mialon; Clémentine Fourrier; Craig Swift; Thomas Wolf; Yann LeCun; Thomas Scialom","collected":true,"note":"p194","scope":"本地 PDF · 摘要初读","summary":"GAIA 以需要检索、工具和综合推理的现实问题构建助手评测。","boundary":"属于相邻 agent 基准，不直接测世界动力学或视频生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2311.12983_GAIA_a_benchmark_for_General_AI_Assistants.pdf"],"sha256":"5bf6f968d4f5cd20acdfca6e81e3c9f5277bb66061fad7a02e35442dff812ba0","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.12983"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"}],"annotation":{"id":"P194","arxiv_id":"2311.12983","title":"GAIA: a benchmark for General AI Assistants","year":"2023","authors":"Grégoire Mialon; Clémentine Fourrier; Craig Swift; Thomas Wolf; Yann LeCun; Thomas Scialom","teams":["yann-lecun"],"topics":["agent","evaluation"],"rqs":["X3c"],"collected":true,"review_status":"abstract_review","question":"怎样用真实问题评估通用助手的工具、推理和多模态能力？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GAIA 以需要检索、工具和综合推理的现实问题构建助手评测。","input_conditions":"摘要初读：GAIA 以需要检索、工具和综合推理的现实问题构建助手评测。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"属于相邻 agent 基准，不直接测世界动力学或视频生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.12983"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2311.12983v1"}],"note":"p194","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P193","title":"NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities","short":"NOIR","year":"2023","authors":"Ruohan Zhang; Sharon Lee; Minjune Hwang; Ayano Hiranaka; Chen Wang; Wensi Ai; Jin Jie Ryan Tan; Shreya Gupta; Yilun Hao; Gabrael Levine; Ruohan Gao; Anthony Norcia; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p193","scope":"本地 PDF · 摘要初读","summary":"NOIR 将脑信号接口与智能机器人技能组合，研究多类家庭活动控制。","boundary":"交互通道和执行系统与视频预览不同；对 Foresee 更适合作为控制权设计参照。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2311.01454_NOIR_Neural_Signal_Operated_Intelligent_Robots_for_Everyday_Activities.pdf"],"sha256":"134774852738bc88082376b49eb3aefe596d3b95320847a75bf0ff2991cb0e7e","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.01454"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X2c","role":"support"}],"annotation":{"id":"P193","arxiv_id":"2311.01454","title":"NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities","year":"2023","authors":"Ruohan Zhang; Sharon Lee; Minjune Hwang; Ayano Hiranaka; Chen Wang; Wensi Ai; Jin Jie Ryan Tan; Shreya Gupta; Yilun Hao; Gabrael Levine; Ruohan Gao; Anthony Norcia; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["hci","agent"],"rqs":["X1a","X2c"],"collected":true,"review_status":"abstract_review","question":"人能否通过脑信号指挥机器人完成日常活动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"NOIR 将脑信号接口与智能机器人技能组合，研究多类家庭活动控制。","input_conditions":"摘要初读：NOIR 将脑信号接口与智能机器人技能组合，研究多类家庭活动控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"交互通道和执行系统与视频预览不同；对 Foresee 更适合作为控制权设计参照。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.01454"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2311.01454"}],"note":"p193","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P192","title":"ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single Image","short":"ZeroNVS","year":"2023","authors":"Kyle Sargent; Zizhang Li; Tanmay Shah; Charles Herrmann; Hong-Xing Yu; Yunzhi Zhang; Eric Ryan Chan; Dmitry Lagun; Li Fei-Fei; Deqing Sun; Jiajun Wu","collected":true,"note":"p192","scope":"本地 PDF · 摘要初读","summary":"ZeroNVS 训练三维感知扩散先验，处理场景数据混合与尺度模糊，并改善完整视角生成。","boundary":"单图隐藏内容是生成推测，尚非经观测验证的环境真值。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2310.17994_ZeroNVS_Zero-Shot_360-Degree_View_Synthesis_from_a_Single_Image.pdf"],"sha256":"bec24cb4db6191dc3607ca1bc79b8eaf640e4c1c0f256ca09661087d03156ba0","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2310.17994"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P192","arxiv_id":"2310.17994","title":"ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single Image","year":"2023","authors":"Kyle Sargent; Zizhang Li; Tanmay Shah; Charles Herrmann; Hong-Xing Yu; Yunzhi Zhang; Eric Ryan Chan; Dmitry Lagun; Li Fei-Fei; Deqing Sun; Jiajun Wu","teams":["fei-fei-li"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"单张自然图像怎样支持更广视角的场景生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ZeroNVS 训练三维感知扩散先验，处理场景数据混合与尺度模糊，并改善完整视角生成。","input_conditions":"摘要初读：ZeroNVS 训练三维感知扩散先验，处理场景数据混合与尺度模糊，并改善完整视角生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"单图隐藏内容是生成推测，尚非经观测验证的环境真值。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2310.17994"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2310.17994v2"}],"note":"p192","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P191","title":"VQ-NeRF: Neural Reflectance Decomposition and Editing with Vector Quantization","short":"VQ-NeRF","year":"2023","authors":"Hongliang Zhong; Jingbo Zhang; Jing Liao","collected":true,"note":"p191","scope":"本地 PDF · 摘要初读","summary":"VQ-NeRF 将连续分支与离散材料码结合，并提供材质编辑界面。","boundary":"材质可编辑性与由材质决定的动力学后果属于不同建模目标。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2310.11864_VQ-NeRF_Neural_Reflectance_Decomposition_and_Editing_with_Vector_Quantization.pdf"],"sha256":"dbc3457a09b27a3c5137949ce600f28352bd809e583b6b906ff850c75373eb3f","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2310.11864"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P191","arxiv_id":"2310.11864","title":"VQ-NeRF: Neural Reflectance Decomposition and Editing with Vector Quantization","year":"2023","authors":"Hongliang Zhong; Jingbo Zhang; Jing Liao","teams":["jing-liao"],"topics":["geometry","hci"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"离散材质表示能否改善三维反射分解和交互编辑？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VQ-NeRF 将连续分支与离散材料码结合，并提供材质编辑界面。","input_conditions":"摘要初读：VQ-NeRF 将连续分支与离散材料码结合，并提供材质编辑界面。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"材质可编辑性与由材质决定的动力学后果属于不同建模目标。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2310.11864"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2310.11864"}],"note":"p191","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P210","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","short":"Agent AI","year":"2024","authors":"Zane Durante; Qiuyuan Huang; Naoki Wake; Ran Gong; Jae Sung Park; Bidipta Sarkar; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Yejin Choi; Katsushi Ikeuchi; Hoi Vo; Li Fei-Fei; Jianfeng Gao","collected":true,"note":"p210","scope":"本地 PDF · 摘要初读","summary":"Agent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。","boundary":"综述提供概念脉络，不能替代具体实验边界。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2401.03568_Agent_AI_Surveying_the_Horizons_of_Multimodal_Interaction.pdf"],"sha256":"62fa6655a8eecfef68bd5ae7965a84726457488b37b29a169397e85c9c0eea6e","pages":80,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2401.03568"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P210","arxiv_id":"2401.03568","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","year":"2024","authors":"Zane Durante; Qiuyuan Huang; Naoki Wake; Ran Gong; Jae Sung Park; Bidipta Sarkar; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Yejin Choi; Katsushi Ikeuchi; Hoi Vo; Li Fei-Fei; Jianfeng Gao","teams":["fei-fei-li"],"topics":["agent","hci"],"rqs":["X3c","W4a"],"collected":true,"review_status":"abstract_review","question":"多模态 agent 如何整合感知、外部知识与人类反馈？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Agent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。","input_conditions":"摘要初读：Agent AI 综述梳理物理与虚拟环境中的交互系统和下一动作预测路线。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"综述提供概念脉络，不能替代具体实验边界。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2401.03568"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2401.03568v2"}],"note":"p210","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P209","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","short":"Moonshot","year":"2024","authors":"David Junhao Zhang; Dongxu Li; Hung Le; Mike Zheng Shou; Caiming Xiong; Doyen Sahoo","collected":true,"note":"p209","scope":"本地 PDF · 摘要初读","summary":"Moonshot 用多模态视频模块与解耦交叉注意力整合条件，并接入预训练 ControlNet。","boundary":"多条件可控性与未知后果预测是不同问题。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2401.01827_Moonshot_Towards_Controllable_Video_Generation_and_Editing_with_Multimodal_Conditions.pdf"],"sha256":"8d588c27ffefee636222553882b971cb5e02acf3a25b2985bf7b4a4eebf84456","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2401.01827"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P209","arxiv_id":"2401.01827","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","year":"2024","authors":"David Junhao Zhang; Dongxu Li; Hung Le; Mike Zheng Shou; Caiming Xiong; Doyen Sahoo","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"图像、文字和几何条件怎样共同控制视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Moonshot 用多模态视频模块与解耦交叉注意力整合条件，并接入预训练 ControlNet。","input_conditions":"摘要初读：Moonshot 用多模态视频模块与解耦交叉注意力整合条件，并接入预训练 ControlNet。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"多条件可控性与未知后果预测是不同问题。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2401.01827"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2401.01827v1"}],"note":"p209","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P208","title":"Gradient-based Planning with World Models","short":"Gradient-based Planning with World Models","year":"2023","authors":"Jyothir S; Siddhartha Jalagam; Yann LeCun; Vlad Sobal","collected":true,"note":"p208","scope":"本地 PDF · 摘要初读","summary":"作者比较梯度优化、其他模型预测控制和策略方法，考察样本效率与规划效果。","boundary":"优化器能找到低模型损失的动作，不代表模型误差或真实执行风险已消除。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2312.17227_Gradient-based_Planning_with_World_Models.pdf"],"sha256":"64926bc0b300f8419953bfd4aec777a96c959b015abad487a0a9eb8acfdb07c4","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.17227"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P208","arxiv_id":"2312.17227","title":"Gradient-based Planning with World Models","year":"2023","authors":"Jyothir S; Siddhartha Jalagam; Yann LeCun; Vlad Sobal","teams":["yann-lecun"],"topics":["world_model","agent","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"可微世界模型中的梯度规划能否替代采样式动作搜索？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者比较梯度优化、其他模型预测控制和策略方法，考察样本效率与规划效果。","input_conditions":"摘要初读：作者比较梯度优化、其他模型预测控制和策略方法，考察样本效率与规划效果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"优化器能找到低模型损失的动作，不代表模型误差或真实执行风险已消除。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.17227"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.17227v1"}],"note":"p208","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P207","title":"ShowRoom3D: Text to High-Quality 3D Room Generation Using 3D Priors","short":"ShowRoom3D","year":"2023","authors":"Weijia Mao; Yan-Pei Cao; Jia-Wei Liu; Zhongcong Xu; Mike Zheng Shou","collected":true,"note":"p207","scope":"本地 PDF · 摘要初读","summary":"ShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。","boundary":"生成静态场景不直接提供随时间演化的物理状态。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2312.13324_ShowRoom3D_Text_to_High-Quality_3D_Room_Generation_Using_3D_Priors.pdf"],"sha256":"e3457f5a42baf95ccda334fcfe67e08ea00ed461a2a9149cc3a237e9a950f95b","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.13324"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P207","arxiv_id":"2312.13324","title":"ShowRoom3D: Text to High-Quality 3D Room Generation Using 3D Priors","year":"2023","authors":"Weijia Mao; Yan-Pei Cao; Jia-Wei Liu; Zhongcong Xu; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["geometry"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"三维先验怎样改善文本生成的房间场景？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。","input_conditions":"摘要初读：ShowRoom3D 结合多视角扩散先验、渐进视角选择和姿态变换优化场景。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"生成静态场景不直接提供随时间演化的物理状态。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.13324"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.13324"}],"note":"p207","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P206","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","short":"ASSISTGUI","year":"2023","authors":"Difei Gao; Lei Ji; Zechen Bai; Mingyu Ouyang; Peiran Li; Dongxing Mao; Qinchen Wu; Weichen Zhang; Peiyi Wang; Xiangwu Guo; Hengxu Wang; Luowei Zhou; Mike Zheng Shou","collected":true,"note":"p206","scope":"本地 PDF · 摘要初读","summary":"AssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。","boundary":"执行基准与人机协作效用不同，用户负担需额外实验。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2312.13108_ASSISTGUI_Task-Oriented_Desktop_Graphical_User_Interface_Automation.pdf"],"sha256":"bd4f1fcdaff8be73eb40b024c934ee2bbe2d62e12926fc66561f51387cdb4fb3","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.13108"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"}],"annotation":{"id":"P206","arxiv_id":"2312.13108","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","year":"2023","authors":"Difei Gao; Lei Ji; Zechen Bai; Mingyu Ouyang; Peiran Li; Dongxing Mao; Qinchen Wu; Weichen Zhang; Peiyi Wang; Xiangwu Guo; Hengxu Wang; Luowei Zhou; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci","evaluation"],"rqs":["X3c"],"collected":true,"review_status":"abstract_review","question":"桌面 agent 能否完成真实软件中的长步骤任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。","input_conditions":"摘要初读：AssistGUI 建立 Windows 软件任务并用 GUI 解析与 actor-critic 推理组织执行。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"执行基准与人机协作效用不同，用户负担需额外实验。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.13108"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.13108"}],"note":"p206","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P205","title":"Model-Based Control with Sparse Neural Dynamics","short":"Model-Based Control with Sparse Neural Dynamics","year":"2023","authors":"Ziang Liu; Genggeng Zhou; Jeff He; Tobia Marcucci; Li Fei-Fei; Jiajun Wu; Yunzhu Li","collected":true,"note":"p205","scope":"本地 PDF · 摘要初读","summary":"作者剪除冗余 ReLU 神经元，再用混合整数规划和分支定界求解动作。","boundary":"结构可优化不等于语义规则可解释；优化保证也受模型误差限制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2312.12791_Model-Based_Control_with_Sparse_Neural_Dynamics.pdf"],"sha256":"fa982f779e80a0f5dec14ffcf5dbef702dedc605182595bbdbf9d75a886988df","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.12791"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P205","arxiv_id":"2312.12791","title":"Model-Based Control with Sparse Neural Dynamics","year":"2023","authors":"Ziang Liu; Genggeng Zhou; Jeff He; Tobia Marcucci; Li Fei-Fei; Jiajun Wu; Yunzhu Li","teams":["fei-fei-li"],"topics":["world_model","efficiency","agent"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"稀疏神经动力学能否更适合可优化的预测控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者剪除冗余 ReLU 神经元，再用混合整数规划和分支定界求解动作。","input_conditions":"摘要初读：作者剪除冗余 ReLU 神经元，再用混合整数规划和分支定界求解动作。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"结构可优化不等于语义规则可解释；优化保证也受模型误差限制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.12791"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.12791v1"}],"note":"p205","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P204","title":"HeadArtist: Text-conditioned 3D Head Generation with Self Score Distillation","short":"HeadArtist","year":"2023","authors":"Hongyu Liu; Xuan Wang; Ziyu Wan; Yujun Shen; Yibing Song; Jing Liao; Qifeng Chen","collected":true,"note":"p204","scope":"本地 PDF · 摘要初读","summary":"HeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。","boundary":"研究人体局部几何与外观生成；不涉及通用世界动力学。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2312.07539_HeadArtist_Text-conditioned_3D_Head_Generation_with_Self_Score_Distillation.pdf"],"sha256":"3d22c1642606fc1c4f2d2d246f162b370803deafcaa2e6438d7a5acbe6ef679e","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.07539"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P204","arxiv_id":"2312.07539","title":"HeadArtist: Text-conditioned 3D Head Generation with Self Score Distillation","year":"2023","authors":"Hongyu Liu; Xuan Wang; Ziyu Wan; Yujun Shen; Yibing Song; Jing Liao; Qifeng Chen","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"文本怎样生成可进一步编辑的三维头部？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。","input_conditions":"摘要初读：HeadArtist 通过关键点引导的 ControlNet 先验与自分数蒸馏优化参数化头部。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"研究人体局部几何与外观生成；不涉及通用世界动力学。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.07539"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.07539v2"}],"note":"p204","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P203","title":"CAD: Photorealistic 3D Generation via Adversarial Distillation","short":"CAD","year":"2023","authors":"Ziyu Wan; Despoina Paschalidou; Ian Huang; Hongyu Liu; Bokui Shen; Xiaoyu Xiang; Jing Liao; Leonidas Guibas","collected":true,"note":"p203","scope":"本地 PDF · 摘要初读","summary":"CAD 比较多视图渲染与扩散先验的分布差异，以对抗学习支持单图条件三维合成与插值。","boundary":"质量和多样性评价不能替代几何或物理约束的完整验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2312.06663_CAD_Photorealistic_3D_Generation_via_Adversarial_Distillation.pdf"],"sha256":"bbdc77f7c59d2fe8824cc79a87ae685ca5704e97e48267ea72409b44d23d6fab","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.06663"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P203","arxiv_id":"2312.06663","title":"CAD: Photorealistic 3D Generation via Adversarial Distillation","year":"2023","authors":"Ziyu Wan; Despoina Paschalidou; Ian Huang; Hongyu Liu; Bokui Shen; Xiaoyu Xiang; Jing Liao; Leonidas Guibas","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"对抗蒸馏能否改善扩散先验引导的三维生成质量和多样性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"CAD 比较多视图渲染与扩散先验的分布差异，以对抗学习支持单图条件三维合成与插值。","input_conditions":"摘要初读：CAD 比较多视图渲染与扩散先验的分布差异，以对抗学习支持单图条件三维合成与插值。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"质量和多样性评价不能替代几何或物理约束的完整验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.06663"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2312.06663"}],"note":"p203","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P202","title":"Photorealistic Video Generation with Diffusion Models","short":"Photorealistic Video Generation with Diffusion Models","year":"2023","authors":"Agrim Gupta; Lijun Yu; Kihyuk Sohn; Xiuye Gu; Meera Hahn; Li Fei-Fei; Irfan Essa; Lu Jiang; José Lezama","collected":true,"note":"p202","scope":"本地 PDF · 摘要初读","summary":"W.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。","boundary":"主要验证通用视频生成，不直接验证行动后果或新规则推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2312.06662_Photorealistic_Video_Generation_with_Diffusion_Models.pdf"],"sha256":"2371878e441f215e1a9eae4511a3bc36c8113a54c1039e7d47eb4adcc4504c13","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.06662"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P202","arxiv_id":"2312.06662","title":"Photorealistic Video Generation with Diffusion Models","year":"2023","authors":"Agrim Gupta; Lijun Yu; Kihyuk Sohn; Xiuye Gu; Meera Hahn; Li Fei-Fei; Irfan Essa; Lu Jiang; José Lezama","teams":["fei-fei-li"],"topics":["video_gen","generative_foundation"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"视频扩散怎样联合利用图像数据并减少注意力成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"W.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。","input_conditions":"摘要初读：W.A.L.T. 结合因果编码、窗口注意力和超分辨级联生成写实视频。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要验证通用视频生成，不直接验证行动后果或新规则推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.06662"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.06662v1"}],"note":"p202","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P201","title":"Chain of Code: Reasoning with a Language Model-Augmented Code Emulator","short":"Chain of Code","year":"2023","authors":"Chengshu Li; Jacky Liang; Andy Zeng; Xinyun Chen; Karol Hausman; Dorsa Sadigh; Sergey Levine; Li Fei-Fei; Fei Xia; Brian Ichter","collected":true,"note":"p201","scope":"本地 PDF · 摘要初读","summary":"Chain of Code 用代码结构组织推理，并让语言模型模拟不易直接执行的语义步骤。","boundary":"部分步骤由语言模型近似，不能将整条链默认视为可验证程序执行。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2312.04474_Chain_of_Code_Reasoning_with_a_Language_Model-Augmented_Code_Emulator.pdf"],"sha256":"3ea67386c3612262130b284f4f74c6c2fc6e137fa3f6b375f34182aa18a72e3b","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.04474"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P201","arxiv_id":"2312.04474","title":"Chain of Code: Reasoning with a Language Model-Augmented Code Emulator","year":"2023","authors":"Chengshu Li; Jacky Liang; Andy Zeng; Xinyun Chen; Karol Hausman; Dorsa Sadigh; Sergey Levine; Li Fei-Fei; Fei Xia; Brian Ichter","teams":["fei-fei-li"],"topics":["agent"],"rqs":["W1a","W4a"],"collected":true,"review_status":"abstract_review","question":"代码与语言仿真能否组合精确计算和语义推理？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Chain of Code 用代码结构组织推理，并让语言模型模拟不易直接执行的语义步骤。","input_conditions":"摘要初读：Chain of Code 用代码结构组织推理，并让语言模型模拟不易直接执行的语义步骤。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"部分步骤由语言模型近似，不能将整条链默认视为可验证程序执行。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.04474"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2312.04474v4"}],"note":"p201","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P220","title":"DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation","short":"DexCap","year":"2024","authors":"Chen Wang; Haochen Shi; Weizhuo Wang; Ruohan Zhang; Li Fei-Fei; C. Karen Liu","collected":true,"note":"p220","scope":"本地 PDF · 摘要初读","summary":"DexCap 提供手部捕捉系统，DexIL 将人类动作数据用于机器人技能学习。","boundary":"捕捉和策略迁移不直接预测未知物体后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2403.07788_DexCap_Scalable_and_Portable_Mocap_Data_Collection_System_for_Dexterous_Manipulation.pdf"],"sha256":"ad87015fd70061e5d0b6d4b21c22411c8071328766892a55f133b652d16de87a","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2403.07788"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P220","arxiv_id":"2403.07788","title":"DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation","year":"2024","authors":"Chen Wang; Haochen Shi; Weizhuo Wang; Ruohan Zhang; Li Fei-Fei; C. Karen Liu","teams":["fei-fei-li"],"topics":["agent","hci"],"rqs":["X1b","X3c"],"collected":true,"review_status":"abstract_review","question":"便携人手动作捕捉怎样支持灵巧机器人模仿？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DexCap 提供手部捕捉系统，DexIL 将人类动作数据用于机器人技能学习。","input_conditions":"摘要初读：DexCap 提供手部捕捉系统，DexIL 将人类动作数据用于机器人技能学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"捕捉和策略迁移不直接预测未知物体后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2403.07788"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2403.07788v2"}],"note":"p220","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P219","title":"DragAnything: Motion Control for Anything using Entity Representation","short":"DragAnything","year":"2024","authors":"Weijia Wu; Zhuang Li; Yuchao Gu; Rui Zhao; Yefei He; David Junhao Zhang; Mike Zheng Shou; Yan Li; Tingting Gao; Di Zhang","collected":true,"note":"p219","scope":"本地 PDF · 摘要初读","summary":"DragAnything 将实体表征与运动引导结合，支持对象和背景的轨迹控制。","boundary":"输入轨迹已指定；控制跟随不能直接证明模型自主预测因果后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2403.07420_DragAnything_Motion_Control_for_Anything_using_Entity_Representation.pdf"],"sha256":"893aa9bae332bc9d7c807751c9453404e93adb50ede2b5394f7ca0dcfc90d692","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2403.07420"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P219","arxiv_id":"2403.07420","title":"DragAnything: Motion Control for Anything using Entity Representation","year":"2024","authors":"Weijia Wu; Zhuang Li; Yuchao Gu; Rui Zhao; Yefei He; David Junhao Zhang; Mike Zheng Shou; Yan Li; Tingting Gao; Di Zhang","teams":["mike-zheng-shou"],"topics":["video_gen","hci"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"怎样通过实体表示分别控制多个对象的运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DragAnything 将实体表征与运动引导结合，支持对象和背景的轨迹控制。","input_conditions":"摘要初读：DragAnything 将实体表征与运动引导结合，支持对象和背景的轨迹控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"输入轨迹已指定；控制跟随不能直接证明模型自主预测因果后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2403.07420"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2403.07420"}],"note":"p219","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P218","title":"Position Paper: Agent AI Towards a Holistic Intelligence","short":"Position Paper","year":"2024","authors":"Qiuyuan Huang; Naoki Wake; Bidipta Sarkar; Zane Durante; Ran Gong; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Noboru Kuno; Ade Famoti; Ashley Llorens; John Langford; Hoi Vo; Li Fei-Fei; Katsu Ikeuchi; Jianfeng Gao","collected":true,"note":"p218","scope":"本地 PDF · 摘要初读","summary":"Agent AI 立场论文讨论感知、基础模型与行动模型的整合路线。","boundary":"研究主张和跨域展望不应当作统一系统已经实现的实验证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2403.00833_Position_Paper_Agent_AI_Towards_a_Holistic_Intelligence.pdf"],"sha256":"4f2426d32f4cd0a8a40929d64524c80bc64d3491dcd5df383adef53c76cf3b34","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2403.00833"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P218","arxiv_id":"2403.00833","title":"Position Paper: Agent AI Towards a Holistic Intelligence","year":"2024","authors":"Qiuyuan Huang; Naoki Wake; Bidipta Sarkar; Zane Durante; Ran Gong; Rohan Taori; Yusuke Noda; Demetri Terzopoulos; Noboru Kuno; Ade Famoti; Ashley Llorens; John Langford; Hoi Vo; Li Fei-Fei; Katsu Ikeuchi; Jianfeng Gao","teams":["fei-fei-li"],"topics":["agent"],"rqs":["X3c","W4a"],"collected":true,"review_status":"abstract_review","question":"基础模型如何与行动结合形成通用具身智能？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Agent AI 立场论文讨论感知、基础模型与行动模型的整合路线。","input_conditions":"摘要初读：Agent AI 立场论文讨论感知、基础模型与行动模型的整合路线。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"研究主张和跨域展望不应当作统一系统已经实现的实验证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2403.00833"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2403.00833v1"}],"note":"p218","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P217","title":"Learning and Leveraging World Models in Visual Representation Learning","short":"Learning and Leveraging World Models in Visual Representation Learning","year":"2024","authors":"Quentin Garrido; Mahmoud Assran; Nicolas Ballas; Adrien Bardes; Laurent Najman; Yann LeCun","collected":true,"note":"p217","scope":"本地 PDF · 摘要初读","summary":"Image World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测，并研究条件和容量的影响。","boundary":"这里的 world model 主要针对图像变换，不能泛化为任意物理环境模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2403.00504_Learning_and_Leveraging_World_Models_in_Visual_Representation_Learning.pdf"],"sha256":"fa435ab0b2219bdaaca9693b7dccf6ab285300a970b6001fe5476ac89ae80972","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2403.00504"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P217","arxiv_id":"2403.00504","title":"Learning and Leveraging World Models in Visual Representation Learning","year":"2024","authors":"Quentin Garrido; Mahmoud Assran; Nicolas Ballas; Adrien Bardes; Laurent Najman; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","generative_foundation"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"预测已知图像变换的作用能否学习更可控的视觉表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Image World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测，并研究条件和容量的影响。","input_conditions":"摘要初读：Image World Models 把 JEPA 从遮挡补全扩展到给定全局光度变化的潜空间预测，并研究条件和容量的影响。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这里的 world model 主要针对图像变换，不能泛化为任意物理环境模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2403.00504"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2403.00504"}],"note":"p217","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P216","title":"Bring Your Own Character: A Holistic Solution for Automatic Facial Animation Generation of Customized Characters","short":"Bring Your Own Character","year":"2024","authors":"Zechen Bai; Peng Chen; Xiaolan Peng; Lu Liu; Hui Chen; Mike Zheng Shou; Feng Tian","collected":true,"note":"p216","scope":"本地 PDF · 摘要初读","summary":"Bring Your Own Character 预测表情系数进行面部重定向，并通过人在环反馈改进定制。","boundary":"角色表情编辑不是开放世界物理交互预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2402.13724_Bring_Your_Own_Character_A_Holistic_Solution_for_Automatic_Facial_Animation_Generation_of_Customized_Characters.pdf"],"sha256":"080c079c721dbcf1494bc4f2cf74c18a1e5397576cb8ce2aa808b58e64d5f171","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2402.13724"}],"verified":"2026-09-19","mappings":[{"rq":"X3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P216","arxiv_id":"2402.13724","title":"Bring Your Own Character: A Holistic Solution for Automatic Facial Animation Generation of Customized Characters","year":"2024","authors":"Zechen Bai; Peng Chen; Xiaolan Peng; Lu Liu; Hui Chen; Mike Zheng Shou; Feng Tian","teams":["mike-zheng-shou"],"topics":["geometry","hci"],"rqs":["X3b","X4a"],"collected":true,"review_status":"abstract_review","question":"不同虚拟角色的面部动画怎样适配并纳入用户反馈？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Bring Your Own Character 预测表情系数进行面部重定向，并通过人在环反馈改进定制。","input_conditions":"摘要初读：Bring Your Own Character 预测表情系数进行面部重定向，并通过人在环反馈改进定制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"角色表情编辑不是开放世界物理交互预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2402.13724"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2402.13724"}],"note":"p216","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P215","title":"An Interactive Agent Foundation Model","short":"An Interactive Agent Foundation Model","year":"2024","authors":"Zane Durante; Bidipta Sarkar; Ran Gong; Rohan Taori; Yusuke Noda; Paul Tang; Ehsan Adeli; Shrinidhi Kowshika Lakshmikanth; Kevin Schulman; Arnold Milstein; Demetri Terzopoulos; Ade Famoti; Noboru Kuno; Ashley Llorens; Hoi Vo; Katsu Ikeuchi; Li Fei-Fei; Jianfeng Gao; Naoki Wake; Qiuyuan Huang","collected":true,"note":"p215","scope":"本地 PDF · 摘要初读","summary":"Interactive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测，研究机器人及游戏等任务。","boundary":"动作泛化与像素世界建模、物理机制可解释性需独立验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2402.05929_An_Interactive_Agent_Foundation_Model.pdf"],"sha256":"d395efa3fc2f525e405438530c2469cb58aba746a30e0cad80f78ac940caa7a1","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2402.05929"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P215","arxiv_id":"2402.05929","title":"An Interactive Agent Foundation Model","year":"2024","authors":"Zane Durante; Bidipta Sarkar; Ran Gong; Rohan Taori; Yusuke Noda; Paul Tang; Ehsan Adeli; Shrinidhi Kowshika Lakshmikanth; Kevin Schulman; Arnold Milstein; Demetri Terzopoulos; Ade Famoti; Noboru Kuno; Ashley Llorens; Hoi Vo; Katsu Ikeuchi; Li Fei-Fei; Jianfeng Gao; Naoki Wake; Qiuyuan Huang","teams":["fei-fei-li"],"topics":["agent","generative_foundation"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"多域多任务预训练能否形成通用交互动作模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Interactive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测，研究机器人及游戏等任务。","input_conditions":"摘要初读：Interactive Agent Foundation Model 结合视觉遮挡、语言建模和下一动作预测，研究机器人及游戏等任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动作泛化与像素世界建模、物理机制可解释性需独立验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2402.05929"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2402.05929v2"}],"note":"p215","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P214","title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion","short":"Direct-a-Video","year":"2024","authors":"Shiyuan Yang; Liang Hou; Haibin Huang; Chongyang Ma; Pengfei Wan; Di Zhang; Xiaodong Chen; Jing Liao","collected":true,"note":"p214","scope":"本地 PDF · 摘要初读","summary":"Direct-a-Video 分别建模相机参数和对象运动，以新增时间交叉注意力和数据增强训练相机控制。","boundary":"用户已指定运动条件；控制准确性需要与自主预测后果区分。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2402.03162_Direct-a-Video_Customized_Video_Generation_with_User-Directed_Camera_Movement_and_Object_Motion.pdf"],"sha256":"b628509aebbd3c80da6a30c32512c31025064674be11937682a2c79964ccaf0a","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2402.03162"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P214","arxiv_id":"2402.03162","title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion","year":"2024","authors":"Shiyuan Yang; Liang Hou; Haibin Huang; Chongyang Ma; Pengfei Wan; Di Zhang; Xiaodong Chen; Jing Liao","teams":["jing-liao"],"topics":["video_gen","geometry"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"如何解耦控制相机运动与多个对象的运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Direct-a-Video 分别建模相机参数和对象运动，以新增时间交叉注意力和数据增强训练相机控制。","input_conditions":"摘要初读：Direct-a-Video 分别建模相机参数和对象运动，以新增时间交叉注意力和数据增强训练相机控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"用户已指定运动条件；控制准确性需要与自主预测后果区分。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2402.03162"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2402.03162v2"}],"note":"p214","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P213","title":"Advances in 3D Generation: A Survey","short":"Advances in 3D Generation","year":"2024","authors":"Xiaoyu Li; Qi Zhang; Di Kang; Weihao Cheng; Yiming Gao; Jingbo Zhang; Zhihao Liang; Jing Liao; Yan-Pei Cao; Ying Shan","collected":true,"note":"p213","scope":"本地 PDF · 摘要初读","summary":"综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。","boundary":"综述用于寻找来源与建立分类，本身不提供各能力的统一实证验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2401.17807_Advances_in_3D_Generation_A_Survey.pdf"],"sha256":"851cba448332cf58493102c17e2470108b6c0dc933fb2a8c06fa5262be402b49","pages":33,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2401.17807"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P213","arxiv_id":"2401.17807","title":"Advances in 3D Generation: A Survey","year":"2024","authors":"Xiaoyu Li; Qi Zhang; Di Kang; Weihao Cheng; Yiming Gao; Jingbo Zhang; Zhihao Liang; Jing Liao; Yan-Pei Cao; Ying Shan","teams":["jing-liao"],"topics":["geometry","evaluation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"三维生成有哪些表示、算法、数据与应用路线？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。","input_conditions":"摘要初读：综述按前馈生成、优化生成、程序生成和生成式新视角合成组织三维文献。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"综述用于寻找来源与建立分类，本身不提供各能力的统一实证验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2401.17807"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2401.17807"}],"note":"p213","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P212","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","short":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","year":"2024","authors":"Xinlei Chen; Zhuang Liu; Saining Xie; Kaiming He","collected":true,"note":"p212","scope":"本地 PDF · 摘要初读","summary":"逐项拆解去噪扩散模型并向去噪自编码器简化，对比其表征学习表现。","boundary":"感知表征质量与生成后果正确性使用不同任务和评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2401.14404_Deconstructing_Denoising_Diffusion_Models_for_Self-Supervised_Learning.pdf"],"sha256":"de3995aa8e3602297a718c1dbf251051a2c4563924d3e921fd334a13a686fd79","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2401.14404"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P212","arxiv_id":"2401.14404","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","year":"2024","authors":"Xinlei Chen; Zhuang Liu; Saining Xie; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a","W4b"],"collected":true,"review_status":"abstract_review","question":"扩散模型的哪些组成部分对自监督表征学习真正必要？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"逐项拆解去噪扩散模型并向去噪自编码器简化，对比其表征学习表现。","input_conditions":"摘要初读：逐项拆解去噪扩散模型并向去噪自编码器简化，对比其表征学习表现。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"感知表征质量与生成后果正确性使用不同任务和评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2401.14404"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2401.14404v1"}],"note":"p212","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P211","title":"Towards A Better Metric for Text-to-Video Generation","short":"Towards A Better Metric for Text-to-Video Generation","year":"2024","authors":"Jay Zhangjie Wu; Guian Fang; Haoning Wu; Xintao Wang; Yixiao Ge; Xiaodong Cun; David Junhao Zhang; Jia-Wei Liu; Yuchao Gu; Rui Zhao; Weisi Lin; Wynne Hsu; Ying Shan; Mike Zheng Shou","collected":true,"note":"p211","scope":"本地 PDF · 摘要初读","summary":"T2VScore 分开建模文本视频对齐与视频质量，并用人工判断数据检验指标。","boundary":"两类观感指标仍不足以证明物理机制和干预结果正确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2401.07781_Towards_A_Better_Metric_for_Text-to-Video_Generation.pdf"],"sha256":"c55bf36b6f20cd4787f079367c7e27c1d5c7b46cc57396b4482f0c15e8b7655c","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2401.07781"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"}],"annotation":{"id":"P211","arxiv_id":"2401.07781","title":"Towards A Better Metric for Text-to-Video Generation","year":"2024","authors":"Jay Zhangjie Wu; Guian Fang; Haoning Wu; Xintao Wang; Yixiao Ge; Xiaodong Cun; David Junhao Zhang; Jia-Wei Liu; Yuchao Gu; Rui Zhao; Weisi Lin; Wynne Hsu; Ying Shan; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"abstract_review","question":"文本到视频怎样同时评估提示对齐与视觉质量？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"T2VScore 分开建模文本视频对齐与视频质量，并用人工判断数据检验指标。","input_conditions":"摘要初读：T2VScore 分开建模文本视频对齐与视频质量，并用人工判断数据检验指标。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"两类观感指标仍不足以证明物理机制和干预结果正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2401.07781"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2401.07781v1"}],"note":"p211","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P230","title":"EG4D: Explicit Generation of 4D Object without Score Distillation","short":"EG4D","year":"2024","authors":"Qi Sun; Zhiyang Guo; Ziyu Wan; Jing Nathan Yan; Shengming Yin; Wengang Zhou; Jing Liao; Houqiang Li","collected":true,"note":"p230","scope":"本地 PDF · 摘要初读","summary":"利用视频扩散生成多视图视频，再进行动态 Gaussian 重建与细节修整，减少对分数蒸馏的依赖。","boundary":"显式四维表示在此指动态外观与几何；不能由此推出对象动力学机制可识别或可编辑。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2405.18132_EG4D_Explicit_Generation_of_4D_Object_without_Score_Distillation.pdf"],"sha256":"f69fec672a1eed5ecc403ca93483811fcf6fb2393227c0aaff645f40f8b2152c","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.18132"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P230","arxiv_id":"2405.18132","title":"EG4D: Explicit Generation of 4D Object without Score Distillation","year":"2024","authors":"Qi Sun; Zhiyang Guo; Ziyu Wan; Jing Nathan Yan; Shengming Yin; Wengang Zhou; Jing Liao; Houqiang Li","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何从单图获得时空一致的显式四维对象？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"利用视频扩散生成多视图视频，再进行动态 Gaussian 重建与细节修整，减少对分数蒸馏的依赖。","input_conditions":"摘要初读：利用视频扩散生成多视图视频，再进行动态 Gaussian 重建与细节修整，减少对分数蒸馏的依赖。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"显式四维表示在此指动态外观与几何；不能由此推出对象动力学机制可识别或可编辑。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.18132"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.18132v1"}],"note":"p230","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P229","title":"TRANSIC: Sim-to-Real Policy Transfer by Learning from Online Correction","short":"TRANSIC","year":"2024","authors":"Yunfan Jiang; Chen Wang; Ruohan Zhang; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p229","scope":"本地 PDF · 摘要初读","summary":"TRANSIC 将仿真策略与真实执行时的人类辅助结合，学习应对接触复杂任务中的迁移误差。","boundary":"人的介入提供额外信息与成本，不能与完全自主系统忽略条件地比较。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2405.10315_TRANSIC_Sim-to-Real_Policy_Transfer_by_Learning_from_Online_Correction.pdf"],"sha256":"b445a54c4e6ce51af8a3552c22db90c44c3808332ea321388e5659b5a6149c1d","pages":39,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.10315"}],"verified":"2026-09-19","mappings":[{"rq":"X3b","role":"support"},{"rq":"X2c","role":"support"}],"annotation":{"id":"P229","arxiv_id":"2405.10315","title":"TRANSIC: Sim-to-Real Policy Transfer by Learning from Online Correction","year":"2024","authors":"Yunfan Jiang; Chen Wang; Ruohan Zhang; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["agent","hci"],"rqs":["X3b","X2c"],"collected":true,"review_status":"abstract_review","question":"人的在线纠正怎样帮助策略跨越仿真到真实的差别？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"TRANSIC 将仿真策略与真实执行时的人类辅助结合，学习应对接触复杂任务中的迁移误差。","input_conditions":"摘要初读：TRANSIC 将仿真策略与真实执行时的人类辅助结合，学习应对接触复杂任务中的迁移误差。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"人的介入提供额外信息与成本，不能与完全自主系统忽略条件地比较。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.10315"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.10315v3"}],"note":"p229","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P228","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","short":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","year":"2024","authors":"Yuexiang Zhai; Hao Bai; Zipeng Lin; Jiayi Pan; Shengbang Tong; Yifei Zhou; Alane Suhr; Saining Xie; Yann LeCun; Yi Ma; Sergey Levine","collected":true,"note":"p228","scope":"本地 PDF · 摘要初读","summary":"作者将任务描述、语言思维链和文本动作接入强化学习，通过任务奖励优化视觉语言决策。","boundary":"推理由 VLM 承担，不属于视频生成模型本身涌现的推理证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2405.10292_Fine-Tuning_Large_Vision-Language_Models_as_Decision-Making_Agents_via_Reinforcement_Learning.pdf"],"sha256":"d0aa2cca69f98ca66273f5d7d77389ba363acf1525e5302813aff989a01e6664","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.10292"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P228","arxiv_id":"2405.10292","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","year":"2024","authors":"Yuexiang Zhai; Hao Bai; Zipeng Lin; Jiayi Pan; Shengbang Tong; Yifei Zhou; Alane Suhr; Saining Xie; Yann LeCun; Yi Ma; Sergey Levine","teams":["yann-lecun"],"topics":["agent","video_understanding"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"强化学习能否把视觉语言模型训练成更有效的决策智能体？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者将任务描述、语言思维链和文本动作接入强化学习，通过任务奖励优化视觉语言决策。","input_conditions":"摘要初读：作者将任务描述、语言思维链和文本动作接入强化学习，通过任务奖励优化视觉语言决策。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"推理由 VLM 承担，不属于视频生成模型本身涌现的推理证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.10292"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.10292"}],"note":"p228","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P227","title":"BEHAVIOR Vision Suite: Customizable Dataset Generation via Simulation","short":"BEHAVIOR Vision Suite","year":"2024","authors":"Yunhao Ge; Yihe Tang; Jiashu Xu; Cem Gokmen; Chengshu Li; Wensi Ai; Benjamin Jose Martinez; Arman Aydin; Mona Anvari; Ayush K Chakravarthy; Hong-Xing Yu; Josiah Wong; Sanjana Srivastava; Sharon Lee; Shengxin Zha; Laurent Itti; Yunzhu Li; Roberto Martín-Martín; Miao Liu; Pengchuan Zhang; Ruohan Zhang; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p227","scope":"本地 PDF · 摘要初读","summary":"BEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数，生成带定制标注的合成数据。","boundary":"可控仿真便于因子实验，但需另外检查仿真到真实的差别。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2405.09546_BEHAVIOR_Vision_Suite_Customizable_Dataset_Generation_via_Simulation.pdf"],"sha256":"317df78c127f63e4d1ca4825c9ca6b3a618230fa3385bda14c61aa63ac486393","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.09546"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P227","arxiv_id":"2405.09546","title":"BEHAVIOR Vision Suite: Customizable Dataset Generation via Simulation","year":"2024","authors":"Yunhao Ge; Yihe Tang; Jiashu Xu; Cem Gokmen; Chengshu Li; Wensi Ai; Benjamin Jose Martinez; Arman Aydin; Mona Anvari; Ayush K Chakravarthy; Hong-Xing Yu; Josiah Wong; Sanjana Srivastava; Sharon Lee; Shengxin Zha; Laurent Itti; Yunzhu Li; Roberto Martín-Martín; Miao Liu; Pengchuan Zhang; Ruohan Zhang; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["geometry","evaluation"],"rqs":["W2d","W4c"],"collected":true,"review_status":"abstract_review","question":"怎样生成可控制环境变量的视觉训练与评价数据？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"BEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数，生成带定制标注的合成数据。","input_conditions":"摘要初读：BEHAVIOR Vision Suite 支持改变场景、外观和物理相关参数，生成带定制标注的合成数据。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"可控仿真便于因子实验，但需另外检查仿真到真实的差别。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.09546"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.09546v1"}],"note":"p227","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P226","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","short":"Learn2Talk","year":"2024","authors":"Yixiang Zhuang; Baoping Cheng; Yao Cheng; Yuntao Jin; Renshuai Liu; Chengyang Li; Xuan Cheng; Jing Liao; Juncong Lin","collected":true,"note":"p226","scope":"本地 PDF · 摘要初读","summary":"Learn2Talk 从二维说话人方法获得唇音同步和教师监督，改进语音到三维面部运动的学习。","boundary":"研究特定人体动画子任务，泛化到手部操作或环境后果需要新证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2404.12888_Learn2Talk_3D_Talking_Face_Learns_from_2D_Talking_Face.pdf"],"sha256":"8be26b4b0abb2481bc95e01956112affc32af2ba0fce98363f5f927bcf2d94b5","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2404.12888"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P226","arxiv_id":"2404.12888","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","year":"2024","authors":"Yixiang Zhuang; Baoping Cheng; Yao Cheng; Yuntao Jin; Renshuai Liu; Chengyang Li; Xuan Cheng; Jing Liao; Juncong Lin","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["X1a","X4a"],"collected":true,"review_status":"abstract_review","question":"二维说话人模型怎样监督三维语音面部动画？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Learn2Talk 从二维说话人方法获得唇音同步和教师监督，改进语音到三维面部运动的学习。","input_conditions":"摘要初读：Learn2Talk 从二维说话人方法获得唇音同步和教师监督，改进语音到三维面部运动的学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"研究特定人体动画子任务，泛化到手部操作或环境后果需要新证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.12888"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.12888v1"}],"note":"p226","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P225","title":"AniClipart: Clipart Animation with Text-to-Video Priors","short":"AniClipart","year":"2024","authors":"Ronghuan Wu; Wanchao Su; Kede Ma; Jing Liao","collected":true,"note":"p225","scope":"本地 PDF · 摘要初读","summary":"AniClipart 用贝塞尔曲线参数化关键点轨迹，并结合视频分数蒸馏与骨架保持损失优化动画。","boundary":"轨迹优化以视频先验和骨架约束为依据，非物理仿真保证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2404.12347_AniClipart_Clipart_Animation_with_Text-to-Video_Priors.pdf"],"sha256":"8b5b637fe3ff58ab32105baf94d0362fb9cc4aedfbf3cd9a147c8ba392876cd8","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2404.12347"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P225","arxiv_id":"2404.12347","title":"AniClipart: Clipart Animation with Text-to-Video Priors","year":"2024","authors":"Ronghuan Wu; Wanchao Su; Kede Ma; Jing Liao","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"如何用视频扩散先验让静态剪贴画形成可控动画？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AniClipart 用贝塞尔曲线参数化关键点轨迹，并结合视频分数蒸馏与骨架保持损失优化动画。","input_conditions":"摘要初读：AniClipart 用贝塞尔曲线参数化关键点轨迹，并结合视频分数蒸馏与骨架保持损失优化动画。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"轨迹优化以视频先验和骨架约束为依据，非物理仿真保证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.12347"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.12347"}],"note":"p225","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P224","title":"EgoPet: Egomotion and Interaction Data from an Animal's Perspective","short":"EgoPet","year":"2024","authors":"Amir Bar; Arya Bakhtiar; Danny Tran; Antonio Loquercio; Jathushan Rajasegaran; Yann LeCun; Amir Globerson; Trevor Darrell","collected":true,"note":"p224","scope":"本地 PDF · 摘要初读","summary":"EgoPet 收集宠物运动与交互视频，设计动物行为任务并评估其对四足机器人预训练的帮助。","boundary":"数据迁移收益不表示人类教程或可控未来视频生成已解决。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2404.09991_EgoPet_Egomotion_and_Interaction_Data_from_an_Animal_s_Perspective.pdf"],"sha256":"8be645841806230228c292995eb6538540f9be6d228b916b37e53fefeeca59ca","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2404.09991"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P224","arxiv_id":"2404.09991","title":"EgoPet: Egomotion and Interaction Data from an Animal's Perspective","year":"2024","authors":"Amir Bar; Arya Bakhtiar; Danny Tran; Antonio Loquercio; Jathushan Rajasegaran; Yann LeCun; Amir Globerson; Trevor Darrell","teams":["yann-lecun"],"topics":["video_understanding","agent","evaluation"],"rqs":["X1b","W1c"],"collected":true,"review_status":"abstract_review","question":"动物第一视角数据能为运动和交互学习提供什么信号？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"EgoPet 收集宠物运动与交互视频，设计动物行为任务并评估其对四足机器人预训练的帮助。","input_conditions":"摘要初读：EgoPet 收集宠物运动与交互视频，设计动物行为任务并评估其对四足机器人预训练的帮助。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"数据迁移收益不表示人类教程或可控未来视频生成已解决。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.09991"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.09991v1"}],"note":"p224","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P223","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","short":"Revisiting Feature Prediction for Learning Visual Representations from Video","year":"2024","authors":"Adrien Bardes; Quentin Garrido; Jean Ponce; Xinlei Chen; Michael Rabbat; Yann LeCun; Mahmoud Assran; Nicolas Ballas","collected":true,"note":"p223","scope":"本地 PDF · 摘要初读","summary":"V-JEPA 从视频特征预测学习表征，以冻结骨干评估运动、外观和图像任务。","boundary":"下游理解准确率不是动作条件后果预测或视频生成的直接验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2404.08471_Revisiting_Feature_Prediction_for_Learning_Visual_Representations_from_Video.pdf"],"sha256":"fb84f79be128e7425263e8674fbc3f2ec991575c4b5880556cfb8f5fa9fd91ba","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2404.08471"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P223","arxiv_id":"2404.08471","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","year":"2024","authors":"Adrien Bardes; Quentin Garrido; Jean Ponce; Xinlei Chen; Michael Rabbat; Yann LeCun; Mahmoud Assran; Nicolas Ballas","teams":["yann-lecun"],"topics":["video_understanding","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"不重建像素，仅预测视频特征能否获得通用视觉表示？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"V-JEPA 从视频特征预测学习表征，以冻结骨干评估运动、外观和图像任务。","input_conditions":"摘要初读：V-JEPA 从视频特征预测学习表征，以冻结骨干评估运动、外观和图像任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"下游理解准确率不是动作条件后果预测或视频生成的直接验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.08471"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.08471v1"}],"note":"p223","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P222","title":"RaFE: Generative Radiance Fields Restoration","short":"RaFE","year":"2024","authors":"Zhongkai Wu; Ziyu Wan; Jing Zhang; Jing Liao; Dong Xu","collected":true,"note":"p222","scope":"本地 PDF · 摘要初读","summary":"RaFE 先修复多视图图像，再通过生成式辐射场处理各视角修复结果的不一致。","boundary":"针对场景恢复与新视角合成，不检验动作条件的未来演化。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2404.03654_RaFE_Generative_Radiance_Fields_Restoration.pdf"],"sha256":"440576c5ed9357fa89873e256a1aaee962ad8be50cd6630a651c3065030cbda4","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2404.03654"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P222","arxiv_id":"2404.03654","title":"RaFE: Generative Radiance Fields Restoration","year":"2024","authors":"Zhongkai Wu; Ziyu Wan; Jing Zhang; Jing Liao; Dong Xu","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何利用二维生成先验修复不同退化类型的辐射场？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RaFE 先修复多视图图像，再通过生成式辐射场处理各视角修复结果的不一致。","input_conditions":"摘要初读：RaFE 先修复多视图图像，再通过生成式辐射场处理各视角修复结果的不一致。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"针对场景恢复与新视角合成，不检验动作条件的未来演化。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2404.03654"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2404.03654"}],"note":"p222","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P221","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","short":"BEHAVIOR-1K","year":"2024","authors":"Chengshu Li; Ruohan Zhang; Josiah Wong; Cem Gokmen; Sanjana Srivastava; Roberto Martín-Martín; Chen Wang; Gabrael Levine; Wensi Ai; Benjamin Martinez; Hang Yin; Michael Lingelbach; Minjune Hwang; Ayano Hiranaka; Sujay Garlanka; Arman Aydin; Sharon Lee; Jiankai Sun; Mona Anvari; Manasi Sharma; Dhruva Bansal; Samuel Hunter; Kyu-Young Kim; Alan Lou; Caleb R Matthews; Ivan Villa-Renteria; Jerry Huayang Tang; Claire Tang; Fei Xia; Yunzhu Li; Silvio Savarese; Hyowon Gweon; C. Karen Liu; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p221","scope":"本地 PDF · 摘要初读","summary":"BEHAVIOR-1K 提供大量人本活动与交互仿真，测试复杂操作及迁移。","boundary":"模拟任务成功与生成视频对人类探索的价值仍是不同结果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2403.09227_BEHAVIOR-1K_A_Human-Centered_Embodied_AI_Benchmark_with_1_000_Everyday_Activities_and_Realistic_Simulation.pdf"],"sha256":"ab4033f3e8a8187ad2cfdf11f1979d33996ecce1e81fa3d62af33a92bbb17a2b","pages":43,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2403.09227"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P221","arxiv_id":"2403.09227","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","year":"2024","authors":"Chengshu Li; Ruohan Zhang; Josiah Wong; Cem Gokmen; Sanjana Srivastava; Roberto Martín-Martín; Chen Wang; Gabrael Levine; Wensi Ai; Benjamin Martinez; Hang Yin; Michael Lingelbach; Minjune Hwang; Ayano Hiranaka; Sujay Garlanka; Arman Aydin; Sharon Lee; Jiankai Sun; Mona Anvari; Manasi Sharma; Dhruva Bansal; Samuel Hunter; Kyu-Young Kim; Alan Lou; Caleb R Matthews; Ivan Villa-Renteria; Jerry Huayang Tang; Claire Tang; Fei Xia; Yunzhu Li; Silvio Savarese; Hyowon Gweon; C. Karen Liu; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["physics","agent","evaluation"],"rqs":["X3c","W1c"],"collected":true,"review_status":"abstract_review","question":"贴近日常需要的长程家庭任务怎样被模拟并评价？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"BEHAVIOR-1K 提供大量人本活动与交互仿真，测试复杂操作及迁移。","input_conditions":"摘要初读：BEHAVIOR-1K 提供大量人本活动与交互仿真，测试复杂操作及迁移。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"模拟任务成功与生成视频对人类探索的价值仍是不同结果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2403.09227"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2403.09227v1"}],"note":"p221","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P240","title":"Learning Video Context as Interleaved Multimodal Sequences","short":"Learning Video Context as Interleaved Multimodal Sequences","year":"2024","authors":"Kevin Qinghong Lin; Pengchuan Zhang; Difei Gao; Xide Xia; Joya Chen; Ziteng Gao; Jinheng Xie; Xuhong Xiao; Mike Zheng Shou","collected":true,"note":"p240","scope":"本地 PDF · 摘要初读","summary":"MovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。","boundary":"外部人物信息与字幕改变输入条件；不是仅凭视频生成器完成推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2407.21757_Learning_Video_Context_as_Interleaved_Multimodal_Sequences.pdf"],"sha256":"01871b1b7ab1f4b8f1cb8a97ec2540b7f38d3f1c1672719866a7f0a0fbac5967","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2407.21757"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P240","arxiv_id":"2407.21757","title":"Learning Video Context as Interleaved Multimodal Sequences","year":"2024","authors":"Kevin Qinghong Lin; Pengchuan Zhang; Difei Gao; Xide Xia; Joya Chen; Ziteng Gao; Jinheng Xie; Xuhong Xiao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_understanding"],"rqs":["W3a","W4b"],"collected":true,"review_status":"abstract_review","question":"长视频上下文如何与角色、字幕和外部知识一起组织？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。","input_conditions":"摘要初读：MovieSeq 用交错多模态序列与指令微调连接画面、人物、情节和字幕。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"外部人物信息与字幕改变输入条件；不是仅凭视频生成器完成推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2407.21757"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2407.21757"}],"note":"p240","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P239","title":"Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLM","short":"Chat2Layout","year":"2024","authors":"Can Wang; Hongliang Zhong; Menglei Chai; Mingming He; Dongdong Chen; Jing Liao","collected":true,"note":"p239","scope":"本地 PDF · 摘要初读","summary":"Chat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM，利用反馈改善交互式家具布局，摘要声明无需修改模型权重。","boundary":"推理与布局决策位于外部 MLLM；应另查真实用户负担和布局约束的评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2407.21333_Chat2Layout_Interactive_3D_Furniture_Layout_with_a_Multimodal_LLM.pdf"],"sha256":"f786bcb836fb3c498f76d1c9e0ba15aa106c04d94f08639e5fb1a0ed5029208d","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2407.21333"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P239","arxiv_id":"2407.21333","title":"Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLM","year":"2024","authors":"Can Wang; Hongliang Zhong; Menglei Chai; Mingming He; Dongdong Chen; Jing Liao","teams":["jing-liao"],"topics":["geometry","agent","hci"],"rqs":["X4a","X3b"],"collected":true,"review_status":"abstract_review","question":"用户如何通过多模态对话迭代修改三维家具布局？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Chat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM，利用反馈改善交互式家具布局，摘要声明无需修改模型权重。","input_conditions":"摘要初读：Chat2Layout 通过视觉文本提示和参考示例搜索引导 MLLM，利用反馈改善交互式家具布局，摘要声明无需修改模型权重。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"推理与布局决策位于外部 MLLM；应另查真实用户负担和布局约束的评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2407.21333"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2407.21333v1"}],"note":"p239","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P238","title":"OccFusion: Rendering Occluded Humans with Generative Diffusion Priors","short":"OccFusion","year":"2024","authors":"Adam Sun; Tiange Xiang; Scott Delp; Li Fei-Fei; Ehsan Adeli","collected":true,"note":"p238","scope":"本地 PDF · 摘要初读","summary":"OccFusion 将三维 Gaussian 表示与二维扩散监督结合，改善遮挡条件的人体重建。","boundary":"生成补全部分未必是真实观测，不能直接用于物理后果真值。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2407.00316_OccFusion_Rendering_Occluded_Humans_with_Generative_Diffusion_Priors.pdf"],"sha256":"b85f0bd2401222a83d6851caa71d85f1c93be473af0e22eb1a6691dbb3e6ffe4","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2407.00316"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P238","arxiv_id":"2407.00316","title":"OccFusion: Rendering Occluded Humans with Generative Diffusion Priors","year":"2024","authors":"Adam Sun; Tiange Xiang; Scott Delp; Li Fei-Fei; Ehsan Adeli","teams":["fei-fei-li"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"遮挡人体的自由视角渲染怎样利用扩散先验补全？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"OccFusion 将三维 Gaussian 表示与二维扩散监督结合，改善遮挡条件的人体重建。","input_conditions":"摘要初读：OccFusion 将三维 Gaussian 表示与二维扩散监督结合，改善遮挡条件的人体重建。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"生成补全部分未必是真实观测，不能直接用于物理后果真值。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2407.00316"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2407.00316v1"}],"note":"p238","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P237","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","short":"Cambrian-1","year":"2024","authors":"Shengbang Tong; Ellis Brown; Penghao Wu; Sanghyun Woo; Manoj Middepogu; Sai Charitha Akula; Jihan Yang; Shusheng Yang; Adithya Iyer; Xichen Pan; Ziteng Wang; Rob Fergus; Yann LeCun; Saining Xie","collected":true,"note":"p237","scope":"本地 PDF · 摘要初读","summary":"Cambrian-1 系统比较视觉编码器，引入 CV-Bench 与空间视觉聚合器，研究视觉中心的多模态学习。","boundary":"视觉问答和图像空间任务不等同于视频动态推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2406.16860_Cambrian-1_A_Fully_Open_Vision-Centric_Exploration_of_Multimodal_LLMs.pdf"],"sha256":"c0ad715235f0c57a04fdb5d39cc8a4be27281cd46586601caa0f074c334f4264","pages":51,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2406.16860"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P237","arxiv_id":"2406.16860","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","year":"2024","authors":"Shengbang Tong; Ellis Brown; Penghao Wu; Sanghyun Woo; Manoj Middepogu; Sai Charitha Akula; Jihan Yang; Shusheng Yang; Adithya Iyer; Xichen Pan; Ziteng Wang; Rob Fergus; Yann LeCun; Saining Xie","teams":["yann-lecun"],"topics":["video_understanding","evaluation"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"视觉编码和连接器如何影响多模态模型的视觉依据？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Cambrian-1 系统比较视觉编码器，引入 CV-Bench 与空间视觉聚合器，研究视觉中心的多模态学习。","input_conditions":"摘要初读：Cambrian-1 系统比较视觉编码器，引入 CV-Bench 与空间视觉聚合器，研究视觉中心的多模态学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视觉问答和图像空间任务不等同于视频动态推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2406.16860"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2406.16860v2"}],"note":"p237","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P236","title":"Autoregressive Image Generation without Vector Quantization","short":"Autoregressive Image Generation without Vector Quantization","year":"2024","authors":"Tianhong Li; Yonglong Tian; He Li; Mingyang Deng; Kaiming He","collected":true,"note":"p236","scope":"本地 PDF · 摘要初读","summary":"通过扩散过程建模连续 token 的条件分布，将 Diffusion Loss 与自回归或掩码自回归架构结合。","boundary":"图像生成的连续表示基础可以提供方法参照，但未直接验证视频机制执行。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2406.11838_Autoregressive_Image_Generation_without_Vector_Quantization.pdf"],"sha256":"a8be10e56ed49f798d155795bc6090d8aa954ed1f6ce43f75e348d451ab7925a","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2406.11838"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P236","arxiv_id":"2406.11838","title":"Autoregressive Image Generation without Vector Quantization","year":"2024","authors":"Tianhong Li; Yonglong Tian; He Li; Mingyang Deng; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"自回归生成是否一定需要离散量化 token？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"通过扩散过程建模连续 token 的条件分布，将 Diffusion Loss 与自回归或掩码自回归架构结合。","input_conditions":"摘要初读：通过扩散过程建模连续 token 的条件分布，将 Diffusion Loss 与自回归或掩码自回归架构结合。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"图像生成的连续表示基础可以提供方法参照，但未直接验证视频机制执行。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2406.11838"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2406.11838v3"}],"note":"p236","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P235","title":"VideoLLM-online: Online Video Large Language Model for Streaming Video","short":"VideoLLM-online","year":"2024","authors":"Joya Chen; Zhaoyang Lv; Shiwei Wu; Kevin Qinghong Lin; Chenan Song; Difei Gao; Jia-Wei Liu; Ziteng Gao; Dongxing Mao; Mike Zheng Shou","collected":true,"note":"p235","scope":"本地 PDF · 摘要初读","summary":"VideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。","boundary":"在线响应与预测尚未发生的后果是不同能力。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2406.11816_VideoLLM-online_Online_Video_Large_Language_Model_for_Streaming_Video.pdf"],"sha256":"d3076aef869cc468c15f606a554b2908daf873e9793bc9799f4a5eeb7ca471dd","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2406.11816"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P235","arxiv_id":"2406.11816","title":"VideoLLM-online: Online Video Large Language Model for Streaming Video","year":"2024","authors":"Joya Chen; Zhaoyang Lv; Shiwei Wu; Kevin Qinghong Lin; Chenan Song; Difei Gao; Jia-Wei Liu; Ziteng Gao; Dongxing Mao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_understanding","efficiency"],"rqs":["W4b","X1b"],"collected":true,"review_status":"abstract_review","question":"模型怎样在连续视频流中及时回答和描述？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。","input_conditions":"摘要初读：VideoLLM-online 以 LIVE 目标、流式数据构造和推理优化支持时间对齐对话。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"在线响应与预测尚未发生的后果是不同能力。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2406.11816"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2406.11816v1"}],"note":"p235","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P234","title":"VideoGUI: A Benchmark for GUI Automation from Instructional Videos","short":"VideoGUI","year":"2024","authors":"Kevin Qinghong Lin; Linjie Li; Difei Gao; Qinchen WU; Mingyi Yan; Zhengyuan Yang; Lijuan Wang; Mike Zheng Shou","collected":true,"note":"p234","scope":"本地 PDF · 摘要初读","summary":"VideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。","boundary":"主要是 GUI 示范理解，不能直接评估物理 AR 教程效果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2406.10227_VideoGUI_A_Benchmark_for_GUI_Automation_from_Instructional_Videos.pdf"],"sha256":"de827d04512c3f4dd97b76c92e90675be8d5694f6a5a97c8c4f7bc9343da8355","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2406.10227"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P234","arxiv_id":"2406.10227","title":"VideoGUI: A Benchmark for GUI Automation from Instructional Videos","year":"2024","authors":"Kevin Qinghong Lin; Linjie Li; Difei Gao; Qinchen WU; Mingyi Yan; Zhengyuan Yang; Lijuan Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci","evaluation"],"rqs":["X1b","X3c"],"collected":true,"review_status":"abstract_review","question":"agent 能否从教学视频中重建并执行软件步骤？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。","input_conditions":"摘要初读：VideoGUI 以视频目标评估高层程序规划、中层动作叙述与原子执行。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要是 GUI 示范理解，不能直接评估物理 AR 教程效果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2406.10227"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2406.10227"}],"note":"p234","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P233","title":"Physically Compatible 3D Object Modeling from a Single Image","short":"Physically Compatible 3D Object Modeling from a Single Image","year":"2024","authors":"Minghao Guo; Bohan Wang; Pingchuan Ma; Tianyuan Zhang; Crystal Elaine Owens; Chuang Gan; Joshua B. Tenenbaum; Kaiming He; Wojciech Matusik","collected":true,"note":"p233","scope":"本地 PDF · 摘要初读","summary":"把静态平衡作为约束，将物理属性分解并连接到三维重建优化中，使模型更适合仿真和制造。","boundary":"单图中的物理属性可能不唯一；静态相容性需要与真实参数识别和长期动态准确性区分。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2405.20510_Physically_Compatible_3D_Object_Modeling_from_a_Single_Image.pdf"],"sha256":"3046b361c4e4ec64a88dae07509a6c66a35ec6df85c602968e7a05104c5633cf","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.20510"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2c","role":"support"}],"annotation":{"id":"P233","arxiv_id":"2405.20510","title":"Physically Compatible 3D Object Modeling from a Single Image","year":"2024","authors":"Minghao Guo; Bohan Wang; Pingchuan Ma; Tianyuan Zhang; Crystal Elaine Owens; Chuang Gan; Joshua B. Tenenbaum; Kaiming He; Wojciech Matusik","teams":["kaiming-he"],"topics":["geometry","physics"],"rqs":["W1c","W2c"],"collected":true,"review_status":"abstract_review","question":"单图重建怎样同时考虑形状、物理属性与外力的相容性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"把静态平衡作为约束，将物理属性分解并连接到三维重建优化中，使模型更适合仿真和制造。","input_conditions":"摘要初读：把静态平衡作为约束，将物理属性分解并连接到三维重建优化中，使模型更适合仿真和制造。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"单图中的物理属性可能不唯一；静态相容性需要与真实参数识别和长期动态准确性区分。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.20510"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.20510"}],"note":"p233","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P232","title":"TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric Meshes","short":"TetSphere Splatting","year":"2024","authors":"Minghao Guo; Bohan Wang; Kaiming He; Wojciech Matusik","collected":true,"note":"p232","scope":"本地 PDF · 摘要初读","summary":"TetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格，评价单视图和多视图重建。","boundary":"几何表示适合后续物理应用，不表示论文已经学习完整动力学。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2405.20283_TetSphere_Splatting_Representing_High-Quality_Geometry_with_Lagrangian_Volumetric_Meshes.pdf"],"sha256":"f9a1657b722bb2a208634977e7d34d77a16db3700f6ad9a2064a3f4cf368a9f9","pages":25,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.20283"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P232","arxiv_id":"2405.20283","title":"TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric Meshes","year":"2024","authors":"Minghao Guo; Bohan Wang; Kaiming He; Wojciech Matusik","teams":["kaiming-he"],"topics":["geometry","physics"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"拉格朗日体网格表示怎样提高三维形状质量和可用性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"TetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格，评价单视图和多视图重建。","input_conditions":"摘要初读：TetSphere Splatting 通过四面体球的变形及几何正则构造高质量体网格，评价单视图和多视图重建。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"几何表示适合后续物理应用，不表示论文已经学习完整动力学。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.20283"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.20283v4"}],"note":"p232","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P231","title":"Hierarchical World Models as Visual Whole-Body Humanoid Controllers","short":"Hierarchical World Models as Visual Whole-Body Humanoid Controllers","year":"2024","authors":"Nicklas Hansen; Jyothir S; Vlad Sobal; Yann LeCun; Xiaolong Wang; Hao Su","collected":true,"note":"p231","scope":"本地 PDF · 摘要初读","summary":"作者让高层视觉策略产生指令、低层控制器执行，并以奖励联合训练模拟人形机器人的多个任务。","boundary":"依赖模拟环境和奖励；动作偏好与物理控制不能替代像素生成评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2405.18418_Hierarchical_World_Models_as_Visual_Whole-Body_Humanoid_Controllers.pdf"],"sha256":"546d2bf73c4594a627685600bb9058ac9bd5426b917bbfbfb4cc0beac646f36f","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2405.18418"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P231","arxiv_id":"2405.18418","title":"Hierarchical World Models as Visual Whole-Body Humanoid Controllers","year":"2024","authors":"Nicklas Hansen; Jyothir S; Vlad Sobal; Yann LeCun; Xiaolong Wang; Hao Su","teams":["yann-lecun"],"topics":["world_model","agent","physics"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"分层世界模型能否从视觉输入学习复杂全身控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者让高层视觉策略产生指令、低层控制器执行，并以奖励联合训练模拟人形机器人的多个任务。","input_conditions":"摘要初读：作者让高层视觉策略产生指令、低层控制器执行，并以奖励联合训练模拟人形机器人的多个任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"依赖模拟环境和奖励；动作偏好与物理控制不能替代像素生成评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.18418"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.18418v3"}],"note":"p231","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P250","title":"Automated Creation of Digital Cousins for Robust Policy Learning","short":"Automated Creation of Digital Cousins for Robust Policy Learning","year":"2024","authors":"Tianyuan Dai; Josiah Wong; Yunfan Jiang; Chen Wang; Cem Gokmen; Ruohan Zhang; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p250","scope":"本地 PDF · 摘要初读","summary":"Digital Cousins 自动生成保留几何与语义可供性的相近场景，组成 real-to-sim-to-real 训练。","boundary":"可供性保持与精确物理孪生不同，不能据此验证某个具体反事实后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2410.07408_Automated_Creation_of_Digital_Cousins_for_Robust_Policy_Learning.pdf"],"sha256":"ba42fcdafd3acf588600bc2ddbe26c7edd1e347adb201eb2d9443e30f30096a0","pages":32,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.07408"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P250","arxiv_id":"2410.07408","title":"Automated Creation of Digital Cousins for Robust Policy Learning","year":"2024","authors":"Tianyuan Dai; Josiah Wong; Yunfan Jiang; Chen Wang; Cem Gokmen; Ruohan Zhang; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["geometry","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"不精确复制真实场景的数字近似能否仍支持策略迁移？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Digital Cousins 自动生成保留几何与语义可供性的相近场景，组成 real-to-sim-to-real 训练。","input_conditions":"摘要初读：Digital Cousins 自动生成保留几何与语义可供性的相近场景，组成 real-to-sim-to-real 训练。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"可供性保持与精确物理孪生不同，不能据此验证某个具体反事实后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.07408"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.07408v3"}],"note":"p250","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P249","title":"Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making","short":"Embodied Agent Interface","year":"2024","authors":"Manling Li; Shiyu Zhao; Qineng Wang; Kangrui Wang; Yu Zhou; Sanjana Srivastava; Cem Gokmen; Tony Lee; Li Erran Li; Ruohan Zhang; Weiyu Liu; Percy Liang; Li Fei-Fei; Jiayuan Mao; Jiajun Wu","collected":true,"note":"p249","scope":"本地 PDF · 摘要初读","summary":"Embodied Agent Interface 形式化任务和模块接口，超越单一终局成功率分析。","boundary":"语言模块诊断与视频生成正确性需要分别评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2410.07166_Embodied_Agent_Interface_Benchmarking_LLMs_for_Embodied_Decision_Making.pdf"],"sha256":"d10c7fee3594c88ff9f6a061a68b64a380a82d36c6652f3b08c42179044e2a9f","pages":107,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.07166"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P249","arxiv_id":"2410.07166","title":"Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making","year":"2024","authors":"Manling Li; Shiyu Zhao; Qineng Wang; Kangrui Wang; Yu Zhou; Sanjana Srivastava; Cem Gokmen; Tony Lee; Li Erran Li; Ruohan Zhang; Weiyu Liu; Percy Liang; Li Fei-Fei; Jiayuan Mao; Jiajun Wu","teams":["fei-fei-li"],"topics":["agent","evaluation"],"rqs":["W1a","X3c"],"collected":true,"review_status":"abstract_review","question":"具身决策的不同语言模块怎样用统一输入输出定位错误？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Embodied Agent Interface 形式化任务和模块接口，超越单一终局成功率分析。","input_conditions":"摘要初读：Embodied Agent Interface 形式化任务和模块接口，超越单一终局成功率分析。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"语言模块诊断与视频生成正确性需要分别评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.07166"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.07166"}],"note":"p249","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P248","title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers","short":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers","year":"2024","authors":"Lirui Wang; Xinlei Chen; Jialiang Zhao; Kaiming He","collected":true,"note":"p248","scope":"本地 PDF · 摘要初读","summary":"HPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据，研究异构预训练的扩展规律。","boundary":"学习对象为控制策略表征，不是可独立检验所有动作后果的世界模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2409.20537_Scaling_Proprioceptive-Visual_Learning_with_Heterogeneous_Pre-trained_Transformers.pdf"],"sha256":"e4cee3f35f6d2bd03ecc1d114809794042f2aa17a2f48304b0d7a90c094e48ba","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2409.20537"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"}],"annotation":{"id":"P248","arxiv_id":"2409.20537","title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers","year":"2024","authors":"Lirui Wang; Xinlei Chen; Jialiang Zhao; Kaiming He","teams":["kaiming-he"],"topics":["agent","generative_foundation"],"rqs":["X1b"],"collected":true,"review_status":"abstract_review","question":"跨机器人、任务和传感器的预训练怎样共享策略表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据，研究异构预训练的扩展规律。","input_conditions":"摘要初读：HPT 用可共享 Transformer 主干连接不同本体的视觉和本体感知数据，研究异构预训练的扩展规律。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"学习对象为控制策略表征，不是可独立检验所有动作后果的世界模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2409.20537"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2409.20537v1"}],"note":"p248","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P247","title":"High Quality Human Image Animation using Regional Supervision and Motion Blur Condition","short":"High Quality Human Image Animation using Regional Supervision and Motion Blur Condition","year":"2024","authors":"Zhongcong Xu; Chaoyue Song; Guoxian Song; Jianfeng Zhang; Jun Hao Liew; Hongyi Xu; You Xie; Linjie Luo; Guosheng Lin; Jiashi Feng; Mike Zheng Shou","collected":true,"note":"p247","scope":"本地 PDF · 摘要初读","summary":"作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。","boundary":"局部外观真实度不能替代动作的物理可行性验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2409.19580_High_Quality_Human_Image_Animation_using_Regional_Supervision_and_Motion_Blur_Condition.pdf"],"sha256":"121b806aa34bc3e1ae96b925fd28d01342d3ccfe054ebfa6ce78db14e6c09c44","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2409.19580"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"}],"annotation":{"id":"P247","arxiv_id":"2409.19580","title":"High Quality Human Image Animation using Regional Supervision and Motion Blur Condition","year":"2024","authors":"Zhongcong Xu; Chaoyue Song; Guoxian Song; Jianfeng Zhang; Jun Hao Liew; Hongyi Xu; You Xie; Linjie Luo; Guosheng Lin; Jiashi Feng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W3b"],"collected":true,"review_status":"abstract_review","question":"人物动画怎样改善脸、手与运动模糊细节？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。","input_conditions":"摘要初读：作者增加关键区域监督、显式运动模糊条件和高分辨率训练策略。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"局部外观真实度不能替代动作的物理可行性验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2409.19580"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2409.19580v1"}],"note":"p247","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P246","title":"Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model","short":"Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model","year":"2024","authors":"Hongliang Zhong; Can Wang; Jingbo Zhang; Jing Liao","collected":true,"note":"p246","scope":"本地 PDF · 摘要初读","summary":"通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。","boundary":"对象插入和多视图一致性不直接验证插入后接触、碰撞等动态后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2409.16938_Generative_Object_Insertion_in_Gaussian_Splatting_with_a_Multi-View_Diffusion_Model.pdf"],"sha256":"874b2489740d5d336f997ac24b50863575b89cec07a7933fcb22af3e8cedd385","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2409.16938"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P246","arxiv_id":"2409.16938","title":"Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model","year":"2024","authors":"Hongliang Zhong; Can Wang; Jingbo Zhang; Jing Liao","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"如何把生成对象以多视图一致的方式插入 Gaussian 场景？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。","input_conditions":"摘要初读：通过多视图扩散先验实现 Gaussian Splatting 场景的生成式对象插入。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"对象插入和多视图一致性不直接验证插入后接触、碰撞等动态后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2409.16938"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2409.16938v2"}],"note":"p246","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P245","title":"LVCD: Reference-based Lineart Video Colorization with Diffusion Models","short":"LVCD","year":"2024","authors":"Zhitong Huang; Mohan Zhang; Jing Liao","collected":true,"note":"p245","scope":"本地 PDF · 摘要初读","summary":"LVCD 使用扩散模型和参考条件处理线稿视频上色，关注颜色与时序一致。","boundary":"目标是上色和身份保持；不是下一事件预测或物理机制推断。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2409.12960_LVCD_Reference-based_Lineart_Video_Colorization_with_Diffusion_Models.pdf"],"sha256":"63d2ad1434fc5b8971204292f14821abc8f75de11169bf253d27dd0394c3f641","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2409.12960"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P245","arxiv_id":"2409.12960","title":"LVCD: Reference-based Lineart Video Colorization with Diffusion Models","year":"2024","authors":"Zhitong Huang; Mohan Zhang; Jing Liao","teams":["jing-liao"],"topics":["video_gen"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"参考图引导的线稿视频上色如何保持长序列一致性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LVCD 使用扩散模型和参考条件处理线稿视频上色，关注颜色与时序一致。","input_conditions":"摘要初读：LVCD 使用扩散模型和参考条件处理线稿视频上色，关注颜色与时序一致。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"目标是上色和身份保持；不是下一事件预测或物理机制推断。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2409.12960"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2409.12960v1"}],"note":"p245","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P244","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","short":"ReKep","year":"2024","authors":"Wenlong Huang; Chen Wang; Yunzhu Li; Ruohan Zhang; Li Fei-Fei","collected":true,"note":"p244","scope":"本地 PDF · 摘要初读","summary":"ReKep 自动生成视觉关键点约束，并通过分层优化求解末端位姿序列。","boundary":"显式任务约束不等于环境动力学模型；关键点与感知是重要条件。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2409.01652_ReKep_Spatio-Temporal_Reasoning_of_Relational_Keypoint_Constraints_for_Robotic_Manipulation.pdf"],"sha256":"6820e718a66f3c52f27996d3ee2623260dd442eddeab2df098212eb6eb769334","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2409.01652"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P244","arxiv_id":"2409.01652","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","year":"2024","authors":"Wenlong Huang; Chen Wang; Yunzhu Li; Ruohan Zhang; Li Fei-Fei","teams":["fei-fei-li"],"topics":["geometry","agent"],"rqs":["W1a","X4a"],"collected":true,"review_status":"abstract_review","question":"关系关键点约束能否把自然语言转成实时操作计划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ReKep 自动生成视觉关键点约束，并通过分层优化求解末端位姿序列。","input_conditions":"摘要初读：ReKep 自动生成视觉关键点约束，并通过分层优化求解末端位姿序列。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"显式任务约束不等于环境动力学模型；关键点与感知是重要条件。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2409.01652"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2409.01652v2"}],"note":"p244","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P243","title":"VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation","short":"VideoLLM-MoD","year":"2024","authors":"Shiwei Wu; Joya Chen; Kevin Qinghong Lin; Qimeng Wang; Yan Gao; Qianli Xu; Tong Xu; Yao Hu; Enhong Chen; Mike Zheng Shou","collected":true,"note":"p243","scope":"本地 PDF · 摘要初读","summary":"VideoLLM-MoD 让部分视觉 token 跳过若干层，减少长视频处理计算。","boundary":"面向视频语言模型；不能直接推断视频扩散骨干有同样收益。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2408.16730_VideoLLM-MoD_Efficient_Video-Language_Streaming_with_Mixture-of-Depths_Vision_Computation.pdf"],"sha256":"6f2f515f032d0183f91cec7d6a9e6285c2a744a5ea3df4a683ff0a97bd684305","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2408.16730"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P243","arxiv_id":"2408.16730","title":"VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation","year":"2024","authors":"Shiwei Wu; Joya Chen; Kevin Qinghong Lin; Qimeng Wang; Yan Gao; Qianli Xu; Tong Xu; Yao Hu; Enhong Chen; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_understanding","efficiency"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"视频语言流式计算能否在保留视觉 token 的同时降成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VideoLLM-MoD 让部分视觉 token 跳过若干层，减少长视频处理计算。","input_conditions":"摘要初读：VideoLLM-MoD 让部分视觉 token 跳过若干层，减少长视频处理计算。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"面向视频语言模型；不能直接推断视频扩散骨干有同样收益。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2408.16730"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2408.16730"}],"note":"p243","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P242","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","short":"Show-o","year":"2024","authors":"Jinheng Xie; Weijia Mao; Zechen Bai; David Junhao Zhang; Weihao Wang; Kevin Qinghong Lin; Yuchao Gu; Zhijie Chen; Zhenheng Yang; Mike Zheng Shou","collected":true,"note":"p242","scope":"本地 PDF · 摘要初读","summary":"Show-o 在共享模型内结合文本建模与视觉生成，研究统一多模态能力。","boundary":"共享参数并不直接证明物理推理或干预预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2408.12528_Show-o_One_Single_Transformer_to_Unify_Multimodal_Understanding_and_Generation.pdf"],"sha256":"b4d94e69c904e408ee2597c9adad047a3f038be855690b6389375d4c7af9306c","pages":25,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2408.12528"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P242","arxiv_id":"2408.12528","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","year":"2024","authors":"Jinheng Xie; Weijia Mao; Zechen Bai; David Junhao Zhang; Weihao Wang; Kevin Qinghong Lin; Yuchao Gu; Zhijie Chen; Zhenheng Yang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"一个 Transformer 能否统一多模态理解和生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Show-o 在共享模型内结合文本建模与视觉生成，研究统一多模态能力。","input_conditions":"摘要初读：Show-o 在共享模型内结合文本建模与视觉生成，研究统一多模态能力。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"共享参数并不直接证明物理推理或干预预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2408.12528"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2408.12528"}],"note":"p242","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P241","title":"PooDLe: Pooled and dense self-supervised learning from naturalistic videos","short":"PooDLe","year":"2024","authors":"Alex N. Wang; Christopher Hoang; Yuwen Xiong; Yann LeCun; Mengye Ren","collected":true,"note":"p241","scope":"本地 PDF · 摘要初读","summary":"PooDLe 结合全局不变表征与光流变换下的稠密等变目标，评估驾驶和行走视频中的特征。","boundary":"表征学习提供基础，不直接预测动作后果或处理规则突变。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2408.11208_PooDLe_Pooled_and_dense_self-supervised_learning_from_naturalistic_videos.pdf"],"sha256":"88f837652f601a950c4b5d41efb7b426cbd3ad42e8e4baaa6c212bbd65687192","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2408.11208"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P241","arxiv_id":"2408.11208","title":"PooDLe: Pooled and dense self-supervised learning from naturalistic videos","year":"2024","authors":"Alex N. Wang; Christopher Hoang; Yuwen Xiong; Yann LeCun; Mengye Ren","teams":["yann-lecun"],"topics":["video_understanding"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何在自然视频中同时学习语义和空间对应？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PooDLe 结合全局不变表征与光流变换下的稠密等变目标，评估驾驶和行走视频中的特征。","input_conditions":"摘要初读：PooDLe 结合全局不变表征与光流变换下的稠密等变目标，评估驾驶和行走视频中的特征。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"表征学习提供基础，不直接预测动作后果或处理规则突变。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2408.11208"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2408.11208v3"}],"note":"p241","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P260","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","short":"ShowUI","year":"2024","authors":"Kevin Qinghong Lin; Linjie Li; Difei Gao; Zhengyuan Yang; Shiwei Wu; Zechen Bai; Weixian Lei; Lijuan Wang; Mike Zheng Shou","collected":true,"note":"p260","scope":"本地 PDF · 摘要初读","summary":"ShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。","boundary":"面向软件操作的动作模型，不是像素世界生成器。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2411.17465_ShowUI_One_Vision-Language-Action_Model_for_GUI_Visual_Agent.pdf"],"sha256":"8bc023be285e71dab992fb5aeffc2bcbcefe155a67b6ce5e6e7e3a3499bb5db5","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.17465"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P260","arxiv_id":"2411.17465","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","year":"2024","authors":"Kevin Qinghong Lin; Linjie Li; Difei Gao; Zhengyuan Yang; Shiwei Wu; Zechen Bai; Weixian Lei; Lijuan Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","efficiency"],"rqs":["X1b","X3c"],"collected":true,"review_status":"abstract_review","question":"轻量视觉语言动作模型怎样处理 GUI 状态和历史？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。","input_conditions":"摘要初读：ShowUI 结合界面引导 token 选择、交错状态动作流与高质量指令数据。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"面向软件操作的动作模型，不是像素世界生成器。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.17465"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.17465"}],"note":"p260","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P259","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","short":"MovieBench","year":"2024","authors":"Weijia Wu; Mingyu Liu; Zeyu Zhu; Xi Xia; Haoen Feng; Wen Wang; Kevin Qinghong Lin; Chunhua Shen; Mike Zheng Shou","collected":true,"note":"p259","scope":"本地 PDF · 摘要初读","summary":"MovieBench 以电影和镜头层级组织视频、角色、音频与描述。","boundary":"角色和故事连续性指标不足以验证动态物理机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2411.15262_MovieBench_A_Hierarchical_Movie_Level_Dataset_for_Long_Video_Generation.pdf"],"sha256":"262f73c56f748f0d0175e4d5e69efcd7ebbc7c07dd49f478cc79c521cedd438c","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.15262"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P259","arxiv_id":"2411.15262","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","year":"2024","authors":"Weijia Wu; Mingyu Liu; Zeyu Zhu; Xi Xia; Haoen Feng; Wen Wang; Kevin Qinghong Lin; Chunhua Shen; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","evaluation"],"rqs":["W3a","W3b"],"collected":true,"review_status":"abstract_review","question":"长视频训练和评价如何覆盖跨镜头角色与叙事？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MovieBench 以电影和镜头层级组织视频、角色、音频与描述。","input_conditions":"摘要初读：MovieBench 以电影和镜头层级组织视频、角色、音频与描述。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"角色和故事连续性指标不足以验证动态物理机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.15262"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.15262v2"}],"note":"p259","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P258","title":"ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning","short":"ReCapture","year":"2024","authors":"David Junhao Zhang; Roni Paiss; Shiran Zada; Nikhil Karnad; David E. Jacobs; Yael Pritch; Inbar Mosseri; Mike Zheng Shou; Neal Wadhwa; Nataniel Ruiz","collected":true,"note":"p258","scope":"本地 PDF · 摘要初读","summary":"ReCapture 先构造新视角的带噪锚定视频，再以掩码视频微调修复。","boundary":"保留的动态来自输入视频；不可见部分是生成假设而非新增观测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2411.05003_ReCapture_Generative_Video_Camera_Controls_for_User-Provided_Videos_using_Masked_Video_Fine-Tuning.pdf"],"sha256":"cc97f87aff76e2b97a80b5c2d6a58bdefe4dc59b54ac2a453d4b4a7b1fbd29d0","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.05003"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P258","arxiv_id":"2411.05003","title":"ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning","year":"2024","authors":"David Junhao Zhang; Roni Paiss; Shiran Zada; Nikhil Karnad; David E. Jacobs; Yael Pritch; Inbar Mosseri; Mike Zheng Shou; Neal Wadhwa; Nataniel Ruiz","teams":["mike-zheng-shou"],"topics":["video_gen","geometry"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"怎样为用户已有视频生成新的相机轨迹？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ReCapture 先构造新视角的带噪锚定视频，再以掩码视频微调修复。","input_conditions":"摘要初读：ReCapture 先构造新视角的带噪锚定视频，再以掩码视频微调修复。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"保留的动态来自输入视频；不可见部分是生成假设而非新增观测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.05003"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.05003v1"}],"note":"p258","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P257","title":"HourVideo: 1-Hour Video-Language Understanding","short":"HourVideo","year":"2024","authors":"Keshigeyan Chandrasegaran; Agrim Gupta; Lea M. Hadzic; Taran Kota; Jimming He; Cristóbal Eyzaguirre; Zane Durante; Manling Li; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p257","scope":"本地 PDF · 摘要初读","summary":"HourVideo 包含总结、回忆、追踪、推理和导航任务，提供长视频问答评价。","boundary":"问答中的预测或反事实标签不表示模型会生成可验证的未来像素。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2411.04998_HourVideo_1-Hour_Video-Language_Understanding.pdf"],"sha256":"61cf706fe65bf6ce03a23f90d203a76c2ea2fceee51cd52f7b68b67cacd023c0","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.04998"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P257","arxiv_id":"2411.04998","title":"HourVideo: 1-Hour Video-Language Understanding","year":"2024","authors":"Keshigeyan Chandrasegaran; Agrim Gupta; Lea M. Hadzic; Taran Kota; Jimming He; Cristóbal Eyzaguirre; Zane Durante; Manling Li; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["video_reasoning","evaluation"],"rqs":["W3a","W4b"],"collected":true,"review_status":"abstract_review","question":"一小时视频中的事件和空间信息怎样持续理解？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HourVideo 包含总结、回忆、追踪、推理和导航任务，提供长视频问答评价。","input_conditions":"摘要初读：HourVideo 包含总结、回忆、追踪、推理和导航任务，提供长视频问答评价。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"问答中的预测或反事实标签不表示模型会生成可验证的未来像素。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.04998"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.04998v1"}],"note":"p257","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P256","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","short":"DINO-WM","year":"2024","authors":"Gaoyue Zhou; Hengkai Pan; Yann LeCun; Lerrel Pinto","collected":true,"note":"p256","scope":"本地 PDF · 摘要初读","summary":"DINO-WM 在预训练视觉特征空间学习动力学，以目标条件搜索完成多类环境中的零样本规划。","boundary":"不重建像素世界；其规划优势不能直接转化为 Foresee 的视频观看质量。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2411.04983_DINO-WM_World_Models_on_Pre-trained_Visual_Features_enable_Zero-shot_Planning.pdf"],"sha256":"7683c366109c091a47b7ae8a3d6520131edd3db1a5aa594d74c7636d2f9745d6","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.04983"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P256","arxiv_id":"2411.04983","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","year":"2024","authors":"Gaoyue Zhou; Hengkai Pan; Yann LeCun; Lerrel Pinto","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"离线视觉轨迹能否支持不依赖专家策略的测试时规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DINO-WM 在预训练视觉特征空间学习动力学，以目标条件搜索完成多类环境中的零样本规划。","input_conditions":"摘要初读：DINO-WM 在预训练视觉特征空间学习动力学，以目标条件搜索完成多类环境中的零样本规划。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"不重建像素世界；其规划优势不能直接转化为 Foresee 的视频观看质量。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.04983"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.04983v2"}],"note":"p256","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P255","title":"Skinned Motion Retargeting with Dense Geometric Interaction Perception","short":"Skinned Motion Retargeting with Dense Geometric Interaction Perception","year":"2024","authors":"Zijie Ye; Jia-Wei Liu; Jia Jia; Shikun Sun; Mike Zheng Shou","collected":true,"note":"p255","scope":"本地 PDF · 摘要初读","summary":"MeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。","boundary":"几何交互保持与完整受力模拟不同，也不是未来视频预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2410.20986_Skinned_Motion_Retargeting_with_Dense_Geometric_Interaction_Perception.pdf"],"sha256":"cb37c559faae2f74a59f109291149d12bbeda8149e171b43fca9d3564033c172","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.20986"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P255","arxiv_id":"2410.20986","title":"Skinned Motion Retargeting with Dense Geometric Interaction Perception","year":"2024","authors":"Zijie Ye; Jia-Wei Liu; Jia Jia; Shikun Sun; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["geometry","physics"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"跨角色动作迁移怎样考虑身体几何接触？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。","input_conditions":"摘要初读：MeshRet 用语义传感点对应和稠密网格交互场建模动作重定向。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"几何交互保持与完整受力模拟不同，也不是未来视频预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.20986"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.20986"}],"note":"p255","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P254","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","short":"Fluid","year":"2024","authors":"Lijie Fan; Tianhong Li; Siyang Qin; Yuanzhen Li; Chen Sun; Michael Rubinstein; Deqing Sun; Kaiming He; Yonglong Tian","collected":true,"note":"p254","scope":"本地 PDF · 摘要初读","summary":"Fluid 对比离散或连续 token、固定或随机顺序，并采用连续 token 的随机顺序自回归生成。","boundary":"验证损失、生成指标与视觉质量可能呈现不同趋势，不能只靠损失判断应用能力。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2410.13863_Fluid_Scaling_Autoregressive_Text-to-image_Generative_Models_with_Continuous_Tokens.pdf"],"sha256":"b347a4f8187b30308730982f37206d9c68089201e7910ddfb9ee1ed6cbd1b93f","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.13863"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P254","arxiv_id":"2410.13863","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","year":"2024","authors":"Lijie Fan; Tianhong Li; Siyang Qin; Yuanzhen Li; Chen Sun; Michael Rubinstein; Deqing Sun; Kaiming He; Yonglong Tian","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"连续 token 与生成顺序怎样影响文本到图像模型的扩展？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Fluid 对比离散或连续 token、固定或随机顺序，并采用连续 token 的随机顺序自回归生成。","input_conditions":"摘要初读：Fluid 对比离散或连续 token、固定或随机顺序，并采用连续 token 的随机顺序自回归生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"验证损失、生成指标与视觉质量可能呈现不同趋势，不能只靠损失判断应用能力。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.13863"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.13863v1"}],"note":"p254","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P253","title":"SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing","short":"SGEdit","year":"2024","authors":"Zhiyuan Zhang; DongDong Chen; Jing Liao","collected":true,"note":"p253","scope":"本地 PDF · 摘要初读","summary":"SGEdit 将 LLM 与文本到图像模型通过场景图连接，支持结构化的对象及关系编辑。","boundary":"属于外部语言模型与生成器协作的编辑管线；具体关系约束和执行范围待正文核查。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2410.11815_SGEdit_Bridging_LLM_with_Text2Image_Generative_Model_for_Scene_Graph-based_Image_Editing.pdf"],"sha256":"93edb53517b804670145b519928498859899ccb5efef6e755888c85bbf76415b","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.11815"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"P253","arxiv_id":"2410.11815","title":"SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing","year":"2024","authors":"Zhiyuan Zhang; DongDong Chen; Jing Liao","teams":["jing-liao"],"topics":["geometry","agent","generative_foundation"],"rqs":["X4a","W3d"],"collected":true,"review_status":"abstract_review","question":"场景图怎样连接语言指令与可控图像编辑？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SGEdit 将 LLM 与文本到图像模型通过场景图连接，支持结构化的对象及关系编辑。","input_conditions":"摘要初读：SGEdit 将 LLM 与文本到图像模型通过场景图连接，支持结构化的对象及关系编辑。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"属于外部语言模型与生成器协作的编辑管线；具体关系约束和执行范围待正文核查。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.11815"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.11815v1"}],"note":"p253","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P252","title":"ControLRM: Fast and Controllable 3D Generation via Large Reconstruction Model","short":"ControLRM","year":"2024","authors":"Hongbin Xu; Weitao Chen; Zhipeng Zhou; Feng Xiao; Baigui Sun; Mike Zheng Shou; Wenxiong Kang","collected":true,"note":"p252","scope":"本地 PDF · 摘要初读","summary":"ControLRM 通过条件分支和图像分支联合训练，连接二维控制与三维表示。","boundary":"主要生成静态三维内容，尚不能直接证明四维动力学正确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2410.09592_ControLRM_Fast_and_Controllable_3D_Generation_via_Large_Reconstruction_Model.pdf"],"sha256":"5e54d96d119e4a31e08eaa4161a3a75e9a1a6d704e127fd55649d76f856550a8","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.09592"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P252","arxiv_id":"2410.09592","title":"ControLRM: Fast and Controllable 3D Generation via Large Reconstruction Model","year":"2024","authors":"Hongbin Xu; Weitao Chen; Zhipeng Zhou; Feng Xiao; Baigui Sun; Mike Zheng Shou; Wenxiong Kang","teams":["mike-zheng-shou"],"topics":["geometry","efficiency"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"大重建模型怎样实现快速且可控的三维生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ControLRM 通过条件分支和图像分支联合训练，连接二维控制与三维表示。","input_conditions":"摘要初读：ControLRM 通过条件分支和图像分支联合训练，连接二维控制与三维表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要生成静态三维内容，尚不能直接证明四维动力学正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.09592"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.09592"}],"note":"p252","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P251","title":"ARCap: Collecting High-quality Human Demonstrations for Robot Learning with Augmented Reality Feedback","short":"ARCap","year":"2024","authors":"Sirui Chen; Chen Wang; Kaden Nguyen; Li Fei-Fei; C. Karen Liu","collected":true,"note":"p251","scope":"本地 PDF · 摘要初读","summary":"ARCap 通过增强现实视觉反馈和触觉警告，帮助用户避免碰撞并匹配机器人运动学。","boundary":"与 AR tutorial 直接相邻，但目标是示范采集；不是多分支未来视频探索。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2410.08464_ARCap_Collecting_High-quality_Human_Demonstrations_for_Robot_Learning_with_Augmented_Reality_Feedback.pdf"],"sha256":"cf8e335b8a117330dcc438ae587553f5e3b933b3fc1ddb85e2854f07ed5dafe8","pages":8,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2410.08464"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X3b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P251","arxiv_id":"2410.08464","title":"ARCap: Collecting High-quality Human Demonstrations for Robot Learning with Augmented Reality Feedback","year":"2024","authors":"Sirui Chen; Chen Wang; Kaden Nguyen; Li Fei-Fei; C. Karen Liu","teams":["fei-fei-li"],"topics":["hci","agent","geometry"],"rqs":["X1a","X3b","X3c"],"collected":true,"review_status":"abstract_review","question":"AR 反馈能否帮助非专家采集机器人可执行的示范？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ARCap 通过增强现实视觉反馈和触觉警告，帮助用户避免碰撞并匹配机器人运动学。","input_conditions":"摘要初读：ARCap 通过增强现实视觉反馈和触觉警告，帮助用户避免碰撞并匹配机器人运动学。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"与 AR tutorial 直接相邻，但目标是示范采集；不是多分支未来视频探索。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2410.08464"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2410.08464"}],"note":"p251","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P270","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","short":"UniMoD","year":"2025","authors":"Weijia Mao; Zhenheng Yang; Mike Zheng Shou","collected":true,"note":"p270","scope":"本地 PDF · 摘要初读","summary":"UniMoD 用任务感知路由选择跳过计算的 token，比较训练成本和多模态任务表现。","boundary":"计算减少不自动等于视频生成延迟或显存同比减少。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2502.06474_UniMoD_Efficient_Unified_Multimodal_Transformers_with_Mixture-of-Depths.pdf"],"sha256":"08c9afeb14ec4b6b384bc7234b6681f3bff882af3bd290f9687cc1badb1e8b6c","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.06474"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P270","arxiv_id":"2502.06474","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","year":"2025","authors":"Weijia Mao; Zhenheng Yang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"统一多模态模型怎样按任务和层减少冗余 token 计算？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"UniMoD 用任务感知路由选择跳过计算的 token，比较训练成本和多模态任务表现。","input_conditions":"摘要初读：UniMoD 用任务感知路由选择跳过计算的 token，比较训练成本和多模态任务表现。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"计算减少不自动等于视频生成延迟或显存同比减少。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.06474"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.06474"}],"note":"p270","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P269","title":"MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation","short":"MakeAnything","year":"2025","authors":"Yiren Song; Cheng Liu; Mike Zheng Shou","collected":true,"note":"p269","scope":"本地 PDF · 摘要初读","summary":"MakeAnything 以多领域过程序列微调 DiT，并用非对称 LoRA 和时空约束生成或反推制作过程。","boundary":"合理制作序列未必是给定真实动作的可核验物理后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2502.01572_MakeAnything_Harnessing_Diffusion_Transformers_for_Multi-Domain_Procedural_Sequence_Generation.pdf"],"sha256":"ff5ab777ebb7db25ca8bf2eb2d358a488b28600f2bdc8361b5a4ccf0b4f5b07c","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.01572"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P269","arxiv_id":"2502.01572","title":"MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation","year":"2025","authors":"Yiren Song; Cheng Liu; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","hci"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"不同制作任务的中间步骤如何保持一致地生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MakeAnything 以多领域过程序列微调 DiT，并用非对称 LoRA 和时空约束生成或反推制作过程。","input_conditions":"摘要初读：MakeAnything 以多领域过程序列微调 DiT，并用非对称 LoRA 和时空约束生成或反推制作过程。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"合理制作序列未必是给定真实动作的可核验物理后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.01572"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.01572"}],"note":"p269","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P268","title":"TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation","short":"TalkingEyes","year":"2025","authors":"Yixiang Zhuang; Chunshan Ma; Yao Cheng; Xuan Cheng; Jing Liao; Juncong Lin","collected":true,"note":"p268","scope":"本地 PDF · 摘要初读","summary":"TalkingEyes 使用音频与三维运动配对数据，在分开的潜空间中生成头部和视线，并与面部动画整合。","boundary":"关注角色表现与语音运动协调，非动作干预下的环境后果模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2501.09921_TalkingEyes_Pluralistic_Speech-Driven_3D_Eye_Gaze_Animation.pdf"],"sha256":"d920bbb14308a0490173af5cef08a35d1d5cdcdb8488e8926a73fcce01924b47","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2501.09921"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P268","arxiv_id":"2501.09921","title":"TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation","year":"2025","authors":"Yixiang Zhuang; Chunshan Ma; Yao Cheng; Xuan Cheng; Jing Liao; Juncong Lin","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["X1a","X4a"],"collected":true,"review_status":"abstract_review","question":"语音如何驱动多样且协调的眼神和头部运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"TalkingEyes 使用音频与三维运动配对数据，在分开的潜空间中生成头部和视线，并与面部动画整合。","input_conditions":"摘要初读：TalkingEyes 使用音频与三维运动配对数据，在分开的潜空间中生成头部和视线，并与面部动画整合。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"关注角色表现与语音运动协调，非动作干预下的环境后果模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2501.09921"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2501.09921"}],"note":"p268","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P267","title":"Why Automate This? Exploring Correlations Between Desire for Robotic Automation, Invested Time and Well-Being","short":"Why Automate This? Exploring Correlations Between Desire for Robotic Automation, Invested Time and Well-Being","year":"2025","authors":"Ruchira Ray; Leona Pang; Sanjana Srivastava; Li Fei-Fei; Samantha Shorey; Roberto Martín-Martín","collected":true,"note":"p267","scope":"本地 PDF · 摘要初读","summary":"作者结合日常活动与福祉调查，分析自动化偏好和时间、情绪的关联。","boundary":"相关性研究不证明机器人介入的因果收益，可为选任务提供人本动机。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2501.06348_Why_Automate_This_Exploring_Correlations_Between_Desire_for_Robotic_Automation_Invested_Time_and_Well-Being.pdf"],"sha256":"d73535139d4f711a275d5c83bd0eda1a964d3aeb24c6409878abe585ec9a7681","pages":26,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2501.06348"}],"verified":"2026-09-19","mappings":[{"rq":"X2c","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P267","arxiv_id":"2501.06348","title":"Why Automate This? Exploring Correlations Between Desire for Robotic Automation, Invested Time and Well-Being","year":"2025","authors":"Ruchira Ray; Leona Pang; Sanjana Srivastava; Li Fei-Fei; Samantha Shorey; Roberto Martín-Martín","teams":["fei-fei-li"],"topics":["hci","agent"],"rqs":["X2c","X3c"],"collected":true,"review_status":"abstract_review","question":"人希望自动化什么活动，是否能用耗时直接预测？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者结合日常活动与福祉调查，分析自动化偏好和时间、情绪的关联。","input_conditions":"摘要初读：作者结合日常活动与福祉调查，分析自动化偏好和时间、情绪的关联。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"相关性研究不证明机器人介入的因果收益，可为选任务提供人本动机。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2501.06348"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2501.06348v4"}],"note":"p267","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P266","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","short":"Thinking in Space","year":"2024","authors":"Jihan Yang; Shusheng Yang; Anjali W. Gupta; Rilyn Han; Li Fei-Fei; Saining Xie","collected":true,"note":"p266","scope":"本地 PDF · 摘要初读","summary":"Thinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。","boundary":"空间问答表现不能等同于完整三维状态恢复或可控未来生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2412.14171_Thinking_in_Space_How_Multimodal_Large_Language_Models_See_Remember_and_Recall_Spaces.pdf"],"sha256":"5ee4d9c16392ccb64929b4aad437e0472c16b8e2b190de9a05e1c0b3e44335d6","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2412.14171"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P266","arxiv_id":"2412.14171","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","year":"2024","authors":"Jihan Yang; Shusheng Yang; Anjali W. Gupta; Rilyn Han; Li Fei-Fei; Saining Xie","teams":["fei-fei-li"],"topics":["video_reasoning","evaluation"],"rqs":["W3a","W4b"],"collected":true,"review_status":"abstract_review","question":"视频语言模型如何看见、记忆并回忆空间？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Thinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。","input_conditions":"摘要初读：Thinking in Space 构建 VSI-Bench 并用语言与视觉表达探查空间推理。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"空间问答表现不能等同于完整三维状态恢复或可控未来生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.14171"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.14171v2"}],"note":"p266","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P265","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","short":"MetaMorph","year":"2024","authors":"Shengbang Tong; David Fan; Jiachen Zhu; Yunyang Xiong; Xinlei Chen; Koustuv Sinha; Michael Rabbat; Yann LeCun; Saining Xie; Zhuang Liu","collected":true,"note":"p265","scope":"本地 PDF · 摘要初读","summary":"MetaMorph 在语言模型中加入视觉 token 预测，研究理解数据与生成能力的相互作用。","boundary":"以图像和多模态任务为主；不能直接当作视频世界推理的实验依据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2412.14164_MetaMorph_Multimodal_Understanding_and_Generation_via_Instruction_Tuning.pdf"],"sha256":"32db2000e915374c84bfea4411daffa12003618907a7640263e2c29e02a48500","pages":25,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2412.14164"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P265","arxiv_id":"2412.14164","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","year":"2024","authors":"Shengbang Tong; David Fan; Jiachen Zhu; Yunyang Xiong; Xinlei Chen; Koustuv Sinha; Michael Rabbat; Yann LeCun; Saining Xie; Zhuang Liu","teams":["yann-lecun"],"topics":["generative_foundation","video_understanding"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"视觉预测式指令微调能否统一理解与生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MetaMorph 在语言模型中加入视觉 token 预测，研究理解数据与生成能力的相互作用。","input_conditions":"摘要初读：MetaMorph 在语言模型中加入视觉 token 预测，研究理解数据与生成能力的相互作用。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"以图像和多模态任务为主；不能直接当作视频世界推理的实验依据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.14164"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.14164v1"}],"note":"p265","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P264","title":"Video Representation Learning with Joint-Embedding Predictive Architectures","short":"Video Representation Learning with Joint-Embedding Predictive Architectures","year":"2024","authors":"Katrina Drozdov; Ravid Shwartz-Ziv; Yann LeCun","collected":true,"note":"p264","scope":"本地 PDF · 摘要初读","summary":"VJ-VCR 以方差协方差正则学习视频表征，并探索潜变量对不确定未来的表达。","boundary":"多未来潜表示并不直接验证人可观看的视频分支或反事实因果正确性。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2412.10925_Video_Representation_Learning_with_Joint-Embedding_Predictive_Architectures.pdf"],"sha256":"eb7e4642dc0a8e6c7a6d162a550c58300de026ef7e86c9f197a76286f5e00767","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2412.10925"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P264","arxiv_id":"2412.10925","title":"Video Representation Learning with Joint-Embedding Predictive Architectures","year":"2024","authors":"Katrina Drozdov; Ravid Shwartz-Ziv; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","video_understanding"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何防止视频 JEPA 坍塌并表示多种可能未来？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VJ-VCR 以方差协方差正则学习视频表征，并探索潜变量对不确定未来的表达。","input_conditions":"摘要初读：VJ-VCR 以方差协方差正则学习视频表征，并探索潜变量对不确定未来的表达。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"多未来潜表示并不直接验证人可观看的视频分支或反事实因果正确性。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.10925"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.10925"}],"note":"p264","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P263","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","short":"The Language of Motion","year":"2024","authors":"Changan Chen; Juze Zhang; Shrinidhi K. Lakshmikanth; Yusu Fang; Ruizhi Shao; Gordon Wetzstein; Li Fei-Fei; Ehsan Adeli","collected":true,"note":"p263","scope":"本地 PDF · 摘要初读","summary":"The Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。","boundary":"动作表达生成不同于人物和物体接触的物理仿真。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2412.10523_The_Language_of_Motion_Unifying_Verbal_and_Non-verbal_Language_of_3D_Human_Motion.pdf"],"sha256":"b912628d29b0f191be9f09a5e254758aa7ec4f46284424f8044201e4f4c870b1","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2412.10523"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P263","arxiv_id":"2412.10523","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","year":"2024","authors":"Changan Chen; Juze Zhang; Shrinidhi K. Lakshmikanth; Yusu Fang; Ruizhi Shao; Gordon Wetzstein; Li Fei-Fei; Ehsan Adeli","teams":["fei-fei-li"],"topics":["geometry","agent","hci"],"rqs":["X1a","X4a"],"collected":true,"review_status":"abstract_review","question":"言语与三维非言语动作怎样统一理解和生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"The Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。","input_conditions":"摘要初读：The Language of Motion 用多模态语言模型连接语言、手势、情绪与动作编辑。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动作表达生成不同于人物和物体接触的物理仿真。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.10523"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.10523v1"}],"note":"p263","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P262","title":"Navigation World Models","short":"Navigation World Models","year":"2024","authors":"Amir Bar; Gaoyue Zhou; Danny Tran; Trevor Darrell; Yann LeCun","collected":true,"note":"p262","scope":"本地 PDF · 摘要初读","summary":"Navigation World Models 预测给定导航动作后的观察，再生成或排序抵达目标的候选轨迹。","boundary":"陌生环境生成与熟悉环境规划的条件不同；不能用视觉合理性代替到达成功率。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2412.03572_Navigation_World_Models.pdf"],"sha256":"33b6532143148b60d991f7cfc0c6ff2c168a54c8dcd285e4dbee5eec84c51a5e","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2412.03572"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P262","arxiv_id":"2412.03572","title":"Navigation World Models","year":"2024","authors":"Amir Bar; Gaoyue Zhou; Danny Tran; Trevor Darrell; Yann LeCun","teams":["yann-lecun"],"topics":["video_gen","world_model","agent"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"动作条件视频预测能否用于视觉导航规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Navigation World Models 预测给定导航动作后的观察，再生成或排序抵达目标的候选轨迹。","input_conditions":"摘要初读：Navigation World Models 预测给定导航动作后的观察，再生成或排序抵达目标的候选轨迹。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"陌生环境生成与熟悉环境规划的条件不同；不能用视觉合理性代替到达成功率。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.03572"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.03572v2"}],"note":"p262","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P261","title":"Distractor-free Generalizable 3D Gaussian Splatting","short":"Distractor-free Generalizable 3D Gaussian Splatting","year":"2024","authors":"Yanqi Bao; Jing Liao; Jing Huo; Yang Gao","collected":true,"note":"p261","scope":"本地 PDF · 摘要初读","summary":"DGGS 在训练中预测并修整干扰掩码，在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。","boundary":"新视角重建的抗干扰性能不等于长期动态状态记忆。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2411.17605_Distractor-free_Generalizable_3D_Gaussian_Splatting.pdf"],"sha256":"4620e20ddaf179120dc987f9f102e82b4f2366859ed40d9fdba1f31891bd0ac6","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2411.17605"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"}],"annotation":{"id":"P261","arxiv_id":"2411.17605","title":"Distractor-free Generalizable 3D Gaussian Splatting","year":"2024","authors":"Yanqi Bao; Jing Liao; Jing Huo; Yang Gao","teams":["jing-liao"],"topics":["geometry"],"rqs":["W3a"],"collected":true,"review_status":"abstract_review","question":"带有动态干扰的多视图输入如何支持泛化三维重建？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DGGS 在训练中预测并修整干扰掩码，在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。","input_conditions":"摘要初读：DGGS 在训练中预测并修整干扰掩码，在推理中重选参考图像并裁剪受干扰的 Gaussian 表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"新视角重建的抗干扰性能不等于长期动态状态记忆。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2411.17605"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2411.17605"}],"note":"p261","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P280","title":"BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities","short":"BEHAVIOR Robot Suite","year":"2025","authors":"Yunfan Jiang; Ruohan Zhang; Josiah Wong; Chen Wang; Yanjie Ze; Hang Yin; Cem Gokmen; Shuran Song; Jiajun Wu; Li Fei-Fei","collected":true,"note":"p280","scope":"本地 PDF · 摘要初读","summary":"BEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案，覆盖多种困难家庭活动。","boundary":"是具身执行基础设施；人机协作与视频预览收益需独立评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2503.05652_BEHAVIOR_Robot_Suite_Streamlining_Real-World_Whole-Body_Manipulation_for_Everyday_Household_Activities.pdf"],"sha256":"828e65325dc70850f10e52c39abd0676e3432dd73c90e4fcfaa80151b729fe4f","pages":36,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.05652"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P280","arxiv_id":"2503.05652","title":"BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities","year":"2025","authors":"Yunfan Jiang; Ruohan Zhang; Josiah Wong; Chen Wang; Yanjie Ze; Hang Yin; Cem Gokmen; Shuran Song; Jiajun Wu; Li Fei-Fei","teams":["fei-fei-li"],"topics":["agent","hci"],"rqs":["X1b","X3c"],"collected":true,"review_status":"abstract_review","question":"家庭任务的全身机器人学习怎样整合本体、采集和训练？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"BEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案，覆盖多种困难家庭活动。","input_conditions":"摘要初读：BEHAVIOR Robot Suite 提供机器人系统、示范接口和学习方案，覆盖多种困难家庭活动。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"是具身执行基础设施；人机协作与视频预览收益需独立评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.05652"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.05652v2"}],"note":"p280","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P279","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","short":"DoraCycle","year":"2025","authors":"Rui Zhao; Weijia Mao; Mike Zheng Shou","collected":true,"note":"p279","scope":"本地 PDF · 摘要初读","summary":"DoraCycle 通过图文双向循环利用单模态数据进行领域适配。","boundary":"主要适用于不依赖精确配对知识的任务；视频动力学需要额外条件。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2503.03651_DoraCycle_Domain-Oriented_Adaptation_of_Unified_Generative_Model_in_Multimodal_Cycles.pdf"],"sha256":"3fc8dbf9a85a9f829c36b4ca257e71855370b7e368256254f79412e28397b83a","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.03651"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P279","arxiv_id":"2503.03651","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","year":"2025","authors":"Rui Zhao; Weijia Mao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"没有配对图文时如何把统一模型适配到新风格领域？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DoraCycle 通过图文双向循环利用单模态数据进行领域适配。","input_conditions":"摘要初读：DoraCycle 通过图文双向循环利用单模态数据进行领域适配。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要适用于不依赖精确配对知识的任务；视频动力学需要额外条件。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.03651"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.03651"}],"note":"p279","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P278","title":"Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models","short":"Difix3D+","year":"2025","authors":"Jay Zhangjie Wu; Yuxuan Zhang; Haithem Turki; Xuanchi Ren; Jun Gao; Mike Zheng Shou; Sanja Fidler; Zan Gojcic; Huan Ling","collected":true,"note":"p278","scope":"本地 PDF · 摘要初读","summary":"Difix3D+ 用单步图像扩散修复渲染结果，并将修复信号反馈到三维表示。","boundary":"新视角补全并不证明补出的隐藏几何是真实测量结果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2503.01774_Difix3D_Improving_3D_Reconstructions_with_Single-Step_Diffusion_Models.pdf"],"sha256":"aeb3665d5f65e8c66f38f325c0d2cceb9c8fe3726ed8757632b660075f6a8ac8","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.01774"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P278","arxiv_id":"2503.01774","title":"Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models","year":"2025","authors":"Jay Zhangjie Wu; Yuxuan Zhang; Haithem Turki; Xuanchi Ren; Jun Gao; Mike Zheng Shou; Sanja Fidler; Zan Gojcic; Huan Ling","teams":["mike-zheng-shou"],"topics":["geometry","generative_foundation","efficiency"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"少步扩散怎样修复三维重建的新视角伪影？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Difix3D+ 用单步图像扩散修复渲染结果，并将修复信号反馈到三维表示。","input_conditions":"摘要初读：Difix3D+ 用单步图像扩散修复渲染结果，并将修复信号反馈到三维表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"新视角补全并不证明补出的隐藏几何是真实测量结果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.01774"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.01774"}],"note":"p278","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P277","title":"Fractal Generative Models","short":"Fractal Generative Models","year":"2025","authors":"Tianhong Li; Qinyi Sun; Lijie Fan; Kaiming He","collected":true,"note":"p277","scope":"本地 PDF · 摘要初读","summary":"Fractal Generative Models 通过递归调用生成模块形成自相似结构，并以逐像素自回归图像生成进行验证。","boundary":"模块递归结构本身不提供多步物理或跨分支一致性保证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2502.17437_Fractal_Generative_Models.pdf"],"sha256":"91ce21363a7b3c6f0376a9a2be8739ad63a038752699229d2ebe226c7b0f7ac2","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.17437"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P277","arxiv_id":"2502.17437","title":"Fractal Generative Models","year":"2025","authors":"Tianhong Li; Qinyi Sun; Lijie Fan; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"递归组合原子生成模块能否形成有效的生成架构？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Fractal Generative Models 通过递归调用生成模块形成自相似结构，并以逐像素自回归图像生成进行验证。","input_conditions":"摘要初读：Fractal Generative Models 通过递归调用生成模块形成自相似结构，并以逐像素自回归图像生成进行验证。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"模块递归结构本身不提供多步物理或跨分支一致性保证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.17437"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.17437v2"}],"note":"p277","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P276","title":"Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models","short":"Learning from Reward-Free Offline Data","year":"2025","authors":"Vlad Sobal; Wancong Zhang; Kyunghyun Cho; Randall Balestriero; Tim G. J. Rudner; Yann LeCun","collected":true,"note":"p276","scope":"本地 PDF · 摘要初读","summary":"作者在导航任务中系统改变数据质量、多样性和环境布局，比较 JEPA 动力学规划与强化学习。","boundary":"结论依赖所测任务与数据分布，不是所有机器人场景的普遍排序。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2502.14819_Learning_from_Reward-Free_Offline_Data_A_Case_for_Planning_with_Latent_Dynamics_Models.pdf"],"sha256":"5491927bbbc966953cfa17ff24e1208349c8e344921aa0dad2363b16d8456ccf","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.14819"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P276","arxiv_id":"2502.14819","title":"Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models","year":"2025","authors":"Vlad Sobal; Wancong Zhang; Kyunghyun Cho; Randall Balestriero; Tim G. J. Rudner; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","evaluation","agent"],"rqs":["W1c","W4c"],"collected":true,"review_status":"abstract_review","question":"没有奖励标注的离线数据何时更适合模型规划而非无模型强化学习？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者在导航任务中系统改变数据质量、多样性和环境布局，比较 JEPA 动力学规划与强化学习。","input_conditions":"摘要初读：作者在导航任务中系统改变数据质量、多样性和环境布局，比较 JEPA 动力学规划与强化学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"结论依赖所测任务与数据分布，不是所有机器人场景的普遍排序。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.14819"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.14819v4"}],"note":"p276","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P275","title":"Is Noise Conditioning Necessary for Denoising Generative Models?","short":"Is Noise Conditioning Necessary for Denoising Generative Models?","year":"2025","authors":"Qiao Sun; Zhicheng Jiang; Hanhong Zhao; Kaiming He","collected":true,"note":"p275","scope":"本地 PDF · 摘要初读","summary":"研究去除噪声条件后的生成性能与误差，并给出理论和图像实验分析。","boundary":"结论与噪声分布、模型和数据设置有关；视频模型迁移需单独测试。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2502.13129_Is_Noise_Conditioning_Necessary_for_Denoising_Generative_Models.pdf"],"sha256":"6d5da1a7224e06598da2ea727af0e6fa4f4a962312837f235fc4c14d0b03be95","pages":34,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.13129"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P275","arxiv_id":"2502.13129","title":"Is Noise Conditioning Necessary for Denoising Generative Models?","year":"2025","authors":"Qiao Sun; Zhicheng Jiang; Hanhong Zhao; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"去噪生成模型是否必须显式输入噪声等级？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"研究去除噪声条件后的生成性能与误差，并给出理论和图像实验分析。","input_conditions":"摘要初读：研究去除噪声条件后的生成性能与误差，并给出理论和图像实验分析。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"结论与噪声分布、模型和数据设置有关；视频模型迁移需单独测试。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.13129"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.13129v2"}],"note":"p275","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P274","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","short":"PhysReason","year":"2025","authors":"Xinyu Zhang; Yuxuan Dong; Yanrui Wu; Jiaxing Huang; Chengyou Jia; Basura Fernando; Mike Zheng Shou; Lingling Zhang; Jun Liu","collected":true,"note":"p274","scope":"本地 PDF · 摘要初读","summary":"PhysReason 构建物理题及答案、步骤级评分，分析定理使用、条件判断与计算问题。","boundary":"物理题推理主要由语言模型完成，不能等同于视频生成中的物理行为。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2502.12054_PhysReason_A_Comprehensive_Benchmark_towards_Physics-Based_Reasoning.pdf"],"sha256":"a795b09bd77707f852435768e35c8f5af6b95637656ef6548e2c556f1371f88d","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.12054"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"}],"annotation":{"id":"P274","arxiv_id":"2502.12054","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","year":"2025","authors":"Xinyu Zhang; Yuxuan Dong; Yanrui Wu; Jiaxing Huang; Chengyou Jia; Basura Fernando; Mike Zheng Shou; Lingling Zhang; Jun Liu","teams":["mike-zheng-shou"],"topics":["physics","video_reasoning","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"abstract_review","question":"模型在哪些物理知识和推导步骤上出错？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PhysReason 构建物理题及答案、步骤级评分，分析定理使用、条件判断与计算问题。","input_conditions":"摘要初读：PhysReason 构建物理题及答案、步骤级评分，分析定理使用、条件判断与计算问题。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"物理题推理主要由语言模型完成，不能等同于视频生成中的物理行为。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.12054"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.12054v2"}],"note":"p274","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P273","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","short":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","year":"2025","authors":"Quentin Garrido; Nicolas Ballas; Mahmoud Assran; Adrien Bardes; Laurent Najman; Michael Rabbat; Emmanuel Dupoux; Yann LeCun","collected":true,"note":"p273","scope":"本地 PDF · 摘要初读","summary":"作者使用预期违背实验，测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。","boundary":"识别异常的惊讶度不等于生成正确干预结果，也不证明规则可编辑。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2502.11831_Intuitive_physics_understanding_emerges_from_self-supervised_pretraining_on_natural_videos.pdf"],"sha256":"8ec7320af6b22e8bf91dae7372a6c1c567f217f23debaf4459cbe8d39b9f620d","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.11831"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"}],"annotation":{"id":"P273","arxiv_id":"2502.11831","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","year":"2025","authors":"Quentin Garrido; Nicolas Ballas; Mahmoud Assran; Adrien Bardes; Laurent Najman; Michael Rabbat; Emmanuel Dupoux; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","physics","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"abstract_review","question":"自然视频中的自监督预测是否学到直觉物理？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者使用预期违背实验，测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。","input_conditions":"摘要初读：作者使用预期违背实验，测试潜空间视频预测器对物体持续性和形状一致性等性质的敏感性。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"识别异常的惊讶度不等于生成正确干预结果，也不证明规则可编辑。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.11831"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.11831v1"}],"note":"p273","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P272","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","short":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","year":"2025","authors":"Shivansh Patel; Xinchen Yin; Wenlong Huang; Shubham Garg; Hooshang Nayyeri; Li Fei-Fei; Svetlana Lazebnik; Yunzhu Li","collected":true,"note":"p272","scope":"本地 PDF · 摘要初读","summary":"IKER 用 VLM 生成和修改 Python 奖励，在重建仿真中训练策略，再部署到真实环境。","boundary":"可执行奖励约束的是目标，不等于学到了可执行世界转移规律。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2502.08643_A_Real-to-Sim-to-Real_Approach_to_Robotic_Manipulation_with_VLM-Generated_Iterative_Keypoint_Rewards.pdf"],"sha256":"7f6fe2f87f3d71b1469cc000f8074b2a28537d544ba4fc5bcd0cfc41ad106b51","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.08643"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P272","arxiv_id":"2502.08643","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","year":"2025","authors":"Shivansh Patel; Xinchen Yin; Wenlong Huang; Shubham Garg; Hooshang Nayyeri; Li Fei-Fei; Svetlana Lazebnik; Yunzhu Li","teams":["fei-fei-li"],"topics":["physics","agent"],"rqs":["W1a","X3b"],"collected":true,"review_status":"abstract_review","question":"语言任务怎样变成可迭代的视觉关键点奖励？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"IKER 用 VLM 生成和修改 Python 奖励，在重建仿真中训练策略，再部署到真实环境。","input_conditions":"摘要初读：IKER 用 VLM 生成和修改 Python 奖励，在重建仿真中训练策略，再部署到真实环境。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"可执行奖励约束的是目标，不等于学到了可执行世界转移规律。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.08643"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.08643"}],"note":"p272","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P271","title":"WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point","short":"WorldGUI","year":"2025","authors":"Henry Hengyuan Zhao; Kaiming Yang; Wendi Yu; Difei Gao; Mike Zheng Shou","collected":true,"note":"p271","scope":"本地 PDF · 摘要初读","summary":"WorldGUI 系统改变软件任务初始状态，用批评式执行框架比较恢复与适应能力。","boundary":"界面状态变化与环境因果规律变化需要区分。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2502.08047_WorldGUI_An_Interactive_Benchmark_for_Desktop_GUI_Automation_from_Any_Starting_Point.pdf"],"sha256":"0f8c34845dca2eda17d89b448d93a031eac034256cd017cea63f3429a019fb23","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2502.08047"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P271","arxiv_id":"2502.08047","title":"WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point","year":"2025","authors":"Henry Hengyuan Zhao; Kaiming Yang; Wendi Yu; Difei Gao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","evaluation"],"rqs":["X3c","W4c"],"collected":true,"review_status":"abstract_review","question":"GUI agent 能否从非默认状态恢复并调整计划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"WorldGUI 系统改变软件任务初始状态，用批评式执行框架比较恢复与适应能力。","input_conditions":"摘要初读：WorldGUI 系统改变软件任务初始状态，用批评式执行框架比较恢复与适应能力。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"界面状态变化与环境因果规律变化需要区分。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.08047"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.08047"}],"note":"p271","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P290","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","short":"LiveCC","year":"2025","authors":"Joya Chen; Ziyun Zeng; Yiqi Lin; Wei Li; Zejun Ma; Mike Zheng Shou","collected":true,"note":"p290","scope":"本地 PDF · 摘要初读","summary":"LiveCC 将词语和视频帧按时间交错训练，建立直播描述数据与体育评论评价。","boundary":"语音是额外监督；评论正确性不同于未来后果预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2504.16030_LiveCC_Learning_Video_LLM_with_Streaming_Speech_Transcription_at_Scale.pdf"],"sha256":"9f341454b0b34e76032b7a5b45675ce2101c175833c37084203bad6eaea7e7ce","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.16030"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P290","arxiv_id":"2504.16030","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","year":"2025","authors":"Joya Chen; Ziyun Zeng; Yiqi Lin; Wei Li; Zejun Ma; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_understanding"],"rqs":["W4b","X1b"],"collected":true,"review_status":"abstract_review","question":"廉价语音转写能否支撑实时视频语言学习？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LiveCC 将词语和视频帧按时间交错训练，建立直播描述数据与体育评论评价。","input_conditions":"摘要初读：LiveCC 将词语和视频帧按时间交错训练，建立直播描述数据与体育评论评价。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"语音是额外监督；评论正确性不同于未来后果预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.16030"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.16030v1"}],"note":"p290","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P289","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","short":"Chain-of-Modality","year":"2025","authors":"Chen Wang; Fei Xia; Wenhao Yu; Tingnan Zhang; Ruohan Zhang; C. Karen Liu; Li Fei-Fei; Jie Tan; Jacky Liang","collected":true,"note":"p289","scope":"本地 PDF · 摘要初读","summary":"Chain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。","boundary":"额外声音、肌肉传感与语言推理改变输入条件，不属于仅视频生成器推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2504.13351_Chain-of-Modality_Learning_Manipulation_Programs_from_Multimodal_Human_Videos_with_Vision-Language-Models.pdf"],"sha256":"2df31f796ae54ba6140f9efb4716dc7ec6c3ec8c1f11a08d031c2929e2c0d7fe","pages":9,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.13351"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P289","arxiv_id":"2504.13351","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","year":"2025","authors":"Chen Wang; Fei Xia; Wenhao Yu; Tingnan Zhang; Ruohan Zhang; C. Karen Liu; Li Fei-Fei; Jie Tan; Jacky Liang","teams":["fei-fei-li"],"topics":["video_reasoning","agent"],"rqs":["X1b","W4b"],"collected":true,"review_status":"abstract_review","question":"视频中难以看见的控制参数能否通过声音和肌肉信号补足？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Chain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。","input_conditions":"摘要初读：Chain-of-Modality 用多模态示范与 VLM 提取任务计划和控制参数。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"额外声音、肌肉传感与语言推理改变输入条件，不属于仅视频生成器推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.13351"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.13351v1"}],"note":"p289","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P288","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","short":"AnimeGamer","year":"2025","authors":"Junhao Cheng; Yuying Ge; Yixiao Ge; Jing Liao; Ying Shan","collected":true,"note":"p288","scope":"本地 PDF · 摘要初读","summary":"AnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示，再由视频扩散模型解码动画镜头。","boundary":"状态推断由 MLLM 承担；语境一致和游戏体验不能替代可执行物理规则检查。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2504.01014_AnimeGamer_Infinite_Anime_Life_Simulation_with_Next_Game_State_Prediction.pdf"],"sha256":"95f1dfccd3984f72a262720f095302a561fee9048ca0782cfd987a61cb4c5a5c","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.01014"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P288","arxiv_id":"2504.01014","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","year":"2025","authors":"Junhao Cheng; Yuying Ge; Yixiao Ge; Jing Liao; Ying Shan","teams":["jing-liao"],"topics":["world_model","video_gen","agent"],"rqs":["W3a","W3b"],"collected":true,"review_status":"abstract_review","question":"互动动画如何在多轮游戏中更新角色状态和动态镜头？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示，再由视频扩散模型解码动画镜头。","input_conditions":"摘要初读：AnimeGamer 由 MLLM 根据历史预测含动作信息的多模态状态表示，再由视频扩散模型解码动画镜头。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"状态推断由 MLLM 承担；语境一致和游戏体验不能替代可执行物理规则检查。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.01014"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.01014"}],"note":"p288","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P287","title":"WorldScore: A Unified Evaluation Benchmark for World Generation","short":"WorldScore","year":"2025","authors":"Haoyi Duan; Hong-Xing Yu; Sirui Chen; Li Fei-Fei; Jiajun Wu","collected":true,"note":"p287","scope":"本地 PDF · 摘要初读","summary":"WorldScore 以明确相机轨迹组织下一场景生成，分开评价控制、质量和动态。","boundary":"相机驱动的世界生成不涵盖全部动作干预和物理机制验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2504.00983_WorldScore_A_Unified_Evaluation_Benchmark_for_World_Generation.pdf"],"sha256":"7ddf259570f4b302f44650329fd24ab331a19e218adf538b47019218fb235d06","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.00983"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"}],"annotation":{"id":"P287","arxiv_id":"2504.00983","title":"WorldScore: A Unified Evaluation Benchmark for World Generation","year":"2025","authors":"Haoyi Duan; Hong-Xing Yu; Sirui Chen; Li Fei-Fei; Jiajun Wu","teams":["fei-fei-li"],"topics":["video_gen","world_model","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"abstract_review","question":"不同三维、四维和视频生成方法怎样在统一世界生成任务上比较？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"WorldScore 以明确相机轨迹组织下一场景生成，分开评价控制、质量和动态。","input_conditions":"摘要初读：WorldScore 以明确相机轨迹组织下一场景生成，分开评价控制、质量和动态。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"相机驱动的世界生成不涵盖全部动作干预和物理机制验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.00983"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.00983"}],"note":"p287","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P286","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","short":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","year":"2025","authors":"Yuchao Gu; Weijia Mao; Mike Zheng Shou","collected":true,"note":"p286","scope":"本地 PDF · 摘要初读","summary":"FAR 使用远近不同的 patch 粒度组织历史帧，提高长视频建模效率。","boundary":"长视频质量不必然意味着长期状态与规则始终正确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2503.19325_Long-Context_Autoregressive_Video_Modeling_with_Next-Frame_Prediction.pdf"],"sha256":"ab386437bb41f1ee752bf0f3985fa5bff8a107df1d11437d87af27e0a7df0fe7","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.19325"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"}],"annotation":{"id":"P286","arxiv_id":"2503.19325","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","year":"2025","authors":"Yuchao Gu; Weijia Mao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency"],"rqs":["W3a"],"collected":true,"review_status":"abstract_review","question":"长上下文视频自回归怎样减少历史冗余又保留近期细节？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"FAR 使用远近不同的 patch 粒度组织历史帧，提高长视频建模效率。","input_conditions":"摘要初读：FAR 使用远近不同的 patch 粒度组织历史帧，提高长视频建模效率。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"长视频质量不必然意味着长期状态与规则始终正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.19325"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.19325v3"}],"note":"p286","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P285","title":"Repurposing 2D Diffusion Models with Gaussian Atlas for 3D Generation","short":"Repurposing 2D Diffusion Models with Gaussian Atlas for 3D Generation","year":"2025","authors":"Tiange Xiang; Kai Li; Chengjiang Long; Christian Häne; Peihong Guo; Scott Delp; Ehsan Adeli; Li Fei-Fei","collected":true,"note":"p285","scope":"本地 PDF · 摘要初读","summary":"Gaussian Atlas 将三维结构展开到稠密二维网格，构建 GaussianVerse 数据进行微调。","boundary":"主要是静态三维对象，尚不直接预测时空交互。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2503.15877_Repurposing_2D_Diffusion_Models_with_Gaussian_Atlas_for_3D_Generation.pdf"],"sha256":"cc35db5b3a717c9462509e7e6b45ee12acd952a020860113fb2f7401059d6668","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.15877"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P285","arxiv_id":"2503.15877","title":"Repurposing 2D Diffusion Models with Gaussian Atlas for 3D Generation","year":"2025","authors":"Tiange Xiang; Kai Li; Chengjiang Long; Christian Häne; Peihong Guo; Scott Delp; Ehsan Adeli; Li Fei-Fei","teams":["fei-fei-li"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"二维扩散预训练怎样迁移到三维 Gaussian 生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Gaussian Atlas 将三维结构展开到稠密二维网格，构建 GaussianVerse 数据进行微调。","input_conditions":"摘要初读：Gaussian Atlas 将三维结构展开到稠密二维网格，构建 GaussianVerse 数据进行微调。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要是静态三维对象，尚不直接预测时空交互。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.15877"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.15877v2"}],"note":"p285","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P284","title":"MTV-Inpaint: Multi-Task Long Video Inpainting","short":"MTV-Inpaint","year":"2025","authors":"Shiyuan Yang; Zheng Gu; Liang Hou; Xin Tao; Pengfei Wan; Xiaodong Chen; Jing Liao","collected":true,"note":"p284","scope":"本地 PDF · 摘要初读","summary":"MTV-Inpaint 以双分支空间注意力统一补全和插入，通过关键帧处理与中间帧传播扩展序列长度。","boundary":"长序列补全强调外观和时序一致，尚需另测编辑引发的真实因果后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2503.11412_MTV-Inpaint_Multi-Task_Long_Video_Inpainting.pdf"],"sha256":"10a152c6f7523fa79fa491ac85abc78fcdbf395039c2ef0746d803d07337cd35","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.11412"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P284","arxiv_id":"2503.11412","title":"MTV-Inpaint: Multi-Task Long Video Inpainting","year":"2025","authors":"Shiyuan Yang; Zheng Gu; Liang Hou; Xin Tao; Pengfei Wan; Xiaodong Chen; Jing Liao","teams":["jing-liao"],"topics":["video_gen"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"长视频如何兼顾区域补全与可控对象插入？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MTV-Inpaint 以双分支空间注意力统一补全和插入，通过关键帧处理与中间帧传播扩展序列长度。","input_conditions":"摘要初读：MTV-Inpaint 以双分支空间注意力统一补全和插入，通过关键帧处理与中间帧传播扩展序列长度。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"长序列补全强调外观和时序一致，尚需另测编辑引发的真实因果后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.11412"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.11412v1"}],"note":"p284","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P283","title":"I2V3D: Controllable image-to-video generation with 3D guidance","short":"I2V3D","year":"2025","authors":"Zhiyuan Zhang; Dongdong Chen; Jing Liao","collected":true,"note":"p283","scope":"本地 PDF · 摘要初读","summary":"I2V3D 先用三维引导生成高质量关键帧，再采用双向引导的视频插值，支持相机、物体和角色动画控制。","boundary":"动作与几何由图形管线提供，属于三维条件生成；插值无训练不表示整条管线无训练。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2503.09733_I2V3D_Controllable_image-to-video_generation_with_3D_guidance.pdf"],"sha256":"56633ccc753cd20c03df705b067edc9ce82af3b97821d2a0141dbd0bad255dff","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.09733"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P283","arxiv_id":"2503.09733","title":"I2V3D: Controllable image-to-video generation with 3D guidance","year":"2025","authors":"Zhiyuan Zhang; Dongdong Chen; Jing Liao","teams":["jing-liao"],"topics":["video_gen","geometry"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何把粗糙三维渲染转换成可控且连贯的视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"I2V3D 先用三维引导生成高质量关键帧，再采用双向引导的视频插值，支持相机、物体和角色动画控制。","input_conditions":"摘要初读：I2V3D 先用三维引导生成高质量关键帧，再采用双向引导的视频插值，支持相机、物体和角色动画控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动作与几何由图形管线提供，属于三维条件生成；插值无训练不表示整条管线无训练。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.09733"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.09733"}],"note":"p283","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P282","title":"Denoising Hamiltonian Network for Physical Reasoning","short":"Denoising Hamiltonian Network for Physical Reasoning","year":"2025","authors":"Congyue Deng; Brandon Y. Feng; Cecilia Garraffo; Alan Garbarz; Robin Walters; William T. Freeman; Leonidas Guibas; Kaiming He","collected":true,"note":"p282","scope":"本地 PDF · 摘要初读","summary":"Denoising Hamiltonian Network 将物理算子推广成可学习的神经算子，覆盖前向模拟之外的物理推理任务。","boundary":"需要核对变量表示、训练分布与物理约束；不能把算子任务直接视为写实视频推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2503.07596_Denoising_Hamiltonian_Network_for_Physical_Reasoning.pdf"],"sha256":"b7248e4bf8cf2a4cfa5c3f614d524079ee11442aaf4c33cfd4a6bddaeb916faf","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.07596"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P282","arxiv_id":"2503.07596","title":"Denoising Hamiltonian Network for Physical Reasoning","year":"2025","authors":"Congyue Deng; Brandon Y. Feng; Cecilia Garraffo; Alan Garbarz; Robin Walters; William T. Freeman; Leonidas Guibas; Kaiming He","teams":["kaiming-he"],"topics":["physics","video_reasoning"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"如何把哈密顿结构扩展到多种物理推理输入输出？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Denoising Hamiltonian Network 将物理算子推广成可学习的神经算子，覆盖前向模拟之外的物理推理任务。","input_conditions":"摘要初读：Denoising Hamiltonian Network 将物理算子推广成可学习的神经算子，覆盖前向模拟之外的物理推理任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"需要核对变量表示、训练分布与物理约束；不能把算子任务直接视为写实视频推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.07596"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.07596v1"}],"note":"p282","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P281","title":"Automated Movie Generation via Multi-Agent CoT Planning","short":"Automated Movie Generation via Multi-Agent CoT Planning","year":"2025","authors":"Weijia Wu; Zeyu Zhu; Mike Zheng Shou","collected":true,"note":"p281","scope":"本地 PDF · 摘要初读","summary":"MovieAgent 用层级多智能体思维链组织场景、镜头与角色，并调用视频生成。","boundary":"叙事推理由 agent 提供，不能视为生成器自身的长程机制推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2503.07314_Automated_Movie_Generation_via_Multi-Agent_CoT_Planning.pdf"],"sha256":"ecf4e084096c19acc40492d502b61982b5c264f4bb2dc8fe35d42790857a604c","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2503.07314"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P281","arxiv_id":"2503.07314","title":"Automated Movie Generation via Multi-Agent CoT Planning","year":"2025","authors":"Weijia Wu; Zeyu Zhu; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"如何从剧本自动规划多场景、多镜头影片？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MovieAgent 用层级多智能体思维链组织场景、镜头与角色，并调用视频生成。","input_conditions":"摘要初读：MovieAgent 用层级多智能体思维链组织场景、镜头与角色，并调用视频生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"叙事推理由 agent 提供，不能视为生成器自身的长程机制推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2503.07314"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2503.07314v1"}],"note":"p281","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P300","title":"Show-o2: Improved Native Unified Multimodal Models","short":"Show-o2","year":"2025","authors":"Jinheng Xie; Zhenheng Yang; Mike Zheng Shou","collected":true,"note":"p300","scope":"本地 PDF · 摘要初读","summary":"Show-o2 结合自回归与 flow matching，并在因果三维 VAE 空间融合视觉表示。","boundary":"统一架构不自动证明理解能力会转移为可靠物理后果生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2506.15564_Show-o2_Improved_Native_Unified_Multimodal_Models.pdf"],"sha256":"081494e8e7aea985cf943c04f46ae2405eec16acfe15ef7e89b95f346a43ccc4","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.15564"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P300","arxiv_id":"2506.15564","title":"Show-o2: Improved Native Unified Multimodal Models","year":"2025","authors":"Jinheng Xie; Zhenheng Yang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation","video_gen"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"理解与图像、视频生成能否使用统一的原生模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Show-o2 结合自回归与 flow matching，并在因果三维 VAE 空间融合视觉表示。","input_conditions":"摘要初读：Show-o2 结合自回归与 flow matching，并在因果三维 VAE 空间融合视觉表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"统一架构不自动证明理解能力会转移为可靠物理后果生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.15564"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.15564v3"}],"note":"p300","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P299","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","short":"V-JEPA 2","year":"2025","authors":"Mido Assran; Adrien Bardes; David Fan; Quentin Garrido; Russell Howes; Mojtaba; Komeili; Matthew Muckley; Ammar Rizvi; Claire Roberts; Koustuv Sinha; Artem Zholus; Sergio Arnaud; Abha Gejji; Ada Martin; Francois Robert Hogan; Daniel Dugas; Piotr Bojanowski; Vasil Khalidov; Patrick Labatut; Francisco Massa; Marc Szafraniec; Kapil Krishnakumar; Yong Li; Xiaodong Ma; Sarath Chandar; Franziska Meier; Yann LeCun; Michael Rabbat; Nicolas Ballas","collected":true,"note":"p299","scope":"本地 PDF · 摘要初读","summary":"V-JEPA 2 先学习视频潜表征，再以机器人数据训练动作条件预测器；语言对齐与机器人规划分别评价。","boundary":"V-JEPA 2-AC 是潜空间规划模型；语言问答结果与机器人控制结果不能互作证明。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2506.09985_V-JEPA_2_Self-Supervised_Video_Models_Enable_Understanding_Prediction_and_Planning.pdf"],"sha256":"9cfcfde5fb0d9730637da5b9e7317825c3f3d09e91f3553e22eeba42c74d2226","pages":48,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.09985"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P299","arxiv_id":"2506.09985","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","year":"2025","authors":"Mido Assran; Adrien Bardes; David Fan; Quentin Garrido; Russell Howes; Mojtaba; Komeili; Matthew Muckley; Ammar Rizvi; Claire Roberts; Koustuv Sinha; Artem Zholus; Sergio Arnaud; Abha Gejji; Ada Martin; Francois Robert Hogan; Daniel Dugas; Piotr Bojanowski; Vasil Khalidov; Patrick Labatut; Francisco Massa; Marc Szafraniec; Kapil Krishnakumar; Yong Li; Xiaodong Ma; Sarath Chandar; Franziska Meier; Yann LeCun; Michael Rabbat; Nicolas Ballas","teams":["yann-lecun"],"topics":["world_model","video_understanding","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"大规模无动作视频预训练怎样支持理解与少量交互数据下的机器人规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"V-JEPA 2 先学习视频潜表征，再以机器人数据训练动作条件预测器；语言对齐与机器人规划分别评价。","input_conditions":"摘要初读：V-JEPA 2 先学习视频潜表征，再以机器人数据训练动作条件预测器；语言对齐与机器人规划分别评价。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"V-JEPA 2-AC 是潜空间规划模型；语言问答结果与机器人控制结果不能互作证明。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.09985"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.09985v1"}],"note":"p299","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P298","title":"Diffuse and Disperse: Image Generation with Representation Regularization","short":"Diffuse and Disperse","year":"2025","authors":"Runqian Wang; Kaiming He","collected":true,"note":"p298","scope":"本地 PDF · 摘要初读","summary":"Dispersive Loss 鼓励隐藏表征分散，不要求正样本配对或外部表征教师，作为生成训练的附加正则。","boundary":"改善图像分布指标不能直接证明物理规律或操作后果更正确。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2506.09027_Diffuse_and_Disperse_Image_Generation_with_Representation_Regularization.pdf"],"sha256":"714146a8feba5f50e70d77b878c5ac5bec01d7f492c879cb25acda788d717a16","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.09027"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P298","arxiv_id":"2506.09027","title":"Diffuse and Disperse: Image Generation with Representation Regularization","year":"2025","authors":"Runqian Wang; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"扩散模型的内部表征分散正则能否改善生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Dispersive Loss 鼓励隐藏表征分散，不要求正样本配对或外部表征教师，作为生成训练的附加正则。","input_conditions":"摘要初读：Dispersive Loss 鼓励隐藏表征分散，不要求正样本配对或外部表征教师，作为生成训练的附加正则。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"改善图像分布指标不能直接证明物理规律或操作后果更正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.09027"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.09027v2"}],"note":"p298","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P297","title":"macOSWorld: A Multilingual Interactive Benchmark for GUI Agents","short":"macOSWorld","year":"2025","authors":"Pei Yang; Hai Ci; Mike Zheng Shou","collected":true,"note":"p297","scope":"本地 PDF · 摘要初读","summary":"macOSWorld 提供可交互软件任务，比较多类 GUI agent 的完成情况。","boundary":"这是相邻交互基准，不能直接支持视频世界模型结论。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2506.04135_macOSWorld_A_Multilingual_Interactive_Benchmark_for_GUI_Agents.pdf"],"sha256":"f083d77d05c7ef05e8e240c5279784f4d1ed7549c789ef35bbdbd45149ceceaa","pages":43,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.04135"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"}],"annotation":{"id":"P297","arxiv_id":"2506.04135","title":"macOSWorld: A Multilingual Interactive Benchmark for GUI Agents","year":"2025","authors":"Pei Yang; Hai Ci; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","evaluation"],"rqs":["X3c"],"collected":true,"review_status":"abstract_review","question":"GUI agent 在 macOS 和多语言任务中的执行能力如何？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"macOSWorld 提供可交互软件任务，比较多类 GUI agent 的完成情况。","input_conditions":"摘要初读：macOSWorld 提供可交互软件任务，比较多类 GUI agent 的完成情况。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是相邻交互基准，不能直接支持视频世界模型结论。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.04135"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.04135v4"}],"note":"p297","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P296","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","short":"UniRL","year":"2025","authors":"Weijia Mao; Zhenheng Yang; Mike Zheng Shou","collected":true,"note":"p296","scope":"本地 PDF · 摘要初读","summary":"UniRL 以模型合成图像形成迭代数据，比较监督微调和 GRPO。","boundary":"自改进主要在所测图像任务中验证；不能推断自进化会顺带解决世界机制问题。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2505.23380_UniRL_Self-Improving_Unified_Multimodal_Models_via_Supervised_and_Reinforcement_Learning.pdf"],"sha256":"52b9dd4a2d3faaac73b44249dcd77a396e9cccd4a9dcfb7e1c39197cc631cdab","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2505.23380"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P296","arxiv_id":"2505.23380","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","year":"2025","authors":"Weijia Mao; Zhenheng Yang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"统一多模态模型能否利用自身生成图像进行后训练？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"UniRL 以模型合成图像形成迭代数据，比较监督微调和 GRPO。","input_conditions":"摘要初读：UniRL 以模型合成图像形成迭代数据，比较监督微调和 GRPO。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"自改进主要在所测图像任务中验证；不能推断自进化会顺带解决世界机制问题。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2505.23380"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2505.23380v1"}],"note":"p296","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P295","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","short":"Video-Holmes","year":"2025","authors":"Junhao Cheng; Yuying Ge; Teng Wang; Yixiao Ge; Jing Liao; Ying Shan","collected":true,"note":"p295","scope":"本地 PDF · 摘要初读","summary":"Video-Holmes 构建需要跨线索整合的视频推理评测，分析 MLLM 在关键证据利用上的不足。","boundary":"评价对象为视频理解模型，不能将得分直接解释为视频生成模型的推演能力。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2505.21374_Video-Holmes_Can_MLLM_Think_Like_Holmes_for_Complex_Video_Reasoning.pdf"],"sha256":"4ea036188bc2df822d897d90067b8f494b84ed99f44514ad8c9e8409dbe2dd3f","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2505.21374"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P295","arxiv_id":"2505.21374","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","year":"2025","authors":"Junhao Cheng; Yuying Ge; Teng Wang; Yixiao Ge; Jing Liao; Ying Shan","teams":["jing-liao"],"topics":["video_understanding","evaluation"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"视频理解模型能否组合分散线索完成复杂推断？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Video-Holmes 构建需要跨线索整合的视频推理评测，分析 MLLM 在关键证据利用上的不足。","input_conditions":"摘要初读：Video-Holmes 构建需要跨线索整合的视频推理评测，分析 MLLM 在关键证据利用上的不足。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"评价对象为视频理解模型，不能将得分直接解释为视频生成模型的推演能力。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2505.21374"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2505.21374v1"}],"note":"p295","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P294","title":"OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation","short":"OSVI-WM","year":"2025","authors":"Raktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad Khorrami","collected":true,"note":"p294","scope":"本地 PDF · 摘要初读","summary":"OSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹，以世界模型指导视觉模仿。","boundary":"示范提供额外目标信息；未见任务泛化与改变物理规律是不同设置。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2505.20425_OSVI-WM_One-Shot_Visual_Imitation_for_Unseen_Tasks_using_World-Model-Guided_Trajectory_Generation.pdf"],"sha256":"9c003e2154fa9eded6615fb9d76f9e383b03cd0aabb1d063c676d3af1c763040","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2505.20425"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P294","arxiv_id":"2505.20425","title":"OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation","year":"2025","authors":"Raktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad Khorrami","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W1c","X1b"],"collected":true,"review_status":"abstract_review","question":"单次示范如何迁移到训练中未见过的任务结构？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"OSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹，以世界模型指导视觉模仿。","input_conditions":"摘要初读：OSVI-WM 根据专家示范和当前观察生成潜状态、动作轨迹，以世界模型指导视觉模仿。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"示范提供额外目标信息；未见任务泛化与改变物理规律是不同设置。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2505.20425"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2505.20425v2"}],"note":"p294","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P293","title":"Mean Flows for One-step Generative Modeling","short":"Mean Flows for One-step Generative Modeling","year":"2025","authors":"Zhengyang Geng; Mingyang Deng; Xingjian Bai; J. Zico Kolter; Kaiming He","collected":true,"note":"p293","scope":"本地 PDF · 摘要初读","summary":"MeanFlow 以区间平均速度代替仅建模瞬时速度，构建不依赖预训练蒸馏的一步生成框架。","boundary":"研究给定图像任务上的采样效率；不是现成视频模型的即插即用加速保证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2505.13447_Mean_Flows_for_One-step_Generative_Modeling.pdf"],"sha256":"322ba9244ad2c72382038e421fe0ffa92510c51d4f9c740bd7282b36bfc25206","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2505.13447"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P293","arxiv_id":"2505.13447","title":"Mean Flows for One-step Generative Modeling","year":"2025","authors":"Zhengyang Geng; Mingyang Deng; Xingjian Bai; J. Zico Kolter; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"平均速度场能否支持从零训练的单步生成模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MeanFlow 以区间平均速度代替仅建模瞬时速度，构建不依赖预训练蒸馏的一步生成框架。","input_conditions":"摘要初读：MeanFlow 以区间平均速度代替仅建模瞬时速度，构建不依赖预训练蒸馏的一步生成框架。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"研究给定图像任务上的采样效率；不是现成视频模型的即插即用加速保证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2505.13447"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2505.13447v1"}],"note":"p293","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P292","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","short":"RAGEN","year":"2025","authors":"Zihan Wang; Kangrui Wang; Qineng Wang; Pingyue Zhang; Linjie Li; Zhengyuan Yang; Xing Jin; Kefan Yu; Minh Nhat Nguyen; Licheng Liu; Eli Gottlieb; Yiping Lu; Kyunghyun Cho; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling Li","collected":true,"note":"p292","scope":"本地 PDF · 摘要初读","summary":"RAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。","boundary":"自进化是训练过程；不能由此推断世界机制的识别、执行和修订已自动解决。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2504.20073_RAGEN_Understanding_Self-Evolution_in_LLM_Agents_via_Multi-Turn_Reinforcement_Learning.pdf"],"sha256":"41d89d5e5466c13bdeda57c78e2b6f1a510fb12b9d4931203979b7af07ff1485","pages":39,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.20073"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P292","arxiv_id":"2504.20073","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","year":"2025","authors":"Zihan Wang; Kangrui Wang; Qineng Wang; Pingyue Zhang; Linjie Li; Zhengyuan Yang; Xing Jin; Kefan Yu; Minh Nhat Nguyen; Licheng Liu; Eli Gottlieb; Yiping Lu; Kyunghyun Cho; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling Li","teams":["fei-fei-li"],"topics":["agent"],"rqs":["W4a","W4c"],"collected":true,"review_status":"abstract_review","question":"多轮强化学习怎样稳定改善交互 agent 的推理？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。","input_conditions":"摘要初读：RAGEN 提供轨迹级训练框架并分析奖励、采样和思维监督的作用。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"自进化是训练过程；不能由此推断世界机制的识别、执行和修订已自动解决。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.20073"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.20073v2"}],"note":"p292","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P291","title":"CasaGPT: Cuboid Arrangement and Scene Assembly for Interior Design","short":"CasaGPT","year":"2025","authors":"Weitao Feng; Hang Zhou; Jing Liao; Li Cheng; Wenbo Zhou","collected":true,"note":"p291","scope":"本地 PDF · 摘要初读","summary":"CasaGPT 自回归排列长方体原语，使用拒绝采样降低对象碰撞，并整理场景布局数据。","boundary":"静态布局碰撞约束与动态物理演化不同；依赖所定义的几何原语和数据范围。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2504.19478_CasaGPT_Cuboid_Arrangement_and_Scene_Assembly_for_Interior_Design.pdf"],"sha256":"f61e00ffc04e5f8fc71a8dc4942cb815031326b1c41b7c3ecb0d354b9bb8ea87","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2504.19478"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P291","arxiv_id":"2504.19478","title":"CasaGPT: Cuboid Arrangement and Scene Assembly for Interior Design","year":"2025","authors":"Weitao Feng; Hang Zhou; Jing Liao; Li Cheng; Wenbo Zhou","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"用分解的长方体原语能否改进室内场景的构成与放置？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"CasaGPT 自回归排列长方体原语，使用拒绝采样降低对象碰撞，并整理场景布局数据。","input_conditions":"摘要初读：CasaGPT 自回归排列长方体原语，使用拒绝采样降低对象碰撞，并整理场景布局数据。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"静态布局碰撞约束与动态物理演化不同；依赖所定义的几何原语和数据范围。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2504.19478"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2504.19478v1"}],"note":"p291","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P310","title":"Cambrian-S: Towards Spatial Supersensing in Video","short":"Cambrian-S","year":"2025","authors":"Shusheng Yang; Jihan Yang; Pinzhi Huang; Ellis Brown; Zihao Yang; Yue Yu; Shengbang Tong; Zihan Zheng; Yifan Xu; Muhan Wang; Daohan Lu; Rob Fergus; Yann LeCun; Li Fei-Fei; Saining Xie","collected":true,"note":"p310","scope":"本地 PDF · 摘要初读","summary":"Cambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据，考察持续空间回忆和计数。","boundary":"主要证据来自理解和空间记忆任务；不能直接视为可控像素世界生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2511.04670_Cambrian-S_Towards_Spatial_Supersensing_in_Video.pdf"],"sha256":"37f622010a463203ac1d8e10fa5d83a3660892366cc9bb71d24a726dabd7bd3b","pages":49,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.04670"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P310","arxiv_id":"2511.04670","title":"Cambrian-S: Towards Spatial Supersensing in Video","year":"2025","authors":"Shusheng Yang; Jihan Yang; Pinzhi Huang; Ellis Brown; Zihao Yang; Yue Yu; Shengbang Tong; Zihan Zheng; Yifan Xu; Muhan Wang; Daohan Lu; Rob Fergus; Yann LeCun; Li Fei-Fei; Saining Xie","teams":["yann-lecun","fei-fei-li"],"topics":["video_understanding","world_model","evaluation"],"rqs":["W3a","W4b"],"collected":true,"review_status":"abstract_review","question":"视频系统怎样持续记忆并推断画面背后的空间状态？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Cambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据，考察持续空间回忆和计数。","input_conditions":"摘要初读：Cambrian-S 提出空间 supersensing 框架、VSI-SUPER 基准与 VSI-590K 数据，考察持续空间回忆和计数。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要证据来自理解和空间记忆任务；不能直接视为可控像素世界生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.04670"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.04670v1"}],"note":"p310","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P309","title":"MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile Manipulation","short":"MoMaGen","year":"2025","authors":"Chengshu Li; Mengdi Xu; Arpit Bahety; Hang Yin; Yunfan Jiang; Huang Huang; Josiah Wong; Sujay Garlanka; Cem Gokmen; Ruohan Zhang; Weiyu Liu; Jiajun Wu; Roberto Martín-Martín; Li Fei-Fei","collected":true,"note":"p309","scope":"本地 PDF · 摘要初读","summary":"MoMaGen 在软硬约束下扩展示范，综合安排底座、相机和多步操作。","boundary":"仿真中的可行示范生成不是任意视频生成的物理推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2510.18316_MoMaGen_Generating_Demonstrations_under_Soft_and_Hard_Constraints_for_Multi-Step_Bimanual_Mobile_Manipulation.pdf"],"sha256":"f028b76f73150897cecae764d82b9984536e2100d1b9e65bedf301b21adaa99a","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2510.18316"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P309","arxiv_id":"2510.18316","title":"MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile Manipulation","year":"2025","authors":"Chengshu Li; Mengdi Xu; Arpit Bahety; Hang Yin; Yunfan Jiang; Huang Huang; Josiah Wong; Sujay Garlanka; Cem Gokmen; Ruohan Zhang; Weiyu Liu; Jiajun Wu; Roberto Martín-Martín; Li Fei-Fei","teams":["fei-fei-li"],"topics":["geometry","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"移动双臂任务的数据生成怎样同时满足可达性和可见性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MoMaGen 在软硬约束下扩展示范，综合安排底座、相机和多步操作。","input_conditions":"摘要初读：MoMaGen 在软硬约束下扩展示范，综合安排底座、相机和多步操作。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"仿真中的可行示范生成不是任意视频生成的物理推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.18316"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.18316v4"}],"note":"p309","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P308","title":"VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents","short":"VAGEN","year":"2025","authors":"Kangrui Wang; Pingyue Zhang; Zihan Wang; Yaning Gao; Linjie Li; Qineng Wang; Hanyang Chen; Chi Wan; Yiping Lu; Zhengyuan Yang; Lijuan Wang; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Yejin Choi; Manling Li","collected":true,"note":"p308","scope":"本地 PDF · 摘要初读","summary":"VAGEN 用强化学习约束视觉状态推理，并提供逐轮状态预测奖励。","boundary":"world model reasoning 由 VLM 的状态推理实现，不能与视频扩散内生推理混用。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2510.16907_VAGEN_Reinforcing_World_Model_Reasoning_for_Multi-Turn_VLM_Agents.pdf"],"sha256":"584f18e662f1a22a2c98ceb379a03016b65c5c26f132d93664e11da3b3f871c3","pages":55,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2510.16907"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P308","arxiv_id":"2510.16907","title":"VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents","year":"2025","authors":"Kangrui Wang; Pingyue Zhang; Zihan Wang; Yaning Gao; Linjie Li; Qineng Wang; Hanyang Chen; Chi Wan; Yiping Lu; Zhengyuan Yang; Lijuan Wang; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Yejin Choi; Manling Li","teams":["fei-fei-li"],"topics":["world_model","agent","video_reasoning"],"rqs":["W1c","W4b"],"collected":true,"review_status":"abstract_review","question":"显式状态估计和转移预测怎样帮助多轮 VLM agent？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VAGEN 用强化学习约束视觉状态推理，并提供逐轮状态预测奖励。","input_conditions":"摘要初读：VAGEN 用强化学习约束视觉状态推理，并提供逐轮状态预测奖励。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"world model reasoning 由 VLM 的状态推理实现，不能与视频扩散内生推理混用。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.16907"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2510.16907"}],"note":"p308","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P307","title":"X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering","short":"X2Video","year":"2025","authors":"Zhitong Huang; Mohan Zhang; Renhan Wang; Rui Tang; Hao Zhu; Jing Liao","collected":true,"note":"p307","scope":"本地 PDF · 摘要初读","summary":"X2Video 用固有属性通道引导视频扩散，通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。","boundary":"大量几何和渲染条件已由输入提供；应按条件渲染评价，而非自动归为未来机制预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2510.08530_X2Video_Adapting_Diffusion_Models_for_Multimodal_Controllable_Neural_Video_Rendering.pdf"],"sha256":"52e44b138725e833182d705781e7ce7cfd428353ba771876ebeb9d8844d05b85","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2510.08530"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P307","arxiv_id":"2510.08530","title":"X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering","year":"2025","authors":"Zhitong Huang; Mohan Zhang; Renhan Wang; Rui Tang; Hao Zhu; Jing Liao","teams":["jing-liao"],"topics":["video_gen","geometry"],"rqs":["W1c","W3b"],"collected":true,"review_status":"abstract_review","question":"多种材质、几何和语言条件怎样共同控制长视频渲染？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"X2Video 用固有属性通道引导视频扩散，通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。","input_conditions":"摘要初读：X2Video 用固有属性通道引导视频扩散，通过混合自注意力、区域交叉注意力和递归采样处理多模态与长序列控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"大量几何和渲染条件已由输入提供；应按条件渲染评价，而非自动归为未来机制预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.08530"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.08530"}],"note":"p307","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P306","title":"Paper2Video: Automatic Video Generation from Scientific Papers","short":"Paper2Video","year":"2025","authors":"Zeyu Zhu; Kevin Qinghong Lin; Mike Zheng Shou","collected":true,"note":"p306","scope":"本地 PDF · 摘要初读","summary":"Paper2Video 构建论文展示基准，PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。","boundary":"这是内容编排式生成；讲解质量不属于物理世界预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2510.05096_Paper2Video_Automatic_Video_Generation_from_Scientific_Papers.pdf"],"sha256":"22183644f460b10e7e798d9e102f83956c6d393530c0989e6d3021e2bd650364","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2510.05096"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P306","arxiv_id":"2510.05096","title":"Paper2Video: Automatic Video Generation from Scientific Papers","year":"2025","authors":"Zeyu Zhu; Kevin Qinghong Lin; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent","hci"],"rqs":["X4a","X3c"],"collected":true,"review_status":"abstract_review","question":"论文怎样自动转为信息协调的讲解视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Paper2Video 构建论文展示基准，PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。","input_conditions":"摘要初读：Paper2Video 构建论文展示基准，PaperTalker 用多智能体协调幻灯片、语音、字幕和讲者。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是内容编排式生成；讲解质量不属于物理世界预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.05096"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.05096v2"}],"note":"p306","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P305","title":"Code2Video: A Code-centric Paradigm for Educational Video Generation","short":"Code2Video","year":"2025","authors":"Yanzhe Chen; Kevin Qinghong Lin; Mike Zheng Shou","collected":true,"note":"p305","scope":"本地 PDF · 摘要初读","summary":"Code2Video 组合规划、代码生成与视觉检查，并用学科视频和知识测验代理指标评价。","boundary":"视频由代码与 agent 组织；VLM 测验也不能直接代表真实人的学习增益。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2510.01174_Code2Video_A_Code-centric_Paradigm_for_Educational_Video_Generation.pdf"],"sha256":"d60affc90d10732718de8fec8203aa480f54d63729e08946a7e895d8b9565fca","pages":26,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2510.01174"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P305","arxiv_id":"2510.01174","title":"Code2Video: A Code-centric Paradigm for Educational Video Generation","year":"2025","authors":"Yanzhe Chen; Kevin Qinghong Lin; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent","hci"],"rqs":["X4a","X3c"],"collected":true,"review_status":"abstract_review","question":"教育视频能否用可执行代码实现可修改的内容规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Code2Video 组合规划、代码生成与视觉检查，并用学科视频和知识测验代理指标评价。","input_conditions":"摘要初读：Code2Video 组合规划、代码生成与视觉检查，并用学科视频和知识测验代理指标评价。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视频由代码与 agent 组织；VLM 测验也不能直接代表真实人的学习增益。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.01174"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.01174v1"}],"note":"p305","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P304","title":"Back to the Features: DINO as a Foundation for Video World Models","short":"Back to the Features","year":"2025","authors":"Federico Baldassarre; Marc Szafraniec; Basile Terver; Vasil Khalidov; Francisco Massa; Yann LeCun; Patrick Labatut; Maximilian Seitzer; Piotr Bojanowski","collected":true,"note":"p304","scope":"本地 PDF · 摘要初读","summary":"DINO-world 在 DINOv2 潜空间预测未来，并考察视频预测与观测—动作轨迹适配。","boundary":"潜空间预测和视频解码质量须分别衡量；动作适配有额外交互数据条件。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2507.19468_Back_to_the_Features_DINO_as_a_Foundation_for_Video_World_Models.pdf"],"sha256":"91c0e4f12ff5e7b097d6ec345c32dd147dfc7b659a408fcec58aa510ed22c4d4","pages":24,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2507.19468"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P304","arxiv_id":"2507.19468","title":"Back to the Features: DINO as a Foundation for Video World Models","year":"2025","authors":"Federico Baldassarre; Marc Szafraniec; Basile Terver; Vasil Khalidov; Francisco Massa; Yann LeCun; Patrick Labatut; Maximilian Seitzer; Piotr Bojanowski","teams":["yann-lecun"],"topics":["world_model","video_gen"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"预训练 DINO 表征能否支撑通用视频世界预测？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DINO-world 在 DINOv2 潜空间预测未来，并考察视频预测与观测—动作轨迹适配。","input_conditions":"摘要初读：DINO-world 在 DINOv2 潜空间预测未来，并考察视频预测与观测—动作轨迹适配。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"潜空间预测和视频解码质量须分别衡量；动作适配有额外交互数据条件。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2507.19468"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2507.19468v1"}],"note":"p304","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P303","title":"Whole-Body Conditioned Egocentric Video Prediction","short":"Whole-Body Conditioned Egocentric Video Prediction","year":"2025","authors":"Yutong Bai; Danny Tran; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra Malik","collected":true,"note":"p303","scope":"本地 PDF · 摘要初读","summary":"PEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型，并在 Nymeria 上设计分层预测与控制评价。","boundary":"输入已包含未来身体运动；它预测观察后果，不能与无动作输入的开放未来预测直接比较。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2506.21552_Whole-Body_Conditioned_Egocentric_Video_Prediction.pdf"],"sha256":"a3a22db87578cc786f9140c9e3b87ff2cc67ca02f3bb26dad55387a1aa48b71b","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.21552"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P303","arxiv_id":"2506.21552","title":"Whole-Body Conditioned Egocentric Video Prediction","year":"2025","authors":"Yutong Bai; Danny Tran; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra Malik","teams":["yann-lecun"],"topics":["video_gen","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"给定全身动作轨迹，能否预测第一人称未来视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型，并在 Nymeria 上设计分层预测与控制评价。","input_conditions":"摘要初读：PEVA 用身体关节层级组织的三维姿态条件训练自回归扩散模型，并在 Nymeria 上设计分层预测与控制评价。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"输入已包含未来身体运动；它预测观察后果，不能与无动作输入的开放未来预测直接比较。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.21552"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.21552v1"}],"note":"p303","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P302","title":"MindCube: Spatial Mental Modeling from Limited Views","short":"MindCube","year":"2025","authors":"Qineng Wang; Baiqiao Yin; Pingyue Zhang; Jianshu Zhang; Kangrui Wang; Zihan Wang; Jieyu Zhang; Keshigeyan Chandrasegaran; Han Liu; Ranjay Krishna; Saining Xie; Jiajun Wu; Li Fei-Fei; Manling Li","collected":true,"note":"p302","scope":"本地 PDF · 摘要初读","summary":"MindCube 设计空间问答，并通过先生成认知地图再推理的训练改善空间理解。","boundary":"认知地图上的假设推演不同于物理视频后果生成。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2506.21458_MindCube_Spatial_Mental_Modeling_from_Limited_Views.pdf"],"sha256":"c9fc97691a917ce4c56024121ff76a57f10788f211329ae44a89f927c2d66a7e","pages":74,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.21458"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"W2c","role":"support"}],"annotation":{"id":"P302","arxiv_id":"2506.21458","title":"MindCube: Spatial Mental Modeling from Limited Views","year":"2025","authors":"Qineng Wang; Baiqiao Yin; Pingyue Zhang; Jianshu Zhang; Kangrui Wang; Zihan Wang; Jieyu Zhang; Keshigeyan Chandrasegaran; Han Liu; Ranjay Krishna; Saining Xie; Jiajun Wu; Li Fei-Fei; Manling Li","teams":["fei-fei-li"],"topics":["video_reasoning","geometry","evaluation"],"rqs":["W4b","W2c"],"collected":true,"review_status":"abstract_review","question":"有限视角下的空间心智模型怎样支持位置、视角和假设运动推理？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MindCube 设计空间问答，并通过先生成认知地图再推理的训练改善空间理解。","input_conditions":"摘要初读：MindCube 设计空间问答，并通过先生成认知地图再推理的训练改善空间理解。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"认知地图上的假设推演不同于物理视频后果生成。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.21458"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.21458v2"}],"note":"p302","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P301","title":"FramePrompt: In-context Controllable Animation with Zero Structural Changes","short":"FramePrompt","year":"2025","authors":"Guian Fang; Yuchao Gu; Mike Zheng Shou","collected":true,"note":"p301","scope":"本地 PDF · 摘要初读","summary":"FramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列，减少专用结构修改。","boundary":"未来骨架已给定；主要验证动作控制而非自主预测动作或物理规律。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2506.17301_FramePrompt_In-context_Controllable_Animation_with_Zero_Structural_Changes.pdf"],"sha256":"9963c3af5eeeeab5c754e9bf00cf00aae49d10aa44e74155de37efc9041396bc","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2506.17301"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P301","arxiv_id":"2506.17301","title":"FramePrompt: In-context Controllable Animation with Zero Structural Changes","year":"2025","authors":"Guian Fang; Yuchao Gu; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"参考图与骨架动作能否直接作为视频序列条件实现动画控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"FramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列，减少专用结构修改。","input_conditions":"摘要初读：FramePrompt 把参考外观、骨架运动和目标视频组织为统一视觉序列，减少专用结构修改。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"未来骨架已给定；主要验证动作控制而非自主预测动作或物理规律。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2506.17301"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2506.17301"}],"note":"p301","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P320","title":"From Generated Human Videos to Physically Plausible Robot Trajectories","short":"From Generated Human Videos to Physically Plausible Robot Trajectories","year":"2025","authors":"James Ni; Zekai Wang; Wei Lin; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra Malik; Roei Herzig","collected":true,"note":"p320","scope":"本地 PDF · 摘要初读","summary":"GenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来，并构建动作基准。","boundary":"物理可行性依赖重建和控制器修正，不能归因于视频生成器独立掌握物理规律。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2512.05094_From_Generated_Human_Videos_to_Physically_Plausible_Robot_Trajectories.pdf"],"sha256":"b793c2e15b842ad5982cb1fc21b70b264e2c419e928ae11ebe09e9f657581736","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.05094"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P320","arxiv_id":"2512.05094","title":"From Generated Human Videos to Physically Plausible Robot Trajectories","year":"2025","authors":"James Ni; Zekai Wang; Wei Lin; Amir Bar; Yann LeCun; Trevor Darrell; Jitendra Malik; Roei Herzig","teams":["yann-lecun"],"topics":["video_gen","geometry","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"生成的人类动作视频怎样转换成真实机器人能执行的全身行为？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来，并构建动作基准。","input_conditions":"摘要初读：GenMimic 将视频生成、4D 人体重建、动作重定向和物理强化学习控制组合起来，并构建动作基准。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"物理可行性依赖重建和控制器修正，不能归因于视频生成器独立掌握物理规律。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.05094"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.05094"}],"note":"p320","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P319","title":"X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale","short":"X-Humanoid","year":"2025","authors":"Pei Yang; Hai Ci; Yiren Song; Mike Zheng Shou","collected":true,"note":"p319","scope":"本地 PDF · 摘要初读","summary":"X-Humanoid 使用合成配对数据适配 Wan 2.2，再将真实人类视频机器人化。","boundary":"本体替换保留既有动作，不直接预测新干预的未知后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2512.04537_X-Humanoid_Robotize_Human_Videos_to_Generate_Humanoid_Videos_at_Scale.pdf"],"sha256":"f183f801907c2cb7d624414c1ca781aac086f13dd396a140976feb68fd9e8cc3","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.04537"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P319","arxiv_id":"2512.04537","title":"X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale","year":"2025","authors":"Pei Yang; Hai Ci; Yiren Song; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"能否规模化把人类活动视频转换为人形机器人数据？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"X-Humanoid 使用合成配对数据适配 Wan 2.2，再将真实人类视频机器人化。","input_conditions":"摘要初读：X-Humanoid 使用合成配对数据适配 Wan 2.2，再将真实人类视频机器人化。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"本体替换保留既有动作，不直接预测新干预的未知后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.04537"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2512.04537"}],"note":"p319","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P318","title":"Improved Mean Flows: On the Challenges of Fastforward Generative Models","short":"Improved Mean Flows","year":"2025","authors":"Zhengyang Geng; Yiyang Lu; Zongze Wu; Eli Shechtman; J. Zico Kolter; Kaiming He","collected":true,"note":"p318","scope":"本地 PDF · 摘要初读","summary":"Improved MeanFlow 用平均速度参数化瞬时速度回归，并把引导作为显式条件，改善从零训练的一步生成。","boundary":"属于生成模型基础方法；在目标视频骨干上的训练成本和后果保持尚未由该摘要验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2512.02012_Improved_Mean_Flows_On_the_Challenges_of_Fastforward_Generative_Models.pdf"],"sha256":"19a2a27ed86cc813bb0943ab43e80f4a80cf725aa692bb2f7d8c33cbbc8e12b7","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.02012"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P318","arxiv_id":"2512.02012","title":"Improved Mean Flows: On the Challenges of Fastforward Generative Models","year":"2025","authors":"Zhengyang Geng; Yiyang Lu; Zongze Wu; Eli Shechtman; J. Zico Kolter; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"平均流的训练目标和引导方式怎样改善单步生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Improved MeanFlow 用平均速度参数化瞬时速度回归，并把引导作为显式条件，改善从零训练的一步生成。","input_conditions":"摘要初读：Improved MeanFlow 用平均速度参数化瞬时速度回归，并把引导作为显式条件，改善从零训练的一步生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"属于生成模型基础方法；在目标视频骨干上的训练成本和后果保持尚未由该摘要验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.02012"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.02012v2"}],"note":"p318","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P317","title":"WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation","short":"WorldWander","year":"2025","authors":"Quanjian Song; Yiren Song; Kelly Peng; Yuan Gao; Mike Zheng Shou","collected":true,"note":"p317","scope":"本地 PDF · 摘要初读","summary":"WorldWander 以同步三元组数据训练上下文视角转换，并构建 EgoExo-8K。","boundary":"视角翻译的时间对应来自输入视频；不等同于未来世界演化。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2511.22098_WorldWander_Bridging_Egocentric_and_Exocentric_Worlds_in_Video_Generation.pdf"],"sha256":"ef48456975ba7bc3747fb8e8bb42d644c6386af538e05ebe720cab374db4e7d2","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.22098"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P317","arxiv_id":"2511.22098","title":"WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation","year":"2025","authors":"Quanjian Song; Yiren Song; Kelly Peng; Yuan Gao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","geometry"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"第一和第三人称视频之间怎样保持同步运动和主体身份？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"WorldWander 以同步三元组数据训练上下文视角转换，并构建 EgoExo-8K。","input_conditions":"摘要初读：WorldWander 以同步三元组数据训练上下文视角转换，并构建 EgoExo-8K。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视角翻译的时间对应来自输入视频；不等同于未来世界演化。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.22098"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.22098v2"}],"note":"p317","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P316","title":"ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction","short":"ENACT","year":"2025","authors":"Qineng Wang; Wenlong Huang; Yu Zhou; Hang Yin; Tianwei Bao; Jianwen Lyu; Weiyu Liu; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Manling Li","collected":true,"note":"p316","scope":"本地 PDF · 摘要初读","summary":"ENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答，测试具身认知与世界建模。","boundary":"采用 VQA 而非像素生成；可作语义后果指标，不能独立评估视频真实性。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2511.20937_ENACT_Evaluating_Embodied_Cognition_with_World_Modeling_of_Egocentric_Interaction.pdf"],"sha256":"fa243a0e57530b77198d33de536c651ca336843fc3703b91dab45c0fae88e1a7","pages":60,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.20937"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W3a","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P316","arxiv_id":"2511.20937","title":"ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction","year":"2025","authors":"Qineng Wang; Wenlong Huang; Yu Zhou; Hang Yin; Tianwei Bao; Jianwen Lyu; Weiyu Liu; Ruohan Zhang; Jiajun Wu; Li Fei-Fei; Manling Li","teams":["fei-fei-li"],"topics":["world_model","video_reasoning","evaluation"],"rqs":["W1c","W3a","W2d"],"collected":true,"review_status":"abstract_review","question":"第一视角长交互中的动作效果和记忆怎样排除画质干扰地评价？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答，测试具身认知与世界建模。","input_conditions":"摘要初读：ENACT 用 BEHAVIOR 合成的状态动作轨迹形成视觉问答，测试具身认知与世界建模。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"采用 VQA 而非像素生成；可作语义后果指标，不能独立评估视频真实性。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.20937"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.20937v1"}],"note":"p316","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P315","title":"Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO","short":"Video-as-Answer","year":"2025","authors":"Junhao Cheng; Liang Hou; Xin Tao; Jing Liao","collected":true,"note":"p315","scope":"本地 PDF · 方法条件已核查","summary":"VANS 将视频下一事件预测定义为任务，通过 Joint-GRPO 联合优化 VLM 的事件描述和视频扩散模型的可视化，并构建任务数据。","boundary":"事件推断与视频生成由两个模型协作；不能仅凭视频回答就认定推理全部发生在视频模型内部。","evidence":"PDF p.4 §3–4：数据与双模型接口；p.12 Appendix C、D.1：训练、统一输出与时延；pp.13–14：多未来及人工评价。方法已核查，未复现实验。","sources":["researcher-collections/jing-liao/pdfs/2511.16669_Video-as-Answer_Predict_and_Generate_Next_Video_Event_with_Joint-GRPO.pdf"],"sha256":"2328c283a20c8a8e5914843cca13237ed7bd500249d06f742408bdfcef3dae18","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.16669"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"core"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P315","arxiv_id":"2511.16669","title":"Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO","year":"2025","authors":"Junhao Cheng; Liang Hou; Xin Tao; Jing Liao","teams":["jing-liao"],"topics":["video_gen","video_reasoning"],"rqs":["W1c","X1b"],"collected":true,"review_status":"method_checked","question":"如何用连续视频回答给定上下文中的下一事件问题？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VANS 将视频下一事件预测定义为任务，通过 Joint-GRPO 联合优化 VLM 的事件描述和视频扩散模型的可视化，并构建任务数据。","input_conditions":"输入上下文视频和程序性／预测性问题；VLM 产生下一事件描述，VDM 额外使用 6 个参考帧的 VAE 特征。","training_supervision":"Qwen2.5-VL-3B + Wan-2.1-1.3B；VANS-Data-100K 含程序与预测样本。先分别监督训练，再用 Joint-GRPO 联合对齐；不是只微调一个视频 LoRA。","inference_support":"事件推断由 VLM 产生文字描述，视频模型负责条件生成。论文报告约 4 秒描述 + 35 秒视频，但该段未交代硬件，不能移植为 A10 延迟。","evaluation":"统一输出 352×640、33 帧；比较文本、FVD、CLIP 指标及人工评价。多未来展示位于附录；不等于配对干预的物理真值验证。","boundary":"与 Foresee 的视频回答和多分支探索最接近之一；推理属于 VLM/VDM 协作。CLIP/FVD 和偏好不足以证实同初态不同动作的因果后果正确。","observed_failures":"","evidence":"PDF p.4 §3–4：数据与双模型接口；p.12 Appendix C、D.1：训练、统一输出与时延；pp.13–14：多未来及人工评价。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.16669"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.16669v2"}],"note":"p315","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":100,"mapping_roles":{"W1c":"core"}},"aliases":[]},{"id":"P314","title":"Computer-Use Agents as Judges for Generative User Interface","short":"Computer-Use Agents as Judges for Generative User Interface","year":"2025","authors":"Kevin Qinghong Lin; Siyuan Hu; Linjie Li; Zhengyuan Yang; Lijuan Wang; Philip Torr; Mike Zheng Shou","collected":true,"note":"p314","scope":"本地 PDF · 摘要初读","summary":"作者提出 AUI-Gym，以 Coder 与计算机使用 agent 协作，通过可执行任务和可视化反馈改进界面。","boundary":"agent 评价不替代真实用户体验，需要区分功能可达与人的使用效用。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2511.15567_Computer-Use_Agents_as_Judges_for_Generative_User_Interface.pdf"],"sha256":"ad59baf14a2e90fce2641e795e20abb005a84120dbeb70bae304c5ac37b93a20","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.15567"}],"verified":"2026-09-19","mappings":[{"rq":"X3b","role":"support"},{"rq":"X3c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P314","arxiv_id":"2511.15567","title":"Computer-Use Agents as Judges for Generative User Interface","year":"2025","authors":"Kevin Qinghong Lin; Siyuan Hu; Linjie Li; Zhengyuan Yang; Lijuan Wang; Philip Torr; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci","evaluation"],"rqs":["X3b","X3c","X4a"],"collected":true,"review_status":"abstract_review","question":"界面生成能否用实际操作 agent 检查功能并指导修改？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者提出 AUI-Gym，以 Coder 与计算机使用 agent 协作，通过可执行任务和可视化反馈改进界面。","input_conditions":"摘要初读：作者提出 AUI-Gym，以 Coder 与计算机使用 agent 协作，通过可执行任务和可视化反馈改进界面。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"agent 评价不替代真实用户体验，需要区分功能可达与人的使用效用。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.15567"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.15567v1"}],"note":"p314","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P313","title":"ARC Is a Vision Problem!","short":"ARC Is a Vision Problem!","year":"2025","authors":"Keya Hu; Ali Cy; Linlu Qiu; Xiaoman Delores Ding; Runqian Wang; Yeyin Eva Zhu; Jacob Andreas; Kaiming He","collected":true,"note":"p313","scope":"本地 PDF · 摘要初读","summary":"Vision ARC 把 ARC 网格任务改写为画布上的图像到图像映射，从 ARC 数据训练，并通过测试时训练适应新任务。","boundary":"视觉推理不等于视频推理；测试时适配成本与任务限定的数据范围需保留。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2511.14761_ARC_Is_a_Vision_Problem.pdf"],"sha256":"0f7c95b5243039fb95827b1f440fd548a96431fb79db551dadf9ebb53e9cb1e0","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.14761"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P313","arxiv_id":"2511.14761","title":"ARC Is a Vision Problem!","year":"2025","authors":"Keya Hu; Ali Cy; Linlu Qiu; Xiaoman Delores Ding; Runqian Wang; Yeyin Eva Zhu; Jacob Andreas; Kaiming He","teams":["kaiming-he"],"topics":["video_reasoning","generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"抽象规则任务能否用纯视觉表示和测试时训练来求解？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Vision ARC 把 ARC 网格任务改写为画布上的图像到图像映射，从 ARC 数据训练，并通过测试时训练适应新任务。","input_conditions":"摘要初读：Vision ARC 把 ARC 网格任务改写为画布上的图像到图像映射，从 ARC 数据训练，并通过测试时训练适应新任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视觉推理不等于视频推理；测试时适配成本与任务限定的数据范围需保留。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.14761"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.14761v1"}],"note":"p313","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P312","title":"Back to Basics: Let Denoising Generative Models Denoise","short":"Back to Basics","year":"2025","authors":"Tianhong Li; Kaiming He","collected":true,"note":"p312","scope":"本地 PDF · 摘要初读","summary":"JiT 以大块像素 Transformer 直接预测干净数据，研究去噪目标与流形假设，避免依赖额外 tokenizer。","boundary":"主要验证图像生成，尚需实测其设计在视频时间一致性上的效果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2511.13720_Back_to_Basics_Let_Denoising_Generative_Models_Denoise.pdf"],"sha256":"8c265e4adfd488ccbce035a53ad9055edddd02f5c0393738f54da583ee832b8f","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.13720"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P312","arxiv_id":"2511.13720","title":"Back to Basics: Let Denoising Generative Models Denoise","year":"2025","authors":"Tianhong Li; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"直接预测干净像素能否简化高维扩散模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"JiT 以大块像素 Transformer 直接预测干净数据，研究去噪目标与流形假设，避免依赖额外 tokenizer。","input_conditions":"摘要初读：JiT 以大块像素 Transformer 直接预测干净数据，研究去噪目标与流形假设，避免依赖额外 tokenizer。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要验证图像生成，尚需实测其设计在视频时间一致性上的效果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.13720"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.13720v2"}],"note":"p312","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P311","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","short":"LeJEPA","year":"2025","authors":"Randall Balestriero; Yann LeCun","collected":true,"note":"p311","scope":"本地 PDF · 摘要初读","summary":"LeJEPA 提出 Sketched Isotropic Gaussian Regularization，研究表示分布与下游预测风险的联系。","boundary":"表示学习理论不是任意环境机制可辨识或长期规划可靠性的证明。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2511.08544_LeJEPA_Provable_and_Scalable_Self-Supervised_Learning_Without_the_Heuristics.pdf"],"sha256":"fe06b5488907f56aa9682e2e2febc552d85fe761fda43f2727e65d60fbeb6485","pages":50,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2511.08544"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P311","arxiv_id":"2511.08544","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","year":"2025","authors":"Randall Balestriero; Yann LeCun","teams":["yann-lecun"],"topics":["generative_foundation","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"怎样简化并理论化 JEPA 的防坍塌表征学习目标？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LeJEPA 提出 Sketched Isotropic Gaussian Regularization，研究表示分布与下游预测风险的联系。","input_conditions":"摘要初读：LeJEPA 提出 Sketched Isotropic Gaussian Regularization，研究表示分布与下游预测风险的联系。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"表示学习理论不是任意环境机制可辨识或长期规划可靠性的证明。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2511.08544"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2511.08544v3"}],"note":"p311","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P330","title":"Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow","short":"Dream2Flow","year":"2025","authors":"Karthik Dharmarajan; Wenlong Huang; Jiajun Wu; Li Fei-Fei; Ruohan Zhang","collected":true,"note":"p330","scope":"本地 PDF · 摘要初读","summary":"Dream2Flow 从生成视频恢复三维物体流，再以轨迹跟踪连接操作控制。","boundary":"真实执行还依赖三维恢复与控制器；必须区分生成和下游转换的误差。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2512.24766_Dream2Flow_Bridging_Video_Generation_and_Open-World_Manipulation_with_3D_Object_Flow.pdf"],"sha256":"873040c1844b4e34f493b1dff8ac4eb16948b23b2fd220adfba2f5dfcb05daad","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.24766"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P330","arxiv_id":"2512.24766","title":"Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow","year":"2025","authors":"Karthik Dharmarajan; Wenlong Huang; Jiajun Wu; Li Fei-Fei; Ruohan Zhang","teams":["fei-fei-li"],"topics":["video_gen","geometry","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"生成视频中的物体运动怎样转成机器人可追踪的任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Dream2Flow 从生成视频恢复三维物体流，再以轨迹跟踪连接操作控制。","input_conditions":"摘要初读：Dream2Flow 从生成视频恢复三维物体流，再以轨迹跟踪连接操作控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"真实执行还依赖三维恢复与控制器；必须区分生成和下游转换的误差。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.24766"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.24766"}],"note":"p330","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P329","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","short":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","year":"2025","authors":"Basile Terver; Tsung-Yen Yang; Jean Ponce; Adrien Bardes; Yann LeCun","collected":true,"note":"p329","scope":"本地 PDF · 摘要初读","summary":"作者系统比较表示、训练目标和规划器配置，并在仿真和真实任务中检查效果。","boundary":"需要按统一数据和预算读比较结果；规划成功不能替代视频真实性评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2512.24497_What_Drives_Success_in_Physical_Planning_with_Joint-Embedding_Predictive_World_Models.pdf"],"sha256":"d2dd4364de28d0b41f7001d26fd8d43487c31a9df5a5759ef319f89adad39a18","pages":55,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.24497"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P329","arxiv_id":"2512.24497","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","year":"2025","authors":"Basile Terver; Tsung-Yen Yang; Jean Ponce; Adrien Bardes; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","evaluation"],"rqs":["W2d","W4a"],"collected":true,"review_status":"abstract_review","question":"JEPA 世界模型的物理规划成功主要受哪些设计影响？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者系统比较表示、训练目标和规划器配置，并在仿真和真实任务中检查效果。","input_conditions":"摘要初读：作者系统比较表示、训练目标和规划器配置，并在仿真和真实任务中检查效果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"需要按统一数据和预算读比较结果；规划成功不能替代视频真实性评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.24497"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.24497v4"}],"note":"p329","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P328","title":"QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models","short":"QuantiPhy","year":"2025","authors":"Li Puyin; Tiange Xiang; Ella Mao; Shirley Wei; Xinye Chen; Adnan Masood; Li Fei-fei; Ehsan Adeli","collected":true,"note":"p328","scope":"本地 PDF · 摘要初读","summary":"QuantiPhy 以数值真值评价尺寸、速度和加速度估计，并改变背景和反事实先验。","boundary":"主要测试 VLM 数值推理，不是生成未来视频的物理正确率。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2512.19526_QuantiPhy_A_Quantitative_Benchmark_Evaluating_Physical_Reasoning_Abilities_of_Vision-Language_Models.pdf"],"sha256":"bf80d110c59702360c656cdb49eb1ab5e6993125e9a9842d7c1c11de33c58786","pages":50,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.19526"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P328","arxiv_id":"2512.19526","title":"QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models","year":"2025","authors":"Li Puyin; Tiange Xiang; Ella Mao; Shirley Wei; Xinye Chen; Adnan Masood; Li Fei-fei; Ehsan Adeli","teams":["fei-fei-li"],"topics":["physics","video_reasoning","evaluation"],"rqs":["W2d","W4b"],"collected":true,"review_status":"abstract_review","question":"模型能否从视频和给定量纲先验准确估计运动物理量？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"QuantiPhy 以数值真值评价尺寸、速度和加速度估计，并改变背景和反事实先验。","input_conditions":"摘要初读：QuantiPhy 以数值真值评价尺寸、速度和加速度估计，并改变背景和反事实先验。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要测试 VLM 数值推理，不是生成未来视频的物理正确率。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.19526"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.19526v1"}],"note":"p328","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P327","title":"Mitty: Diffusion-based Human-to-Robot Video Generation","short":"Mitty","year":"2025","authors":"Yiren Song; Cheng Liu; Weijia Mao; Mike Zheng Shou","collected":true,"note":"p327","scope":"本地 PDF · 摘要初读","summary":"Mitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。","boundary":"动作来源视频已知；外形迁移质量与真实操作成功需要分开验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2512.17253_Mitty_Diffusion-based_Human-to-Robot_Video_Generation.pdf"],"sha256":"a883300a26ac1469f6e06dc131df89cb2478ec3ac62eb8c1ad10b2ec5ae9d695","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.17253"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P327","arxiv_id":"2512.17253","title":"Mitty: Diffusion-based Human-to-Robot Video Generation","year":"2025","authors":"Yiren Song; Cheng Liu; Weijia Mao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"人类操作视频怎样端到端转成机器人外形的视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Mitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。","input_conditions":"摘要初读：Mitty 利用视频上下文学习与自动合成人机配对数据进行 Human2Robot 转换。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"动作来源视频已知；外形迁移质量与真实操作成功需要分开验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.17253"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.17253v1"}],"note":"p327","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P326","title":"World Models for Learning Dexterous Hand-Object Interactions from Human Videos","short":"World Models for Learning Dexterous Hand-Object Interactions from Human Videos","year":"2025","authors":"Raktim Gautam Goswami; Amir Bar; David Fan; Tsung-Yen Yang; Gaoyue Zhou; Prashanth Krishnamurthy; Michael Rabbat; Farshad Khorrami; Yann LeCun","collected":true,"note":"p326","scope":"本地 PDF · 摘要初读","summary":"DexWM 使用手指关键点动作表示与潜状态、手部一致性目标，学习可用于灵巧规划的动态表示。","boundary":"主要预测潜状态；人到机器人动作映射与写实后果生成是另外的环节。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2512.13644_World_Models_for_Learning_Dexterous_Hand-Object_Interactions_from_Human_Videos.pdf"],"sha256":"caa494829e49b893346ae4fcedbe462e99f197192c7e84d27405a2776723a390","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.13644"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P326","arxiv_id":"2512.13644","title":"World Models for Learning Dexterous Hand-Object Interactions from Human Videos","year":"2025","authors":"Raktim Gautam Goswami; Amir Bar; David Fan; Tsung-Yen Yang; Gaoyue Zhou; Prashanth Krishnamurthy; Michael Rabbat; Farshad Khorrami; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"人类第一人称手部视频能否支持灵巧操作世界模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DexWM 使用手指关键点动作表示与潜状态、手部一致性目标，学习可用于灵巧规划的动态表示。","input_conditions":"摘要初读：DexWM 使用手指关键点动作表示与潜状态、手部一致性目标，学习可用于灵巧规划的动态表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要预测潜状态；人到机器人动作映射与写实后果生成是另外的环节。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.13644"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.13644v2"}],"note":"p326","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P325","title":"Animus3D: Text-driven 3D Animation via Motion Score Distillation","short":"Animus3D","year":"2025","authors":"Qi Sun; Can Wang; Jiaxiang Shang; Wensen Feng; Jing Liao","collected":true,"note":"p325","scope":"本地 PDF · 摘要初读","summary":"Animus3D 以运动分数蒸馏优化运动场，利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。","boundary":"由视频先验蒸馏出的运动仍需单独检验物理参数和干预后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2512.12534_Animus3D_Text-driven_3D_Animation_via_Motion_Score_Distillation.pdf"],"sha256":"c9e3d50c33c9c3b9bd088293d01d2f953c69787bd24db4a9259627d7262581d6","pages":11,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.12534"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P325","arxiv_id":"2512.12534","title":"Animus3D: Text-driven 3D Animation via Motion Score Distillation","year":"2025","authors":"Qi Sun; Can Wang; Jiaxiang Shang; Wensen Feng; Jing Liao","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"如何从文本和静态三维资产生成稳定且明显的运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Animus3D 以运动分数蒸馏优化运动场，利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。","input_conditions":"摘要初读：Animus3D 以运动分数蒸馏优化运动场，利用 LoRA 静态分布、反演估噪及时空正则保持外观与运动细节。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"由视频先验蒸馏出的运动仍需单独检验物理参数和干预后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.12534"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2512.12534"}],"note":"p325","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P324","title":"Bidirectional Normalizing Flow: From Data to Noise and Back","short":"Bidirectional Normalizing Flow","year":"2025","authors":"Yiyang Lu; Qiao Sun; Xianbang Wang; Zhicheng Jiang; Hanhong Zhao; Kaiming He","collected":true,"note":"p324","scope":"本地 PDF · 摘要初读","summary":"BiFlow 放宽精确解析逆的要求，通过双向归一化流改进生成质量和采样效率。","boundary":"单次函数评估及图像采样速度不等于完整视频管线的端到端延迟。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2512.10953_Bidirectional_Normalizing_Flow_From_Data_to_Noise_and_Back.pdf"],"sha256":"c1de5fd627ede22ecfb4abdb7f24118656a3194fbce9fe8994162926835a8c9d","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.10953"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P324","arxiv_id":"2512.10953","title":"Bidirectional Normalizing Flow: From Data to Noise and Back","year":"2025","authors":"Yiyang Lu; Qiao Sun; Xianbang Wang; Zhicheng Jiang; Hanhong Zhao; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"归一化流怎样避免因果解码带来的采样瓶颈？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"BiFlow 放宽精确解析逆的要求，通过双向归一化流改进生成质量和采样效率。","input_conditions":"摘要初读：BiFlow 放宽精确解析逆的要求，通过双向归一化流改进生成质量和采样效率。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"单次函数评估及图像采样速度不等于完整视频管线的端到端延迟。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.10953"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.10953"}],"note":"p324","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P323","title":"VL-JEPA: Joint Embedding Predictive Architecture for Vision-language","short":"VL-JEPA","year":"2025","authors":"Delong Chen; Mustafa Shukor; Theo Moutakanni; Willy Chung; Jade Yu; Tejaswi Kasarla; Yejin Bang; Allen Bolourchi; Yann LeCun; Pascale Fung","collected":true,"note":"p323","scope":"本地 PDF · 摘要初读","summary":"VL-JEPA 将视觉语言预测放在语义嵌入空间，研究选择性解码与视频理解。","boundary":"这是视觉语言理解架构，不是直接生成未来视频的世界模型。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2512.10942_VL-JEPA_Joint_Embedding_Predictive_Architecture_for_Vision-language.pdf"],"sha256":"f3218282df13e288d07056e05a50e1306e4cb2b87cd7292538c9da9daf3d7439","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.10942"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P323","arxiv_id":"2512.10942","title":"VL-JEPA: Joint Embedding Predictive Architecture for Vision-language","year":"2025","authors":"Delong Chen; Mustafa Shukor; Theo Moutakanni; Willy Chung; Jade Yu; Tejaswi Kasarla; Yejin Bang; Allen Bolourchi; Yann LeCun; Pascale Fung","teams":["yann-lecun"],"topics":["video_understanding","generative_foundation"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"视觉语言系统能否预测语义表示并按需解码文本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VL-JEPA 将视觉语言预测放在语义嵌入空间，研究选择性解码与视频理解。","input_conditions":"摘要初读：VL-JEPA 将视觉语言预测放在语义嵌入空间，研究选择性解码与视频理解。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是视觉语言理解架构，不是直接生成未来视频的世界模型。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.10942"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.10942v2"}],"note":"p323","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P322","title":"Closing the Train-Test Gap in World Models for Gradient-Based Planning","short":"Closing the Train-Test Gap in World Models for Gradient-Based Planning","year":"2025","authors":"Arjun Parthasarathy; Nimit Kalra; Rohun Agrawal; Yann LeCun; Oumayma Bounou; Pavel Izmailov; Micah Goldblum","collected":true,"note":"p322","scope":"本地 PDF · 摘要初读","summary":"作者以面向规划的数据合成和训练设计，改善 JEPA 在梯度动作规划中的使用效果。","boundary":"规划适配的收益需在一致预算下比较，不代表所有长程后果都可信。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2512.09929_Closing_the_Train-Test_Gap_in_World_Models_for_Gradient-Based_Planning.pdf"],"sha256":"f09aa7c2cd408d3fd5abbb964652cc14261d53aa2e00abc582eba3ed4dbbffad","pages":25,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.09929"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P322","arxiv_id":"2512.09929","title":"Closing the Train-Test Gap in World Models for Gradient-Based Planning","year":"2025","authors":"Arjun Parthasarathy; Nimit Kalra; Rohun Agrawal; Yann LeCun; Oumayma Bounou; Pavel Izmailov; Micah Goldblum","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"训练时预测转移与测试时优化动作之间的差别如何缩小？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者以面向规划的数据合成和训练设计，改善 JEPA 在梯度动作规划中的使用效果。","input_conditions":"摘要初读：作者以面向规划的数据合成和训练设计，改善 JEPA 在梯度动作规划中的使用效果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"规划适配的收益需在一致预算下比较，不代表所有长程后果都可信。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.09929"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.09929"}],"note":"p322","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P321","title":"H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos","short":"H2R-Grounder","year":"2025","authors":"Hai Ci; Xiaokang Liu; Pei Yang; Yiren Song; Mike Zheng Shou","collected":true,"note":"p321","scope":"本地 PDF · 摘要初读","summary":"H2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频，并微调 Wan 模型。","boundary":"运动提示提供额外轨迹信息；视觉上的物理贴合不等于低层控制可执行。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2512.09406_H2R-Grounder_A_Paired-Data-Free_Paradigm_for_Translating_Human_Interaction_Videos_into_Physically_Grounded_Robot_Vi.pdf"],"sha256":"38d17367bcbdb98b124fd00d14ff3bd0ac717312079b92e00a6b12d4adcfbff4","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.09406"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P321","arxiv_id":"2512.09406","title":"H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos","year":"2025","authors":"Hai Ci; Xiaokang Liu; Pei Yang; Yiren Song; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","geometry","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"没有人机配对视频时如何生成保持动作的机器人视频？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"H2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频，并微调 Wan 模型。","input_conditions":"摘要初读：H2R-Grounder 用背景修补及夹爪位置、方向视觉提示连接人类与机器人视频，并微调 Wan 模型。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"运动提示提供额外轨迹信息；视觉上的物理贴合不等于低层控制可执行。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.09406"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.09406"}],"note":"p321","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P340","title":"Generative Modeling via Drifting","short":"Generative Modeling via Drifting","year":"2026","authors":"Mingyang Deng; He Li; Tianhong Li; Yilun Du; Kaiming He","collected":true,"note":"p340","scope":"本地 PDF · 摘要初读","summary":"Drifting Models 通过漂移场推动生成样本分布与数据分布匹配，形成单步推理的生成器。","boundary":"ImageNet 图像结果不能直接作为视频时序质量或小显存实时性的证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2602.04770_Generative_Modeling_via_Drifting.pdf"],"sha256":"4c6de150102edf01fdde787a2bc6d20962cd2021769db09e41c4ac7fb4ab852f","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.04770"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P340","arxiv_id":"2602.04770","title":"Generative Modeling via Drifting","year":"2026","authors":"Mingyang Deng; He Li; Tianhong Li; Yilun Du; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"能否在训练阶段演化生成分布，从而只用一步采样？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Drifting Models 通过漂移场推动生成样本分布与数据分布匹配，形成单步推理的生成器。","input_conditions":"摘要初读：Drifting Models 通过漂移场推动生成样本分布与数据分布匹配，形成单步推理的生成器。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"ImageNet 图像结果不能直接作为视频时序质量或小显存实时性的证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.04770"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.04770v2"}],"note":"p340","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P339","title":"A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures","short":"A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures","year":"2026","authors":"Basile Terver; Randall Balestriero; Megi Dervishi; David Fan; Quentin Garrido; Tushar Nagarajan; Koustuv Sinha; Wancong Zhang; Mike Rabbat; Yann LeCun; Amir Bar","collected":true,"note":"p339","scope":"本地 PDF · 摘要初读","summary":"EB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。","boundary":"软件框架的覆盖范围不是每类下游能力已验证的证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2602.03604_A_Lightweight_Library_for_Energy-Based_Joint-Embedding_Predictive_Architectures.pdf"],"sha256":"45cab1dc74600314965a5bd18a9fc89afb722a5a53f99e37a30c07daf6a6ec0f","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.03604"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P339","arxiv_id":"2602.03604","title":"A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures","year":"2026","authors":"Basile Terver; Randall Balestriero; Megi Dervishi; David Fan; Quentin Garrido; Tushar Nagarajan; Koustuv Sinha; Wancong Zhang; Mike Rabbat; Yann LeCun; Amir Bar","teams":["yann-lecun"],"topics":["world_model","generative_foundation"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"怎样以统一组件实现图像、视频和动作条件 JEPA？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"EB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。","input_conditions":"摘要初读：EB-JEPA 整理表征学习与世界建模的模块化实现和实验接口。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"软件框架的覆盖范围不是每类下游能力已验证的证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.03604"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.03604v3"}],"note":"p339","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P338","title":"Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations","short":"Rectified LpJEPA","year":"2026","authors":"Yilun Kuang; Yash Dagade; Tim G. J. Rudner; Randall Balestriero; Yann LeCun","collected":true,"note":"p338","scope":"本地 PDF · 摘要初读","summary":"Rectified LpJEPA 以整流广义高斯分布约束表示，研究稀疏性与视觉表征学习。","boundary":"主要是表征基础方法；视频后果预测与规划需要另外验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2602.01456_Rectified_LpJEPA_Joint-Embedding_Predictive_Architectures_with_Sparse_and_Maximum-Entropy_Representations.pdf"],"sha256":"7533200d7ce5e32d4e9a50b31e3dcf0bbea9befaed5b56cbc44e15fac27e54da","pages":50,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.01456"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P338","arxiv_id":"2602.01456","title":"Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations","year":"2026","authors":"Yilun Kuang; Yash Dagade; Tim G. J. Rudner; Randall Balestriero; Yann LeCun","teams":["yann-lecun"],"topics":["generative_foundation"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"能否用稀疏非负表征的分布匹配目标改善自监督学习？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Rectified LpJEPA 以整流广义高斯分布约束表示，研究稀疏性与视觉表征学习。","input_conditions":"摘要初读：Rectified LpJEPA 以整流广义高斯分布约束表示，研究稀疏性与视觉表征学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要是表征基础方法；视频后果预测与规划需要另外验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.01456"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.01456v2"}],"note":"p338","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P337","title":"Parallel Stochastic Gradient-Based Planning for World Models","short":"Parallel Stochastic Gradient-Based Planning for World Models","year":"2026","authors":"Michael Psenka; Michael Rabbat; Aditi Krishnapriyan; Yann LeCun; Amir Bar","collected":true,"note":"p337","scope":"本地 PDF · 摘要初读","summary":"GRASP 引入并行优化的虚拟状态和软动力学约束，缓解逐步展开的规划成本。","boundary":"收益依赖已学习的世界模型及优化条件，不直接解决视频生成显存占用。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2602.00475_Parallel_Stochastic_Gradient-Based_Planning_for_World_Models.pdf"],"sha256":"633bff79e5913401f578d4f13cbee65526221fef859d865cdaab6cfc0fa802a8","pages":23,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.00475"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P337","arxiv_id":"2602.00475","title":"Parallel Stochastic Gradient-Based Planning for World Models","year":"2026","authors":"Michael Psenka; Michael Rabbat; Aditi Krishnapriyan; Yann LeCun; Amir Bar","teams":["yann-lecun"],"topics":["world_model","efficiency","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"怎样加速通过可微世界模型进行动作规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GRASP 引入并行优化的虚拟状态和软动力学约束，缓解逐步展开的规划成本。","input_conditions":"摘要初读：GRASP 引入并行优化的虚拟状态和软动力学约束，缓解逐步展开的规划成本。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"收益依赖已学习的世界模型及优化条件，不直接解决视频生成显存占用。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.00475"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.00475v1"}],"note":"p337","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P336","title":"One-step Latent-free Image Generation with Pixel Mean Flows","short":"One-step Latent-free Image Generation with Pixel Mean Flows","year":"2026","authors":"Yiyang Lu; Susie Lu; Qiao Sun; Hanhong Zhao; Zhicheng Jiang; Xianbang Wang; Tianhong Li; Zhengyang Geng; Kaiming He","collected":true,"note":"p336","scope":"本地 PDF · 摘要初读","summary":"Pixel MeanFlow 区分网络输出空间和损失空间，在图像流形与平均速度之间建立转换。","boundary":"评价主要为静态图像生成；直接迁移到视频仍需处理时间维度与资源需求。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2601.22158_One-step_Latent-free_Image_Generation_with_Pixel_Mean_Flows.pdf"],"sha256":"eeb12d58cad222029d10c2549e68cb68de890dae84dcf1b1692c4368e47004a0","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2601.22158"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P336","arxiv_id":"2601.22158","title":"One-step Latent-free Image Generation with Pixel Mean Flows","year":"2026","authors":"Yiyang Lu; Susie Lu; Qiao Sun; Hanhong Zhao; Zhicheng Jiang; Xianbang Wang; Tianhong Li; Zhengyang Geng; Kaiming He","teams":["kaiming-he"],"topics":["generative_foundation","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"如何实现无需潜空间编码器的单步像素图像生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Pixel MeanFlow 区分网络输出空间和损失空间，在图像流形与平均速度之间建立转换。","input_conditions":"摘要初读：Pixel MeanFlow 区分网络输出空间和损失空间，在图像流形与平均速度之间建立转换。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"评价主要为静态图像生成；直接迁移到视频仍需处理时间维度与资源需求。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2601.22158"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2601.22158v3"}],"note":"p336","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P335","title":"ShowUI-Aloha: Human-Taught GUI Agent","short":"ShowUI-Aloha","year":"2026","authors":"Yichun Zhang; Xiangwu Guo; Yauhong Goh; Jessica Hu; Zhiheng Chen; Xin Wang; Difei Gao; Mike Zheng Shou","collected":true,"note":"p335","scope":"本地 PDF · 摘要初读","summary":"ShowUI-Aloha 结合录屏和精确交互记录，整理可执行任务与示范数据。","boundary":"软件界面操作与物理 AR 任务存在状态和动作接口差别。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2601.07181_ShowUI-Aloha_Human-Taught_GUI_Agent.pdf"],"sha256":"b3904c9a6bb4a90932307a97dba7f34754a6b29a7027d4fd1753aa700d82e83c","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2601.07181"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P335","arxiv_id":"2601.07181","title":"ShowUI-Aloha: Human-Taught GUI Agent","year":"2026","authors":"Yichun Zhang; Xiangwu Guo; Yauhong Goh; Jessica Hu; Zhiheng Chen; Xin Wang; Difei Gao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci"],"rqs":["X1b","X4a"],"collected":true,"review_status":"abstract_review","question":"怎样把非结构化人类录屏转成 GUI agent 可学习的任务？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ShowUI-Aloha 结合录屏和精确交互记录，整理可执行任务与示范数据。","input_conditions":"摘要初读：ShowUI-Aloha 结合录屏和精确交互记录，整理可执行任务与示范数据。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"软件界面操作与物理 AR 任务存在状态和动作接口差别。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2601.07181"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2601.07181v1"}],"note":"p335","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P334","title":"Learning Latent Action World Models In The Wild","short":"Learning Latent Action World Models In The Wild","year":"2026","authors":"Quentin Garrido; Tushar Nagarajan; Basile Terver; Nicolas Ballas; Yann LeCun; Michael Rabbat","collected":true,"note":"p334","scope":"本地 PDF · 摘要初读","summary":"作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模，减少对离散动作码的依赖。","boundary":"潜动作的控制效果不代表动作语义具有唯一的因果解释。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2601.05230_Learning_Latent_Action_World_Models_In_The_Wild.pdf"],"sha256":"b005b53ccba93bcc68471d7c9fb88b1504849b8e63f11395d18d6535fec2bca4","pages":37,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2601.05230"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P334","arxiv_id":"2601.05230","title":"Learning Latent Action World Models In The Wild","year":"2026","authors":"Quentin Garrido; Tushar Nagarajan; Basile Terver; Nicolas Ballas; Yann LeCun; Michael Rabbat","teams":["yann-lecun"],"topics":["world_model","video_gen"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"无动作标注的真实视频能否提供可迁移的连续潜动作？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模，减少对离散动作码的依赖。","input_conditions":"摘要初读：作者从自然视频学习受约束的连续潜动作并用于动作条件世界建模，减少对离散动作码的依赖。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"潜动作的控制效果不代表动作语义具有唯一的因果解释。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2601.05230"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2601.05230v2"}],"note":"p334","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P333","title":"PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation","short":"PointWorld","year":"2026","authors":"Wenlong Huang; Yu-Wei Chao; Arsalan Mousavian; Ming-Yu Liu; Dieter Fox; Kaichun Mo; Li Fei-Fei","collected":true,"note":"p333","scope":"本地 PDF · 摘要初读","summary":"PointWorld 从 RGB-D 与动作预测逐像素三维位移，并以真实、合成轨迹研究跨本体规模化训练。","boundary":"三维位移预测与写实视频渲染是不同输出；动作和深度是额外条件。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2601.03782_PointWorld_Scaling_3D_World_Models_for_In-The-Wild_Robotic_Manipulation.pdf"],"sha256":"368ee87a0aeb2b784026d4eb0bd47e38937759473a2762f0ac338f9ad06a4b08","pages":38,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2601.03782"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P333","arxiv_id":"2601.03782","title":"PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation","year":"2026","authors":"Wenlong Huang; Yu-Wei Chao; Arsalan Mousavian; Ming-Yu Liu; Dieter Fox; Kaichun Mo; Li Fei-Fei","teams":["fei-fei-li"],"topics":["world_model","geometry","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"不同机器人能否在统一三维点流中表达动作和状态变化？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PointWorld 从 RGB-D 与动作预测逐像素三维位移，并以真实、合成轨迹研究跨本体规模化训练。","input_conditions":"摘要初读：PointWorld 从 RGB-D 与动作预测逐像素三维位移，并以真实、合成轨迹研究跨本体规模化训练。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"三维位移预测与写实视频渲染是不同输出；动作和深度是额外条件。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2601.03782"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2601.03782"}],"note":"p333","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P332","title":"Value-guided action planning with JEPA world models","short":"Value-guided action planning with JEPA world models","year":"2025","authors":"Matthieu Destrade; Oumayma Bounou; Quentin Le Lidec; Jean Ponce; Yann LeCun","collected":true,"note":"p332","scope":"本地 PDF · 摘要初读","summary":"Value-guided action planning 使表示距离近似目标条件价值，从而为动作优化提供更有用的信号。","boundary":"引入任务价值改变了监督条件，不能直接与纯无奖励表示学习等同。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2601.00844_Value-guided_action_planning_with_JEPA_world_models.pdf"],"sha256":"ba1c5eb85c58ac4d1ab81b707019751689b2a7dc10f4d3f5db9ceb8d3ada35e3","pages":7,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2601.00844"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P332","arxiv_id":"2601.00844","title":"Value-guided action planning with JEPA world models","year":"2025","authors":"Matthieu Destrade; Oumayma Bounou; Quentin Le Lidec; Jean Ponce; Yann LeCun","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"如何让潜空间距离更接近任务价值而改善动作规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Value-guided action planning 使表示距离近似目标条件价值，从而为动作优化提供更有用的信号。","input_conditions":"摘要初读：Value-guided action planning 使表示距离近似目标条件价值，从而为动作优化提供更有用的信号。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"引入任务价值改变了监督条件，不能直接与纯无奖励表示学习等同。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2601.00844"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2601.00844v1"}],"note":"p332","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P331","title":"ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands","short":"ShowUI-$π$","year":"2025","authors":"Siyuan Hu; Kevin Qinghong Lin; Mike Zheng Shou","collected":true,"note":"p331","scope":"本地 PDF · 摘要初读","summary":"ShowUI-π 用 flow 模型生成连续鼠标调整，并构建拖拽数据与 ScreenDrag 基准。","boundary":"输出是界面动作轨迹，不能当作像素视频生成模型的推理结果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2512.24965_ShowUI-_Flow-based_Generative_Models_as_GUI_Dexterous_Hands.pdf"],"sha256":"15c655e464f2f9ed719c6cdc796777658952cff8b4529c14f337373fa1e0d8c7","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2512.24965"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P331","arxiv_id":"2512.24965","title":"ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands","year":"2025","authors":"Siyuan Hu; Kevin Qinghong Lin; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci"],"rqs":["X1a","X3c"],"collected":true,"review_status":"abstract_review","question":"GUI agent 怎样同时生成点击与连续拖拽动作？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ShowUI-π 用 flow 模型生成连续鼠标调整，并构建拖拽数据与 ScreenDrag 基准。","input_conditions":"摘要初读：ShowUI-π 用 flow 模型生成连续鼠标调整，并构建拖拽数据与 ScreenDrag 基准。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"输出是界面动作轨迹，不能当作像素视频生成模型的推理结果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2512.24965"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2512.24965"}],"note":"p331","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P350","title":"Temporal Straightening for Latent Planning","short":"Temporal Straightening for Latent Planning","year":"2026","authors":"Ying Wang; Oumayma Bounou; Gaoyue Zhou; Randall Balestriero; Tim G. J. Rudner; Yann LeCun; Mengye Ren","collected":true,"note":"p350","scope":"本地 PDF · 摘要初读","summary":"Temporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。","boundary":"更易优化的潜空间不必等同于真实世界的线性动力学或显式机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2603.12231_Temporal_Straightening_for_Latent_Planning.pdf"],"sha256":"832ded537e06439556493d215e22568fc6d530d252b13b0d5895417ff25e4a3b","pages":29,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.12231"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P350","arxiv_id":"2603.12231","title":"Temporal Straightening for Latent Planning","year":"2026","authors":"Ying Wang; Oumayma Bounou; Gaoyue Zhou; Randall Balestriero; Tim G. J. Rudner; Yann LeCun; Mengye Ren","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"怎样使潜空间轨迹更利于梯度规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Temporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。","input_conditions":"摘要初读：Temporal Straightening 用轨迹曲率约束改善潜空间距离和规划优化条件。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"更易优化的潜空间不必等同于真实世界的线性动力学或显式机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.12231"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.12231v3"}],"note":"p350","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P349","title":"EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation","short":"EffectMaker","year":"2026","authors":"Shiyuan Yang; Ruihuang Li; Jiale Tao; Shuai Shao; Qinglin Lu; Jing Liao","collected":true,"note":"p349","scope":"本地 PDF · 摘要初读","summary":"EffectMaker 将推理和特效生成连接，构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。","boundary":"特效可以刻意违背真实物理；应分别核对参考一致性、可控性与推理承担者。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2603.06014_EffectMaker_Unifying_Reasoning_and_Generation_for_Customized_Visual_Effect_Creation.pdf"],"sha256":"6f5c7200c87c1527aff00a1382e8b2101e51006a94d8a1fe0d291aefb60bdd3e","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.06014"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P349","arxiv_id":"2603.06014","title":"EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation","year":"2026","authors":"Shiyuan Yang; Ruihuang Li; Jiale Tao; Shuai Shao; Qinglin Lu; Jing Liao","teams":["jing-liao"],"topics":["video_gen","video_reasoning"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"如何从参考效果中推断并生成可定制的视频特效？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"EffectMaker 将推理和特效生成连接，构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。","input_conditions":"摘要初读：EffectMaker 将推理和特效生成连接，构建覆盖多类视觉效果的合成训练数据以支持参考条件定制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"特效可以刻意违背真实物理；应分别核对参考一致性、可控性与推理承担者。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.06014"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.06014v1"}],"note":"p349","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P348","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","short":"Kiwi-Edit","year":"2026","authors":"Yiqi Lin; Guoqiang Liang; Ziyun Zeng; Zechen Bai; Yanzhe Chen; Mike Zheng Shou","collected":true,"note":"p348","scope":"本地 PDF · 摘要初读","summary":"Kiwi-Edit 构建参考图引导的编辑四元组数据，并以多阶段训练融合语义查询和视觉特征。","boundary":"参考遵循和编辑保持与干预后果的因果正确性不同。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2603.02175_Kiwi-Edit_Versatile_Video_Editing_via_Instruction_and_Reference_Guidance.pdf"],"sha256":"9dff3f5ac153e0195fad13ac26e82825238bbe2c60206fb50c4718b61755191d","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.02175"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P348","arxiv_id":"2603.02175","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","year":"2026","authors":"Yiqi Lin; Guoqiang Liang; Ziyun Zeng; Zechen Bai; Yanzhe Chen; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["X4a","W3b"],"collected":true,"review_status":"abstract_review","question":"视频编辑能否同时精确遵循语言与视觉参考？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Kiwi-Edit 构建参考图引导的编辑四元组数据，并以多阶段训练融合语义查询和视觉特征。","input_conditions":"摘要初读：Kiwi-Edit 构建参考图引导的编辑四元组数据，并以多阶段训练融合语义查询和视觉特征。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"参考遵循和编辑保持与干预后果的因果正确性不同。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.02175"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.02175"}],"note":"p348","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P347","title":"Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs","short":"Learning from Trials and Errors","year":"2026","authors":"Yining Hong; Huang Huang; Manling Li; Li Fei-Fei; Leonidas Guibas; Jiajun Wu; Yejin Choi","collected":true,"note":"p347","scope":"本地 PDF · 摘要初读","summary":"Reflective Test-Time Planning 在行动前评分候选，行动后以外部反馈更新模型，并追溯早期决策。","boundary":"推理和更新主要由具身语言 agent 承担，不能作为视频生成模型内生推理证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2602.21198_Learning_from_Trials_and_Errors_Reflective_Test-Time_Planning_for_Embodied_LLMs.pdf"],"sha256":"04876b8eb9758dad5fbe793b5fa2b603974674cca46e2e7fbf3cd55d8552e28f","pages":33,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.21198"}],"verified":"2026-09-19","mappings":[{"rq":"W1d","role":"support"},{"rq":"X3b","role":"support"}],"annotation":{"id":"P347","arxiv_id":"2602.21198","title":"Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs","year":"2026","authors":"Yining Hong; Huang Huang; Manling Li; Li Fei-Fei; Leonidas Guibas; Jiajun Wu; Yejin Choi","teams":["fei-fei-li"],"topics":["agent","world_model"],"rqs":["W1d","X3b"],"collected":true,"review_status":"abstract_review","question":"执行前后反思怎样共同改善长程具身规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Reflective Test-Time Planning 在行动前评分候选，行动后以外部反馈更新模型，并追溯早期决策。","input_conditions":"摘要初读：Reflective Test-Time Planning 在行动前评分候选，行动后以外部反馈更新模型，并追溯早期决策。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"推理和更新主要由具身语言 agent 承担，不能作为视频生成模型内生推理证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.21198"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.21198"}],"note":"p347","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P346","title":"GeoPT: Scaling Physics Simulation via Lifted Geometric Pre-Training","short":"GeoPT","year":"2026","authors":"Haixu Wu; Minghao Guo; Zongyi Li; Zhiyang Dou; Mingsheng Long; Kaiming He; Wojciech Matusik","collected":true,"note":"p346","scope":"本地 PDF · 方法条件已核查","summary":"GeoPT 用合成动态信息扩展静态几何上的自监督任务，再适配流体、固体等神经仿真任务。","boundary":"这是神经仿真器预训练，输出与评价并非写实视频生成。","evidence":"PDF pp.3–6：预训练任务、合成动态与下游适配。方法已核查，未复现实验。","sources":["researcher-collections/kaiming-he/pdfs/2602.20399_GeoPT_Scaling_Physics_Simulation_via_Lifted_Geometric_Pre-Training.pdf"],"sha256":"9c8ce699ca8c5006f19728962f66b2b042000d8b1665c1544ddc6c45a4be1428","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.20399"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P346","arxiv_id":"2602.20399","title":"GeoPT: Scaling Physics Simulation via Lifted Geometric Pre-Training","year":"2026","authors":"Haixu Wu; Minghao Guo; Zongyi Li; Zhiyang Dou; Mingsheng Long; Kaiming He; Wojciech Matusik","teams":["kaiming-he"],"topics":["physics","geometry"],"rqs":["W1c"],"collected":true,"review_status":"method_checked","question":"静态几何预训练怎样为物理仿真提供有用的动态表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GeoPT 用合成动态信息扩展静态几何上的自监督任务，再适配流体、固体等神经仿真任务。","input_conditions":"几何数据及合成动态信号；下游为神经物理仿真的流体、固体等任务。","training_supervision":"GeoPT 用随机速度、粒子和动态距离等构造预训练信号，把静态几何数据扩展为动态表征学习。","inference_support":"适配到下游物理预测器；不是完整像素视频生成管线。","evaluation":"下游神经仿真任务评估；本轮未把仿真误差转写为视频生成质量结论。","boundary":"可以提供几何表征与物理监督的训练思路；不能直接作为自然视频推理的实验基线。","observed_failures":"","evidence":"PDF pp.3–6：预训练任务、合成动态与下游适配。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.20399"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.20399v2"}],"note":"p346","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":82},"aliases":[]},{"id":"P345","title":"Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling","short":"Ani3DHuman","year":"2026","authors":"Qi Sun; Can Wang; Jiaxiang Shang; Yingchun Liu; Jing Liao","collected":true,"note":"p345","scope":"本地 PDF · 摘要初读","summary":"Ani3DHuman 将刚性骨架运动与残余非刚性运动分层，由粗渲染引导视频扩散，再通过自引导随机采样兼顾外观质量和身份保持。","boundary":"刚性动作由运动学方法提供；衣物等细节的视觉合理性不等于完整物理仿真。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2602.19089_Ani3DHuman_Photorealistic_3D_Human_Animation_with_Self-guided_Stochastic_Sampling.pdf"],"sha256":"20408cdc9dd8ba4ca8e71b2a20175b61923cbbf72d33e9a6ee75c2a3ab6d917e","pages":26,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.19089"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P345","arxiv_id":"2602.19089","title":"Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling","year":"2026","authors":"Qi Sun; Can Wang; Jiaxiang Shang; Yingchun Liu; Jing Liao","teams":["jing-liao"],"topics":["geometry","video_gen"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"如何同时保持三维人体身份、关节运动和非刚性细节？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Ani3DHuman 将刚性骨架运动与残余非刚性运动分层，由粗渲染引导视频扩散，再通过自引导随机采样兼顾外观质量和身份保持。","input_conditions":"摘要初读：Ani3DHuman 将刚性骨架运动与残余非刚性运动分层，由粗渲染引导视频扩散，再通过自引导随机采样兼顾外观质量和身份保持。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"刚性动作由运动学方法提供；衣物等细节的视觉合理性不等于完整物理仿真。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.19089"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.19089v1"}],"note":"p345","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P344","title":"Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity","short":"Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity","year":"2026","authors":"Le Lin; Zihao Zhu; Rainbow Tin Hung Ho; Jing Liao; Yuhan Luo","collected":true,"note":"p344","scope":"本地 PDF · 摘要初读","summary":"系统分析创作画面并与创作者对话，报告五位相关专家的初步评价和后续设计问题。","boundary":"属于进行中的探索性研究；专家意见不能替代临床疗效或长期用户收益验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2602.14183_Exploring_a_Multimodal_Chatbot_as_a_Facilitator_in_Therapeutic_Art_Activity.pdf"],"sha256":"51a00643aded9a127f34619f307ed8a9496e334b839b63d09b2a82f506e8798b","pages":6,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.14183"}],"verified":"2026-09-19","mappings":[{"rq":"X3b","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P344","arxiv_id":"2602.14183","title":"Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity","year":"2026","authors":"Le Lin; Zihao Zhu; Rainbow Tin Hung Ho; Jing Liao; Yuhan Luo","teams":["jing-liao"],"topics":["hci","agent"],"rqs":["X3b","X3c"],"collected":true,"review_status":"abstract_review","question":"多模态聊天机器人如何支持艺术创作中的反思交流？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"系统分析创作画面并与创作者对话，报告五位相关专家的初步评价和后续设计问题。","input_conditions":"摘要初读：系统分析创作画面并与创作者对话，报告五位相关专家的初步评价和后续设计问题。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"属于进行中的探索性研究；专家意见不能替代临床疗效或长期用户收益验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.14183"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.14183v2"}],"note":"p344","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P343","title":"stable-worldmodel-v1: Reproducible World Modeling Research and Evaluation","short":"stable-worldmodel-v1","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Dan Haramati; Nassim Massaudi; Damien Scieur; Yann LeCun; Randall Balestriero","collected":true,"note":"p343","scope":"本地 PDF · 摘要初读","summary":"stable-worldmodel-v1 提供统一模型与规划评测，讨论 DINO-WM 等方法对分布变化的表现。","boundary":"与后续 stable-worldmodel 报告属于同一项目脉络，保留独立预印本记录而不视作独立复现实验。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2602.08968_stable-worldmodel-v1_Reproducible_World_Modeling_Research_and_Evaluation.pdf"],"sha256":"52bd6b3194034879efad3e2a8e3154aaf7abb07640c5b78e9fe743fed7cebeb2","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.08968"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P343","arxiv_id":"2602.08968","title":"stable-worldmodel-v1: Reproducible World Modeling Research and Evaluation","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Dan Haramati; Nassim Massaudi; Damien Scieur; Yann LeCun; Randall Balestriero","teams":["yann-lecun"],"topics":["world_model","evaluation"],"rqs":["W2d","W4c"],"collected":true,"review_status":"abstract_review","question":"怎样系统比较潜空间世界模型在环境变化下的规划稳健性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"stable-worldmodel-v1 提供统一模型与规划评测，讨论 DINO-WM 等方法对分布变化的表现。","input_conditions":"摘要初读：stable-worldmodel-v1 提供统一模型与规划评测，讨论 DINO-WM 等方法对分布变化的表现。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"与后续 stable-worldmodel 报告属于同一项目脉络，保留独立预印本记录而不视作独立复现实验。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.08968"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.08968v2"}],"note":"p343","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P342","title":"Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?","short":"Theory of Space","year":"2026","authors":"Pingyue Zhang; Zihan Huang; Yue Wang; Jieyu Zhang; Letian Xue; Zihan Wang; Qineng Wang; Keshigeyan Chandrasegaran; Ruohan Zhang; Yejin Choi; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Manling Li","collected":true,"note":"p342","scope":"本地 PDF · 摘要初读","summary":"Theory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。","boundary":"显式报告的信念是探针输出，不应默认忠实等同于全部内部状态。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2602.07055_Theory_of_Space_Can_Foundation_Models_Construct_Spatial_Beliefs_through_Active_Exploration.pdf"],"sha256":"79bf433cd80d17b97f971eaffec019517c1b12bd1775268f4e1d887ef3abfc01","pages":34,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.07055"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"X1c","role":"support"}],"annotation":{"id":"P342","arxiv_id":"2602.07055","title":"Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?","year":"2026","authors":"Pingyue Zhang; Zihan Huang; Yue Wang; Jieyu Zhang; Letian Xue; Zihan Wang; Qineng Wang; Keshigeyan Chandrasegaran; Ruohan Zhang; Yejin Choi; Ranjay Krishna; Jiajun Wu; Li Fei-Fei; Manling Li","teams":["fei-fei-li"],"topics":["world_model","agent","evaluation"],"rqs":["W3a","X1c"],"collected":true,"review_status":"abstract_review","question":"智能体怎样从主动探索的部分观察建立和修正空间信念？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Theory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。","input_conditions":"摘要初读：Theory of Space 用逐步空间信念探针分析探索效率、知识退化及错误信念的修正。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"显式报告的信念是探针输出，不应默认忠实等同于全部内部状态。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.07055"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.07055v1"}],"note":"p342","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P341","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","short":"World-VLA-Loop","year":"2026","authors":"Xiaokang Liu; Zechen Bai; Hai Ci; Kevin Yuchen Ma; Mike Zheng Shou","collected":true,"note":"p341","scope":"本地 PDF · 摘要初读","summary":"World-VLA-Loop 以状态感知视频模型预测帧和二元奖励，形成世界模型与 VLA 的闭环训练。","boundary":"策略收益需与模型误差区分；闭环改进不自动解决新规律或反常识机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2602.06508_World-VLA-Loop_Closed-Loop_Learning_of_Video_World_Model_and_VLA_Policy.pdf"],"sha256":"7fec3ba10f703027ea302f8a9752d398d6f562cbb0e99c0161d0044a8621ccc0","pages":16,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2602.06508"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P341","arxiv_id":"2602.06508","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","year":"2026","authors":"Xiaokang Liu; Zechen Bai; Hai Ci; Kevin Yuchen Ma; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","world_model","agent"],"rqs":["W1c","W4c"],"collected":true,"review_status":"abstract_review","question":"视频世界模型与动作策略能否通过成功及近成功轨迹共同改进？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"World-VLA-Loop 以状态感知视频模型预测帧和二元奖励，形成世界模型与 VLA 的闭环训练。","input_conditions":"摘要初读：World-VLA-Loop 以状态感知视频模型预测帧和二元奖励，形成世界模型与 VLA 的闭环训练。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"策略收益需与模型误差区分；闭环改进不自动解决新规律或反常识机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2602.06508"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2602.06508"}],"note":"p341","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P360","title":"RAGEN-2: Reasoning Collapse in Agentic RL","short":"RAGEN-2","year":"2026","authors":"Zihan Wang; Chi Gui; Xing Jin; Qineng Wang; Licheng Liu; Kangrui Wang; Shiqi Chen; Linjie Li; Zhengyuan Yang; Pingyue Zhang; Yiping Lu; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling Li","collected":true,"note":"p360","scope":"本地 PDF · 摘要初读","summary":"RAGEN-2 区分输出多样性与跨输入可辨别性，提出互信息代理诊断和信噪比筛选。","boundary":"agent 文本推理的模板坍塌与视频生成的推理能力须分别测量。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2604.06268_RAGEN-2_Reasoning_Collapse_in_Agentic_RL.pdf"],"sha256":"ef9b6f06768f39cc6d41d6ca909f1c23b51873eef3ed668c249e6553240c85ed","pages":44,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.06268"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P360","arxiv_id":"2604.06268","title":"RAGEN-2: Reasoning Collapse in Agentic RL","year":"2026","authors":"Zihan Wang; Chi Gui; Xing Jin; Qineng Wang; Licheng Liu; Kangrui Wang; Shiqi Chen; Linjie Li; Zhengyuan Yang; Pingyue Zhang; Yiping Lu; Jiajun Wu; Li Fei-Fei; Lijuan Wang; Yejin Choi; Manling Li","teams":["fei-fei-li"],"topics":["agent","evaluation"],"rqs":["W4b","W4c"],"collected":true,"review_status":"abstract_review","question":"强化学习中的推理是否依赖当前输入，而非套用模板？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RAGEN-2 区分输出多样性与跨输入可辨别性，提出互信息代理诊断和信噪比筛选。","input_conditions":"摘要初读：RAGEN-2 区分输出多样性与跨输入可辨别性，提出互信息代理诊断和信噪比筛选。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"agent 文本推理的模板坍塌与视频生成的推理能力须分别测量。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.06268"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.06268v1"}],"note":"p360","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P359","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","short":"OpenWorldLib","year":"2026","authors":"DataFlow Team; Bohan Zeng; Daili Hua; Kaixin Zhu; Yifan Dai; Bozhou Li; Yuran Wang; Chengzhuo Tong; Yifan Yang; Mingkun Chang; Jianbin Zhao; Zhou Liu; Hao Liang; Xiaochen Ma; Ruichuan An; Junbo Niu; Zimo Meng; Tianyi Bai; Meiyi Qiang; Huanyao Zhang; Zhiyou Xiao; Tianyu Guo; Qinhan Yu; Runhao Zhao; Zhengpin Li; Xinyi Huang; Yisheng Pan; Yiwen Tang; Juanxi Tian; Yang Shi; Yue Ding; Xinlong Chen; Hongcheng Gao; Minglei Shi; Jialong Wu; Zekun Wang; Yuanxing Zhang; Xintao Wang; Pengfei Wan; Yiren Song; Mike Zheng Shou; Wentao Zhang","collected":true,"note":"p359","scope":"本地 PDF · 摘要初读","summary":"OpenWorldLib 提供多任务推理框架和能力分类，连接感知、交互与长期记忆模块。","boundary":"统一代码接口不意味着模型在全部能力上均已达标。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2604.04707_OpenWorldLib_A_Unified_Codebase_and_Definition_of_Advanced_World_Models.pdf"],"sha256":"3cc9a8f0540d484d3572c669f0dca62330c92604d8892104e0724c94f3e5fe2b","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.04707"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W3a","role":"support"}],"annotation":{"id":"P359","arxiv_id":"2604.04707","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","year":"2026","authors":"DataFlow Team; Bohan Zeng; Daili Hua; Kaixin Zhu; Yifan Dai; Bozhou Li; Yuran Wang; Chengzhuo Tong; Yifan Yang; Mingkun Chang; Jianbin Zhao; Zhou Liu; Hao Liang; Xiaochen Ma; Ruichuan An; Junbo Niu; Zimo Meng; Tianyi Bai; Meiyi Qiang; Huanyao Zhang; Zhiyou Xiao; Tianyu Guo; Qinhan Yu; Runhao Zhao; Zhengpin Li; Xinyi Huang; Yisheng Pan; Yiwen Tang; Juanxi Tian; Yang Shi; Yue Ding; Xinlong Chen; Hongcheng Gao; Minglei Shi; Jialong Wu; Zekun Wang; Yuanxing Zhang; Xintao Wang; Pengfei Wan; Yiren Song; Mike Zheng Shou; Wentao Zhang","teams":["mike-zheng-shou"],"topics":["world_model"],"rqs":["W1c","W3a"],"collected":true,"review_status":"abstract_review","question":"异构世界模型如何通过统一接口复用和比较？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"OpenWorldLib 提供多任务推理框架和能力分类，连接感知、交互与长期记忆模块。","input_conditions":"摘要初读：OpenWorldLib 提供多任务推理框架和能力分类，连接感知、交互与长期记忆模块。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"统一代码接口不意味着模型在全部能力上均已达标。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.04707"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.04707v2"}],"note":"p359","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P358","title":"Hierarchical Planning with Latent World Models","short":"Hierarchical Planning with Latent World Models","year":"2026","authors":"Wancong Zhang; Basile Terver; Artem Zholus; Soham Chitnis; Harsh Sutaria; Mido Assran; Randall Balestriero; Amir Bar; Adrien Bardes; Yann LeCun; Nicolas Ballas","collected":true,"note":"p358","scope":"本地 PDF · 摘要初读","summary":"HWM 使用分层世界模型与模型预测控制，在不同层级组织目标和动作搜索。","boundary":"层级规划成功不自动保证像素生成长期一致。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2604.03208_Hierarchical_Planning_with_Latent_World_Models.pdf"],"sha256":"a3217f9fa8806a9d1b01f03bf2005de4a85e1d9bbe2312c39fd993ceaf233b9d","pages":29,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.03208"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P358","arxiv_id":"2604.03208","title":"Hierarchical Planning with Latent World Models","year":"2026","authors":"Wancong Zhang; Basile Terver; Artem Zholus; Soham Chitnis; Harsh Sutaria; Mido Assran; Randall Balestriero; Amir Bar; Adrien Bardes; Yann LeCun; Nicolas Ballas","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W4a","W1c"],"collected":true,"review_status":"abstract_review","question":"视觉潜空间规划怎样扩展到更长时间尺度？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HWM 使用分层世界模型与模型预测控制，在不同层级组织目标和动作搜索。","input_conditions":"摘要初读：HWM 使用分层世界模型与模型预测控制，在不同层级组织目标和动作搜索。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"层级规划成功不自动保证像素生成长期一致。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.03208"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.03208v2"}],"note":"p358","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P357","title":"IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction","short":"IMPASTO","year":"2026","authors":"Yingke Wang; Hao Li; Yifeng Zhu; Hong-Xing Yu; Ken Goldberg; Li Fei-Fei; Jiajun Wu; Yunzhu Li; Ruohan Zhang","collected":true,"note":"p357","scope":"本地 PDF · 摘要初读","summary":"IMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。","boundary":"与绘画任务直接相邻；需要细读画材、笔触参数及预测误差的具体范围。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2603.29315_IMPASTO_Integrating_Model-Based_Planning_with_Learned_Dynamics_Models_for_Robotic_Oil_Painting_Reproduction.pdf"],"sha256":"0d90acc934d92a4b360cbe903eddbfa5045b1a47e469bd3f5ddc31008de12062","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.29315"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P357","arxiv_id":"2603.29315","title":"IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction","year":"2026","authors":"Yingke Wang; Hao Li; Yifeng Zhu; Hong-Xing Yu; Ken Goldberg; Li Fei-Fei; Jiajun Wu; Yunzhu Li; Ruohan Zhang","teams":["fei-fei-li"],"topics":["world_model","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"学习的像素动力学怎样用于真实油画笔触规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"IMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。","input_conditions":"摘要初读：IMPASTO 将像素变化预测与模型规划结合进行机器人油画复现。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"与绘画任务直接相邻；需要细读画材、笔触参数及预测误差的具体范围。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.29315"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.29315"}],"note":"p357","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P356","title":"CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation","short":"CaP-X","year":"2026","authors":"Letian Fu; Justin Yu; Karim El-Refai; Ethan Kou; Haoru Xue; Huang Huang; Wenli Xiao; Guanzhi Wang; Dantong Niu; Fei-Fei Li; Guanya Shi; Jiajun Wu; Shankar Sastry; Yuke Zhu; Ken Goldberg; Linxi \"Jim\" Fan","collected":true,"note":"p356","scope":"本地 PDF · 摘要初读","summary":"CaP-X 统一代码策略评价，并研究多轮反馈、技能合成和强化学习改进。","boundary":"显式代码策略与可执行环境动力学模型不同，也非视频生成器推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2603.22435_CaP-X_A_Framework_for_Benchmarking_and_Improving_Coding_Agents_for_Robot_Manipulation.pdf"],"sha256":"fe177f46cdbfd7fdd605aacfaea8399269cd7a9075b6425e9d0257620ee2baa6","pages":58,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.22435"}],"verified":"2026-09-19","mappings":[{"rq":"W1a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P356","arxiv_id":"2603.22435","title":"CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation","year":"2026","authors":"Letian Fu; Justin Yu; Karim El-Refai; Ethan Kou; Haoru Xue; Huang Huang; Wenli Xiao; Guanzhi Wang; Dantong Niu; Fei-Fei Li; Guanya Shi; Jiajun Wu; Shankar Sastry; Yuke Zhu; Ken Goldberg; Linxi \"Jim\" Fan","teams":["fei-fei-li"],"topics":["agent","evaluation"],"rqs":["W1a","X3c"],"collected":true,"review_status":"abstract_review","question":"代码作为机器人策略时，抽象层级与执行反馈怎样影响可靠性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"CaP-X 统一代码策略评价，并研究多轮反馈、技能合成和强化学习改进。","input_conditions":"摘要初读：CaP-X 统一代码策略评价，并研究多轮反馈、技能合成和强化学习改进。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"显式代码策略与可执行环境动力学模型不同，也非视频生成器推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.22435"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.22435v2"}],"note":"p356","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P355","title":"P-Flow: Prompting Visual Effects Generation","short":"P-Flow","year":"2026","authors":"Rui Zhao; Mike Zheng Shou","collected":true,"note":"p355","scope":"本地 PDF · 摘要初读","summary":"P-Flow 探索免训练的动态特效定制，在文本和图像条件视频任务中评估效果。","boundary":"特效生成可以违背现实物理，但不因此证明用户指定机制被系统性执行。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2603.22091_P-Flow_Prompting_Visual_Effects_Generation.pdf"],"sha256":"29a4df888f3bd28ca6c4fa5f10faf525f5aebe459a6315b0de264d60c86b5e3c","pages":17,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.22091"}],"verified":"2026-09-19","mappings":[{"rq":"W2a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P355","arxiv_id":"2603.22091","title":"P-Flow: Prompting Visual Effects Generation","year":"2026","authors":"Rui Zhao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W2a","X4a"],"collected":true,"review_status":"abstract_review","question":"不更新模型参数能否按提示定制动态视觉特效？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"P-Flow 探索免训练的动态特效定制，在文本和图像条件视频任务中评估效果。","input_conditions":"摘要初读：P-Flow 探索免训练的动态特效定制，在文本和图像条件视频任务中评估效果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"特效生成可以违背现实物理，但不因此证明用户指定机制被系统性执行。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.22091"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.22091"}],"note":"p355","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P354","title":"MIRAGE: The Illusion of Visual Understanding","short":"MIRAGE","year":"2026","authors":"Mohammad Asadi; Jack W. O'Sullivan; Fang Cao; Tahoura Nedaee; Kamyar Rajabalifardi; Fei-Fei Li; Ehsan Adeli; Euan Ashley","collected":true,"note":"p354","scope":"本地 PDF · 摘要初读","summary":"MIRAGE 检查缺失图像时仍产生详细描述和高分的现象，并提出减少文本泄漏的评价方法。","boundary":"主要实验涉及图像问答；作为视觉依赖测试的设计参照，不能直接外推视频生成失败率。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2603.21687_MIRAGE_The_Illusion_of_Visual_Understanding.pdf"],"sha256":"56fe2e64fd295dd0ab9eb820e0f89e701e180aa01795716104acbfca26f0b4dc","pages":29,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.21687"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P354","arxiv_id":"2603.21687","title":"MIRAGE: The Illusion of Visual Understanding","year":"2026","authors":"Mohammad Asadi; Jack W. O'Sullivan; Fang Cao; Tahoura Nedaee; Kamyar Rajabalifardi; Fei-Fei Li; Ehsan Adeli; Euan Ashley","teams":["fei-fei-li"],"topics":["video_understanding","evaluation"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"多模态模型的正确回答是否真正使用了图像？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MIRAGE 检查缺失图像时仍产生详细描述和高分的现象，并提出减少文本泄漏的评价方法。","input_conditions":"摘要初读：MIRAGE 检查缺失图像时仍产生详细描述和高分的现象，并提出减少文本泄漏的评价方法。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"主要实验涉及图像问答；作为视觉依赖测试的设计参照，不能直接外推视频生成失败率。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.21687"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.21687v3"}],"note":"p354","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P353","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","short":"LeWorldModel","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Damien Scieur; Yann LeCun; Randall Balestriero","collected":true,"note":"p353","scope":"本地 PDF · 摘要初读","summary":"LeWorldModel 联合学习编码与未来潜状态预测，并以高斯正则约束表示分布，考察规划和物理异常信号。","boundary":"物理异常可检测不等于已识别具体因果规律，也不直接提供人可观看的后果视频。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2603.19312_LeWorldModel_Stable_End-to-End_Joint-Embedding_Predictive_Architecture_from_Pixels.pdf"],"sha256":"553a01501ac74ec56721cfdb936d3825ac941734133a1fd761f614c01b6887e9","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.19312"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P353","arxiv_id":"2603.19312","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Damien Scieur; Yann LeCun; Randall Balestriero","teams":["yann-lecun"],"topics":["world_model","physics"],"rqs":["W1c","W2d"],"collected":true,"review_status":"abstract_review","question":"能否以简洁的端到端目标从像素学习可用于规划的世界模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LeWorldModel 联合学习编码与未来潜状态预测，并以高斯正则约束表示分布，考察规划和物理异常信号。","input_conditions":"摘要初读：LeWorldModel 联合学习编码与未来潜状态预测，并以高斯正则约束表示分布，考察规划和物理异常信号。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"物理异常可检测不等于已识别具体因果规律，也不直接提供人可观看的后果视频。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.19312"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.19312v3"}],"note":"p353","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P352","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","short":"V-JEPA 2.1","year":"2026","authors":"Lorenzo Mur-Labadia; Matthew Muckley; Amir Bar; Mido Assran; Koustuv Sinha; Mike Rabbat; Yann LeCun; Nicolas Ballas; Adrien Bardes","collected":true,"note":"p352","scope":"本地 PDF · 摘要初读","summary":"V-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。","boundary":"重点是表示学习；应与动作条件世界模型和视频生成模块区分。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2603.14482_V-JEPA_2_1_Unlocking_Dense_Features_in_Video_Self-Supervised_Learning.pdf"],"sha256":"b40580916242ade00e2ac177cb01473d511f021d5a25f7552fd17512b3a72bbb","pages":37,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.14482"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P352","arxiv_id":"2603.14482","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","year":"2026","authors":"Lorenzo Mur-Labadia; Matthew Muckley; Amir Bar; Mido Assran; Koustuv Sinha; Mike Rabbat; Yann LeCun; Nicolas Ballas; Adrien Bardes","teams":["yann-lecun"],"topics":["video_understanding","world_model"],"rqs":["W1c","W4b"],"collected":true,"review_status":"abstract_review","question":"怎样获得空间与时间上更稠密、稳定的视频表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"V-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。","input_conditions":"摘要初读：V-JEPA 2.1 通过图像与视频上的自监督学习及中间层监督改善稠密视觉表示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"重点是表示学习；应与动作条件世界模型和视频生成模块区分。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.14482"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.14482v3"}],"note":"p352","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P351","title":"Representation Learning for Spatiotemporal Physical Systems","short":"Representation Learning for Spatiotemporal Physical Systems","year":"2026","authors":"Helen Qu; Rudy Morel; Michael McCabe; Alberto Bietti; François Lanusse; Shirley Ho; Yann LeCun","collected":true,"note":"p351","scope":"本地 PDF · 摘要初读","summary":"作者用物理参数估计等下游任务评估时空物理系统的表示，比较预测式与通用自监督学习。","boundary":"评价强调任务差别；不能把一个下游任务的优势泛化到全部物理推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2603.13227_Representation_Learning_for_Spatiotemporal_Physical_Systems.pdf"],"sha256":"72431d26489450db993513a92320d0f73180b66c9e155ea7efc8e140bb834ba3","pages":9,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2603.13227"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P351","arxiv_id":"2603.13227","title":"Representation Learning for Spatiotemporal Physical Systems","year":"2026","authors":"Helen Qu; Rudy Morel; Michael McCabe; Alberto Bietti; François Lanusse; Shirley Ho; Yann LeCun","teams":["yann-lecun"],"topics":["physics","evaluation","video_understanding"],"rqs":["W1c","W2d"],"collected":true,"review_status":"abstract_review","question":"物理系统表征的质量是否能由下一帧预测准确率代表？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者用物理参数估计等下游任务评估时空物理系统的表示，比较预测式与通用自监督学习。","input_conditions":"摘要初读：作者用物理参数估计等下游任务评估时空物理系统的表示，比较预测式与通用自监督学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"评价强调任务差别；不能把一个下游任务的优势泛化到全部物理推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.13227"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.13227v1"}],"note":"p351","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P370","title":"StreamingEffect: Real-Time Human-Centric Video Effect Generation","short":"StreamingEffect","year":"2026","authors":"Yiren Song; Cheng Liu; Yuxin Jiang; Mike Zheng Shou","collected":true,"note":"p370","scope":"本地 PDF · 摘要初读","summary":"StreamingEffect 将双向教师蒸馏为因果学生并减少采样步数，支持在线注入关键帧特效。","boundary":"论文的实时设置使用 H200；不能直接承诺 A10 上同等分辨率和延迟。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.17019_StreamingEffect_Real-Time_Human-Centric_Video_Effect_Generation.pdf"],"sha256":"bcd9ea701f726ec4ff2941bebbb4b757775362e9a7d432b69d52f5da73204d5d","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.17019"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P370","arxiv_id":"2605.17019","title":"StreamingEffect: Real-Time Human-Centric Video Effect Generation","year":"2026","authors":"Yiren Song; Cheng Liu; Yuxin Jiang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency","hci"],"rqs":["W3a","X4a"],"collected":true,"review_status":"abstract_review","question":"交互式人物视频特效怎样做到因果流式生成？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"StreamingEffect 将双向教师蒸馏为因果学生并减少采样步数，支持在线注入关键帧特效。","input_conditions":"摘要初读：StreamingEffect 将双向教师蒸馏为因果学生并减少采样步数，支持在线注入关键帧特效。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"论文的实时设置使用 H200；不能直接承诺 A10 上同等分辨率和延迟。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.17019"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.17019"}],"note":"p370","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P369","title":"AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation","short":"AnyFlow","year":"2026","authors":"Yuchao Gu; Guian Fang; Yuxin Jiang; Weijia Mao; Song Han; Han Cai; Mike Zheng Shou","collected":true,"note":"p369","scope":"本地 PDF · 摘要初读","summary":"AnyFlow 学习任意时间区间的 flow map，并通过在策略分布上的模拟蒸馏改善少步采样。","boundary":"速度与质量需按模型、帧数、硬件共同报告；蒸馏本身不保证物理推理保留。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.13724_AnyFlow_Any-Step_Video_Diffusion_Model_with_On-Policy_Flow_Map_Distillation.pdf"],"sha256":"5c868d02d9b1885516efea37413c48fecbffc5231aaad458c506c542756e39a1","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.13724"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P369","arxiv_id":"2605.13724","title":"AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation","year":"2026","authors":"Yuchao Gu; Guian Fang; Yuxin Jiang; Weijia Mao; Song Han; Han Cai; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"视频扩散怎样同时适应不同采样预算并减少因果滚动误差？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AnyFlow 学习任意时间区间的 flow map，并通过在策略分布上的模拟蒸馏改善少步采样。","input_conditions":"摘要初读：AnyFlow 学习任意时间区间的 flow map，并通过在策略分布上的模拟蒸馏改善少步采样。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"速度与质量需按模型、帧数、硬件共同报告；蒸馏本身不保证物理推理保留。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.13724"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.13724v1"}],"note":"p369","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P368","title":"World Action Models: The Next Frontier in Embodied AI","short":"World Action Models","year":"2026","authors":"Siyin Wang; Junhao Shi; Zhaoyang Fu; Xinzhe He; Feihong Liu; Chenchen Yang; Yikang Zhou; Zhaoye Fei; Jingjing Gong; Jinlan Fu; Mike Zheng Shou; Xuanjing Huang; Xipeng Qiu; Yu-Gang Jiang","collected":true,"note":"p368","scope":"本地 PDF · 摘要初读","summary":"World Action Models 综述区分级联和联合建模，梳理数据、条件和动作解码方式。","boundary":"综述中的研究议程不是新模型能力已被验证的证据。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.12090_World_Action_Models_The_Next_Frontier_in_Embodied_AI.pdf"],"sha256":"4b729cae694621b327156c6cd75778764664a6a3a8cebce7637162d89d544b6b","pages":69,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.12090"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P368","arxiv_id":"2605.12090","title":"World Action Models: The Next Frontier in Embodied AI","year":"2026","authors":"Siyin Wang; Junhao Shi; Zhaoyang Fu; Xinzhe He; Feihong Liu; Chenchen Yang; Yikang Zhou; Zhaoye Fei; Jingjing Gong; Jinlan Fu; Mike Zheng Shou; Xuanjing Huang; Xipeng Qiu; Yu-Gang Jiang","teams":["mike-zheng-shou"],"topics":["world_model","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"怎样统一描述未来状态预测和动作生成的结合方式？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"World Action Models 综述区分级联和联合建模，梳理数据、条件和动作解码方式。","input_conditions":"摘要初读：World Action Models 综述区分级联和联合建模，梳理数据、条件和动作解码方式。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"综述中的研究议程不是新模型能力已被验证的证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.12090"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.12090v1"}],"note":"p368","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P367","title":"OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation","short":"OmniHumanoid","year":"2026","authors":"Yiren Song; Xiyao Deng; Pei Yang; Yihan Wang; Mike Zheng Shou","collected":true,"note":"p367","scope":"本地 PDF · 摘要初读","summary":"OmniHumanoid 将共享运动迁移与外形适配器分开，并支持流式人形视频生成。","boundary":"保持动作外观与真实机器人可执行性需要不同测试。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.12038_OmniHumanoid_Streaming_Cross-Embodiment_Video_Generation_with_Paired-Free_Adaptation.pdf"],"sha256":"9e4860b1b4d0508780804c6c4a37abd23653a92720c48c9fc8fd35308806a0e2","pages":15,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.12038"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P367","arxiv_id":"2605.12038","title":"OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation","year":"2026","authors":"Yiren Song; Xiyao Deng; Pei Yang; Yihan Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"跨机器人外形的视频动作迁移能否减少新外形配对数据需求？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"OmniHumanoid 将共享运动迁移与外形适配器分开，并支持流式人形视频生成。","input_conditions":"摘要初读：OmniHumanoid 将共享运动迁移与外形适配器分开，并支持流式人形视频生成。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"保持动作外观与真实机器人可执行性需要不同测试。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.12038"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.12038"}],"note":"p367","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P366","title":"On Training in Imagination","short":"On Training in Imagination","year":"2026","authors":"Nadav Timor; Ravid Shwartz-Ziv; Micah Goldblum; Yann LeCun; David Harel","collected":true,"note":"p366","scope":"本地 PDF · 摘要初读","summary":"作者分析动力学和奖励误差对策略学习的影响，讨论噪声、方差与计算预算之间的关系。","boundary":"理论中的误差与平滑性假设需要对应到实际模型；不能以视频观感代替回报验证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2605.06732_On_Training_in_Imagination.pdf"],"sha256":"d5090958c236509a195949febba05be65e00413a54c92dffe616f812f1e02d00","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.06732"}],"verified":"2026-09-19","mappings":[{"rq":"W4c","role":"support"}],"annotation":{"id":"P366","arxiv_id":"2605.06732","title":"On Training in Imagination","year":"2026","authors":"Nadav Timor; Ravid Shwartz-Ziv; Micah Goldblum; Yann LeCun; David Harel","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W4c"],"collected":true,"review_status":"abstract_review","question":"在想象轨迹上训练策略时，模型误差怎样影响策略回报？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者分析动力学和奖励误差对策略学习的影响，讨论噪声、方差与计算预算之间的关系。","input_conditions":"摘要初读：作者分析动力学和奖励误差对策略学习的影响，讨论噪声、方差与计算预算之间的关系。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"理论中的误差与平滑性假设需要对应到实际模型；不能以视频观感代替回报验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.06732"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.06732v2"}],"note":"p366","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P365","title":"Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance","short":"Sparkle","year":"2026","authors":"Ziyun Zeng; Yiqi Lin; Guoqiang Liang; Mike Zheng Shou","collected":true,"note":"p365","scope":"本地 PDF · 摘要初读","summary":"Sparkle 构建解耦引导和质量筛选的数据管线，并发布背景替换数据与基准。","boundary":"已知原视频内容的编辑，不等同于预测新动作的后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.06535_Sparkle_Realizing_Lively_Instruction-Guided_Video_Background_Replacement_via_Decoupled_Guidance.pdf"],"sha256":"0f6e44f8bdf1460ffb1639861f2bce47ea8c392d7bad7fd845eb0a03aca89295","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.06535"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"P365","arxiv_id":"2605.06535","title":"Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance","year":"2026","authors":"Ziyun Zeng; Yiqi Lin; Guoqiang Liang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","evaluation"],"rqs":["X4a","W3b"],"collected":true,"review_status":"abstract_review","question":"怎样为背景替换生成更准确的前景和背景监督？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Sparkle 构建解耦引导和质量筛选的数据管线，并发布背景替换数据与基准。","input_conditions":"摘要初读：Sparkle 构建解耦引导和质量筛选的数据管线，并发布背景替换数据与基准。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"已知原视频内容的编辑，不等同于预测新动作的后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.06535"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.06535v1"}],"note":"p365","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P364","title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","short":"Agentic World Modeling","year":"2026","authors":"Meng Chu; Xuan Billy Zhang; Kevin Qinghong Lin; Lingdong Kong; Jize Zhang; Teng Tu; Weijian Ma; Ziqi Huang; Senqiao Yang; Wei Huang; Yeying Jin; Zhefan Rao; Jinhui Ye; Xinyu Lin; Xichen Zhang; Qisheng Hu; Shuai Yang; Leyang Shen; Wei Chow; Yifei Dong; Fengyi Wu; Quanyu Long; Bin Xia; Shaozuo Yu; Mingkang Zhu; Wenhu Zhang; Jiehui Huang; Haokun Gui; Runyi Li; Chenyu Tang; Dong Huang; Xuhang Chen; Rui Liu; Chengzu Li; Shiyi Du; Xu Huang; Haoxuan Che; Long Chen; Qifeng Chen; Wenya Wang; Wenxuan Zhang; Xiaojuan Qi; Yang Deng; Yanwei Li; Mike Zheng Shou; Zhi-Qi Cheng; See-Kiong Ng; Ziwei Liu; Philip Torr; Jiaya Jia","collected":true,"note":"p364","scope":"本地 PDF · 摘要初读","summary":"Agentic World Modeling 以能力层级和规律类型整理文献，并提出面向决策的评价原则。","boundary":"分类框架用于组织证据，不能把所有子领域的进展当成同一种能力。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2604.22748_Agentic_World_Modeling_Foundations_Capabilities_Laws_and_Beyond.pdf"],"sha256":"bcbdd805f4f00d7c84b9fb673af01e5ac42cd1cfe11b35db00bdcc96ce4357db","pages":92,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.22748"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P364","arxiv_id":"2604.22748","title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","year":"2026","authors":"Meng Chu; Xuan Billy Zhang; Kevin Qinghong Lin; Lingdong Kong; Jize Zhang; Teng Tu; Weijian Ma; Ziqi Huang; Senqiao Yang; Wei Huang; Yeying Jin; Zhefan Rao; Jinhui Ye; Xinyu Lin; Xichen Zhang; Qisheng Hu; Shuai Yang; Leyang Shen; Wei Chow; Yifei Dong; Fengyi Wu; Quanyu Long; Bin Xia; Shaozuo Yu; Mingkang Zhu; Wenhu Zhang; Jiehui Huang; Haokun Gui; Runyi Li; Chenyu Tang; Dong Huang; Xuhang Chen; Rui Liu; Chengzu Li; Shiyi Du; Xu Huang; Haoxuan Che; Long Chen; Qifeng Chen; Wenya Wang; Wenxuan Zhang; Xiaojuan Qi; Yang Deng; Yanwei Li; Mike Zheng Shou; Zhi-Qi Cheng; See-Kiong Ng; Ziwei Liu; Philip Torr; Jiaya Jia","teams":["mike-zheng-shou"],"topics":["world_model","agent","evaluation"],"rqs":["W1c","W2d"],"collected":true,"review_status":"abstract_review","question":"跨不同环境和规则类型，怎样比较 agent 的世界建模能力？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Agentic World Modeling 以能力层级和规律类型整理文献，并提出面向决策的评价原则。","input_conditions":"摘要初读：Agentic World Modeling 以能力层级和规律类型整理文献，并提出面向决策的评价原则。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"分类框架用于组织证据，不能把所有子领域的进展当成同一种能力。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.22748"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.22748v3"}],"note":"p364","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P363","title":"Image Generators are Generalist Vision Learners","short":"Image Generators are Generalist Vision Learners","year":"2026","authors":"Valentin Gabeur; Shangbang Long; Songyou Peng; Paul Voigtlaender; Shuyang Sun; Yanan Bao; Karen Truong; Zhicheng Wang; Wenlei Zhou; Jonathan T. Barron; Kyle Genova; Nithish Kannen; Sherry Ben; Yandong Li; Mandy Guo; Suhas Yogin; Yiming Gu; Huizhong Chen; Oliver Wang; Saining Xie; Howard Zhou; Kaiming He; Thomas Funkhouser; Jean-Baptiste Alayrac; Radu Soricut","collected":true,"note":"p363","scope":"本地 PDF · 摘要初读","summary":"Vision Banana 将多种感知任务的输出编码成 RGB 图像，以图像生成骨干进行统一指令微调。","boundary":"任务涉及二维和三维感知；视频动力学与反事实后果需要独立评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/kaiming-he/pdfs/2604.20329_Image_Generators_are_Generalist_Vision_Learners.pdf"],"sha256":"088b078cbc2b6183ec50fc95910c1daf6e29f7e4928ed17dda6d978a82204dc6","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.20329"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"}],"annotation":{"id":"P363","arxiv_id":"2604.20329","title":"Image Generators are Generalist Vision Learners","year":"2026","authors":"Valentin Gabeur; Shangbang Long; Songyou Peng; Paul Voigtlaender; Shuyang Sun; Yanan Bao; Karen Truong; Zhicheng Wang; Wenlei Zhou; Jonathan T. Barron; Kyle Genova; Nithish Kannen; Sherry Ben; Yandong Li; Mandy Guo; Suhas Yogin; Yiming Gu; Huizhong Chen; Oliver Wang; Saining Xie; Howard Zhou; Kaiming He; Thomas Funkhouser; Jean-Baptiste Alayrac; Radu Soricut","teams":["kaiming-he"],"topics":["generative_foundation","geometry"],"rqs":["W4b"],"collected":true,"review_status":"abstract_review","question":"图像生成模型能否通过少量指令微调成为通用视觉模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Vision Banana 将多种感知任务的输出编码成 RGB 图像，以图像生成骨干进行统一指令微调。","input_conditions":"摘要初读：Vision Banana 将多种感知任务的输出编码成 RGB 图像，以图像生成骨干进行统一指令微调。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"任务涉及二维和三维感知；视频动力学与反事实后果需要独立评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.20329"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.20329v3"}],"note":"p363","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P362","title":"HumanScore: Benchmarking Human Motions in Generated Videos","short":"HumanScore","year":"2026","authors":"Yusu Fang; Tiange Xiang; Tian Tan; Narayan Schuetz; Scott Delp; Li Fei-Fei; Ehsan Adeli","collected":true,"note":"p362","scope":"本地 PDF · 摘要初读","summary":"HumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。","boundary":"人体运动评价不直接覆盖液体、接触物体或任意自定义规律。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2604.20157_HumanScore_Benchmarking_Human_Motions_in_Generated_Videos.pdf"],"sha256":"d59f84b262a81d4065149f7810b9d4a164c9f093eaf059e8e726518ec969d9f6","pages":50,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.20157"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"}],"annotation":{"id":"P362","arxiv_id":"2604.20157","title":"HumanScore: Benchmarking Human Motions in Generated Videos","year":"2026","authors":"Yusu Fang; Tiange Xiang; Tian Tan; Narayan Schuetz; Scott Delp; Li Fei-Fei; Ehsan Adeli","teams":["fei-fei-li"],"topics":["video_gen","physics","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"abstract_review","question":"生成的人体动作是否符合身体结构和生物力学约束？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"HumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。","input_conditions":"摘要初读：HumanScore 用多种运动强度提示及物理相关指标评估生成视频中的人体运动。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"人体运动评价不直接覆盖液体、接触物体或任意自定义规律。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.20157"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.20157v1"}],"note":"p362","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P361","title":"GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents","short":"GameWorld","year":"2026","authors":"Mingyu Ouyang; Siyuan Hu; Kevin Qinghong Lin; Hwee Tou Ng; Mike Zheng Shou","collected":true,"note":"p361","scope":"本地 PDF · 摘要初读","summary":"GameWorld 统一浏览器游戏动作接口，并用可检验状态度量任务结果。","boundary":"游戏执行成功不同于生成的视频是否遵循同一规则。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2604.07429_GameWorld_Towards_Standardized_and_Verifiable_Evaluation_of_Multimodal_Game_Agents.pdf"],"sha256":"5966ec57c1ef2f7efff58859a8948e1c3288451241c696241c0af4b85412eb73","pages":52,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2604.07429"}],"verified":"2026-09-19","mappings":[{"rq":"X3c","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P361","arxiv_id":"2604.07429","title":"GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents","year":"2026","authors":"Mingyu Ouyang; Siyuan Hu; Kevin Qinghong Lin; Hwee Tou Ng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","evaluation"],"rqs":["X3c","W2d"],"collected":true,"review_status":"abstract_review","question":"多模态游戏 agent 能否用状态真值进行可复现评价？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GameWorld 统一浏览器游戏动作接口，并用可检验状态度量任务结果。","input_conditions":"摘要初读：GameWorld 统一浏览器游戏动作接口，并用可检验状态度量任务结果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"游戏执行成功不同于生成的视频是否遵循同一规则。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2604.07429"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2604.07429"}],"note":"p361","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P380","title":"Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?","short":"Dream.exe","year":"2026","authors":"Rui Zhao; Kaiming Yang; Jifeng Zhu; Siyang Chen; Ziqi Wang; Weijia Wu; Kevin Qinghong Lin; Heng Wang; Mike Zheng Shou","collected":true,"note":"p380","scope":"本地 PDF · 方法条件已核查","summary":"Dream.exe 以视频到执行管线，分别评估视觉质量、轨迹保真和执行成功。","boundary":"执行评价也受运动恢复与控制管线影响，需与视频生成错误分开归因。","evidence":"PDF pp.3–4 §3.1–3.3：任务筛选、难度层级、模型类别与执行评价管线。方法已核查，未重新跑执行实验。","sources":["researcher-collections/mike-zheng-shou/pdfs/2606.04811_Dream_exe_Can_Video_Generation_Models_Dream_Executable_Robot_Manipulation.pdf"],"sha256":"94482eb28e5379a842f0d0172f75faea766f4457ca268924da6a5eceb0e741be","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.04811"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"core"}],"annotation":{"id":"P380","arxiv_id":"2606.04811","title":"Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?","year":"2026","authors":"Rui Zhao; Kaiming Yang; Jifeng Zhu; Siyang Chen; Ziqi Wang; Weijia Wu; Kevin Qinghong Lin; Heng Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","physics","evaluation"],"rqs":["W2d"],"collected":true,"review_status":"method_checked","question":"视频中看似合理的机器人操作是否真的可执行？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Dream.exe 以视频到执行管线，分别评估视觉质量、轨迹保真和执行成功。","input_conditions":"可恢复的 RoboCasa365 初始状态、首帧和任务提示；生成视频后通过运动恢复管线形成控制轨迹。","training_supervision":"主要贡献是评价框架；包含通用闭源、开源及机器人专用模型，并另测在测试集外数据微调的 Wan。","inference_support":"轨迹恢复、分割、相机／场景信息与物理仿真执行共同参与评价；需排除这些环节的误差。","evaluation":"约 101 个经过视角、遮挡与轨迹可辨性筛选的任务，分原子动作、多对象交互、多阶段任务；视觉质量、轨迹保真与执行成功分开。","boundary":"把可执行性加入观感指标十分相关，但任务经过专门筛选，且当前轨迹管线不支持底座导航；不直接覆盖绘画、液体或用户自定世界规律。","observed_failures":"","evidence":"PDF pp.3–4 §3.1–3.3：任务筛选、难度层级、模型类别与执行评价管线。方法已核查，未重新跑执行实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.04811"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.04811v2"}],"note":"p380","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":96,"mapping_roles":{"W2d":"core"}},"aliases":[]},{"id":"P379","title":"Demo2Tutorial: From Human Experience to Multimodal Software Tutorials","short":"Demo2Tutorial","year":"2026","authors":"Zechen Bai; Zhiheng Chen; Yiqi Lin; Kevin Qinghong Lin; Difei Gao; Xiangwu Guo; Xin Wang; Mike Zheng Shou","collected":true,"note":"p379","scope":"本地 PDF · 方法条件已核查","summary":"Demo2Tutorial 将录屏和交互日志解析为动作与意图，再形成层级任务图及图文教程，评估人和 GUI agent 的使用效果。","boundary":"生成的是软件操作教程，不能等同于预测物理干预后果的视频。","evidence":"PDF pp.4–5 §3.2–5：动作解析、任务图、选帧、TutorialBench 与三类评价。方法已核查，未复现实验。","sources":["researcher-collections/mike-zheng-shou/pdfs/2606.03951_Demo2Tutorial_From_Human_Experience_to_Multimodal_Software_Tutorials.pdf"],"sha256":"c57408b0f7544f983611881c86ea19f6c78250860d64739139782db5c44aa957","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.03951"}],"verified":"2026-09-19","mappings":[{"rq":"X1b","role":"support"},{"rq":"X4a","role":"core"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P379","arxiv_id":"2606.03951","title":"Demo2Tutorial: From Human Experience to Multimodal Software Tutorials","year":"2026","authors":"Zechen Bai; Zhiheng Chen; Yiqi Lin; Kevin Qinghong Lin; Difei Gao; Xiangwu Guo; Xin Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci"],"rqs":["X1b","X4a","X3c"],"collected":true,"review_status":"method_checked","question":"人类的软件操作记录怎样转成可学习的多模态教程？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Demo2Tutorial 将录屏和交互日志解析为动作与意图，再形成层级任务图及图文教程，评估人和 GUI agent 的使用效果。","input_conditions":"同步录屏与鼠标、键盘等精确操作日志；可选任务目标。","training_supervision":"GPT-4o 解析状态变化和意图，Step Planner 组成层级图；不是训练视频扩散模型来预测下一操作后果。","inference_support":"Actor-critic 整理步骤，OCR、分割与图像处理选帧并标注，输出图文交错教程。","evaluation":"TutorialBench 的教程质量比较、教程作为 Agent-S3 外部知识时的 OSWorld 完成率，以及用户完成时间和形式偏好。","boundary":"它生成软件教程；Foresee 的物理多分支后果是另一个输出目标。原文 p.5 图与段落的逐软件数量不一致，本条不据此细分统计。","observed_failures":"","evidence":"PDF pp.4–5 §3.2–5：动作解析、任务图、选帧、TutorialBench 与三类评价。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.03951"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.03951v1"}],"note":"p379","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":91,"mapping_roles":{"X4a":"core"}},"aliases":[]},{"id":"P378","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","short":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","year":"2026","authors":"Junhao Cheng; Liang Hou; Tianxiong Zhong; Xin Tao; Pengfei Wan; Kun Gai; Jing Liao","collected":true,"note":"p378","scope":"本地 PDF · 方法条件已核查","summary":"VLM 作为教师构造可微奖励，在测试时优化视频模型的轻量 LoRA，并在 VBVR 与 RULER 上评价。","boundary":"推理阶段仍需要外部教师及在线优化，不能当作无需外部帮助的视频内生推理。","evidence":"PDF p.4 Algorithm 1 与 §B：教师查询和更新流程；p.6 Tables I–II 与参数；p.11 Fig.7、Table V：人工失败归因。方法已核查，未复现实验。","sources":["researcher-collections/jing-liao/pdfs/2606.02564_VLMs_are_Good_Teachers_for_Video_Reasoning_via_Adaptive_Test-Time_Optimization.pdf"],"sha256":"86dca8dff75c7f64442b97ab627e32bf7625261174e6cea7b0f667f3997a05b6","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.02564"}],"verified":"2026-09-19","mappings":[{"rq":"W4d","role":"core"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P378","arxiv_id":"2606.02564","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","year":"2026","authors":"Junhao Cheng; Liang Hou; Tianxiong Zhong; Xin Tao; Pengfei Wan; Kun Gai; Jing Liao","teams":["jing-liao"],"topics":["video_gen","video_reasoning"],"rqs":["W4d","W2d"],"collected":true,"review_status":"method_checked","question":"外部视觉语言模型能否通过过程奖励提升视频生成模型的规则执行？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VLM 作为教师构造可微奖励，在测试时优化视频模型的轻量 LoRA，并在 VBVR 与 RULER 上评价。","input_conditions":"文本任务及可选图像；VLM 教师为当前实例提出目标完成和中间过程的二元检查问题。","training_supervision":"测试时冻结教师与视频骨干，只更新 rank-16 LoRA，最多 40 步；通过轻量 VAE 与可微 VLM 奖励反传。","inference_support":"每个测试实例都使用外部 VLM 教师和在线优化。视频承担视觉执行，但不是完全无外援的内生推理设置。","evaluation":"VBVR-Bench 与 RULER-Bench 分开报告；在所述 89 帧设置下比较推理预算。另人工检查每个基准 100 个生成案例，定义过程或最终目标违反为失败。","boundary":"证明外部过程监督能改善视频规则执行；不能据此认定视频骨干已独立学会相同规则。教师失误与生成器失误应分开记录。","observed_failures":"【作者观察】教师有时漏掉细粒度视觉错误或生成不完整目标；pp.11 的两组 100 案例中剩余失败为 18%／29%。这是该人工子集的比例，不是总榜失败率。优化还有轻微画质损失。","evidence":"PDF p.4 Algorithm 1 与 §B：教师查询和更新流程；p.6 Tables I–II 与参数；p.11 Fig.7、Table V：人工失败归因。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.02564"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.02564"}],"note":"p378","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":99,"mapping_roles":{"W4d":"core"}},"aliases":[]},{"id":"P377","title":"PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion","short":"PAI-Studio","year":"2026","authors":"Heyuan Gao; Bangxun Tang; Yiren Song; Guian Fang; Zijian He; Jie Yang; Mike Zheng Shou","collected":true,"note":"p377","scope":"本地 PDF · 摘要初读","summary":"PAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观，并构建电影来源训练数据。","boundary":"背景一致与重光照不直接验证接触、受力或反事实后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2606.01399_PAI-Studio_Cinematic_Video_Background_Replacement_with_Camera-Aware_Motion.pdf"],"sha256":"0e6849ccc5158041ce5e1a045157e355e52ddecd28e1f5cc218b33f7c76cd2ea","pages":26,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.01399"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P377","arxiv_id":"2606.01399","title":"PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion","year":"2026","authors":"Heyuan Gao; Bangxun Tang; Yiren Song; Guian Fang; Zijian He; Jie Yang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W3b","X4a"],"collected":true,"review_status":"abstract_review","question":"更换动态背景时怎样保持前景运动、身份和光照协调？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观，并构建电影来源训练数据。","input_conditions":"摘要初读：PAI-Studio 用参考条件与双向注意力联合建模前景动态和背景外观，并构建电影来源训练数据。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"背景一致与重光照不直接验证接触、受力或反事实后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.01399"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.01399v1"}],"note":"p377","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P376","title":"Planning with the Views","short":"Planning with the Views","year":"2026","authors":"Kangrui Wang; Linjie Li; Zhengyuan Yang; Shiqi Chen; Zihan Wang; Li Fei-Fei; Jiajun Wu; Leonidas Guibas; Lijuan Wang; Manling Li","collected":true,"note":"p376","scope":"本地 PDF · 摘要初读","summary":"Planning with the Views 在 ViewSuite 中评估视角变换，通过自探索和视图图蒸馏改善规划。","boundary":"对象是主动观察与空间推理，不直接生成物理交互后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2605.29563_Planning_with_the_Views.pdf"],"sha256":"f0a1bb9724940a2d3b876b8368e5e22c748c4e43ec1e01e66bc0e21dbc38589e","pages":39,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.29563"}],"verified":"2026-09-19","mappings":[{"rq":"X1c","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P376","arxiv_id":"2605.29563","title":"Planning with the Views","year":"2026","authors":"Kangrui Wang; Linjie Li; Zhengyuan Yang; Shiqi Chen; Zihan Wang; Li Fei-Fei; Jiajun Wu; Leonidas Guibas; Lijuan Wang; Manling Li","teams":["fei-fei-li"],"topics":["video_reasoning","agent"],"rqs":["X1c","W4b"],"collected":true,"review_status":"abstract_review","question":"智能体能否预测视角改变并组合多步观察计划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Planning with the Views 在 ViewSuite 中评估视角变换，通过自探索和视图图蒸馏改善规划。","input_conditions":"摘要初读：Planning with the Views 在 ViewSuite 中评估视角变换，通过自探索和视图图蒸馏改善规划。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"对象是主动观察与空间推理，不直接生成物理交互后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.29563"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.29563v4"}],"note":"p376","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P375","title":"When Does LeJEPA Learn a World Model?","short":"When Does LeJEPA Learn a World Model?","year":"2026","authors":"David Klindt; Yann LeCun; Randall Balestriero","collected":true,"note":"p375","scope":"本地 PDF · 摘要初读","summary":"作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。","boundary":"结论依赖所给生成过程和分布假设，不能外推为真实世界因果机制的普遍可辨识性。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2605.26379_When_Does_LeJEPA_Learn_a_World_Model.pdf"],"sha256":"912f41e8c3fe5389f2136362533e4c7fc3695df8ad1b796adb285a49bb11f676","pages":48,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.26379"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P375","arxiv_id":"2605.26379","title":"When Does LeJEPA Learn a World Model?","year":"2026","authors":"David Klindt; Yann LeCun; Randall Balestriero","teams":["yann-lecun"],"topics":["world_model"],"rqs":["W1c","W4c"],"collected":true,"review_status":"abstract_review","question":"在什么条件下，JEPA 学到的表示可辨识为世界状态？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。","input_conditions":"摘要初读：作者分析 LeJEPA 的线性可辨识性以及状态分布、噪声假设与规划性能之间的关系。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"结论依赖所给生成过程和分布假设，不能外推为真实世界因果机制的普遍可辨识性。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.26379"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.26379v1"}],"note":"p375","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P374","title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","short":"stable-worldmodel","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Luiz Facury; Nassim Massaudi; Ayush Chaurasia; Francesco Capuano; Richard Gao; Taj Gillin; Dan Haramati; Damien Scieur; Yann LeCun; Randall Balestriero","collected":true,"note":"p374","scope":"本地 PDF · 摘要初读","summary":"stable-worldmodel 提供数据、模型和规划器接口，以及视觉、几何和物理变化的统一实验平台。","boundary":"这是比较基础设施；具体模型是否解决某类变化仍须查看实验结果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2605.21800_stable-worldmodel_A_Platform_for_Reproducible_World_Modeling_Research_and_Evaluation.pdf"],"sha256":"d9b1ea1261c7aea9f0a382c1992073b62e6f713553533557a24b71f3b498b666","pages":36,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.21800"}],"verified":"2026-09-19","mappings":[{"rq":"W2d","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P374","arxiv_id":"2605.21800","title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","year":"2026","authors":"Lucas Maes; Quentin Le Lidec; Luiz Facury; Nassim Massaudi; Ayush Chaurasia; Francesco Capuano; Richard Gao; Taj Gillin; Dan Haramati; Damien Scieur; Yann LeCun; Randall Balestriero","teams":["yann-lecun"],"topics":["world_model","evaluation"],"rqs":["W2d","W4c"],"collected":true,"review_status":"abstract_review","question":"怎样使世界模型在受控环境变化下的比较可复现？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"stable-worldmodel 提供数据、模型和规划器接口，以及视觉、几何和物理变化的统一实验平台。","input_conditions":"摘要初读：stable-worldmodel 提供数据、模型和规划器接口，以及视觉、几何和物理变化的统一实验平台。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是比较基础设施；具体模型是否解决某类变化仍须查看实验结果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.21800"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.21800v1"}],"note":"p374","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P373","title":"SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution","short":"SWEET","year":"2026","authors":"Yiren Song; Yihan Wang; Xiyao Deng; Zhuoran Yan; Mike Zheng Shou","collected":true,"note":"p373","scope":"本地 PDF · 摘要初读","summary":"SWEET 在相同机器人数据设置下比较视频生成和图像编辑，再用逐次编辑产生任务关键帧。","boundary":"稀疏目标的执行收益不表示帧间动态正确；对 Foresee 是预览预算的对照方法。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.19319_SWEET_Sparse_World_Modeling_with_Image_Editing_for_Embodied_Task_Execution.pdf"],"sha256":"7b278a04c9b23b87d7df2c3d8fbba39c440375cd0dd37d4d23f1cdf1d89e0694","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.19319"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P373","arxiv_id":"2605.19319","title":"SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution","year":"2026","authors":"Yiren Song; Yihan Wang; Xiyao Deng; Zhuoran Yan; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["world_model","agent","efficiency"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"机器人任务是否可以用稀疏关键状态替代密集视频规划？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SWEET 在相同机器人数据设置下比较视频生成和图像编辑，再用逐次编辑产生任务关键帧。","input_conditions":"摘要初读：SWEET 在相同机器人数据设置下比较视频生成和图像编辑，再用逐次编辑产生任务关键帧。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"稀疏目标的执行收益不表示帧间动态正确；对 Foresee 是预览预算的对照方法。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.19319"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.19319"}],"note":"p373","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P372","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","short":"ESI-Bench","year":"2026","authors":"Yining Hong; Jiageng Liu; Han Yin; Manling Li; Leonidas Guibas; Li Fei-Fei; Jiajun Wu; Yejin Choi","collected":true,"note":"p372","scope":"本地 PDF · 摘要初读","summary":"ESI-Bench 在 OmniGibson 中让观察者执行动作取证，比较主动探索、被动观察与三维辅助。","boundary":"显式三维表示错误也可能损害推理；不能预设 3D 辅助必然更可靠。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2605.18746_ESI-Bench_Towards_Embodied_Spatial_Intelligence_that_Closes_the_Perception-Action_Loop.pdf"],"sha256":"bf5f11b8ffc8a3ce3add08ad4f833ffcec6ceab47e2cbed8e8a24a7f8a9469f9","pages":38,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.18746"}],"verified":"2026-09-19","mappings":[{"rq":"X1c","role":"support"},{"rq":"W4b","role":"support"}],"annotation":{"id":"P372","arxiv_id":"2605.18746","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","year":"2026","authors":"Yining Hong; Jiageng Liu; Han Yin; Manling Li; Leonidas Guibas; Li Fei-Fei; Jiajun Wu; Yejin Choi","teams":["fei-fei-li"],"topics":["agent","evaluation","geometry"],"rqs":["X1c","W4b"],"collected":true,"review_status":"abstract_review","question":"空间理解从固定观察转为主动探索后会发生什么？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ESI-Bench 在 OmniGibson 中让观察者执行动作取证，比较主动探索、被动观察与三维辅助。","input_conditions":"摘要初读：ESI-Bench 在 OmniGibson 中让观察者执行动作取证，比较主动探索、被动观察与三维辅助。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"显式三维表示错误也可能损害推理；不能预设 3D 辅助必然更可靠。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.18746"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.18746v2"}],"note":"p372","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P371","title":"VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers","short":"VISTA","year":"2026","authors":"Yiren Song; Wangzi Yao; Haofan Wang; Mike Zheng Shou","collected":true,"note":"p371","scope":"本地 PDF · 摘要初读","summary":"VISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。","boundary":"风格和时间一致性的结果不能证明物理规则遵循。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2605.17312_VISTA_Triplet-Supervised_Video_Style_Transfer_with_Diffusion_Transformers.pdf"],"sha256":"adf1173982c0327c98dad41bc46679f22e1957b8d6b9e28fba664d27369f7a6f","pages":13,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2605.17312"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"}],"annotation":{"id":"P371","arxiv_id":"2605.17312","title":"VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers","year":"2026","authors":"Yiren Song; Wangzi Yao; Haofan Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W3b"],"collected":true,"review_status":"abstract_review","question":"视频风格迁移怎样解耦风格、内容和运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。","input_conditions":"摘要初读：VISTA 使用运动对齐的三元组数据与风格适配器训练视频扩散模型。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"风格和时间一致性的结果不能证明物理规则遵循。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.17312"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.17312"}],"note":"p371","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P390","title":"ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents","short":"ReGRPO","year":"2026","authors":"Binjie Zhang; Mike Zheng Shou","collected":true,"note":"p390","scope":"本地 PDF · 摘要初读","summary":"ReGRPO 用错误类型、证据和修复计划构造训练数据，再联合优化反思与纠正动作并计入反思成本。","boundary":"工具任务中的纠错不直接证明物理世界机制修订或视频推理。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2606.31392_ReGRPO_Reflection-Augmented_Policy_Optimization_for_Tool-Using_Agents.pdf"],"sha256":"90a758137f9f806a368585afe21ac6cb3989279dd10463d92842f3bd38e51bb6","pages":29,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.31392"}],"verified":"2026-09-19","mappings":[{"rq":"X3b","role":"support"}],"annotation":{"id":"P390","arxiv_id":"2606.31392","title":"ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents","year":"2026","authors":"Binjie Zhang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent"],"rqs":["X3b"],"collected":true,"review_status":"abstract_review","question":"工具智能体怎样从实际失败中学习有效且不过量的反思？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ReGRPO 用错误类型、证据和修复计划构造训练数据，再联合优化反思与纠正动作并计入反思成本。","input_conditions":"摘要初读：ReGRPO 用错误类型、证据和修复计划构造训练数据，再联合优化反思与纠正动作并计入反思成本。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"工具任务中的纠错不直接证明物理世界机制修订或视频推理。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.31392"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.31392v1"}],"note":"p390","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P389","title":"SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation","short":"SimFoundry","year":"2026","authors":"Nadun Ranawaka; Josiah Wong; Wei-Lin Pai; Wei-Teng Chu; Tianyuan Dai; Masoud Moghani; Hang Yin; Yunfan Jiang; Wesley Durbano; Brandon Huynh; Yu Fang; Danfei Xu; Ruohan Zhang; Li Fei-Fei; Linxi Fan; Bowen Wen; Ajay Mandlekar; Yuke Zhu","collected":true,"note":"p389","scope":"本地 PDF · 摘要初读","summary":"SimFoundry 以模块化 real-to-sim 管线生成场景，并比较仿真排序和真实执行结果。","boundary":"仿真与真实的相关性在所测任务中成立，不能作为所有生成世界的物理保真保证。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2606.28276_SimFoundry_Modular_and_Automated_Scene_Generation_for_Policy_Learning_and_Evaluation.pdf"],"sha256":"2a4e30098edc6561be9ae0aa9ba39815a3f3566cb76e28c5abb073c951e0896e","pages":52,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.28276"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2d","role":"support"}],"annotation":{"id":"P389","arxiv_id":"2606.28276","title":"SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation","year":"2026","authors":"Nadun Ranawaka; Josiah Wong; Wei-Lin Pai; Wei-Teng Chu; Tianyuan Dai; Masoud Moghani; Hang Yin; Yunfan Jiang; Wesley Durbano; Brandon Huynh; Yu Fang; Danfei Xu; Ruohan Zhang; Li Fei-Fei; Linxi Fan; Bowen Wen; Ajay Mandlekar; Yuke Zhu","teams":["fei-fei-li"],"topics":["geometry","physics","agent","evaluation"],"rqs":["W1c","W2d"],"collected":true,"review_status":"abstract_review","question":"真实视频能否自动转成适合策略学习和评价的模拟场景？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SimFoundry 以模块化 real-to-sim 管线生成场景，并比较仿真排序和真实执行结果。","input_conditions":"摘要初读：SimFoundry 以模块化 real-to-sim 管线生成场景，并比较仿真排序和真实执行结果。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"仿真与真实的相关性在所测任务中成立，不能作为所有生成世界的物理保真保证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.28276"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.28276v4"}],"note":"p389","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P388","title":"Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos","short":"Supervise What Survives","year":"2026","authors":"Danze Chen; Yanzhe Chen; Qiming Huang; Zhijun Cao; Chen Gao; Mike Zheng Shou","collected":true,"note":"p388","scope":"本地 PDF · 摘要初读","summary":"GRA 将合成数据中的几何运动提炼为二维末端路径，用辅助预测和表征对齐适配 VLA。","boundary":"视频中的几何轨迹与低层电机控制分开处理；不能直接把像素恢复成可靠控制标签。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2606.24448_Supervise_What_Survives_Geometry-Guided_VLA_Adaptation_from_Synthetic_Robot_Videos.pdf"],"sha256":"f9aabeb548ce5d5b8d2e523174ba013d72e1db271236011f44bc8a1bc4be4aec","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.24448"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P388","arxiv_id":"2606.24448","title":"Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos","year":"2026","authors":"Danze Chen; Yanzhe Chen; Qiming Huang; Zhijun Cao; Chen Gao; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","geometry","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"合成机器人视频中的哪些信息适合监督真实动作模型？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GRA 将合成数据中的几何运动提炼为二维末端路径，用辅助预测和表征对齐适配 VLA。","input_conditions":"摘要初读：GRA 将合成数据中的几何运动提炼为二维末端路径，用辅助预测和表征对齐适配 VLA。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视频中的几何轨迹与低层电机控制分开处理；不能直接把像素恢复成可靠控制标签。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.24448"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.24448"}],"note":"p388","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P387","title":"MeshFlow: Mesh Generation with Equivariant Flow Matching","short":"MeshFlow","year":"2026","authors":"Qi Sun; Kiyohiro Nakayama; Jing Nathan Yan; Qixing Huang; Alexander Rush; Leonidas Guibas; Gordon Wetzstein; Jing Liao; Guandao Yang","collected":true,"note":"p387","scope":"本地 PDF · 摘要初读","summary":"MeshFlow 在三角形集合上使用等变最优传输流匹配，修改 Transformer 与训练目标以保持排列对称性。","boundary":"研究网格表示和生成，未在摘要中提出动态机制学习或动作后果预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2606.23489_MeshFlow_Mesh_Generation_with_Equivariant_Flow_Matching.pdf"],"sha256":"c4544385bea3f55672e34ecbbc73af07beb0681407cac9984a8bc611bf4157d9","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.23489"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P387","arxiv_id":"2606.23489","title":"MeshFlow: Mesh Generation with Equivariant Flow Matching","year":"2026","authors":"Qi Sun; Kiyohiro Nakayama; Jing Nathan Yan; Qixing Huang; Alexander Rush; Leonidas Guibas; Gordon Wetzstein; Jing Liao; Guandao Yang","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"网格生成如何尊重面与顶点排列的对称性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MeshFlow 在三角形集合上使用等变最优传输流匹配，修改 Transformer 与训练目标以保持排列对称性。","input_conditions":"摘要初读：MeshFlow 在三角形集合上使用等变最优传输流匹配，修改 Transformer 与训练目标以保持排列对称性。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"研究网格表示和生成，未在摘要中提出动态机制学习或动作后果预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.23489"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.23489v2"}],"note":"p387","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P386","title":"SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors","short":"SkyJEPA","year":"2026","authors":"Pratyaksh Rao; Wancong Zhang; Randall Balestriero; Yann LeCun; Giuseppe Loianno","collected":true,"note":"p386","scope":"本地 PDF · 摘要初读","summary":"SkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合，研究仿真到真实的飞行控制。","boundary":"可读出的物理状态与控制成功不代表模型内部是完整可解释的物理机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2606.23444_SkyJEPA_Learning_Long-Horizon_World_Models_for_Zero-Shot_Sim-to-Real_Control_of_Quadrotors.pdf"],"sha256":"523eab23420bb1180313472d4ecac96e496241f09a57a5f1b469bb61b4e8f03e","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.23444"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P386","arxiv_id":"2606.23444","title":"SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors","year":"2026","authors":"Pratyaksh Rao; Wancong Zhang; Randall Balestriero; Yann LeCun; Giuseppe Loianno","teams":["yann-lecun"],"topics":["world_model","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"如何把潜空间世界模型用于高频无人机控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"SkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合，研究仿真到真实的飞行控制。","input_conditions":"摘要初读：SkyJEPA 将隐空间动力学、物理启发的状态探针与采样规划结合，研究仿真到真实的飞行控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"可读出的物理状态与控制成功不代表模型内部是完整可解释的物理机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.23444"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.23444v2"}],"note":"p386","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P385","title":"BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing","short":"BoxCtrl","year":"2026","authors":"Feifei Wang; Shiyuan Yang; Xiaoyu Li; Jing Liao","collected":true,"note":"p385","scope":"本地 PDF · 摘要初读","summary":"BoxCtrl 以 RGB 三维框的二维投影作为视觉提示，先使用合成数据监督微调，再通过真实数据与几何、画质奖励进行强化学习。","boundary":"编辑目标由用户的几何控制给定；几何编辑准确性与未知物理后果预测应分别评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2606.23270_BoxCtrl_3D-Aware_Visual_Prompting_for_Geometric_Image_Editing.pdf"],"sha256":"9e0a06eee81e9ac0b84faf94287b9cf7cb03cfc40645716ecf4c9980f919f5f3","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.23270"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"}],"annotation":{"id":"P385","arxiv_id":"2606.23270","title":"BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing","year":"2026","authors":"Feifei Wang; Shiyuan Yang; Xiaoyu Li; Jing Liao","teams":["jing-liao"],"topics":["geometry","generative_foundation"],"rqs":["X4a"],"collected":true,"review_status":"abstract_review","question":"如何通过投影的三维框精确控制图像中的几何编辑？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"BoxCtrl 以 RGB 三维框的二维投影作为视觉提示，先使用合成数据监督微调，再通过真实数据与几何、画质奖励进行强化学习。","input_conditions":"摘要初读：BoxCtrl 以 RGB 三维框的二维投影作为视觉提示，先使用合成数据监督微调，再通过真实数据与几何、画质奖励进行强化学习。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"编辑目标由用户的几何控制给定；几何编辑准确性与未知物理后果预测应分别评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.23270"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.23270"}],"note":"p385","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P384","title":"Learning Stable Canonical Worlds for Novel View Synthesis and Beyond","short":"Learning Stable Canonical Worlds for Novel View Synthesis and Beyond","year":"2026","authors":"Xiaoyu Xu; Jian Zou; Sheyang Tang; Zhihua Wang; Jing Liao; Kede Ma","collected":true,"note":"p384","scope":"本地 PDF · 摘要初读","summary":"CanonicalGS 将多视图观测聚合成场景中心表示，降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。","boundary":"摘要报告新视角合成与分割收益；静态表示稳定性不直接检验动态世界机制。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2606.23027_Learning_Stable_Canonical_Worlds_for_Novel_View_Synthesis_and_Beyond.pdf"],"sha256":"96a4d8784d971b86d842a097d559c9d6a78a184ec5cea306bc2b31dba4ca748b","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.23027"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"}],"annotation":{"id":"P384","arxiv_id":"2606.23027","title":"Learning Stable Canonical Worlds for Novel View Synthesis and Beyond","year":"2026","authors":"Xiaoyu Xu; Jian Zou; Sheyang Tang; Zhihua Wang; Jing Liao; Kede Ma","teams":["jing-liao"],"topics":["geometry","world_model"],"rqs":["W3a"],"collected":true,"review_status":"abstract_review","question":"增加输入视图时，三维表示怎样收敛到稳定的场景坐标？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"CanonicalGS 将多视图观测聚合成场景中心表示，降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。","input_conditions":"摘要初读：CanonicalGS 将多视图观测聚合成场景中心表示，降低冗余和不可靠观测对前馈 Gaussian Splatting 的干扰。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"摘要报告新视角合成与分割收益；静态表示稳定性不直接检验动态世界机制。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.23027"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.23027"}],"note":"p384","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P383","title":"Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models","short":"Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models","year":"2026","authors":"Tianyi Xiang; Mingming He; Li Ma; Jing Liao","collected":true,"note":"p383","scope":"本地 PDF · 摘要初读","summary":"通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境，并构造重光照训练配对。","boundary":"视频合成中的交互合理性需要与指定动作下的正确后果区分；控制输入与配对数据条件待正文核查。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2606.20233_Cinematic_Compositing_Using_Character-Environment-Harmonized_Video_Generation_Models.pdf"],"sha256":"78fb1df14e456ece6967a9b4122a9f10d0a2b99e0660fa5c3cde6d5385f457f6","pages":14,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.20233"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W2c","role":"support"}],"annotation":{"id":"P383","arxiv_id":"2606.20233","title":"Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models","year":"2026","authors":"Tianyi Xiang; Mingming He; Li Ma; Jing Liao","teams":["jing-liao"],"topics":["video_gen","physics"],"rqs":["W1c","W2c"],"collected":true,"review_status":"abstract_review","question":"视频合成如何同时表现角色对环境的交互与环境对角色的光照影响？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境，并构造重光照训练配对。","input_conditions":"摘要初读：通过三类掩码和 RGB-D 联合去噪协调角色、交互道具与环境，并构造重光照训练配对。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视频合成中的交互合理性需要与指定动作下的正确后果区分；控制输入与配对数据条件待正文核查。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.20233"},{"label":"官方 PDF","url":"https://export.arxiv.org/pdf/2606.20233"}],"note":"p383","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P382","title":"You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences","short":"You Don't Need Strong Assumptions","year":"2026","authors":"Ninad Daithankar; Alexi Gladstone; Yann LeCun; Heng Ji","collected":true,"note":"p382","scope":"本地 PDF · 摘要初读","summary":"这项工作研究利用时间差分学习视觉表示，重新审视常见预训练假设。","boundary":"本轮只核对摘要层的问题定位；具体目标与理论条件仍需方法复核。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2606.15956_You_Don_t_Need_Strong_Assumptions_Visual_Representation_Learning_via_Temporal_Differences.pdf"],"sha256":"2becb6e3a77c05861ed1b1179c8443fc717dc166cbc0b90f54256a07a2117dba","pages":25,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.15956"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P382","arxiv_id":"2606.15956","title":"You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences","year":"2026","authors":"Ninad Daithankar; Alexi Gladstone; Yann LeCun; Heng Ji","teams":["yann-lecun"],"topics":["video_understanding"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"时间差分能否在较弱假设下提供有用的视觉学习信号？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"这项工作研究利用时间差分学习视觉表示，重新审视常见预训练假设。","input_conditions":"摘要初读：这项工作研究利用时间差分学习视觉表示，重新审视常见预训练假设。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"本轮只核对摘要层的问题定位；具体目标与理论条件仍需方法复核。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.15956"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.15956v1"}],"note":"p382","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P381","title":"Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks","short":"Unifying Object-Centric World Models and Diffusion Policy","year":"2026","authors":"Raktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad Khorrami","collected":true,"note":"p381","scope":"本地 PDF · 摘要初读","summary":"WorldDP 在运行时提出可行的子目标，由低层 diffusion policy 执行，连接世界预测与多阶段机器人任务。","boundary":"高层目标有效性与生成视频中的细粒度物理正确性属于不同评价。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2606.08775_Unifying_Object-Centric_World_Models_and_Diffusion_Policy_A_Hierarchical_Framework_for_Multi-Stage_Robotic_Tasks.pdf"],"sha256":"f0ea19498d3df994d42b4229e76ad5c84df85cb2c98a25d565542740da6520e9","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.08775"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P381","arxiv_id":"2606.08775","title":"Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks","year":"2026","authors":"Raktim Gautam Goswami; Prashanth Krishnamurthy; Yann LeCun; Farshad Khorrami","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"对象级世界模型能否为长任务提供可执行的中间目标？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"WorldDP 在运行时提出可行的子目标，由低层 diffusion policy 执行，连接世界预测与多阶段机器人任务。","input_conditions":"摘要初读：WorldDP 在运行时提出可行的子目标，由低层 diffusion policy 执行，连接世界预测与多阶段机器人任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"高层目标有效性与生成视频中的细粒度物理正确性属于不同评价。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.08775"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.08775v1"}],"note":"p381","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P400","title":"One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry","short":"One Demonstration, Many Objects","year":"2026","authors":"Satvik Sharma; Samrat Sahoo; Huang Huang; Fei-Fei Li; Jiajun Wu; Dorsa Sadigh; Jeannette Bohg","collected":true,"note":"p400","scope":"本地 PDF · 摘要初读","summary":"DemoMimic 关注接触点附近的物体几何，学习更可泛化的灵巧操作策略。","boundary":"策略的接触泛化不是视频生成的直接证据；奖励和真实测试条件仍需细读。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2609.01938_One_Demonstration_Many_Objects_Generalizing_Manipulation_via_Local_Contact_Geometry.pdf"],"sha256":"511f00ee6bbcf92bf104dea7dd8f9a8f389d19e7d976a86e411954a5fcafcfce","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2609.01938"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P400","arxiv_id":"2609.01938","title":"One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry","year":"2026","authors":"Satvik Sharma; Samrat Sahoo; Huang Huang; Fei-Fei Li; Jiajun Wu; Dorsa Sadigh; Jeannette Bohg","teams":["fei-fei-li"],"topics":["geometry","physics","agent"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"少量示范如何通过局部接触几何迁移到不同物体？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DemoMimic 关注接触点附近的物体几何，学习更可泛化的灵巧操作策略。","input_conditions":"摘要初读：DemoMimic 关注接触点附近的物体几何，学习更可泛化的灵巧操作策略。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"策略的接触泛化不是视频生成的直接证据；奖励和真实测试条件仍需细读。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2609.01938"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2609.01938v2"}],"note":"p400","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P399","title":"LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics","short":"LeVJEPA","year":"2026","authors":"Lukas Kuhn; Lucas Maes; Giuseppe Serra; Quentin Le Lidec; Yann LeCun; Randall Balestriero; Florian Buettner","collected":true,"note":"p399","scope":"本地 PDF · 摘要初读","summary":"LeVJEPA 将 LeJEPA 的表征学习目标扩展到视频，并比较外观与运动任务中的表示质量。","boundary":"视频编码能力不等于像素级未来生成；需另测动作条件预测。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2608.27395_LeVJEPA_Efficient_Scalable_Video_Pretraining_without_the_Heuristics.pdf"],"sha256":"047a945c5ccc7846269aa077fabce672f2b6c62b1aefba38ffa23004e63bad08","pages":12,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2608.27395"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P399","arxiv_id":"2608.27395","title":"LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics","year":"2026","authors":"Lukas Kuhn; Lucas Maes; Giuseppe Serra; Quentin Le Lidec; Yann LeCun; Randall Balestriero; Florian Buettner","teams":["yann-lecun"],"topics":["video_understanding","world_model"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"怎样以较少训练启发式学习兼顾外观与运动的视频表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LeVJEPA 将 LeJEPA 的表征学习目标扩展到视频，并比较外观与运动任务中的表示质量。","input_conditions":"摘要初读：LeVJEPA 将 LeJEPA 的表征学习目标扩展到视频，并比较外观与运动任务中的表示质量。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"视频编码能力不等于像素级未来生成；需另测动作条件预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2608.27395"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2608.27395v1"}],"note":"p399","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P398","title":"TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks","short":"TrAct","year":"2026","authors":"Zhi Cao; Howard Ji; Kevin Zhang; Kuangzhi Ge; Li Fei-Fei; Jiajun Wu; Huang Huang","collected":true,"note":"p398","scope":"本地 PDF · 方法条件已核查","summary":"TrAct 联合提出动作及视觉轨迹，用轨迹条件世界模型预测后果，再由视觉语言奖励模型排序。","boundary":"动作提出与结果评分有独立模块；需要区分轨迹跟随、被动物体预测及最终执行成功。","evidence":"PDF pp.3–5 §3–4：完整接口、训练、推理与 LIBERO-INTEGRAL；p.5 §4.2：对照错误。方法已核查，未复现实验。","sources":["researcher-collections/fei-fei-li/pdfs/2608.24101_TrAct_Bridging_Robot_Control_and_Visual_Prediction_with_Visual_Tracks.pdf"],"sha256":"2663c30640474871fa2f844ba3861b850cde109d85954ae99867887780cde74d","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2608.24101"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"core"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P398","arxiv_id":"2608.24101","title":"TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks","year":"2026","authors":"Zhi Cao; Howard Ji; Kevin Zhang; Kuangzhi Ge; Li Fei-Fei; Jiajun Wu; Huang Huang","teams":["fei-fei-li"],"topics":["video_gen","world_model","agent"],"rqs":["W1c","W4a"],"collected":true,"review_status":"method_checked","question":"视觉轨迹能否连接候选机器人动作与未来视频评价？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"TrAct 联合提出动作及视觉轨迹，用轨迹条件世界模型预测后果，再由视觉语言奖励模型排序。","input_conditions":"当前图像与语言目标；VLAT 同时提出候选机器人动作和二维视觉轨迹，轨迹作为未来视频模型条件。","training_supervision":"π0.5 改为动作／轨迹联合 flow 训练；SVD 加轨迹 ControlNet。预训练用 DROID/EgoDex，轨迹来自校准投影和 CoTracker；动作模型报告 4 张 H100、3 万步。","inference_support":"视频模型生成各候选轨迹的视觉结果，由基于 InternVL2 的 VLAC 评分，再执行对应动作。规划并非视频模型单独完成。","evaluation":"LIBERO-INTEGRAL 包括稳健性和跨本体任务；比较 π0.5、仅 VLAT、动作条件及轨迹条件世界模型，并测试真实 Franka。统一数据适配用于检验轨迹接口的作用。","boundary":"该系统把候选动作选择转成可观看未来的比较，与 Foresee 有直接交集；但有机器人状态、校准、多视角与奖励模型条件，不能原样外推到用户日常任务。","observed_failures":"【作者对照观察】动作条件基线出现夹爪姿态错误、物体消失与跨视图位置不一致；这是论文 Fig.3 的方法对照，不是所有当前模型的普遍缺陷结论。","evidence":"PDF pp.3–5 §3–4：完整接口、训练、推理与 LIBERO-INTEGRAL；p.5 §4.2：对照错误。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2608.24101"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2608.24101v3"}],"note":"p398","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":97,"mapping_roles":{"W1c":"core"}},"aliases":[]},{"id":"P397","title":"LpWM: A Case for Sparse Representations in World Models","short":"LpWM","year":"2026","authors":"Yilun Kuang; Yash Dagade; Quentin Le Lidec; Lucas Maes; Randall Balestriero; Yann LeCun","collected":true,"note":"p397","scope":"本地 PDF · 摘要初读","summary":"LpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。","boundary":"理论假设与实验环境需单独核对，不能直接推成任意真实世界的可解释规则。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2608.22764_LpWM_A_Case_for_Sparse_Representations_in_World_Models.pdf"],"sha256":"76ab29b8610553410ac6b3c0683ccc6d71baabedf49ee6a4463a652a82c3d5ae","pages":28,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2608.22764"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W4a","role":"support"}],"annotation":{"id":"P397","arxiv_id":"2608.22764","title":"LpWM: A Case for Sparse Representations in World Models","year":"2026","authors":"Yilun Kuang; Yash Dagade; Quentin Le Lidec; Lucas Maes; Randall Balestriero; Yann LeCun","teams":["yann-lecun"],"topics":["world_model"],"rqs":["W1c","W4a"],"collected":true,"review_status":"abstract_review","question":"什么潜空间几何更适合学习和规划非线性动力学？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"LpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。","input_conditions":"摘要初读：LpWM 从稀疏表征与动力学近似的关系出发研究世界模型的潜空间结构。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"理论假设与实验环境需单独核对，不能直接推成任意真实世界的可解释规则。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2608.22764"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2608.22764v1"}],"note":"p397","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P396","title":"Masked Visual Actions for Unified World Modeling","short":"Masked Visual Actions for Unified World Modeling","year":"2026","authors":"Hadi Alzayer; Wenlong Huang; Haonan Chen; Christopher Luey; Lvmin Zhang; Maneesh Agrawala; Gordon Wetzstein; Li Fei-Fei; Yilun Du; Jiajun Wu; Jia-Bin Huang","collected":true,"note":"p396","scope":"本地 PDF · 方法条件已核查","summary":"Masked Visual Actions 以部分可见的实体轨迹视频作为动作接口，预测其余交互并支持候选策略评价。","boundary":"部分实体未来已知，但被遮挡实体后果仍需预测；输入条件强于仅给首帧。","evidence":"PDF pp.3–5：实体掩码接口、数据构造；p.6 §4.2：训练规模；p.7 §5.1、Tables 1–2：跨本体条件与比较。方法已核查，未复现实验。","sources":["researcher-collections/fei-fei-li/pdfs/2607.19343_Masked_Visual_Actions_for_Unified_World_Modeling.pdf"],"sha256":"feef3cb2cd12955f1ac8daf4d5493a9a1f22f2855f2be03abe71373a0e4e8dee","pages":21,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2607.19343"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"core"},{"rq":"W2c","role":"support"}],"annotation":{"id":"P396","arxiv_id":"2607.19343","title":"Masked Visual Actions for Unified World Modeling","year":"2026","authors":"Hadi Alzayer; Wenlong Huang; Haonan Chen; Christopher Luey; Lvmin Zhang; Maneesh Agrawala; Gordon Wetzstein; Li Fei-Fei; Yilun Du; Jiajun Wu; Jia-Bin Huang","teams":["fei-fei-li"],"topics":["video_gen","world_model"],"rqs":["W1c","W2c"],"collected":true,"review_status":"method_checked","question":"遮挡不同实体的未来轨迹能否统一前向、逆向与无条件世界建模？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Masked Visual Actions 以部分可见的实体轨迹视频作为动作接口，预测其余交互并支持候选策略评价。","input_conditions":"首帧与部分可见的实体未来轨迹视频。主动实体运动可以给定，被遮挡实体及其交互后果仍须生成。","training_supervision":"Wan-Fun-Control 2.2 14B；同一 VAE 编码条件，缺失区域置灰后拼接。LoRA rank 256，batch 4，8 张 H200，约 1 万步／4 天。","inference_support":"依赖分割或机器人渲染提供像素动作条件；下游规划用多候选 rollout。不能把给定轨迹区域的准确复现全部计为自主后果预测。","evaluation":"DROID、未见末端形态与 BEHAVIOR 本体上的视觉保真和控制比较，另有策略评价、规划和逆向建模实验。Table 1 各基线条件不完全相同，需连同正文说明比较。","boundary":"适合作为 Foresee 的动作接口对照。完整训练配方远大于 4×A10；缩小骨干或训练量后的效果需要实测。","observed_failures":"","evidence":"PDF pp.3–5：实体掩码接口、数据构造；p.6 §4.2：训练规模；p.7 §5.1、Tables 1–2：跨本体条件与比较。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2607.19343"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2607.19343v1"}],"note":"p396","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":98,"mapping_roles":{"W1c":"core"}},"aliases":[]},{"id":"P395","title":"Patch Policy: Efficient Embodied Control via Dense Visual Representations","short":"Patch Policy","year":"2026","authors":"Gaoyue Zhou; Zichen Jeff Cui; Ada Langford; Bowen Tan; Yann LeCun; Lerrel Pinto","collected":true,"note":"p395","scope":"本地 PDF · 摘要初读","summary":"Patch Policy 使用预训练视觉特征中的局部 token，减少对完整视觉语言模型的依赖。","boundary":"机器人动作策略并非可供人浏览的后果视频生成器。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/yann-lecun/pdfs/2607.18236_Patch_Policy_Efficient_Embodied_Control_via_Dense_Visual_Representations.pdf"],"sha256":"9c4c9a5416831e337a9b76ac5edd6f0c2cc8746ec7b76f582565b53b2d37b919","pages":27,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2607.18236"}],"verified":"2026-09-19","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"P395","arxiv_id":"2607.18236","title":"Patch Policy: Efficient Embodied Control via Dense Visual Representations","year":"2026","authors":"Gaoyue Zhou; Zichen Jeff Cui; Ada Langford; Bowen Tan; Yann LeCun; Lerrel Pinto","teams":["yann-lecun"],"topics":["agent","efficiency"],"rqs":["W4a"],"collected":true,"review_status":"abstract_review","question":"能否直接利用稠密视觉 token 学习高效的机器人策略？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Patch Policy 使用预训练视觉特征中的局部 token，减少对完整视觉语言模型的依赖。","input_conditions":"摘要初读：Patch Policy 使用预训练视觉特征中的局部 token，减少对完整视觉语言模型的依赖。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"机器人动作策略并非可供人浏览的后果视频生成器。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2607.18236"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2607.18236v1"}],"note":"p395","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P394","title":"RoboTTT: Context Scaling for Robot Policies","short":"RoboTTT","year":"2026","authors":"Yunfan Jiang; Yevgen Chebotar; Ruijie Zheng; Fengyuan Hu; Yunhao Ge; Jimmy Wu; Tianyuan Dai; Scott Reed; Li Fei-Fei; Yuke Zhu; Linxi \"Jim\" Fan","collected":true,"note":"p394","scope":"本地 PDF · 摘要初读","summary":"RoboTTT 用测试时训练机制扩展视觉运动上下文，研究示范学习、扰动恢复与多阶段任务。","boundary":"长策略上下文不等于像素视频的长期世界记忆。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/fei-fei-li/pdfs/2607.15275_RoboTTT_Context_Scaling_for_Robot_Policies.pdf"],"sha256":"6e3cbcbc0ab4db0c20e693c905c9ff4e7f7afe726b15f8fb6dc3a6d7415e4ca0","pages":22,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2607.15275"}],"verified":"2026-09-19","mappings":[{"rq":"W3a","role":"support"},{"rq":"X1b","role":"support"}],"annotation":{"id":"P394","arxiv_id":"2607.15275","title":"RoboTTT: Context Scaling for Robot Policies","year":"2026","authors":"Yunfan Jiang; Yevgen Chebotar; Ruijie Zheng; Fengyuan Hu; Yunhao Ge; Jimmy Wu; Tianyuan Dai; Scott Reed; Li Fei-Fei; Yuke Zhu; Linxi \"Jim\" Fan","teams":["fei-fei-li"],"topics":["agent","world_model","efficiency"],"rqs":["W3a","X1b"],"collected":true,"review_status":"abstract_review","question":"机器人策略怎样利用很长的交互历史而控制推理成本？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RoboTTT 用测试时训练机制扩展视觉运动上下文，研究示范学习、扰动恢复与多阶段任务。","input_conditions":"摘要初读：RoboTTT 用测试时训练机制扩展视觉运动上下文，研究示范学习、扰动恢复与多阶段任务。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"长策略上下文不等于像素视频的长期世界记忆。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2607.15275"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2607.15275v1"}],"note":"p394","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P393","title":"ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning","short":"ThinkBLOX","year":"2026","authors":"Yuan Xiao; Can Wang; Xiangyu Kong; Jing Liao","collected":true,"note":"p393","scope":"本地 PDF · 摘要初读","summary":"ThinkBLOX 用 VLM 逐步放置和修整场景，构建带多视图、推理说明和 JSON 布局的训练数据，并使用分层奖励优化。","boundary":"推理发生在 VLM 与显式场景布局层；尚不能据此认定视频模型自身推断物理后果。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/jing-liao/pdfs/2607.13539_ThinkBLOX_3D_Indoor_Scene_Generation_with_Progressive_Reasoning.pdf"],"sha256":"de4aa660b0bf398e069ce0f3a2a6d4bd0a340330571e29d4984a65c95a1b054b","pages":20,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2607.13539"}],"verified":"2026-09-19","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"P393","arxiv_id":"2607.13539","title":"ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning","year":"2026","authors":"Yuan Xiao; Can Wang; Xiangyu Kong; Jing Liao","teams":["jing-liao"],"topics":["geometry","agent"],"rqs":["X4a","W3d"],"collected":true,"review_status":"abstract_review","question":"三维室内场景能否通过逐步推理与局部反馈来构建和修改？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"ThinkBLOX 用 VLM 逐步放置和修整场景，构建带多视图、推理说明和 JSON 布局的训练数据，并使用分层奖励优化。","input_conditions":"摘要初读：ThinkBLOX 用 VLM 逐步放置和修整场景，构建带多视图、推理说明和 JSON 布局的训练数据，并使用分层奖励优化。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"推理发生在 VLM 与显式场景布局层；尚不能据此认定视频模型自身推断物理后果。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2607.13539"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2607.13539v1"}],"note":"p393","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"P392","title":"Video Generation Models are General-Purpose Vision Learners","short":"Video Generation Models are General-Purpose Vision Learners","year":"2026","authors":"Letian Wang; Chuhan Zhang; Rishabh Kabra; Jasper Uijlings; Steven Waslander; Andrew Zisserman; Joao Carreira; Kaiming He; Misha Andriluka; Eduard Gabriel Bazavan; Andrei Zanfir; Cristian Sminchisescu","collected":true,"note":"p392","scope":"本地 PDF · 方法条件已核查","summary":"GenCeption 将预训练视频扩散骨干改为前馈感知模型，经任务条件后训练支持深度、法线、分割、姿态和关键点等任务。","boundary":"重点是生成预训练到感知的迁移，不能把感知任务泛化等同于视频模型预测干预后果。","evidence":"PDF pp.5–7 §3、Fig.4–5：生成到感知改造和统一输出；方法已核查，未复现实验。","sources":["researcher-collections/kaiming-he/pdfs/2607.09024_Video_Generation_Models_are_General-Purpose_Vision_Learners.pdf"],"sha256":"26bd3358e5d33da3f221c3dce11878af6635d478bc9d5986d5f7535542218dac","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2607.09024"}],"verified":"2026-09-19","mappings":[{"rq":"W4b","role":"support"},{"rq":"W1c","role":"support"}],"annotation":{"id":"P392","arxiv_id":"2607.09024","title":"Video Generation Models are General-Purpose Vision Learners","year":"2026","authors":"Letian Wang; Chuhan Zhang; Rishabh Kabra; Jasper Uijlings; Steven Waslander; Andrew Zisserman; Joao Carreira; Kaiming He; Misha Andriluka; Eduard Gabriel Bazavan; Andrei Zanfir; Cristian Sminchisescu","teams":["kaiming-he"],"topics":["video_gen","video_understanding","generative_foundation"],"rqs":["W4b","W1c"],"collected":true,"review_status":"method_checked","question":"视频生成预训练能否提供可迁移到多种视觉任务的通用表征？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"GenCeption 将预训练视频扩散骨干改为前馈感知模型，经任务条件后训练支持深度、法线、分割、姿态和关键点等任务。","input_conditions":"已观测 RGB 视频与目标感知任务提示；输出深度、法线、分割、相机或关键点等表征。","training_supervision":"将视频扩散骨干改成干净 latent、固定 t=0 的单次前向感知模型；稠密任务映射到 RGB，稀疏任务加可学习 token，主要使用合成监督。","inference_support":"不进行多步去噪以预测未知未来；视频预训练作为视觉特征基础，任务提示选择输出模态。","evaluation":"多类稠密与稀疏视觉感知任务；本条核查了接口和训练任务，未逐表复核全部分数。","boundary":"重要之处是视频生成预训练向视觉能力的迁移，不是直接证明生成器会推断动作后果或新规律。","observed_failures":"","evidence":"PDF pp.5–7 §3、Fig.4–5：生成到感知改造和统一输出；方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2607.09024"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2607.09024v1"}],"note":"p392","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":93},"aliases":[]},{"id":"P391","title":"AdaJEPA: An Adaptive Latent World Model","short":"AdaJEPA","year":"2026","authors":"Ying Wang; Oumayma Bounou; Yann LeCun; Mengye Ren","collected":true,"note":"p391","scope":"本地 PDF · 方法条件已核查","summary":"AdaJEPA 在执行动作后，用观测到的转移更新编码器和预测器的部分参数，再进行规划。","boundary":"属于潜空间模型的测试时适应；不等于显式规则编辑，也没有直接验证写实视频质量。","evidence":"PDF pp.2–6：方法闭环、更新参数、回放、数据与变化设置。方法已核查，未复现实验。","sources":["researcher-collections/yann-lecun/pdfs/2606.32026_AdaJEPA_An_Adaptive_Latent_World_Model.pdf"],"sha256":"8e4dfbf66b1f4b0ef46122dab4a291a470ff55cd736a384de298516df3c4b2f1","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2606.32026"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"W1d","role":"core"},{"rq":"W4c","role":"support"}],"annotation":{"id":"P391","arxiv_id":"2606.32026","title":"AdaJEPA: An Adaptive Latent World Model","year":"2026","authors":"Ying Wang; Oumayma Bounou; Yann LeCun; Mengye Ren","teams":["yann-lecun"],"topics":["world_model","agent"],"rqs":["W1c","W1d","W4c"],"collected":true,"review_status":"method_checked","question":"部署时遇到外观或动力学变化，潜空间世界模型能否利用刚发生的交互快速适应？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"AdaJEPA 在执行动作后，用观测到的转移更新编码器和预测器的部分参数，再进行规划。","input_conditions":"预训练 JEPA、目标图像和部署时不断到来的真实状态转移；测试改变形状、颜色、动作映射或噪声。","training_supervision":"测试时每次 MPC 后用自监督转移损失更新编码器、预测器的后层；近期 5 个样本回放，每次一步梯度更新。","inference_support":"执行—观察—适应—重规划闭环；预测和目标比较发生在潜空间，不渲染写实视频。","evaluation":"PushT、PointMaze 上的变化测试；按目标达成评价，而不是视频 FVD。正文给出种子和每种环境的具体变化，不能概括为任意机制突变均已解决。","boundary":"与可修订世界模型直接相关，更新的是参数，不是显式符号规律；能否用于可观看后果及非真实规律需另行实验。","observed_failures":"","evidence":"PDF pp.2–6：方法闭环、更新参数、回放、数据与变化设置。方法已核查，未复现实验。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.32026"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2606.32026v1"}],"note":"p391","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":94,"mapping_roles":{"W1d":"core"}},"aliases":[]},{"id":"P404","title":"DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation","short":"DeformGS","year":"2023","authors":"Bardienus P. Duisterhof; Zhao Mandi; Yunchao Yao; Jia-Wei Liu; Jenny Seidenschwarz; Mike Zheng Shou; Deva Ramanan; Shuran Song; Stan Birchfield; Bowen Wen; Jeffrey Ichnowski","collected":true,"note":"p404","scope":"本地 PDF · 摘要初读","summary":"DeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。","boundary":"这是已观测动态的重建；物理启发正则不等于未知未来的完整模拟器。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2312.00583_DeformGS_Scene_Flow_in_Highly_Deformable_Scenes_for_Deformable_Object_Manipulation.pdf"],"sha256":"3742577278088e5e7589b8eec7a7b5b77fee18a397040a6f83677fdc26dca3bb","pages":18,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2312.00583"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"P404","arxiv_id":"2312.00583","title":"DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation","year":"2023","authors":"Bardienus P. Duisterhof; Zhao Mandi; Yunchao Yao; Jia-Wei Liu; Jenny Seidenschwarz; Mike Zheng Shou; Deva Ramanan; Shuran Song; Stan Birchfield; Bowen Wen; Jeffrey Ichnowski","teams":["mike-zheng-shou"],"topics":["geometry","physics"],"rqs":["W1c"],"collected":true,"review_status":"abstract_review","question":"多视角视频怎样重建高形变物体的稠密运动？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"DeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。","input_conditions":"摘要初读：DeformGS 通过 Gaussian 表示和动量、等距启发正则估计场景流。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"这是已观测动态的重建；物理启发正则不等于未知未来的完整模拟器。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2312.00583"},{"label":"官方 PDF","url":"https://deformgs.github.io/paper.pdf"}],"note":"p404","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"本地文件为作者 DeformGS 项目页提供的 WAFR 2024 版本；arXiv 版本号仅描述检索元数据，不代表两份文件相同。"},"aliases":[]},{"id":"P403","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","short":"MagicAnimate","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Hanshu Yan; Jia-Wei Liu; Chenxu Zhang; Jiashi Feng; Mike Zheng Shou","collected":true,"note":"p403","scope":"本地 PDF · 摘要初读","summary":"MagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。","boundary":"运动条件控制与物理规律推断需要不同实验。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2311.16498_MagicAnimate_Temporally_Consistent_Human_Image_Animation_using_Diffusion_Model.pdf"],"sha256":"5193981db6663482b98892b14935ce49ff9f76073360817f93021916f06af8b9","pages":10,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2311.16498"}],"verified":"2026-09-19","mappings":[{"rq":"W3b","role":"support"}],"annotation":{"id":"P403","arxiv_id":"2311.16498","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Hanshu Yan; Jia-Wei Liu; Chenxu Zhang; Jiashi Feng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W3b"],"collected":true,"review_status":"abstract_review","question":"人物图像动画怎样保持身份和时间连续？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。","input_conditions":"摘要初读：MagicAnimate 使用视频扩散、外观编码与片段融合改善人物动画。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"运动条件控制与物理规律推断需要不同实验。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2311.16498"},{"label":"官方 PDF","url":"https://openaccess.thecvf.com/content/CVPR2024/papers/Xu_MagicAnimate_Temporally_Consistent_Human_Image_Animation_using_Diffusion_Model_CVPR_2024_paper.pdf"}],"note":"p403","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"本地文件为CVPR 2024 会议开放版本；arXiv 版本号仅描述检索元数据，不代表两份文件相同。"},"aliases":[]},{"id":"P402","title":"MotionDirector: Motion Customization of Text-to-Video Diffusion Models","short":"MotionDirector","year":"2023","authors":"Rui Zhao; Yuchao Gu; Jay Zhangjie Wu; David Junhao Zhang; Jiawei Liu; Weijia Wu; Jussi Keppo; Mike Zheng Shou","collected":true,"note":"p402","scope":"本地 PDF · 摘要初读","summary":"MotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。","boundary":"运动风格迁移不直接验证动作导致的对象状态变化。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2310.08465_MotionDirector_Motion_Customization_of_Text-to-Video_Diffusion_Models.pdf"],"sha256":"b3954f5fe89602da976141a2109c78bccd8f928aefdfbcf759fb2f2ee0fdfcb5","pages":19,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2310.08465"}],"verified":"2026-09-19","mappings":[{"rq":"W1c","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"P402","arxiv_id":"2310.08465","title":"MotionDirector: Motion Customization of Text-to-Video Diffusion Models","year":"2023","authors":"Rui Zhao; Yuchao Gu; Jay Zhangjie Wu; David Junhao Zhang; Jiawei Liu; Weijia Wu; Jussi Keppo; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen"],"rqs":["W1c","X4a"],"collected":true,"review_status":"abstract_review","question":"少量视频中的运动概念怎样与外观解耦迁移？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"MotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。","input_conditions":"摘要初读：MotionDirector 用双路径 LoRA 和去外观偏差的时间损失学习运动定制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"运动风格迁移不直接验证动作导致的对象状态变化。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2310.08465"},{"label":"官方 PDF","url":"https://www.ecva.net/papers/eccv_2024/papers_ECCV/papers/07327.pdf"}],"note":"p402","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"version_note":"本地文件为ECCV 2024 会议开放版本；arXiv 版本号仅描述检索元数据，不代表两份文件相同。"},"aliases":[]},{"id":"P401","title":"Show-Harness: Just a VLM Agent Can Play Robots","short":"Show-Harness","year":"2026","authors":"Yanzhe Chen; Zechen Bai; Zhijun Cao; Wenzheng Zeng; Kevin Qinghong Lin; Yiqi Lin; Guoqiang Liang; Kevin Yuchen Ma; Qiming Huang; Mike Zheng Shou","collected":true,"note":"p401","scope":"本地 PDF · 摘要初读","summary":"Show-Harness 通过语义动作接口连接意图与执行，并以 GUMI 支持 GUI 示范采集。","boundary":"属于机器人交互与执行接口，不直接生成或验证未来视频。","evidence":"依据作者提交的 arXiv 摘要与元数据进行首轮标注；全文已逐页提取，但未逐项复核方法、指标和图表。","sources":["researcher-collections/mike-zheng-shou/pdfs/2609.10522_Show-Harness_Just_a_VLM_Agent_Can_Play_Robots.pdf"],"sha256":"383f91ed602bbe1bbba46e49dfa146ea20fa40f7555e576a17bfd081e7d357f6","pages":30,"links":[{"label":"arXiv 作者记录","url":"https://arxiv.org/abs/2609.10522"}],"verified":"2026-09-19","mappings":[{"rq":"X1a","role":"support"},{"rq":"X3c","role":"support"}],"annotation":{"id":"P401","arxiv_id":"2609.10522","title":"Show-Harness: Just a VLM Agent Can Play Robots","year":"2026","authors":"Yanzhe Chen; Zechen Bai; Zhijun Cao; Wenzheng Zeng; Kevin Qinghong Lin; Yiqi Lin; Guoqiang Liang; Kevin Yuchen Ma; Qiming Huang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci"],"rqs":["X1a","X3c"],"collected":true,"review_status":"abstract_review","question":"怎样用紧凑的语义接口让人和 VLM 操控不同机器人？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Show-Harness 通过语义动作接口连接意图与执行，并以 GUMI 支持 GUI 示范采集。","input_conditions":"摘要初读：Show-Harness 通过语义动作接口连接意图与执行，并以 GUMI 支持 GUI 示范采集。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"属于机器人交互与执行接口，不直接生成或验证未来视频。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2609.10522"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2609.10522v1"}],"note":"p401","collection_status":"downloaded","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0},"aliases":[]},{"id":"S01","title":"PILCO: A Model-Based and Data-Efficient Approach to Policy Search","short":"PILCO","year":"2011","authors":"Deisenroth & Rasmussen","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"用概率动力学与不确定性传播减少控制学习所需的真实交互。","boundary":"概率模型与近似推断条件下的控制；不是通用视频模拟。","evidence":"P121 PDF pp.9、11、16；作者机构库摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://spiral.imperial.ac.uk/entities/publication/5d3d92ac-439a-47c4-beb8-311c3c7122cc"}],"verified":"2026-09-19","seed":"P121","depth":1,"mappings":[{"rq":"W1c","role":"core"}],"aliases":[]},{"id":"S02","title":"On Learning to Think: Algorithmic Information Theory for Novel Combinations of Reinforcement Learning Controllers and Recurrent Neural World Models","short":"On Learning to Think","year":"2015","authors":"Jürgen Schmidhuber","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"讨论控制器如何利用循环世界模型进行预测与求解。","boundary":"理论框架与历史脉络，不是后来视频世界模型的统一实证基线。","evidence":"P121 PDF p.2、p.20；arXiv 原始记录","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/1511.09249"}],"verified":"2026-09-19","seed":"P121","depth":1,"mappings":[{"rq":"W1c","role":"core"}],"aliases":[]},{"id":"S03","title":"Dream to Control: Learning Behaviors by Latent Imagination","short":"Dreamer","year":"2020 / 2019","authors":"Hafner et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"在紧凑潜空间想象轨迹，并通过价值梯度学习长程行为。","boundary":"依赖学习的动力学；没有可编辑符号规则或物理正确性保证。","evidence":"P123 PDF p.15；Dreamer §1、§4–5","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/1912.01603"}],"verified":"2026-09-19","seed":"P123","depth":1,"mappings":[{"rq":"W1c","role":"core"}],"aliases":[]},{"id":"S04","title":"Mastering Diverse Domains through World Models","short":"DreamerV3","year":"2023（预印本）","authors":"Hafner et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"通过稳定化训练使世界模型控制器在多领域使用同一配置。","boundary":"学得任务控制能力，不代表任意规则的因果识别。此处对应被引用的 2023 预印本题名。","evidence":"P156 PDF p.1、参考文献[1] p.11；arXiv v2","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2301.04104"}],"verified":"2026-09-19","seed":"P156","depth":1,"mappings":[{"rq":"W1b","role":"support"},{"rq":"W1c","role":"core"}],"aliases":[]},{"id":"S05","title":"Learning Latent Dynamics for Planning from Pixels","short":"PlaNet","year":"2019 / 2018","authors":"Hafner et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"从图像学潜在状态动力学，在潜空间中在线规划。","boundary":"与 Dreamer 的策略/价值学习不同，主要用在线规划。","evidence":"Dreamer §4 Reconstruction、§5 Control with latent dynamics；arXiv 原文","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/1811.04551"}],"verified":"2026-09-19","seed":"S03","depth":2,"mappings":[{"rq":"W1c","role":"core"}],"aliases":[]},{"id":"S06","title":"Human-Level Reinforcement Learning through Theory-Based Modeling, Exploration, and Planning","short":"Theory-based RL","year":"2021","authors":"Tsividis et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"用可组合的游戏理论、实验式探索和规划提高样本效率。","boundary":"预设表示与游戏环境；WorldCoder 后续改用通用 Python 和 LLM 先验。","evidence":"P150 PDF p.2、参考文献[67] p.14；arXiv 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2107.12544"}],"verified":"2026-09-19","seed":"P150","depth":1,"mappings":[{"rq":"W1b","role":"support"}],"aliases":[]},{"id":"S07","title":"Lenia — Biology of Artificial Life","short":"Lenia","year":"2019 / 2018","authors":"Bert Wang-Chak Chan","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"研究连续细胞自动机中的自组织生命形态及其参数空间。","boundary":"人工生命基底，不等于已实现真实生物进化。","evidence":"ASAL PDF pp.1–2、参考文献 p.14；Lenia 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/1812.05433"}],"verified":"2026-09-19","seed":"P163","depth":1,"mappings":[{"rq":"W3c","role":"core"}],"aliases":[]},{"id":"S08","title":"Abandoning Objectives: Evolution Through the Search for Novelty Alone","short":"Novelty Search","year":"2011","authors":"Lehman & Stanley","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"以行为新颖性驱动搜索，减少预定义目标的欺骗性。","boundary":"新颖性不自动等于有用性或无限开放演化。","evidence":"ASAL PDF p.16 参考文献；原论文 PDF 镜像 https://gwern.net/doc/reinforcement-learning/exploration/2011-lehman.pdf","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://doi.org/10.1162/EVCO_a_00025"}],"verified":"2026-09-19","seed":"P163","depth":1,"mappings":[{"rq":"W3c","role":"core"}],"aliases":[]},{"id":"S09","title":"Generative Agents: Interactive Simulacra of Human Behavior","short":"Generative Agents","year":"2023","authors":"Park et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"以记忆、反思与规划支持可信的社会行为模拟。","boundary":"行为可信度和涌现示例不等于真实社会预测有效性。","evidence":"P145 PDF p.8 明确复用 Park 等的关联记忆；arXiv 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2304.03442"}],"verified":"2026-09-19","seed":"P145","depth":1,"mappings":[{"rq":"W3c","role":"core"}],"aliases":[]},{"id":"S10","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","short":"Chain of Thought","year":"2022","authors":"Wei et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"通过中间文字步骤的示例提示改善多步任务表现。","boundary":"输出推理文本不保证忠实或正确。","evidence":"P104 PDF pp.1–2 明确对照；原论文摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2201.11903"}],"verified":"2026-09-19","seed":"P104","depth":1,"mappings":[{"rq":"W4a","role":"core"}],"aliases":[]},{"id":"S11","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","short":"Tree of Thoughts","year":"2023","authors":"Yao et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"把单条推理扩展成可评估、回溯的候选思维搜索树。","boundary":"RAP 将其列为并行相关工作，不能说 RAP 由它单向演化而来。","evidence":"P104 PDF p.2 使用 concurrently；ToT 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2305.10601"}],"verified":"2026-09-19","seed":"P104","depth":1,"mappings":[{"rq":"W4a","role":"core"}],"aliases":[]},{"id":"S12","title":"ACRE: Abstract Causal REasoning Beyond Covariation","short":"ACRE","year":"2021","authors":"Zhang et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"通过对象与 Blicket 机器观察测试超越共现的抽象因果归纳。","boundary":"给定观察的推断；IVRE 才进一步让智能体主动操作并更新信念。","evidence":"P143 PDF pp.2–4 明确继承 ACRE 设置；CVPR 官方页面","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://openaccess.thecvf.com/content/CVPR2021/html/Zhang_ACRE_Abstract_Causal_REasoning_Beyond_Covariation_CVPR_2021_paper.html"}],"verified":"2026-09-19","seed":"P143","depth":1,"mappings":[{"rq":"W1d","role":"core"},{"rq":"X1c","role":"core"}],"aliases":[]},{"id":"S13","title":"Thinking Like a Skeptic: Defeasible Inference in Natural Language","short":"Defeasible NLI","year":"2020","authors":"Rudinger et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"新信息如何增强或削弱原本合理的自然语言推断？","boundary":"一般可撤销推断不一定涉及因果关系。","evidence":"P017 PDF p.3 区分 δ-NLI 与 δ-CAUSAL，p.11 引用；P021 p.10 [31]","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://aclanthology.org/2020.findings-emnlp.418/"}],"verified":"2026-09-19","seed":"P017","depth":1,"mappings":[{"rq":"W2b","role":"core"}],"aliases":[]},{"id":"S14","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning","short":"DAgger","year":"2011","authors":"Ross, Gordon & Bagnell","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"聚合当前策略遇到的状态与专家标签，缓解行为克隆的分布偏移。","boundary":"原始采样/控制机制对实时人类专家的负担，促成 HG-DAgger 的人控接管。","evidence":"P001 PDF pp.1–2；AISTATS 官方论文页","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://proceedings.mlr.press/v15/ross11a.html"}],"verified":"2026-09-19","seed":"P001","depth":1,"mappings":[{"rq":"X2c","role":"core"}],"aliases":[]},{"id":"S15","title":"Human I/O: Towards a Unified Approach to Detecting Situational Impairments","short":"Human I/O","year":"2024","authors":"Liu et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"用第一人称感知估计眼、耳、手和发声通道的可用性。","boundary":"主要检测情境障碍；没有联合解决主动帮助内容选择。","evidence":"P059 PDF p.2、p.18 [41]；作者 arXiv 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2403.04008"}],"verified":"2026-09-19","seed":"P059","depth":1,"mappings":[{"rq":"X2b","role":"core"},{"rq":"X4b","role":"support"}],"aliases":[]},{"id":"S16","title":"OmniActions: Predicting Digital Actions in Response to Real-World Multimodal Sensory Inputs with LLMs","short":"OmniActions","year":"2024","authors":"Li et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"由现实图像/音频与情境预测用户希望进行的数字后续动作。","boundary":"动作意图预测不等于情境中的时机与通道协调。","evidence":"P059 PDF pp.2–3、p.18 [34]；作者 arXiv 摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2405.03901"}],"verified":"2026-09-19","seed":"P059","depth":1,"mappings":[{"rq":"X2b","role":"core"}],"aliases":[]},{"id":"S17","title":"GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality","short":"GazePointAR","year":"2024","authors":"Lee et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"联合语音、注视、指向和会话历史消解可穿戴 AR 中的代词指涉。","boundary":"侧重理解用户指向；AgentHands 转向智能体如何通过手势向人表达。","evidence":"P061 PDF p.3、p.16 [38]；作者实验室论文全文","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://makeabilitylab.cs.washington.edu/project/gazepointar/"}],"verified":"2026-09-19","seed":"P061","depth":1,"mappings":[{"rq":"X1a","role":"core"}],"aliases":[]},{"id":"S18","title":"“Put-That-There”: Voice and Gesture at the Graphics Interface","short":"Put-That-There","year":"1980","authors":"Richard A. Bolt","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"结合语音和指向，使用户能用指示代词操纵图形对象。","boundary":"基于 GazePointAR 正文对该工作的描述和原始参考条目核验；本轮 ACM 全文未能访问。","evidence":"GazePointAR PDF pp.2–3、p.14 [9]","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://doi.org/10.1145/800250.807503"}],"verified":"2026-09-19","seed":"S17","depth":2,"mappings":[{"rq":"X1a","role":"core"}],"aliases":[]},{"id":"S19","title":"Guidelines for Human-AI Interaction","short":"Human–AI Guidelines","year":"2019","authors":"Amershi et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"整理初次使用、日常交互、错误与长期使用中的人机交互规范。","boundary":"设计指南不是对任意应用协作收益的实验保证。","evidence":"P149 PDF p.1、p.13 参考文献；Microsoft Research 原论文","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://www.microsoft.com/en-us/research/wp-content/uploads/2019/01/Guidelines-for-Human-AI-Interaction-camera-ready.pdf"}],"verified":"2026-09-19","seed":"P149","depth":1,"mappings":[{"rq":"X2a","role":"support"},{"rq":"X3b","role":"support"},{"rq":"X4b","role":"core"}],"aliases":[]},{"id":"S20","title":"Beyond Accuracy: The Role of Mental Models in Human-AI Team Performance","short":"Beyond Accuracy","year":"2019","authors":"Bansal et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"研究人对模型错误边界的认识如何影响团队表现。","boundary":"提高机器准确率并不必然提高团队效用；不能直接推出 XR 的效果。","evidence":"P041 PDF p.7 参考文献；HCOMP 官方论文页","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://ojs.aaai.org/index.php/HCOMP/article/view/5285"}],"verified":"2026-09-19","seed":"P041","depth":1,"mappings":[{"rq":"X2c","role":"core"},{"rq":"X3c","role":"support"}],"aliases":[]},{"id":"S21","title":"ConditionalQA: A Complex Reading Comprehension Dataset with Conditional Answers","short":"ConditionalQA","year":"2022","authors":"Sun, Cohen & Salakhutdinov","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"要求同时回答问题及列出答案成立的条件。","boundary":"条件化阅读理解为 GPS 的主动询问提供任务基础；本身不是物理实验。","evidence":"P159 PDF p.7、p.14 参考文献；ACL 官方论文页","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://aclanthology.org/2022.acl-long.253/"}],"verified":"2026-09-19","seed":"P159","depth":1,"mappings":[{"rq":"X2a","role":"core"}],"aliases":[]},{"id":"S22","title":"ReAct: Synergizing Reasoning and Acting in Language Models","short":"ReAct","year":"2023 / 2022","authors":"Yao et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"交替生成推理与环境动作，让外部观察反馈进入后续推理。","boundary":"与学习可执行转移程序不同，推理/行动仍主要由 LLM 在线产生。","evidence":"P150 PDF pp.1–2 明确比较；原论文摘要","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2210.03629"}],"verified":"2026-09-19","seed":"P150","depth":1,"mappings":[{"rq":"W4a","role":"core"}],"aliases":[]},{"id":"S23","title":"Satori: Towards Proactive AR Assistant with Belief-Desire-Intention User Modeling","short":"Satori","year":"2025 / 2024","authors":"Li et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"用信念—欲望—意图用户模型组织主动 AR 帮助的推断。","boundary":"显式 BDI 不等于已校准的多假设推断或可纠正机制。","evidence":"P059 PDF p.18 [33]；CHI DOI 10.1145/3706598.3714188；亦见本地 XR 草稿","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2410.16668"}],"verified":"2026-09-19","seed":"P059","depth":1,"mappings":[{"rq":"X1b","role":"core"},{"rq":"X2b","role":"core"}],"aliases":[]},{"id":"S24","title":"Augmented Object Intelligence with XR-Objects","short":"XR-Objects","year":"2024","authors":"Dogan et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"让现实对象成为带情境菜单、查询与数字操作的交互入口。","boundary":"对象语义和动作入口不等于已辨明隐藏原因。","evidence":"P061 PDF p.3 引用 Dogan 等[12]；Google Research 论文页；亦见 XR 草稿","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2404.13274"}],"verified":"2026-09-19","seed":"P061","depth":1,"mappings":[{"rq":"X1a","role":"core"}],"aliases":[]},{"id":"S25","title":"AiGet: Transforming Everyday Moments into Hidden Knowledge Discovery with AI Assistance on Smart Glasses","short":"AiGet","year":"2025","authors":"Cai et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"通过智能眼镜在日常低负荷时刻主动呈现与环境有关的知识。","boundary":"Sensible Agent 将其与时间紧迫、社会约束强的辅助场景区分。","evidence":"P059 §1 对照 AiGet；arXiv 作者摘要；亦见 XR 草稿","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://arxiv.org/abs/2501.16240"}],"verified":"2026-09-19","seed":"P059","depth":1,"mappings":[{"rq":"X2b","role":"core"}],"aliases":[]},{"id":"S26","title":"Bubbleu: Exploring Augmented Reality Game Design with Uncertain AI-based Interaction","short":"Bubbleu","year":"2023","authors":"Kim et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"对象检测会出错时，模糊性、透明性与可控性怎样改变 AR 游戏体验？","boundary":"手机 AR 游戏中的感知错误设计，不等于 LLM 语义置信度校准。","evidence":"本地阅读笔记提出线索，ACM 正式论文摘要及作者 PDF 另行核验","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://doi.org/10.1145/3544548.3581270"}],"verified":"2026-09-19","seed":"abductive/conclusion.md","depth":1,"mappings":[{"rq":"X3a","role":"core"}],"aliases":[]},{"id":"S27","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","short":"NUWA-XL","year":"2023","authors":"Yin et al.","collected":false,"note":null,"scope":"滚雪球新增 · 未收集 PDF","summary":"以全局关键帧和局部递归扩散降低长视频训练/推理差距。","boundary":"长视频渲染与全局连贯不自动构成动作条件世界机制。","evidence":"P127 PDF p.14 参考文献；ACL 官方论文页；亦见本地 VideoGeneration 报告","sources":[],"links":[{"label":"论文 / 作者来源","url":"https://aclanthology.org/2023.acl-long.73/"}],"verified":"2026-09-19","seed":"P127","depth":1,"mappings":[{"rq":"W3b","role":"core"}],"aliases":[]},{"id":"C01","title":"Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes","short":"Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes","year":"2026","authors":"Hikaru Shindo; Yu Deng; Teng Cao; Quentin Delfosse; Christopher Tauchmann; Jannis Blüml; Gopika Sudhakaran; Kristian Kersting","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"ESBM 用类型谓词、加权规则、选项与机制记忆描述行为；把问答和转移预测错误转成局部编辑约束。","boundary":"已在所测 Atari 式协议实现机制预测和修改；因此这些性质本身不能直接当作 B3 的新颖性。任意视觉世界是未验证条件。","evidence":"2026-09-19 核对 arXiv 作者摘要和版本记录；本轮尚未收藏 PDF。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.07127"}],"verified":"2026-09-19","seed":"母问题定位与既有研究备忘录的外部补充","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1b","role":"core"},{"rq":"W1d","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"C01","arxiv_id":"2606.07127","title":"Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes","year":"2026","authors":"Hikaru Shindo; Yu Deng; Teng Cao; Quentin Delfosse; Christopher Tauchmann; Jannis Blüml; Gopika Sudhakaran; Kristian Kersting","teams":[],"topics":["world_model","agent"],"rqs":["W1b","W1d","W3d"],"collected":false,"review_status":"abstract_review","question":"可执行机制、主动探针和局部编辑能否共同训练更可解释的行为？","question_origin":"依作者摘要改写；用于对照母问题边界，不声称是作者编号 RQ。","summary":"ESBM 用类型谓词、加权规则、选项与机制记忆描述行为；把问答和转移预测错误转成局部编辑约束。","input_conditions":"ESBM 用类型谓词、加权规则、选项与机制记忆描述行为；把问答和转移预测错误转成局部编辑约束。","training_supervision":"本条根据作者摘要定位；训练与数据细节待全文标注。","inference_support":"见摘要所述接口；未将外部工具或语言环境推理归为视频模型内生能力。","evaluation":"使用作者摘要所述任务定位；本条不转录未经本轮复核的定量表格。","boundary":"已在所测 Atari 式协议实现机制预测和修改；因此这些性质本身不能直接当作 B3 的新颖性。任意视觉世界是未验证条件。","evidence":"2026-09-19 核对 arXiv 作者摘要和版本记录；本轮尚未收藏 PDF。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2606.07127"}],"note":null,"priority":75,"discovery":"母问题定位与既有研究备忘录的外部补充","mapping_roles":{"W1b":"core"}},"aliases":[]},{"id":"C02","title":"Self-Evolving World Models for LLM Agent Planning","short":"Self-Evolving World Models for LLM Agent Planning","year":"2026","authors":"Xuan Zhang; Wenxuan Zhang; See-Kiong Ng; Yang Deng","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"WorldEvolver 从真实转移检索经验、总结预测误差，并筛除低置信后果，保持模型参数与下游 agent 冻结。","boundary":"在 ALFWorld、ScienceWorld、Word2World 与 AgentBoard 等环境评估；更新的是部署时经验记忆，模型与 agent 冻结，不表示生态演化或视频像素推演。","evidence":"2026-09-19 核对 arXiv 2606.30639v2（2026-09-01）作者摘要与版本记录；未收集 PDF、未复现。","sources":[],"links":[{"label":"arXiv v2","url":"https://arxiv.org/abs/2606.30639v2"}],"verified":"2026-09-19","seed":"母问题定位与既有研究备忘录的外部补充","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1d","role":"core"},{"rq":"W3a","role":"support"},{"rq":"W4c","role":"support"}],"annotation":{"id":"C02","arxiv_id":"2606.30639","title":"Self-Evolving World Models for LLM Agent Planning","year":"2026","authors":"Xuan Zhang; Wenxuan Zhang; See-Kiong Ng; Yang Deng","teams":[],"topics":["world_model","agent"],"rqs":["W1d","W3a","W4c"],"collected":false,"review_status":"abstract_review","question":"不更新模型参数，部署记忆修订能否改善后果预测与规划？","question_origin":"依作者摘要改写；用于对照母问题边界，不声称是作者编号 RQ。","summary":"WorldEvolver 从真实转移检索经验、总结预测误差，并筛除低置信后果，保持模型参数与下游 agent 冻结。","input_conditions":"WorldEvolver 从真实转移检索经验、总结预测误差，并筛除低置信后果，保持模型参数与下游 agent 冻结。","training_supervision":"本条根据作者摘要定位；训练与数据细节待全文标注。","inference_support":"见摘要所述接口；未将外部工具或语言环境推理归为视频模型内生能力。","evaluation":"使用作者摘要所述任务定位；本条不转录未经本轮复核的定量表格。","boundary":"在 ALFWorld、ScienceWorld、Word2World 与 AgentBoard 等环境评估；更新的是部署时经验记忆，模型与 agent 冻结，不表示生态演化或视频像素推演。","evidence":"2026-09-19 核对 arXiv 2606.30639v2（2026-09-01）作者摘要与版本记录；未收集 PDF、未复现。","checked":"2026-09-19","links":[{"label":"arXiv v2","url":"https://arxiv.org/abs/2606.30639v2"}],"note":null,"priority":75,"discovery":"母问题定位与既有研究备忘录的外部补充","mapping_roles":{"W1d":"core"}},"aliases":[]},{"id":"C03","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","short":"What-If World","year":"2026","authors":"Kunlin Cai; Rui Song; Jinghuai Zhang; Kaiyuan Zhang; Pranav Bodapati; Alicia Yu; Fnu Suya; Mohammad Rostami; Jiaqi Ma; Yuan Tian","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"What-If World 从 nuScenes、DROID 帧构建 319 组干预提示，按提示遵循、物理、环境保持和结果差异评价成对视频。","boundary":"配对得分不能直接解读为整条视频全部正确的比例；数据公开可用性和评分细节需要独立核查。","evidence":"2026-09-19 核对 arXiv 作者摘要和版本记录；本轮尚未收藏 PDF。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.27589"}],"verified":"2026-09-19","seed":"母问题定位与既有研究备忘录的外部补充","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W2c","role":"core"},{"rq":"W2d","role":"support"}],"annotation":{"id":"C03","arxiv_id":"2605.27589","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","year":"2026","authors":"Kunlin Cai; Rui Song; Jinghuai Zhang; Kaiyuan Zhang; Pranav Bodapati; Alicia Yu; Fnu Suya; Mohammad Rostami; Jiaqi Ma; Yuan Tian","teams":[],"topics":["video_gen","world_model","physics","evaluation"],"rqs":["W2c","W2d"],"collected":false,"review_status":"abstract_review","question":"同一初始场景中只改变一个物理条件，生成后果是否发生相应变化？","question_origin":"依作者摘要改写；用于对照母问题边界，不声称是作者编号 RQ。","summary":"What-If World 从 nuScenes、DROID 帧构建 319 组干预提示，按提示遵循、物理、环境保持和结果差异评价成对视频。","input_conditions":"What-If World 从 nuScenes、DROID 帧构建 319 组干预提示，按提示遵循、物理、环境保持和结果差异评价成对视频。","training_supervision":"本条根据作者摘要定位；训练与数据细节待全文标注。","inference_support":"见摘要所述接口；未将外部工具或语言环境推理归为视频模型内生能力。","evaluation":"使用作者摘要所述任务定位；本条不转录未经本轮复核的定量表格。","boundary":"配对得分不能直接解读为整条视频全部正确的比例；数据公开可用性和评分细节需要独立核查。","evidence":"2026-09-19 核对 arXiv 作者摘要和版本记录；本轮尚未收藏 PDF。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.27589"}],"note":null,"priority":75,"discovery":"母问题定位与既有研究备忘录的外部补充","mapping_roles":{"W2c":"core"}},"aliases":[]},{"id":"T260318246","title":"Rapid Adaptation of Particle Dynamics for Generalized Deformable Object Mobile Manipulation","short":"Rapid Adaptation of Particle Dynamics for Generalized Deformable Object Mobile Manipulation","year":"2026","authors":"Bohan Wu; Roberto Martín-Martín; Li Fei-Fei","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"RAPiD 利用仿真中的粒子和物理特权信息训练动态嵌入，再学习视觉运动适配。","boundary":"训练具有仿真特权监督；快速适配并非从任意视频无监督发现完整规则。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.18246"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.18246v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W1c","role":"support"},{"rq":"W1d","role":"support"}],"annotation":{"id":"T260318246","arxiv_id":"2603.18246","title":"Rapid Adaptation of Particle Dynamics for Generalized Deformable Object Mobile Manipulation","year":"2026","authors":"Bohan Wu; Roberto Martín-Martín; Li Fei-Fei","teams":["fei-fei-li"],"topics":["physics","world_model","agent"],"rqs":["W1c","W1d"],"collected":false,"review_status":"abstract_review","question":"形变物体动力学未知时怎样快速适配操作策略？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"RAPiD 利用仿真中的粒子和物理特权信息训练动态嵌入，再学习视觉运动适配。","input_conditions":"摘要初读：RAPiD 利用仿真中的粒子和物理特权信息训练动态嵌入，再学习视觉运动适配。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"训练具有仿真特权监督；快速适配并非从任意视频无监督发现完整规则。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2603.18246"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2603.18246v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T260517423","title":"Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration","short":"Soap2Soap","year":"2026","authors":"Yiren Song; Huilin Zhong; Kevin Qinghong Lin; Haofan Wang; Mike Zheng Shou","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"Soap2Soap 用多智能体、持久 JSON 剧本和场景／镜头参考锚点维护长程一致性。","boundary":"原始视频已提供叙事和动作；这是重制条件下的保持，不是未知未来预测。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.17423"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.17423v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W3a","role":"support"},{"rq":"W3b","role":"support"}],"annotation":{"id":"T260517423","arxiv_id":"2605.17423","title":"Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration","year":"2026","authors":"Yiren Song; Huilin Zhong; Kevin Qinghong Lin; Haofan Wang; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","agent"],"rqs":["W3a","W3b"],"collected":false,"review_status":"abstract_review","question":"长篇视频重制怎样保持原有叙事、动作和角色？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Soap2Soap 用多智能体、持久 JSON 剧本和场景／镜头参考锚点维护长程一致性。","input_conditions":"摘要初读：Soap2Soap 用多智能体、持久 JSON 剧本和场景／镜头参考锚点维护长程一致性。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"原始视频已提供叙事和动作；这是重制条件下的保持，不是未知未来预测。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2605.17423"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2605.17423v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T250901986","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","short":"Draw-In-Mind","year":"2025","authors":"Ziyun Zeng; David Junhao Zhang; Wei Li; Mike Zheng Shou","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"Draw-In-Mind 用设计思维链数据连接冻结 VLM 与可训练图像生成器。","boundary":"推理依赖外部 VLM 和思维链训练数据，不是视频生成器独立的推理证据。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2509.01986"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2509.01986v4"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W4b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"T250901986","arxiv_id":"2509.01986","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","year":"2025","authors":"Ziyun Zeng; David Junhao Zhang; Wei Li; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["generative_foundation","agent"],"rqs":["W4b","X4a"],"collected":false,"review_status":"abstract_review","question":"图像编辑中如何把设计意图与像素生成分工得更清楚？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Draw-In-Mind 用设计思维链数据连接冻结 VLM 与可训练图像生成器。","input_conditions":"摘要初读：Draw-In-Mind 用设计思维链数据连接冻结 VLM 与可训练图像生成器。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"推理依赖外部 VLM 和思维链训练数据，不是视频生成器独立的推理证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2509.01986"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2509.01986v4"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T251008527","title":"FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control","short":"FlexTraj","year":"2025","authors":"Zhiyuan Zhang; Can Wang; Dongdong Chen; Jing Liao","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"FlexTraj 以分割标识、时间一致的轨迹标识和可选颜色组成点运动表示，统一多类动作与相机控制。","boundary":"未来轨迹是控制条件；轨迹执行与模型自行推断运动后果属于不同测试。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.08527"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.08527v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"T251008527","arxiv_id":"2510.08527","title":"FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control","year":"2025","authors":"Zhiyuan Zhang; Can Wang; Dongdong Chen; Jing Liao","teams":["jing-liao"],"topics":["video_gen","geometry"],"rqs":["W1c"],"collected":false,"review_status":"abstract_review","question":"如何让同一个图生视频模型支持稠密、稀疏及不同粒度的轨迹控制？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"FlexTraj 以分割标识、时间一致的轨迹标识和可选颜色组成点运动表示，统一多类动作与相机控制。","input_conditions":"摘要初读：FlexTraj 以分割标识、时间一致的轨迹标识和可选颜色组成点运动表示，统一多类动作与相机控制。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"未来轨迹是控制条件；轨迹执行与模型自行推断运动后果属于不同测试。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2510.08527"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2510.08527v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T250215027","title":"InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback","short":"InterFeedback","year":"2025","authors":"Henry Hengyuan Zhao; Wenqi Pei; Yifei Tao; Haiyang Mei; Mike Zheng Shou","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"InterFeedback 提供自动化交互评价和人工反馈案例，检查模型对纠正信息的利用。","boundary":"文本反馈修正能力不直接代表身体交互或世界动力学修订。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.15027"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.15027v3"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"X3b","role":"support"}],"annotation":{"id":"T250215027","arxiv_id":"2502.15027","title":"InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback","year":"2025","authors":"Henry Hengyuan Zhao; Wenqi Pei; Yifei Tao; Haiyang Mei; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["agent","hci","evaluation"],"rqs":["X3b"],"collected":false,"review_status":"abstract_review","question":"多模态模型能否根据人的反馈有效修正回答？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"InterFeedback 提供自动化交互评价和人工反馈案例，检查模型对纠正信息的利用。","input_conditions":"摘要初读：InterFeedback 提供自动化交互评价和人工反馈案例，检查模型对纠正信息的利用。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"文本反馈修正能力不直接代表身体交互或世界动力学修订。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2502.15027"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2502.15027v3"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T240510316","title":"Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model","short":"Analogist","year":"2024","authors":"Zheng Gu; Shiyuan Yang; Jing Liao; Jing Huo; Yang Gao","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"Analogist 结合自注意力复制、文本提示与交叉注意力掩码执行视觉类比，其中 GPT-4V 辅助生成提示。","boundary":"无需微调的图像类比仍使用外部 VLM；不构成纯视频模型自身推理的证据。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.10316"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.10316v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W4a","role":"support"}],"annotation":{"id":"T240510316","arxiv_id":"2405.10316","title":"Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model","year":"2024","authors":"Zheng Gu; Shiyuan Yang; Jing Liao; Jing Huo; Yang Gao","teams":["jing-liao"],"topics":["generative_foundation","video_reasoning"],"rqs":["W4a"],"collected":false,"review_status":"abstract_review","question":"图像扩散模型能否根据视觉示例执行上下文类比？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"Analogist 结合自注意力复制、文本提示与交叉注意力掩码执行视觉类比，其中 GPT-4V 辅助生成提示。","input_conditions":"摘要初读：Analogist 结合自注意力复制、文本提示与交叉注意力掩码执行视觉类比，其中 GPT-4V 辅助生成提示。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"无需微调的图像类比仍使用外部 VLM；不构成纯视频模型自身推理的证据。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2405.10316"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2405.10316v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T241211621","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","short":"VG-TVP","year":"2024","authors":"Muhammet Furkan Ilaslan; Ali Koksal; Kevin Qinhong Lin; Burak Satar; Mike Zheng Shou; Qianli Xu","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"VG-TVP 用图文桥接与融合描述组织多模态计划，并在 Daily-PP 上评估信息性与连贯性。","boundary":"规划来自 LLM；视频表达不独立证明程序或物理执行正确。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.11621"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.11621v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"X1b","role":"support"},{"rq":"X4a","role":"support"}],"annotation":{"id":"T241211621","arxiv_id":"2412.11621","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","year":"2024","authors":"Muhammet Furkan Ilaslan; Ali Koksal; Kevin Qinhong Lin; Burak Satar; Mike Zheng Shou; Qianli Xu","teams":["mike-zheng-shou"],"topics":["video_gen","agent","hci"],"rqs":["X1b","X4a"],"collected":false,"review_status":"abstract_review","question":"程序性任务规划怎样同时提供文字和视频表达？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"VG-TVP 用图文桥接与融合描述组织多模态计划，并在 Daily-PP 上评估信息性与连贯性。","input_conditions":"摘要初读：VG-TVP 用图文桥接与融合描述组织多模态计划，并在 Daily-PP 上评估信息性与连贯性。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"规划来自 LLM；视频表达不独立证明程序或物理执行正确。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2412.11621"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2412.11621v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T230613078","title":"Continuous Layout Editing of Single Images with Diffusion Models","short":"Continuous Layout Editing of Single Images with Diffusion Models","year":"2023","authors":"Zhiyuan Zhang; Zhitong Huang; Jing Liao","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"通过掩码文本反演分离对象概念，再优化预训练扩散模型使输出符合用户布局。","boundary":"无训练的布局优化只是管线一部分；视觉保持不等于因果影响范围已验证。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.13078"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.13078v1"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"X4a","role":"support"},{"rq":"W3d","role":"support"}],"annotation":{"id":"T230613078","arxiv_id":"2306.13078","title":"Continuous Layout Editing of Single Images with Diffusion Models","year":"2023","authors":"Zhiyuan Zhang; Zhitong Huang; Jing Liao","teams":["jing-liao"],"topics":["generative_foundation","hci"],"rqs":["X4a","W3d"],"collected":false,"review_status":"abstract_review","question":"单张已有图像怎样连续修改布局并保留对象属性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"通过掩码文本反演分离对象概念，再优化预训练扩散模型使输出符合用户布局。","input_conditions":"摘要初读：通过掩码文本反演分离对象概念，再优化预训练扩散模型使输出符合用户布局。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"无训练的布局优化只是管线一部分；视觉保持不等于因果影响范围已验证。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2306.13078"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2306.13078v1"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"T221206384","title":"PV3D: A 3D Generative Model for Portrait Video Generation","short":"PV3D","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Wenqing Zhang; Song Bai; Jiashi Feng; Mike Zheng Shou","collected":false,"note":null,"scope":"公开文献记录 · PDF 待收集","summary":"PV3D 将三维图像生成扩展到时空表示，并用动作与相机条件区分运动来源。","boundary":"正式发表于 2023；肖像动态范围有限，不能直接推广到物体交互。","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","sources":[],"links":[{"label":"arXiv","url":"https://arxiv.org/abs/2212.06384"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2212.06384v3"}],"verified":"2026-09-19","seed":"研究者公开论文记录","depth":1,"discovery_method":"author_search","mappings":[{"rq":"W1c","role":"support"}],"annotation":{"id":"T221206384","arxiv_id":"2212.06384","title":"PV3D: A 3D Generative Model for Portrait Video Generation","year":"2023","authors":"Zhongcong Xu; Jianfeng Zhang; Jun Hao Liew; Wenqing Zhang; Song Bai; Jiashi Feng; Mike Zheng Shou","teams":["mike-zheng-shou"],"topics":["video_gen","geometry"],"rqs":["W1c"],"collected":false,"review_status":"abstract_review","question":"肖像视频怎样同时保持时间和多视角一致性？","question_origin":"依作者摘要与任务定义改写；非作者逐字或编号 RQ。","summary":"PV3D 将三维图像生成扩展到时空表示，并用动作与相机条件区分运动来源。","input_conditions":"摘要初读：PV3D 将三维图像生成扩展到时空表示，并用动作与相机条件区分运动来源。 详细输入及特权信息待方法复核。","training_supervision":"本条训练配方尚未逐项核查；不从标题或摘要推断 GPU 可行性。","inference_support":"需核对是否依赖语言模型、轨迹、仿真器或搜索；不能仅凭 video/world/reasoning 名称判断。","evaluation":"本轮仅作问题与方法定位，尚未独立核对实验表格。","boundary":"正式发表于 2023；肖像动态范围有限，不能直接推广到物体交互。","observed_failures":"","evidence":"arXiv 作者摘要与版本元数据（检索于 2026-09-19）；全文提取与人工方法核查分开计数。","checked":"2026-09-19","links":[{"label":"arXiv","url":"https://arxiv.org/abs/2212.06384"},{"label":"官方 PDF","url":"https://arxiv.org/pdf/2212.06384v3"}],"note":null,"collection_status":"unavailable","author_relation":"目标研究者为署名作者；不推断团队主导或具体作者贡献。","priority":0,"collection_note":"已保留摘要与来源；公开 PDF 下载尚未成功，失败日志在本地收藏索引。"},"aliases":[]},{"id":"C04","title":"Elaboration Tolerance","short":"Elaboration Tolerance","year":"2003（网页版本）","authors":"John McCarthy","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"讨论事实、参数与谓词的扩展，以及非单调推理如何支持情境变化。","boundary":"不能把扩展容忍度的概念论证当成开放世界自动生成的完整实现或性能保证。","evidence":"作者 Stanford 页面摘要及扩展类型说明；2003-09-29 为该网页版本时间。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://www-formal.stanford.edu/jmc/elaboration/elaboration.html"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1e","role":"support"},{"rq":"W3e","role":"core"},{"rq":"W2a","role":"core"}],"research_question":{"kind":"依论文改写","text":"表示怎样容纳新现象、条件变化与概念拓展，并允许撤销默认结论？","location":"作者 Stanford 页面摘要及扩展类型说明；2003-09-29 为该网页版本时间。"},"annotation":{"id":"C04","title":"Elaboration Tolerance","year":"2003（网页版本）","authors":"John McCarthy","teams":[],"topics":["world_model"],"rqs":["W2a","W1e","W3e"],"collected":false,"review_status":"abstract_review","question":"表示怎样容纳新现象、条件变化与概念拓展，并允许撤销默认结论？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"讨论事实、参数与谓词的扩展，以及非单调推理如何支持情境变化。","input_conditions":"已有逻辑表示与背景假设；以传教士与食人族问题的变体讨论表示适应性。","training_supervision":"本文使用形式化表示与求解；无视频生成器训练。","inference_support":"逻辑表示与非单调推理；不是视频生成模型。","evaluation":"概念与形式化挑战；网页摘要说明只完成了部分情境演算形式化。","boundary":"不能把扩展容忍度的概念论证当成开放世界自动生成的完整实现或性能保证。","observed_failures":"","evidence":"作者 Stanford 页面摘要及扩展类型说明；2003-09-29 为该网页版本时间。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://www-formal.stanford.edu/jmc/elaboration/elaboration.html"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W2a":"core","W1e":"support","W3e":"core"}},"aliases":[]},{"id":"C05","title":"Imaginarium: A Tool for Casual Constraint-Based PCG","short":"Imaginarium","year":"2019","authors":"Ian Horswill","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"面向桌面角色扮演的约束创作工具，把对象类型与属性约束交给求解器生成实例。","boundary":"对象生成的表达范围受语言与作者本体限制，不是任意生态或社会的长期演化。","evidence":"作者 PDF pp.1–2；EXAG 2019。只核查所述方法范围。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://ianhorswill.github.io/Papers/EXAG-19-Imaginarium.pdf"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1e","role":"core"},{"rq":"W3e","role":"support"},{"rq":"X4a","role":"core"}],"research_question":{"kind":"依论文改写","text":"非程序员怎样用受限英语描述对象本体，并生成满足约束的实例？","location":"作者 PDF pp.1–2；EXAG 2019。只核查所述方法范围。"},"annotation":{"id":"C05","title":"Imaginarium: A Tool for Casual Constraint-Based PCG","year":"2019","authors":"Ian Horswill","teams":[],"topics":["world_model","hci"],"rqs":["W1e","W3e","X4a"],"collected":false,"review_status":"method_checked","question":"非程序员怎样用受限英语描述对象本体，并生成满足约束的实例？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"面向桌面角色扮演的约束创作工具，把对象类型与属性约束交给求解器生成实例。","input_conditions":"用户给定类型、属性、关系与约束；输入采用受限英语。","training_supervision":"本文使用形式化表示与求解；无视频生成器训练。","inference_support":"将声明转换为约束，依赖外部约束求解器。","evaluation":"在线核对 PDF pp.1–2 的接口、约束生成与示例；未复现系统。","boundary":"对象生成的表达范围受语言与作者本体限制，不是任意生态或社会的长期演化。","observed_failures":"","evidence":"作者 PDF pp.1–2；EXAG 2019。只核查所述方法范围。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://ianhorswill.github.io/Papers/EXAG-19-Imaginarium.pdf"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W1e":"core","W3e":"support","X4a":"core"}},"aliases":[]},{"id":"C06","title":"Retcon: A Least-Commitment Story-World System","short":"Retcon","year":"2022","authors":"Ian Horswill","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"给人工撰写的故事片段标注前提，用 SAT 检查器保留相容的后续选择，逐步收缩可能世界。","boundary":"不从零生成故事，也不允许玩家任意创造事实；区分写作设定状态与故事内部状态。","evidence":"PDF pp.1、4–6；2022 workshop 页脚；p.8 参考文献 [17] 引用 Open-World Planning。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://www.exag.org/papers/Retcon%20A%20Least-Commitment%20Story-World%20System.pdf"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1e","role":"core"},{"rq":"W3e","role":"support"},{"rq":"W3d","role":"core"},{"rq":"X4a","role":"core"}],"research_question":{"kind":"依论文改写","text":"怎样延迟确定世界设定，同时保证玩家选择的故事片段不与已定设定冲突？","location":"PDF pp.1、4–6；2022 workshop 页脚；p.8 参考文献 [17] 引用 Open-World Planning。"},"annotation":{"id":"C06","title":"Retcon: A Least-Commitment Story-World System","year":"2022","authors":"Ian Horswill","teams":[],"topics":["world_model","hci"],"rqs":["W1e","W3d","W3e","X4a"],"collected":false,"review_status":"method_checked","question":"怎样延迟确定世界设定，同时保证玩家选择的故事片段不与已定设定冲突？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"给人工撰写的故事片段标注前提，用 SAT 检查器保留相容的后续选择，逐步收缩可能世界。","input_conditions":"作者提供片段、设定前提、约束和状态转移；玩家选择有限的后续片段。","training_supervision":"本文使用形式化表示与求解；无视频生成器训练。","inference_support":"SAT 可满足性检查，加上片段的前置条件与状态更新。","evaluation":"在线核对 PDF pp.1、4–6 的限制、形式化与算法；不把示例当通用基准。","boundary":"不从零生成故事，也不允许玩家任意创造事实；区分写作设定状态与故事内部状态。","observed_failures":"","evidence":"PDF pp.1、4–6；2022 workshop 页脚；p.8 参考文献 [17] 引用 Open-World Planning。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://www.exag.org/papers/Retcon%20A%20Least-Commitment%20Story-World%20System.pdf"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W1e":"core","W3d":"core","W3e":"support","X4a":"core"}},"aliases":[]},{"id":"C07","title":"Towards General Natural Language Understanding with Probabilistic Worldbuilding","short":"PWM","year":"2022","authors":"Abulhair Saparov; Tom M. Mitchell","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"PWM 将句义、事实和推理写成形式语言，以解析和溯因更新潜在世界模型。","boundary":"问答任务中的世界建模，不能直接外推为生态、社会与文化的创造性演化。","evidence":"ACL Anthology 官方摘要与发表记录，TACL 2022，pp.325–342。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://aclanthology.org/2022.tacl-1.19/"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W1e","role":"core"},{"rq":"W2b","role":"core"},{"rq":"W4a","role":"support"}],"research_question":{"kind":"依论文改写","text":"能否用可解释的符号贝叶斯世界模型，联合解析语言、补充解释并进行推理？","location":"ACL Anthology 官方摘要与发表记录，TACL 2022，pp.325–342。"},"annotation":{"id":"C07","title":"Towards General Natural Language Understanding with Probabilistic Worldbuilding","year":"2022","authors":"Abulhair Saparov; Tom M. Mitchell","teams":[],"topics":["world_model"],"rqs":["W1e","W2b","W4a"],"collected":false,"review_status":"abstract_review","question":"能否用可解释的符号贝叶斯世界模型，联合解析语言、补充解释并进行推理？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"PWM 将句义、事实和推理写成形式语言，以解析和溯因更新潜在世界模型。","input_conditions":"文本观察与符号语义表示；具体语言覆盖需按论文方法核对。","training_supervision":"本文使用形式化表示与求解；无视频生成器训练。","inference_support":"符号贝叶斯推断；生成的是内部世界解释，不是像素视频。","evaluation":"作者在 ProofWriter 与 FictionalGeoQA 上报告概念验证；本条核对官方摘要与元数据。","boundary":"问答任务中的世界建模，不能直接外推为生态、社会与文化的创造性演化。","observed_failures":"","evidence":"ACL Anthology 官方摘要与发表记录，TACL 2022，pp.325–342。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://aclanthology.org/2022.tacl-1.19/"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W1e":"core","W2b":"core","W4a":"support"}},"aliases":[]},{"id":"C08","title":"Emergent social conventions and collective bias in LLM populations","short":"Emergent Social Conventions","year":"2025","authors":"Ariel Flint Ashery; Luca Maria Aiello; Andrea Baronchelli","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"在命名博弈中让 LLM 群体通过局部互动形成共同约定，并研究偏差与规范改变。","boundary":"验证命名博弈中的社会约定，不代表任意文化、制度或生态反馈已被准确模拟。","evidence":"arXiv v2 元数据与 HTML Experimental Setup；Science Advances 11, eadu9368 (2025)。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://arxiv.org/abs/2410.08948v2"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W3e","role":"support"},{"rq":"W3c","role":"core"}],"research_question":{"kind":"依论文改写","text":"局部两两协调能否形成全局约定、集体偏差，并被坚定少数群体改变？","location":"arXiv v2 元数据与 HTML Experimental Setup；Science Advances 11, eadu9368 (2025)。"},"annotation":{"id":"C08","title":"Emergent social conventions and collective bias in LLM populations","year":"2025","authors":"Ariel Flint Ashery; Luca Maria Aiello; Andrea Baronchelli","teams":[],"topics":["agent","world_model"],"rqs":["W3c","W3e"],"collected":false,"review_status":"method_checked","question":"局部两两协调能否形成全局约定、集体偏差，并被坚定少数群体改变？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"在命名博弈中让 LLM 群体通过局部互动形成共同约定，并研究偏差与规范改变。","input_conditions":"有限名称集合、两两互动、协调收益和有限历史记忆；并非自由社会的任意行为。","training_supervision":"以模型提示与外部实验环境为主；本条不声称训练了视频生成器。","inference_support":"LLM 决策，外部实验循环维护配对、历史和得分。","evaluation":"查看原文 Experimental Setup：测局部协调到群体共识、名称偏好和少数群体影响；未复现。","boundary":"验证命名博弈中的社会约定，不代表任意文化、制度或生态反馈已被准确模拟。","observed_failures":"","evidence":"arXiv v2 元数据与 HTML Experimental Setup；Science Advances 11, eadu9368 (2025)。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://arxiv.org/abs/2410.08948v2"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W3c":"core","W3e":"support"},"arxiv_id":"2410.08948"},"aliases":[]},{"id":"C09","title":"LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals","short":"Self-Report Agents","year":"2026（v3）","authors":"Joon Sung Park; Carolyn Q. Zou; Jonne Kamphorst; Niles Egan; Aaron Shaw; Benjamin Mako Hill; Carrie Cai; Meredith Ringel Morris; Percy Liang; Robb Willer; Michael S. Bernstein","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"依据 1,052 位美国参与者的自述数据构建个体模拟，检验留出回答、人格与行为任务。","boundary":"有经验验证，但人群、输入和任务边界明确；不能推断任意社会长期演化正确。","evidence":"arXiv 2411.10109v3 作者摘要与版本记录；2024 首版题为 Generative Agent Simulations of 1,000 People。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://arxiv.org/abs/2411.10109v3"}],"verified":"2026-09-19","seed":"规则归纳—世界拓展的主题补充检索","depth":1,"discovery_method":"context_search","mappings":[{"rq":"W3e","role":"support"},{"rq":"W3c","role":"core"}],"research_question":{"kind":"依论文改写","text":"以个体访谈或问卷构建的 agent，能否预测该个体在新问项与行为任务中的反应？","location":"arXiv 2411.10109v3 作者摘要与版本记录；2024 首版题为 Generative Agent Simulations of 1,000 People。"},"annotation":{"id":"C09","title":"LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals","year":"2026（v3）","authors":"Joon Sung Park; Carolyn Q. Zou; Jonne Kamphorst; Niles Egan; Aaron Shaw; Benjamin Mako Hill; Carrie Cai; Meredith Ringel Morris; Percy Liang; Robb Willer; Michael S. Bernstein","teams":[],"topics":["agent","evaluation"],"rqs":["W3c","W3e"],"collected":false,"review_status":"abstract_review","question":"以个体访谈或问卷构建的 agent，能否预测该个体在新问项与行为任务中的反应？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"依据 1,052 位美国参与者的自述数据构建个体模拟，检验留出回答、人格与行为任务。","input_conditions":"访谈、结构化问卷或两者结合；个体模拟有真实人员数据作为条件。","training_supervision":"以模型提示与外部实验环境为主；本条不声称训练了视频生成器。","inference_support":"LLM 以个体自述资料为依据；不是从少量世界法则推出新社会。","evaluation":"核对 2026-06-28 v3 摘要；评价包含留出 GSS、人格、经济博弈与实验反应。不混用旧版百分比。","boundary":"有经验验证，但人群、输入和任务边界明确；不能推断任意社会长期演化正确。","observed_failures":"","evidence":"arXiv 2411.10109v3 作者摘要与版本记录；2024 首版题为 Generative Agent Simulations of 1,000 People。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://arxiv.org/abs/2411.10109v3"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"规则归纳—世界拓展的主题补充检索","mapping_roles":{"W3c":"core","W3e":"support"},"arxiv_id":"2411.10109"},"aliases":[]},{"id":"C10","title":"Open-World Planning for Story Generation","short":"Open-World Story Planning","year":"2005","authors":"Mark O. Riedl; R. Michael Young","collected":false,"note":null,"scope":"外部前作 · 尚未收藏 PDF","summary":"ISR 在真、假与未定事实之间维护初态，按规划需要决定作者允许留空的部分。","boundary":"允许在已定义的事实空间内补全初态，不等于自主发明任意新物理或社会本体。","evidence":"IJCAI 官方 PDF pp.1–2；由 Retcon p.8 参考文献 [17] 向后追溯。","sources":[],"links":[{"label":"论文原文 / 官方记录","url":"https://www.ijcai.org/Proceedings/05/Papers/post-0020.pdf"}],"verified":"2026-09-19","seed":"Retcon 参考文献 [17]","depth":2,"discovery_method":"citation_search","mappings":[{"rq":"W1e","role":"core"},{"rq":"W3e","role":"support"},{"rq":"W3b","role":"core"}],"research_question":{"kind":"依论文改写","text":"规划故事时，能否延迟决定作者未指定的初始事实，以获得可行故事？","location":"IJCAI 官方 PDF pp.1–2；由 Retcon p.8 参考文献 [17] 向后追溯。"},"annotation":{"id":"C10","title":"Open-World Planning for Story Generation","year":"2005","authors":"Mark O. Riedl; R. Michael Young","teams":[],"topics":["world_model"],"rqs":["W1e","W3b","W3e"],"collected":false,"review_status":"method_checked","question":"规划故事时，能否延迟决定作者未指定的初始事实，以获得可行故事？","question_origin":"根据论文问题、方法或摘要改写；不是作者编号或逐字 RQ。","summary":"ISR 在真、假与未定事实之间维护初态，按规划需要决定作者允许留空的部分。","input_conditions":"已知动作前置条件与效果；作者明确指定可留空的事实和互斥条件。","training_supervision":"本文使用形式化表示与求解；无视频生成器训练。","inference_support":"部分序因果链接规划，加上初始状态修订。","evaluation":"核查 IJCAI 2005 两页短文的初态划分、算法与示例；无现代大规模生成基准。","boundary":"允许在已定义的事实空间内补全初态，不等于自主发明任意新物理或社会本体。","observed_failures":"","evidence":"IJCAI 官方 PDF pp.1–2；由 Retcon p.8 参考文献 [17] 向后追溯。","checked":"2026-09-19","links":[{"label":"论文原文 / 官方记录","url":"https://www.ijcai.org/Proceedings/05/Papers/post-0020.pdf"}],"note":null,"collection_status":"not_collected","collection_note":"已在线核查所标范围；本轮只补充文献关系，未下载本地 PDF。","priority":65,"discovery":"Retcon 参考文献 [17]","mapping_roles":{"W1e":"core","W3b":"core","W3e":"support"}},"aliases":[]}],"edges":[{"id":"S01-P121","source":"S01","target":"P121","kind":"citation","change":"低维概率动力学 → 压缩视觉与循环动态；仍须处理模型被策略利用","evidence":"P121 PDF pp.9、11、16 对 PILCO 的讨论与引用","url":"https://arxiv.org/abs/1803.10122v4"},{"id":"S02-P121","source":"S02","target":"P121","kind":"citation","change":"控制器/循环世界模型框架 → 可运行的视觉环境实验","evidence":"P121 PDF p.2 明确沿用 2015 工作的概念和术语，p.20 参考文献","url":"https://arxiv.org/abs/1803.10122v4"},{"id":"P121-S03","source":"P121","target":"S03","kind":"citation","change":"两阶段模型与演化控制 → 潜空间价值梯度与长程策略学习","evidence":"Dreamer §5 Control with latent dynamics 明确对照 World Models","url":"https://arxiv.org/html/1912.01603v3#S5"},{"id":"S05-S03","source":"S05","target":"S03","kind":"citation","change":"在线潜空间规划 → 学习动作和价值，考虑想象窗口之外的收益","evidence":"Dreamer §4 Reconstruction、§5 明确采用并对照 PlaNet","url":"https://arxiv.org/html/1912.01603v3#S4"},{"id":"S03-P123","source":"S03","target":"P123","kind":"citation","change":"动作有监督的控制学习 → 无动作标签的视频与潜动作；属于相关工作对照","evidence":"P123 PDF p.15 引用 Dream to Control；P123 方法的任务变化据其摘要/正文归纳","url":"https://arxiv.org/abs/2402.15391v1"},{"id":"S06-P150","source":"S06","target":"P150","kind":"citation","change":"领域特定的程序理论 → 用 LLM 写通用 Python，并支持探索与转移","evidence":"P150 PDF p.2 将[13,17,67]列为更接近的问题设置；p.14 [67]","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/820c61a0cd419163ccbd2c33b268816e-Abstract-Conference.html"},{"id":"S22-P150","source":"S22","target":"P150","kind":"citation","change":"每步 LLM 推理行动 → LLM 编写环境模型，再用独立规划器复用","evidence":"P150 PDF p.2 明确与 ReAct 对照","url":"https://proceedings.neurips.cc/paper_files/paper/2024/hash/820c61a0cd419163ccbd2c33b268816e-Abstract-Conference.html"},{"id":"P150-P156","source":"P150","target":"P156","kind":"citation","change":"确定性、单个大程序 → 随机、部分可观测、多个带权程序专家","evidence":"P156 PDF p.1 明确指出 WorldCoder [3] 的适用限制；p.11 参考文献","url":"https://arxiv.org/abs/2505.10819v4"},{"id":"S04-P156","source":"S04","target":"P156","kind":"citation","change":"数据密集神经世界模型 → 从少量经验合成局部程序专家","evidence":"P156 PDF p.1 对照 Dreamer[1]，p.11 对应 DreamerV3 2023","url":"https://arxiv.org/abs/2505.10819v4"},{"id":"P123-P081","source":"P123","target":"P081","kind":"citation","change":"可控潜动作 → 跨情境共享动作语义与迁移","evidence":"P081 PDF §1–2 讨论潜动作泛化；p.10 引用 Genie","url":"https://arxiv.org/abs/2602.10104v2"},{"id":"P142-P157","source":"P142","target":"P157","kind":"citation","change":"元强化学习的隐藏机制任务 → 基础模型跨轮总结与规则突变适应","evidence":"P157 PDF p.1、Alchemy 设置；对 Wang 等 Alchemy 的引用","url":"https://arxiv.org/abs/2412.06438v2"},{"id":"S12-P143","source":"S12","target":"P143","kind":"citation","change":"给定对象/机器观察 → 允许主动放置对象、检验假设与更新信念","evidence":"P143 PDF pp.2–4 明确写明继承 ACRE 外观与 Blicket 机器","url":"https://arxiv.org/abs/2206.09203v2"},{"id":"P002-P017","source":"P002","target":"P017","kind":"citation","change":"静态最合理解释 → 新信息改变因果关系强弱","evidence":"P017 PDF p.3 Table 1 引用 ART/Bhagavatula 2020；是任务对照，不声称直接方法继承","url":"https://arxiv.org/abs/2401.03183v2"},{"id":"S13-P017","source":"S13","target":"P017","kind":"citation","change":"一般可撤销 NLI → 专门研究因果关系的支持与削弱","evidence":"P017 PDF p.3 明确区分 Rudinger 2020 与 δ-CAUSAL，p.11 引用","url":"https://arxiv.org/abs/2401.03183v2"},{"id":"S13-P021","source":"S13","target":"P021","kind":"citation","change":"文字可撤销推断 → 反常视频中随观察揭示更新解释","evidence":"P021 PDF p.10 参考文献[31]；任务变化据正文归纳","url":null},{"id":"P011-P015","source":"P011","target":"P015","kind":"synthesis","change":"默认/反事实任务比较 → 分离规则归纳和规则执行","evidence":"P015 与本地 abductive/conclusion.md 均标明 Wu 等 2023 的反事实设置；详见 P015 正文","url":"https://arxiv.org/abs/2408.00114v2"},{"id":"S07-P163","source":"S07","target":"P163","kind":"citation","change":"人工设计/探索连续自动机 → 基础模型引导模拟参数搜索","evidence":"ASAL PDF pp.1–2、p.14 明确列出 Lenia 基底","url":"https://arxiv.org/abs/2412.17799v2"},{"id":"S08-P163","source":"S08","target":"P163","kind":"citation","change":"行为新颖性搜索 → 以基础模型表征定义模拟的新颖性与多样性","evidence":"ASAL PDF p.16 引用 Lehman & Stanley 2011；非声称原封不动继承算法","url":"https://arxiv.org/abs/2412.17799v2"},{"id":"S09-P145","source":"S09","target":"P145","kind":"citation","change":"记忆与反思的社会角色 → Game Master 维护物理/社会/数字行动后果","evidence":"P145 PDF p.8 明确采用 Park et al. 2023 相同的关联记忆结构","url":"https://arxiv.org/abs/2312.03664v2"},{"id":"P138-P128","source":"P138","target":"P128","kind":"citation","change":"逐句故事图像 → 带显式历史记忆的多镜头视频","evidence":"P128 PDF p.13 [25] 引用 StoryGAN；任务差异为本图比较","url":"https://arxiv.org/abs/2512.19539v1"},{"id":"P039-P128","source":"P039","target":"P128","kind":"citation","change":"图像故事中的视觉记忆 → 镜头级视频记忆与历史帧选择","evidence":"P128 PDF p.14 [37] 引用 Make-a-Story","url":"https://arxiv.org/abs/2512.19539v1"},{"id":"S27-P127","source":"S27","target":"P127","kind":"citation","change":"粗到细长视频扩散 → 分层叙事关键帧与扩散渲染","evidence":"P127 PDF p.14 引用 NUWA-XL；比较表示层次，不声称单线技术继承","url":"https://arxiv.org/abs/2407.16655v3"},{"id":"S10-P104","source":"S10","target":"P104","kind":"citation","change":"推理文字链 → 显式动作/预测状态交替与 MCTS 规划","evidence":"P104 PDF pp.1–2、p.4 明确比较 CoT","url":null},{"id":"S11-P104","source":"S11","target":"P104","kind":"comparison","change":"同为多路径搜索；RAP 额外显式建模状态转移","evidence":"P104 PDF p.2 写 concurrently：并行相关工作，不是已证实的先后继承","url":null},{"id":"S14-P001","source":"S14","target":"P001","kind":"citation","change":"算法混合专家/新手控制 → 人类自主接管与交还控制","evidence":"P001 PDF pp.1–2 对照 DAgger 的随机门控与实时专家局限","url":"https://arxiv.org/abs/1810.02890v2"},{"id":"S20-P041","source":"S20","target":"P041","kind":"citation","change":"理解机器错误边界 → 联合优化机器预测器与向人求助策略","evidence":"P041 PDF p.7 引用 Bansal 等 2019；任务与目标变化据正文归纳","url":"https://arxiv.org/abs/2005.00582v1"},{"id":"S15-P059","source":"S15","target":"P059","kind":"citation","change":"识别人的通道可用性 → 同时选择主动帮助内容与交互方式","evidence":"P059 PDF p.2 明确指出 Human I/O 未处理主动意图生成，p.18 [41]","url":"https://doi.org/10.1145/3746059.3747748"},{"id":"S16-P059","source":"S16","target":"P059","kind":"citation","change":"预测数字后续动作 → 面对真实情境协调内容、时机和通道","evidence":"P059 PDF pp.2–3 明确比较 OmniActions，p.18 [34]","url":"https://doi.org/10.1145/3746059.3747748"},{"id":"S23-P059","source":"S23","target":"P059","kind":"citation","change":"BDI 用户建模 → 聚焦如何低打扰地递送主动帮助","evidence":"P059 PDF p.18 [33] 引用 Satori；条件对照据两篇摘要归纳","url":"https://doi.org/10.1145/3746059.3747748"},{"id":"S25-P059","source":"S25","target":"P059","kind":"citation","change":"低负荷的日常知识发现 → 紧迫、社会受限情境中的帮助递送","evidence":"P059 §1 明确比较 AiGet","url":"https://arxiv.org/html/2509.09255v1#S1"},{"id":"S18-S17","source":"S18","target":"S17","kind":"citation","change":"大屏语音/手势指涉 → 可穿戴 AR 的注视、手势、视觉与对话历史","evidence":"GazePointAR PDF pp.2–3 明确追溯 Bolt 1980，p.14 [9]","url":"https://makeabilitylab.cs.washington.edu/media/publications/Lee_GazepointarAContextAwareMultimodalVoiceAssistantForPronounDisambiguationInWearableAugmentedReality_CHI2024.pdf#page=2"},{"id":"S17-P061","source":"S17","target":"P061","kind":"citation","change":"理解人的空间指向 → 智能体也用与语音同步的空间手势表达","evidence":"P061 PDF p.3 指出空间交流不对称；p.16 [38]","url":"https://doi.org/10.1145/3772318.3790938"},{"id":"S24-P061","source":"S24","target":"P061","kind":"citation","change":"物体上的查询/操作入口 → 空间手势与动作示范","evidence":"P061 PDF p.3 引用 XR-Objects [12] 并讨论输出仍主要靠语言的限制","url":"https://doi.org/10.1145/3772318.3790938"},{"id":"S19-P149","source":"S19","target":"P149","kind":"citation","change":"交互设计原则 → 训练何时澄清的对话动作策略","evidence":"P149 PDF p.1、p.13 明确引用 Amershi 等 2019；是设计背景，非算法继承","url":"https://openreview.net/forum?id=SIE6VFps9x"},{"id":"P149-P159","source":"P149","target":"P159","kind":"citation","change":"学习问/答策略 → 显式条件 DAG、裁剪与提问效率目标","evidence":"P159 PDF p.11 引用 Learning to Clarify；§1 对既有方法的结构缺失分析","url":"https://proceedings.iclr.cc/paper_files/paper/2026/hash/1f49b7fbd7c7afc52c1db0d4ed1a338d-Abstract-Conference.html"},{"id":"S21-P159","source":"S21","target":"P159","kind":"citation","change":"答案及其成立条件 → 主动询问缺失条件并裁剪推理分支","evidence":"P159 PDF p.7 数据集设置、p.14 Sun 等 2022 条目","url":"https://proceedings.iclr.cc/paper_files/paper/2026/hash/1f49b7fbd7c7afc52c1db0d4ed1a338d-Abstract-Conference.html"},{"id":"P055-P059","source":"P055","target":"P059","kind":"synthesis","change":"混合主动权与打扰成本 → XR 多模态可用性与主动帮助","evidence":"本图按问题框架建立的概念桥；本轮未证实 P059 直接引用 P055","url":"https://doi.org/10.1145/3746059.3747748"},{"id":"P143-P157","source":"P143","target":"P157","kind":"synthesis","change":"合成环境主动实验 → 包含人执行动作的 3D 取证与规则变更","evidence":"本图对已实现条件的比较；未将其标成直接引用","url":"https://arxiv.org/abs/2412.06438v2"},{"id":"P147-P160","source":"P147","target":"P160","kind":"comparison","change":"可运行环境与计划树修改 ↔ 大规模设定与上下文管理","evidence":"两者产物不同；由本图并列比较，不是后一篇已经补齐前者能力","url":"https://arxiv.org/abs/2607.09403v1"},{"id":"S26-P038","source":"S26","target":"P038","kind":"comparison","change":"感知错误的游戏交互设计 ↔ 语言不确定表达与依赖","evidence":"本地 conclusion.md 并列阅读线索；两篇独立问题，未核实直接引用","url":"https://doi.org/10.1145/3630106.3658941"},{"id":"P002-P008","source":"P002","target":"P008","kind":"citation","change":"文本前后观察的解释 → 遮蔽视频事件的描述与解释","evidence":"P008 PDF pp.1–2 讨论语言溯因任务，p.14 [5] 引用 Bhagavatula 等 2020","url":"https://arxiv.org/abs/2203.14040v1"},{"id":"P008-P030","source":"P008","target":"P030","kind":"citation","change":"VAR 视频编码与解释生成 → 语言假设筛选结合图像想象","evidence":"P030 PDF p.2 明确回顾 REASONER/Liang 等 2022；p.5 沿用 VAR 数据","url":"https://arxiv.org/abs/2601.02771v1"},{"id":"P002-P019","source":"P002","target":"P019","kind":"citation","change":"文本溯因 NLI → 比较原因/后果图像并解释选择","evidence":"P019 PDF p.1 明确称 inspired by Bhagavatula et al. 2019 的文本 abductive NLI","url":"https://arxiv.org/abs/2410.02613v1"},{"id":"P002-P021","source":"P002","target":"P021","kind":"citation","change":"一般常识解释 → 意外视频事件与证据逐步揭示","evidence":"P021 PDF p.2 将 Bhagavatula 等[3]列为语言计算溯因起点","url":null},{"id":"P138-P039","source":"P138","target":"P039","kind":"citation","change":"故事级一致性判别 → 视觉记忆中的实体/背景与指代保持","evidence":"P039 PDF p.3 Story Generation 明确称 Li 等[30]/StoryGAN 提出初始任务","url":null},{"id":"P330-P380","source":"P330","target":"P380","kind":"citation","change":"以生成视频恢复三维物体流并控制 → 将生成模型作为固定被测对象，独立评价执行成功","evidence":"Dream.exe PDF p.3 明确讨论 Dream2Flow，并区分本工作的评价定位","url":"https://arxiv.org/abs/2606.04811"},{"id":"P369-P085","source":"P369","target":"P085","kind":"citation","change":"任意步 flow map 蒸馏 → 在多骨干世界模型中用于自回归适配，再进行 DMD","evidence":"SolarWM PDF p.5 明列 teacher-forced AnyFlow autoregressive initialization","url":"https://arxiv.org/abs/2609.02886v1"},{"id":"P256-P391","source":"P256","target":"P391","kind":"citation","change":"离线学模型、测试时优化动作 → 执行新转移后更新部分模型参数再规划","evidence":"AdaJEPA PDF p.9 比较 DINO-WM 的 Frozen/Adapt；p.14 明确沿用其 PushT 设置","url":"https://arxiv.org/abs/2606.32026"},{"id":"P158-P378","source":"P158","target":"P378","kind":"citation","change":"评估生成视频的规则执行 → 用外部 VLM 生成目标和过程查询并优化视频 LoRA","evidence":"VLM-as-Teacher PDF pp.2–3 引用 RULER-Bench，p.6 Table II 使用其指标；不声称基准本身提供优化方法","url":"https://arxiv.org/abs/2606.02564"},{"id":"P315-P378","source":"P315","target":"P378","kind":"comparison","change":"VLM 先预测下一事件文字 → VLM 对生成过程提供测试时可微监督","evidence":"资料库对照 VANS PDF pp.4、12 与教师方法 PDF pp.4、6；本轮未核实直接引用","url":"https://arxiv.org/abs/2606.02564"},{"id":"P396-P398","source":"P396","target":"P398","kind":"comparison","change":"给定部分实体像素轨迹、预测其余后果 → 联合提出动作和稀疏轨迹，生成并评分多个未来","evidence":"资料库比较 Masked Visual Actions PDF pp.3–7 与 TrAct pp.3–5；不是已核实的技术继承","url":"https://arxiv.org/abs/2608.24101"},{"id":"P150-C01","source":"P150","target":"C01","kind":"comparison","change":"从交互合成世界程序 → 把任务分数、可回答性和主动探针一起用于局部机制编辑","evidence":"WorldCoder 既有全文笔记与 ESBM 作者摘要的条件比较；尚未在本轮核查后者引用表","url":"https://arxiv.org/abs/2606.07127"},{"source":"C10","target":"C06","kind":"citation","change":"从按规划需要补全初态 → 对故事设定延迟承诺与约束检查","evidence":"Retcon PDF p.8 参考文献 [17] 明确列出 Riedl & Young (2005)；条件差别是本综述归纳，不表示算法直接继承。","url":"https://www.exag.org/papers/Retcon%20A%20Least-Commitment%20Story-World%20System.pdf","id":"C10-C06"},{"source":"C05","target":"C06","kind":"comparison","change":"从约束对象生成 → 约束故事设定与片段选择","evidence":"两篇方法范围比较；本次没有核实它们之间的直接引用。","url":"https://www.exag.org/papers/Retcon%20A%20Least-Commitment%20Story-World%20System.pdf","id":"C05-C06"},{"source":"S09","target":"C08","kind":"comparison","change":"从日常群体协调 → 受控命名博弈中的规范形成与改变","evidence":"不同任务与评价条件的并行比较；此边不声明引用继承。","url":"https://arxiv.org/abs/2410.08948v2","id":"S09-C08"},{"source":"C08","target":"C09","kind":"comparison","change":"从群体约定涌现 → 真实个体的留出行为预测","evidence":"群体机制与个体预测是不同验证目标；此边只用于对照。","url":"https://arxiv.org/abs/2411.10109v3","id":"C08-C09"},{"source":"P163","target":"C08","kind":"comparison","change":"从人工生命底层涌现 → 语言 agent 的社会协调","evidence":"底层规则、主体和评价目标不同；相似的涌现表述不能互相替代验证。","url":"https://arxiv.org/abs/2410.08948v2","id":"P163-C08"}],"lanes":[{"route":"world","rq":"W1c","title":"视觉世界模型：从预测到控制","papers":["S01","P121","S03","P123","P081"]},{"route":"world","rq":"W1c","title":"第二轮追溯：Dreamer 的状态表示从哪里来","papers":["S05","S03","P123"]},{"route":"world","rq":"W1b","title":"程序机制：放宽确定性与整体程序假设","papers":["S06","P150","P156"]},{"route":"world","rq":"W1d","title":"主动发现：从已有观察到实验","papers":["S12","P143","P157"]},{"route":"world","rq":"W1d","title":"跨试次学习与规则突变","papers":["P142","P157"]},{"route":"world","rq":"W2b","title":"新证据可以推翻什么","papers":["S13","P017"]},{"route":"world","rq":"W2b","title":"可撤销推断转向视频","papers":["S13","P021"]},{"route":"world","rq":"W2b","title":"从文本解释到视频解释与想象","papers":["P002","P008","P030"]},{"route":"world","rq":"W2b","title":"溯因问题如何变成多图比较","papers":["P002","P019"]},{"route":"world","rq":"W3b","title":"长故事：从图像记忆到镜头记忆","papers":["P138","P039","P128"]},{"route":"world","rq":"W3b","title":"长视频的结构分解","papers":["S27","P127"]},{"route":"world","rq":"W3c","title":"演化：从规则基底到自动搜索","papers":["S07","P163"]},{"route":"world","rq":"W3c","title":"新颖性也是一种搜索目标","papers":["S08","P163"]},{"route":"world","rq":"W3c","title":"社会行为与共同世界","papers":["S09","P145"]},{"route":"world","rq":"W4a","title":"文字链变为状态规划","papers":["S10","P104"]},{"route":"xr","rq":"X1a","title":"第二轮追溯：空间交流从输入走向输出","papers":["S18","S17","P061"]},{"route":"xr","rq":"X2b","title":"主动帮助必须适应人的通道","papers":["S15","P059"]},{"route":"xr","rq":"X2b","title":"从预测动作到协调帮助","papers":["S16","P059"]},{"route":"xr","rq":"X2b","title":"用户意图与情境递送","papers":["S23","P059"]},{"route":"xr","rq":"X2a","title":"澄清：从交互原则到条件结构","papers":["S19","P149","P159"]},{"route":"xr","rq":"X2a","title":"问题来源：答案为何还附带条件","papers":["S21","P159"]},{"route":"xr","rq":"X2c","title":"谁决定接管","papers":["S14","P001"]},{"route":"xr","rq":"X2c","title":"评价单位变成团队","papers":["S20","P041"]},{"route":"xr","rq":"X1c","title":"由实验到人执行的取证","papers":["S12","P143","P157"]},{"route":"world","rq":"W2d","title":"从生成运动到执行检验","papers":["P330","P380"]},{"route":"world","rq":"W3a","title":"少步视频方法进入长程训练流程","papers":["P369","P085"]},{"route":"world","rq":"W1d","title":"从冻结潜空间规划到测试时适应","papers":["P256","P391"]},{"route":"world","rq":"W4d","title":"规则评测成为测试时监督参照","papers":["P158","P378"]},{"route":"world","rq":"W4d","title":"两种外部推理支持的位置","papers":["P315","P378"]},{"route":"world","rq":"W1c","title":"实体未来与稀疏轨迹两种动作接口","papers":["P396","P398"]},{"route":"world","rq":"W1b","title":"可执行机制已有直接前作","papers":["P150","C01"]},{"route":"world","rq":"W1e","title":"不完备世界已有直接前作：初态与设定的延迟承诺","papers":["C10","C06"]},{"route":"world","rq":"W1e","title":"约束对象与约束叙事：能力范围对照","papers":["C05","C06"]},{"route":"world","rq":"W3c","title":"社会模拟的不同证据：协调、规范与个体预测","papers":["S09","C08","C09"]},{"route":"world","rq":"W3e","title":"局部涌现的两类条件：人工生命与社会约定","papers":["P163","C08"]}],"bridges":[{"id":"B1","title":"让人参与机制辨别，而不只是补充事实","question":"智能体维护多个隐藏机制假设时，怎样选择一个值得请求人执行的空间取证动作？","rqs":["W1d","W2b","X1c","X2b","X2c"],"papers":["P143","P157","P159","P059","P041"],"known":"IVRE 已让智能体主动实验；P157 已让人执行 3D 放置/移动；GPS 已优化提问，但规则已知。","delta":"把未知机制、人的行动负担、介入通道和证据收益放到同一个闭环中。","test":"比较直接建议、文本澄清、自由取证与成本敏感取证；同时测假设淘汰、任务成功、打扰次数/身体负担、错误介入与修复时间。"},{"id":"B2","title":"可修正的假设成为 XR 交互对象","question":"怎样向人呈现少量有区分度的假设、来源与缺失证据，并让修正改变后续行为？","rqs":["W2b","X1a","X3a","X3b"],"papers":["P021","P038","P061","P080","P091","P097"],"known":"新证据修正、空间表达、置信表达和交互解释分别已有工作；可见 CoT 不能直接当成内部真因。","delta":"在对象和任务上绑定假设，而不是仅展示一个置信数；明确区分用户确认指涉与用户提供新证据。","test":"对照单一解释、概率显示与可编辑假设；测恰当依赖、纠错成本、共享指涉、错误记忆持续与恢复。"},{"id":"B3","title":"规则编辑方向：暂缓拟题","question":"先核对相关论文的能力、输入条件与验证范围，再重新界定问题。","rqs":["W1a","W1b","W2c","W3b","W3d","X4a"],"papers":["P154","P150","P156","P071","P147","P160","P158","C01","C02"],"known":"WorldCoder、PoE-World 和 ESBM 已研究可执行机制及修订；WorldEvolver 的更新发生在部署上下文。当前文献用于对照不同条件。","delta":"暂不提出新的 RQ；不将可执行、可修订、可验证本身标为研究空白。","test":"先完成论文标注，再确定是否存在值得验证的具体差别。","status":"deferred"}],"families":[{"ids":["P026","P103"],"reason":"Coconut 的不同本地版本"},{"ids":["P102","P137"],"reason":"Long-Context State-Space Video World Models 的不同文件"},{"ids":["P127","P134"],"reason":"MovieDreamer 的不同本地版本"},{"ids":["P042","P045"],"reason":"同一叙事因果研究的后续/早期版本，题名不同"}],"coverage":{"pdf_files":398,"local_documents":398,"existing_notes":398,"map_only":0,"external_papers":46,"folders":[{"name":"Reasoning","files":60,"documents":60},{"name":"VideoGeneration","files":20,"documents":20},{"name":"abductive","files":38,"documents":38},{"name":"bryan wilder","files":12,"documents":12},{"name":"eric horvitz","files":3,"documents":3},{"name":"hci_du","files":7,"documents":7},{"name":"humanintheloop","files":3,"documents":3},{"name":"researcher-collections","files":240,"documents":240},{"name":"shibo hao","files":13,"documents":13},{"name":"uncertainty","files":2,"documents":2}],"historical_aliases":{"P003":"P002","P082":"P081","P109":"P103","P026":"P103","P102":"P137","P134":"P127"},"supplements":[{"path":"abductive/Abductive Reasoning XR Agent.docx","use":"用于理解假设呈现、主动取证、修复和人的成本；研究草稿中的空白主张须用论文核查。"},{"path":"abductive/conclusion.md","use":"作为 Bubbleu 等外部论文的检索线索；不作为原论文证据。"},{"path":"VideoGeneration/VideoGen × World Model × Storytelling 交叉领域高影响论文深度研究报告.docx","use":"对照长视频、叙事、动作控制三支；补查 NUWA-XL，修正‘视觉一致即因果一致’的混同。"},{"path":"Reasoning/Learning_Long-form_Movie_Prior_via_Large_Language_Models.notes.md","use":"与 P161 对照，保留稀疏分镜和布局指标的适用边界。"}],"archived_duplicates":10},"methodology":["长期母问题、父子层级及条件变化均为文献组织框架。候选选题与母问题分别呈现；B3 暂缓拟题，先标注文献。","实线箭头表示后者正文/参考文献确实引用前者；箭头上的问题变化是归纳比较，引用本身不等于全部方法继承。虚线表示本图的概念关联或并行对照。","颜色仅表示本地 PDF 是否存在：蓝色已收集，橙色未收集。证据深度与复现状态另用文字标注；在线摘要、下载 PDF、提取全文与方法核查是不同状态。","按当前目录与 SHA-256 清单核对：398 个活跃 PDF、398 个本地文献节点。duplicate-paper-archive 中归档的重复/旧版本不重复计数，历史 ID 保留别名跳转。","覆盖现有文献目录及研究者收藏。新增记录注明摘要初读或方法核查；方法支撑不等于已解决对应应用问题。","以本地论文及草稿为种子，优先向后追溯作者在引言/相关工作明确定位的问题；核对论文原文、官方记录或作者页面。第二轮实例：Genie→Dreamer→PlaNet，AgentHands→GazePointAR→Put-That-There。","检索快照更新至 2026-09-19；作者署名检索与引用滚雪球分别记录。未穷尽全部团队工作或参考文献，没有证据时不建立引用继承边。","TeaCache、ASAL、Diffusion as Shader 已随本地目录同步成为 P162–P164，使用当前正式笔记；没有把这些已收集文献误标成外部检索项。","世界构建补充区分主题检索与引用滚雪球：C04–C09 为主题补充，C10 由 Retcon 参考文献 [17] 向后追溯。新增 W1e、W3e 是综合组织分支，不是某篇原文的统一命名。"]}