{"schema_version":1,"updated":"2026-09-19","title":"从少量规则，到可推演的世界","question":"如何从稀疏示例和部分规则构造可扩展的世界，区分推导与补充假设，并使多步、跨领域的演化持续符合已确定的机制？","assessment":"局部能力已有实证，完整目标仍缺少联合验证。规则归纳、程序执行、约束创作、人工生命和社会模拟各自覆盖了一部分；这些结果还不能拼成一个已验证的、从几条规则自动生长出生态—社会—文化的通用系统。","basis":"综合现有资料库及本轮补充前作，核对截至 2026-09-19。以下成熟度是对任务条件与证据范围的归纳，不是统一排行榜，也不声称穷尽全部相关研究。","stages":[{"id":"induction","number":"01","label":"归纳机制","input":"示例 / 交互 → 候选规则","question":"哪些机制能解释观察，什么实验能区分它们？","boundary":"有限示例通常不能唯一确定规则；需要假设空间或主动取证。","rqs":["W1b","W1d"],"papers":["P015","P142","P152"]},{"id":"deduction","number":"02","label":"按规则推导","input":"规则 + 状态 + 行动 → 后果","question":"在未见组合中，能否多步、重复地执行同一机制？","boundary":"程序或规划器执行成功，不能直接证明视频模型自身会推演。","rqs":["W4a","W4d","W2d"],"papers":["P150","P156","P158"]},{"id":"completion","number":"03","label":"补充假设","input":"不完备设定 → 多个合法世界","question":"哪些是必然后果，哪些依赖额外假设或可撤销常识？","boundary":"合理的补全不一定是真实机制，也不一定是唯一答案。","rqs":["W1e","W2a","W2b"],"papers":["C04","C06","C07"]},{"id":"extension","number":"04","label":"演化与拓展","input":"局部机制 → 新对象 / 群体 / 制度","question":"局部变化如何传到更高层，并通过反馈影响后续演化？","boundary":"丰富现象或流畅叙事，需要进一步用状态、反馈与约束验证。","rqs":["W3c","W3e"],"papers":["P163","P145","C08"]}],"example":{"rule":"设定：植物只能从月光获得外部能量。","note":"概念示例，用来区分推理类型；不是论文实验或真实生态学结论。四类工作可以循环进行，不是能力已依次解决的流水线。","items":[{"label":"观察不足以唯一归纳","text":"若示例只是“夜间生长、白天不生长”，月光、温度或人为控制都可能解释，需要区分性实验。"},{"label":"由规则直接推出","text":"完全没有月光时，植物无法通过该途径获得新的外部能量；这不等于它会立刻死亡。"},{"label":"补充后才能推出","text":"还需声明储能、耗能与生存阈值，才能推算连续无月夜的影响。默认重力等规则是否保留，也应写清。"},{"label":"可选的世界拓展","text":"夜间农业、食物分配制度或月亮崇拜都可能成为设定；它们不是原规则唯一蕴含的社会与文化。"}]},"progress":[{"id":"rule-learning","label":"规则归纳与主动发现","stages":["induction"],"status":"限定环境已有实证","achieved":"SolverLearner 将规则归纳与执行分离；Alchemy、DiscoveryWorld 让智能体在可检验环境中发现隐藏机制。","condition":"从固定或受限机制族、预先构建的实验世界出发，评估留出预测、实验过程与发现的知识。","limit":"能拟合已见例子，不代表唯一识别了机制；开放世界的假设空间仍需定义。","papers":["P015","P142","P152","P157"],"rqs":["W1b","W1d"]},{"id":"executable","label":"可执行世界与组合动力学","stages":["induction","deduction"],"status":"可执行接口已有实证","achieved":"WorldCoder 学习并修订代码世界模型；PoE-World 组合程序化专家；Text2World 将描述转成 PDDL 并用执行检验。","condition":"分别依赖确定性环境假设、对象状态接口或形式化规划语言。","limit":"解释、规划与执行的外部工具是方法的一部分；不能据此推断像素生成器具备同等机制能力。","papers":["P150","P156","P154"],"rqs":["W1a","W1b","W4a"]},{"id":"revision","label":"机制修订与适应","stages":["induction","completion"],"status":"已有方法，更新对象不同","achieved":"ESBM 讨论机制记忆与局部编辑；WorldEvolver 根据预测失配更新可检索的经验记忆。","condition":"必须标明更新的是程序、记忆、参数还是世界规则；WorldEvolver 的基础模型与 agent 保持冻结。","limit":"模型或记忆的自我改进，不等于世界内部生态与社会的演化；摘要证据不能替代端到端实验。","papers":["C01","C02","P157"],"rqs":["W1d","W2b","W3d"]},{"id":"worldbuilding","label":"不完备设定与约束创作","stages":["completion","extension"],"status":"有长期前作与局部系统","achieved":"开放世界故事规划可补充初始设定；Imaginarium 用约束生成对象；Retcon 保留未定设定并筛去冲突片段；PWM 以符号贝叶斯推断更新世界模型。","condition":"分别依赖作者提供的动作、类型、约束、片段或语言表示；各自验证的任务不同。","limit":"AutoWorldBuilder 能组织概念生成，但其当前实验尚未实现关系解析；完成一次生成不代表世界机制正确。","papers":["C10","C05","C06","C07","P160"],"rqs":["W1e","W2b","W3d"]},{"id":"alife","label":"人工生命与开放演化","stages":["extension"],"status":"局部规则涌现已有实证","achieved":"Lenia 等底层系统产生复杂形态；ASAL 用基础模型评价仿真视频，搜索目标现象、持续新颖性与多样性。","condition":"演化发生在指定的人工生命底层规则与参数空间中，视频主要用于评价。","limit":"涌现丰富形态，还不能验证生态资源、经济制度与文化之间的统一因果闭环。","papers":["S07","P163"],"rqs":["W3c","W3e"]},{"id":"social","label":"社会行为、规范与个体模拟","stages":["deduction","extension"],"status":"已有行为与社会实验","achieved":"Generative Agents 展示群体协调；Concordia 提供社会模拟框架；命名博弈研究规范形成与改变；自述数据研究在留出问项与行为任务中检验个体模拟。","condition":"区分可信感、群体协调、局部博弈规律与真实人群预测；这些是不同评价目标。","limit":"尚不能把这些局部结果直接外推为任意虚构生态—社会—文化的长期正确演化。","papers":["S09","P145","C08","C09"],"rqs":["W3c","W3e"]},{"id":"video","label":"视频生成执行规则","stages":["deduction"],"status":"已有直接评测与改进方法","achieved":"RULER 分开评估规则一致性、视觉一致性、画质和指令遵循；VLMTeachers 用外部 VLM 反馈指导测试时训练。","condition":"先辨认视频模型输入中是否已包含答案、未来轨迹或外部求解结果。","limit":"短片规则评分不等于多步、跨分支的整段成功；外部教师带来的收益要单独归因。","papers":["P158","P378","P315","P396","P398"],"rqs":["W2d","W4d"]},{"id":"elaboration","label":"常识、例外与表示拓展","stages":["completion","extension"],"status":"经典问题，现代条件待检验","achieved":"Elaboration Tolerance 已讨论新增事实、参数、谓词参数和情境；非单调推理允许撤销默认结论。现有因果叙事任务检验模型能否服从给定条件。","condition":"需区分默认常识、用户硬规则与观测证据，并给出冲突处理范围。","limit":"提出新设定后，选择性保留其余常识并在生成视频中持续执行，需要专门的组合与干预测试。","papers":["C04","P042","P015"],"rqs":["W2a","W1e","W3e"]}],"cautions":[{"title":"完成率与一致性分开","text":"AutoWorldBuilder 的 §6.4 明确写出：关系解析尚未实现，内部审核的零问题检测也可能反映审核过宽。不能把内部通过率写成无矛盾证明。","papers":["P160"]},{"title":"问项分数与整段成功分开","text":"RULER v1 的 Veo 3.1 规则一致性为 48.87/100，是问项评分聚合，不是 48.87% 的完整视频全部正确；该版本结果也不是 2026 年最新模型排名。","papers":["P158"]},{"title":"社会模拟已有验证，范围需保留","text":"命名博弈验证局部协调如何形成约定；自述数据研究验证个体的留出回答与行为。两者提供实证，但不验证完整文明的生成。","papers":["C08","C09"]}],"evaluation_regimes":[{"title":"发现一个隐藏机制","text":"环境有隐藏真值。测试留出转移、区分性干预、样本效率和不确定性；允许多个在当前证据下等价的机制。","papers":["P142","P152","P015"]},{"title":"构造多个合法世界","text":"设定不唯一。测试硬约束、补充假设的可追踪性、可执行性与有效多样性；不给虚构社会文化强加唯一答案。","papers":["C05","C06","C10"]},{"title":"预测现实中的人或生态","text":"逻辑自洽还不够。需要真实留出数据、干预响应、分布校准与外推边界；按具体用途验证。","papers":["C09","P145"]}],"evaluation":[{"dimension":"规则归纳","test":"按机制或组合划分训练／测试，加入能区分候选解释的干预。","metrics":"留出转移准确率、机制等价类恢复、校准与交互样本数。","pitfall":"只验证对已见例子的拟合。","papers":["P015","P142","P152"]},{"dimension":"假设与逻辑一致性","test":"记录给定事实、推导结论、可撤销默认和新假设；用独立约束检查器检查所编码规则。","metrics":"约束满足率、冲突定位、结论对额外假设的依赖。","pitfall":"把未编码部分也算作已证明，或仅让生成者给自己打分。","papers":["C06","C07","P160"]},{"dimension":"组合与多步推演","test":"保留单规则训练，留出规则组合、触发次序、实体绑定与更长链条。","metrics":"逐步事件正确率、整条轨迹通过率、首次违规位置，随深度变化的曲线。","pitfall":"把换措辞、换背景当成未见机制组合。","papers":["P156","P158"]},{"dimension":"长期演化与干预","test":"同一初态重复触发规则，成对改变一个行动或规则条件，并复查无关对象。","metrics":"状态保持、受影响变量响应、不应变化部分的保持、资源收支误差。","pitfall":"只核对终帧，忽略中间违规；用空场景或静止视频规避规则。","papers":["P150","P156","P163"]},{"dimension":"跨层反馈","test":"在明确建模的资源—行动—制度链条中扰动一个变量，沿依赖追踪传播与反馈。","metrics":"响应方向与延迟、跨层约束、反馈稳定性；现实用途另测经验吻合。","pitfall":"把任何合理故事当作被规则蕴含的唯一演化。","papers":["P145","C08","C09"]},{"dimension":"有效多样性","test":"同样的部分设定生成多个世界，只在约束合格且完成指定事件的结果中统计差异。","metrics":"有效世界比例、机制／结构覆盖与新颖性，多随机种子置信区间。","pitfall":"单纯奖励视觉差异，或牺牲可执行性增加新颖性。","papers":["C05","C06","P163"]},{"dimension":"视频中的可见证据","test":"盲评生成视频中的对象、动作和状态转移；对事件检测器与 VLM 裁判做人工校验。","metrics":"画质、指令、事件完成、规则一致性分别报告，并给整段成功率。","pitfall":"从提示词或外部轨迹推断视频已经实现了同样的后果。","papers":["P158","P378"]},{"dimension":"人类探索与修复","test":"让用户依据 Foresee 分支预测未见后果、识别额外假设并纠正错误；控制视频质量与等待差异。","metrics":"机制理解、迁移决策、纠错成本、恰当依赖；同时测首分支延迟与多分支总耗时。","pitfall":"只问喜好、沉浸感或看起来是否可信。","papers":["P147","P038","P065"],"rqs":["X3b","X3c"]}],"evaluation_note":"以上是本综述提出的组合评测方案。每行论文提供相关任务、方法或评价依据，不表示某一篇已经实现整行协议；新增指标与切分须在具体项目中预先定义。","attribution":[{"title":"视频模型直接推演","text":"测试只给初态、规则与行动，不给未来答案。训练可以使用仿真真值或教师标签，但要披露来源并严格留出测试组合。"},{"title":"外部推理后生成","text":"测试时 LLM、VLM 或搜索先给出后果／计划，再交给生成器。衡量系统收益，并用去掉外援的对照分离贡献。"},{"title":"给定未来约束再生成","text":"未来轨迹、关键帧或完整仿真状态已给定时，重点是渲染和条件遵循；不能单凭画面正确归因为未知后果推理。"}],"gaps":[{"title":"多个候选世界与可见的不确定性","prior":"Alchemy 的机制不确定性、PWM 的溯因和 Retcon 的未定设定都是直接前作。","delta":"将多个仍合法的机制分别演成视频，并明确哪些差异来自证据不足、哪些来自创作选择。","test":"新证据到来后，淘汰不相容分支，同时保留仍可行分支。","papers":["P142","C07","C06"],"rqs":["W1e","X3a"]},{"title":"反常识规则下，选择性保留日常机制","prior":"Elaboration Tolerance、非单调推理与反常识推理任务已讨论默认与例外。","delta":"只替换指定机制，检测其他物理、对象身份和动作后果是否仍按声明的默认规则执行。","test":"成对反常识规则、互不相关对象与多次触发；分别统计必须改变与必须保持的部分。","papers":["C04","P042","P158"],"rqs":["W2a","W2c","W4d"]},{"title":"生态—经济—社会的闭环反馈","prior":"ASAL、Concordia 和规范涌现各有局部实验，并非无人考虑群体或社会演化。","delta":"把资源、个体行动、制度形成和资源再分配接到同一个可检验的反馈系统。","test":"明确跨层接口与资源账目，再做扰动和长期追踪；逐层报告失效。","papers":["P163","P145","C08"],"rqs":["W3c","W3e"]},{"title":"拓展对象、属性与制度，同时保留已定事实","prior":"开放世界规划、Imaginarium、Retcon 已研究补全初态、对象生成和延迟承诺。","delta":"允许新的对象类型、可执行动作或制度进入世界，并验证它们与已有机制共同运行。","test":"新增对象或规则后重放历史、检查新旧实体交互，区分新增设定和推导后果。","papers":["C04","C10","C05","C06"],"rqs":["W1e","W3e","X4a"]},{"title":"区分世界事实、角色信念和社会规范","prior":"社会模拟、符号世界模型与叙事研究分别处理世界、角色信息和约束。","delta":"允许角色误解或违反规范，同时保持真实状态与后果一致。不能把违背社会规范直接判为物理或逻辑错误。","test":"构造错误信念、信息不对称和规范违反，分别验证行为动机、世界转移与社会反馈。","papers":["P145","C07","C08"],"rqs":["W3c","W3e"]},{"title":"生成模型在未见规则组合中的持续执行","prior":"RULER 已有规则推理评测，VLMTeachers 已有外部反馈改进。","delta":"将规则组合、实体绑定、重复触发和链条深度系统分离，测试不给未来轨迹时能否生成正确新后果。","test":"同样基础模型与推理预算，对比直接生成、训练改进、外部求解和已知轨迹条件。","papers":["P158","P378","P396","P398"],"rqs":["W2d","W4d"]}],"gaps_note":"这里列的是现有证据尚未充分联合覆盖的条件，不是已确认的无人研究空白。每项先列前作，再说明需要增加什么测试；新颖性仍需围绕选定的具体条件继续检索。","focus":{"label":"三个月候选切口 · 给定规则的组合推演","question":"给定少量日常或反常识规则，不提供未来轨迹，视频生成模型能否把这些规则组合应用到未见情境，生成多步一致的后果？","reason":"先隔离“执行规则”与“发现规则”，才能判断失败发生在理解、组合、生成还是评价。完整生态与社会拓展保留为长期方向。","training":"候选训练贡献：用可执行环境提供事件／状态监督，对视频生成器进行轻量训练，针对组合、对象绑定和多次触发约束学习。是否需要奖励训练，由第一轮失败类型决定。","feasibility":"以 4 × 24 GB A10 为预算，先测模型、分辨率、帧数与 LoRA 的实际显存和耗时；多卡显存不能直接当作单卡大显存。三个月可行性和实时性均需据实测收敛。","sequence":[{"label":"第 1–2 周 · 复核失败","text":"复用 RULER 适配子集，固定版本与采样设置；建立事件标注和人工复核，先确认稳定、可重复的失败。"},{"label":"第 3–6 周 · 训练与切分","text":"从单规则到组合规则，留出实体、组合与触发顺序；先用小规模训练检验收益，避免同一视频或机制模板泄漏。"},{"label":"第 7–9 周 · 归因与泛化","text":"比较同底座无训练、训练改进、外部后果提示和给定轨迹；报告整段成功、深度曲线、泛化与计算成本。"},{"label":"第 10–12 周 · Foresee 验证","text":"模型结果可信后再接入分支探索，检验用户能否理解并迁移规则；若训练无效，收敛为有证据的能力边界，调整论文主张。"}],"go_no_go":"继续条件：基线在所选规则上有稳定缺陷，事件裁判经人工校验可用，且训练在留出组合上改善整段成功。若仅改善画质、依赖测试时答案或算力不适配，则缩小任务或更换方法。","xr":"与 Foresee 的连接：呈现同一初态下可检验的操作—后果分支，让用户看懂规则与假设。首个分支延迟、多分支总耗时和机制理解分别评价。","rqs":["W4d","W2d","X3b","X3c"],"papers":["P158","P378","P150","P156"],"status":"候选问题与实验计划；不是已经证明的新颖性、性能或三个月产出承诺。B3 规则编辑方向继续暂缓拟题。"}}