ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据
ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。
搜索
PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。
WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。
在传统认知里,制作一个高质量 3D 模型,往往意味着复杂的软件流程、昂贵的硬件设备,以及经年累月积累的专业知识。对专业设计师而言,这是日常工作;可对普通用户而言,却是「看得见,做不了」的高门槛。
3D空间数据的瓶颈,从来不是算法,而是标注。
把一个Bug交给Claude Code或Codex,十几分钟后它回了一句“Done”和一大片Diff。过程中它读错了什么、为什么反复改同一个文件、最后有没有重新跑测试......开发者想知道就只能去几百行日志里碰运气。7月11日,一个名叫Mindwalk的开源项目发布了v0.1.0。
大模型竞技场的 AI 能力负责人 Peter Gostev,在前几天公开了 63 条几乎是故意为难模型的 3D 提示词;从大型 3D 世界,到各种可游玩的 3D 场景、名画世界,以及极端视角、自然奇观,和元素与宇宙终局场面等。
测试方法很简单。 找一个创意性极强的项目,让 4 个模型从零搭建,然后逐个跑一遍,看看谁做得最好看、谁最完整、谁翻车最惨。项目选的是一个 3D 浮岛创意作品集,对标 jordan-breton.com 那种风格,一座漂浮在空中的岛屿,上面有自然元素,随着页面滚动镜头会环绕岛屿移动,分成远景、中景、近景、拉远四个章节。
昨天早上我想给 Claude 的一篇文章配几张 3:4 的社交媒体图。手边有自己做的社交媒体 Skills,就顺手让 Codex 调了 GPT-Image 2.0。出来的效果超出预期。干净白底,克制的 3D 材质,中文标签直接印在图里,远看像杂志内页,近看细节都读得清。
近期, ECCV 2026 结果公布,Realsee 团队的成果 Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes 成功入选。它面向室内全景图像,能够从稀疏、无序的全景照片中,直接预测相机位姿、度量深度和点云重建结果,可以为 3DGS 提供更稳定、更精准的几何约束。
两个月的时间,混元 3 正式版上线。结合了用户对预览版的反馈以及对模型稳定性和可用性的提升,Hy3 在 Agent 和 Coding 能力上有了实质的提升。我们做了多个前端网页的生成测试,大多数都包含复杂的 3D 网页模拟、严格的游戏逻辑,以及需要调用不同的框架和库文件,Hy3 交付的内容要比预览版好上一个等级。