巫女桔子才不是污女呢 2026-03-28 从热力学的角度来看,完全模拟一部分的真实世界,一定要消耗比这部分真实世界的全部能量更多的能量。 比如用超级计算机在虚拟世界中完全还原一双筷子,那么需要投入的电能的总量(J或者kJ)一定大于这个筷子的质量m×c²(质能方程e=mc²) ♥ 271 ↩ 40
北欧晨风 2026-03-28 [doge]虚拟世界并不需要模拟一整个宇宙,只需要模拟一个人他自己的生活环境就可以了,算力并没有很夸张。除了这个人每天眼睛看到的东西以外,其他的都是NPC罢了,比如最近中东在打仗,但实际上那里的人并不存在。但是你如果不相信亲自去看的话,虚拟世界在临时渲染出来,让你看到。包括评论区的每个评论,甚至说up主,都是不存在的代码罢了。如果有谁跟你嘴硬说他不是代码,那也没法证明。 ♥ 39 ↩ 3
skiuniverse 2026-03-28 之前调研强化学习时有了解过一些,世界模型应该是和model-based RL(基于模型的强化学习)相关联的,相当于先去学习整个环境的马尔可夫决策链(观测模型、转移模型、奖励模型),再基于这个学到的世界模型以及真实环境训练强化学习模型,同时利用强化学习过程中的探索样本反过来继续更新世界模型。 相比于不采用世界模型的model-free RL,我个人理解model-based RL能缓解DRL的冷启动和稀疏奖励问题。因为已有一个世界模型,所以DRL的决策网络在一开始更新时就更知道往哪个方向能有效提升动作价值(model-free RL则得探索到高价值样本后才知道)。 世界模型也能推演下一步后的下下步、下下下步,能更大概率看到未来的“稀疏奖励”,而model-free RL要么像PPO算法那样必须使用完整轨迹更新网络(蒙特卡洛方法的梯度估计低偏差、高方差,不过PPO严格意义上应该算蒙特卡洛和TD方法的混合),要么像TD3算法那样使用当前奖励和价值网络估计的下一个状态的价值来计算当前状态价值,依赖价值网络的学习效果(TD方法的梯度估计高偏差、低方差)。 当然了,一个理论上看起来更复杂但效果好的东西,想实操起来也像理论那么好,那估计得投入亿点点精力了( ♥ 16
挽梦儿 2026-03-28 世界模型和前年的元宇宙又有什么区别呢,以元宇宙为概念的mate公司把现金流快烧完了也没成功,前段时间都放弃了,世界模型不过是为了追求股市新增长点的资本狂欢罢了 ♥ 8 ↩ 9
逺呿の偝影 2026-03-28 有时候真的在思考这件事,何为真实,何为虚拟。从物理层面出发的话,你永远无法真实的触碰到任何物体,你的触觉是对电子斥力的感知罢了。而且最新的研究发现,物质是可以从真空中产生的。 ♥ 5
doyouwannasee 2026-03-28 虚拟世界不一定要实时演算,它的一秒,本底世界用一年来运算都没事,即使暂停它们的时钟,虚拟世界也感觉不到的。所以几大假想的前提都无需这么多限制。 ♥ 5 ↩ 1
Comments
从热力学的角度来看,完全模拟一部分的真实世界,一定要消耗比这部分真实世界的全部能量更多的能量。 比如用超级计算机在虚拟世界中完全还原一双筷子,那么需要投入的电能的总量(J或者kJ)一定大于这个筷子的质量m×c²(质能方程e=mc²)
♥ 271 ↩ 40
有可能
♥ 65 ↩ 3
如果是这样,那我得多录几发。[思考][思考][思考]
♥ 45 ↩ 3
[doge]虚拟世界并不需要模拟一整个宇宙,只需要模拟一个人他自己的生活环境就可以了,算力并没有很夸张。除了这个人每天眼睛看到的东西以外,其他的都是NPC罢了,比如最近中东在打仗,但实际上那里的人并不存在。但是你如果不相信亲自去看的话,虚拟世界在临时渲染出来,让你看到。包括评论区的每个评论,甚至说up主,都是不存在的代码罢了。如果有谁跟你嘴硬说他不是代码,那也没法证明。
♥ 39 ↩ 3
无聊,为什么人家高等文明不能直接造一个真的宇宙出来观察呢?他们难道不会知道计算机会出bug吗?[笑哭]
♥ 22 ↩ 5
世界模型的概念我觉得就跟AGI一样,还属于愿景。目前的方案都还不算真正的世界模型。 或者说这个概念有点和人工智能一样,是很宽泛的
♥ 18
如何用二进制的离散数据去模拟一个连续的世界?
♥ 22 ↩ 13
之前调研强化学习时有了解过一些,世界模型应该是和model-based RL(基于模型的强化学习)相关联的,相当于先去学习整个环境的马尔可夫决策链(观测模型、转移模型、奖励模型),再基于这个学到的世界模型以及真实环境训练强化学习模型,同时利用强化学习过程中的探索样本反过来继续更新世界模型。 相比于不采用世界模型的model-free RL,我个人理解model-based RL能缓解DRL的冷启动和稀疏奖励问题。因为已有一个世界模型,所以DRL的决策网络在一开始更新时就更知道往哪个方向能有效提升动作价值(model-free RL则得探索到高价值样本后才知道)。 世界模型也能推演下一步后的下下步、下下下步,能更大概率看到未来的“稀疏奖励”,而model-free RL要么像PPO算法那样必须使用完整轨迹更新网络(蒙特卡洛方法的梯度估计低偏差、高方差,不过PPO严格意义上应该算蒙特卡洛和TD方法的混合),要么像TD3算法那样使用当前奖励和价值网络估计的下一个状态的价值来计算当前状态价值,依赖价值网络的学习效果(TD方法的梯度估计高偏差、低方差)。 当然了,一个理论上看起来更复杂但效果好的东西,想实操起来也像理论那么好,那估计得投入亿点点精力了(
♥ 16
技术进步是真快,以前学校和比赛里都是学的规控算法,这几年车企都不讲规控了都开始搞VLA、端到端、世界模型…
♥ 14 ↩ 1
害,你别管世界是真的还是假的,只要你自己活的开心都无所谓[doge]
♥ 12
模拟世界还是算了,就现在这点算力,能模拟一粒沙子我都算你nb。
♥ 14 ↩ 3
话说 无人驾驶车上路有段时间了吧,还没出现事故致死事件么?没看到过相关新闻啊
♥ 7 ↩ 2
啊我们的世界是虚拟的[惊讶],哪快快快把你们的作弊码发过来我要开创造
♥ 6 ↩ 3
世界模型和前年的元宇宙又有什么区别呢,以元宇宙为概念的mate公司把现金流快烧完了也没成功,前段时间都放弃了,世界模型不过是为了追求股市新增长点的资本狂欢罢了
♥ 8 ↩ 9
绝对是模拟喵 还有,你怎么知道我钓到巨物了[doge]
♥ 5 ↩ 1
有时候真的在思考这件事,何为真实,何为虚拟。从物理层面出发的话,你永远无法真实的触碰到任何物体,你的触觉是对电子斥力的感知罢了。而且最新的研究发现,物质是可以从真空中产生的。
♥ 5
虚拟世界不一定要实时演算,它的一秒,本底世界用一年来运算都没事,即使暂停它们的时钟,虚拟世界也感觉不到的。所以几大假想的前提都无需这么多限制。
♥ 5 ↩ 1
那万一这个模型出bug了怎么办[doge_金箍]
♥ 5 ↩ 2
工业界不是早就用上仿真软件了吗。
♥ 6 ↩ 5
确实模拟了个世界[笑哭]
♥ 3