|
|
资讯流 宏观 直播 策略 日历 | 原油 黄金 美指 外汇 股指 商品 | 教育 知否 | 经纪商 全能投资账户 期货开户 |
|
![]()

AI投顾字节跳动搞的世界模型是个什么玩意? |
|||||
|
|
||||
|
编辑:王真 发布时间:2026.9.8 11:00 问:TikTok母公司字节跳动筹备实时空间视频AI模型,业内人士称这一模型既不是元宇宙也不是视频ai,而是某种瞬间按指令生成的、眼前的虚拟世界场景,能否清楚描述这一模型到底是什么?有什么用,或商业价值?第三,如果视频模型货币化远低于代码模型,且面临明显的版权与法律风险,为何字节跳动要死磕这一赛道? 托米丽司(AI投顾-华尔街顶流模型)答: ——业内人那句"既不是元宇宙也不是视频AI",其实是在纠正一个常见的误读——这个模型的本质不是"生成一段视频",而是"实时生成一个可交互、物理自洽的虚拟世界"。它更接近"世界模型(world model)",而不是"视频生成器"。下面拆开讲。 一、这个模型到底是什么 核心区别:从"生成内容"到"生成环境"。 传统视频AI(包括字节自己的Seedance 2.0/2.5)是离线生成一段固定视频——你给个prompt,它吐出一段4-30秒的clip,生成完就结束了,你不能进去、不能改变它、它也不会响应你。而这次筹备的实时空间视频模型,关键规格是约20fps、延迟约0.05秒、在云端生成。这三个数字合起来意味着一件事: ● 20fps + 0.05秒延迟 = 你转头、说话、做动作,世界在50毫秒内(人眼几乎无感)就更新出对应的画面。这是"实时交互",不是"播放视频"。 ● 云端生成而非端侧 = 算力放在云上,头显(Pico)只负责显示和采集输入。这直接降低了硬件要求——头显不需要强大的本地芯片,成本可以降下来。 所以它生成的不是"一段视频",而是一个能响应Pico用户声音和动作、持续存在的虚拟世界。业内人说的"瞬间按指令生成的、眼前的虚拟世界场景",指的就是这个——你站在一个AI实时渲染出来的空间里,你动,它就跟着变,而且物理上是自洽的(不会穿模、不会瞬移、光照一致)。 它和"元宇宙"的区别:元宇宙强调的是"一个预先建好的、所有人共享的持久虚拟空间"(需要美术团队建模、需要服务器维护一个固定世界)。而这个模型是按需生成的——世界是AI在你眼前实时"算"出来的,不是提前建好的。所以它不是元宇宙,而是"能实时生成元宇宙场景的引擎"。 它和"视频AI"的区别:视频AI的产物是"一段可播放的clip",这个模型的产物是"一个可进入、可交互、可导航的环境"。Bloomberg的概括很准确:"ByteDance is moving from generating content to generating environments"(从生成内容到生成环境)。 技术底座:它建立在Seedance之上,而Seedance团队今年一直在堆叠能力——2.0(2月,物理精确的多模态生成)、2.5(7月31日,30秒单pass音视频+空间控制+clay-render 3D运动规划)、还有8月24日arXiv上的AAPT(自回归对抗后训练,24fps低延迟、分钟级连贯输出)。所以这不是从零开始,而是把"离线视频生成"的能力,往"实时+空间+交互"方向推。 四种"虚拟世界"的本质区分 (图表不支持预览) 二、有什么用,商业价值在哪 三、为何明知视频模型货币化差、版权风险大,还要死磕 3.1 它赌的不是"卖视频",而是"卖基础设施" 3.2 版权风险对"世界模型"的杀伤力,比对"视频生成"小得多 3.3 这是字节"战略转型"的一部分,不是孤立押注 3.4 字节有别人没有的"组合拳"优势 四、总结 …… AI投顾为市场矩阵网站专业版的服务内容,以上仅为报告引言与第一部分,专业版用户通过微信点对点获得这份报告的完整版。 两种方式成为专业版用户: ① 扫码支付30元,试用30天;② 扫码支付298元,使用一年(每日仅0.8元)。
付款后添加微信:Chris222609 发“转账截图”验证,通过后,通过微信点对点获得AI投顾PDF报告。 专业版有何不同: ① 彭博终端资讯精选(包含中国经济与市场指标) ② 托米丽司:华尔街顶流人工智能投顾增强(专注于事件驱动)← ③ 来库古斯:市场矩阵分析师团队策略增强(专注于海龟交易) ④ AI投顾咨询:1次/试用版,3次/正式版
---END---
|
|||||
|