福州科技圈热议:一段文字生成60秒高清视频,Sora如何改写AI视频生成格局?
2024年初,美国人工智能公司推出的文生视频大模型Sora迅速引爆全球技术圈——仅凭一段提示文本,即可输出长达60秒、多角色互动、背景连贯的高清视频。这一突破,让福州数字中国建设峰会持续关注的“多模态生成”议题再度升温。
◎本报记者 崔 爽
相较于Gen 2、Pika等早期工具仅能生成数秒片段,Sora在时长、稳定性与细节还原度上实现跃升:提示越详尽,画面越逼真。目前其官网已公开48个演示视频,从城市街景到室内微距,帧帧清晰、逻辑自洽,引发福建高校AI实验室及福州软件园多家企业的深度研讨。
不过,出于对滥用风险的审慎考量,该模型暂未向公众开放。现阶段仅面向少量研究人员与创意从业者定向邀测,以收集真实场景下的反馈数据——这也为福州大学、福建师范大学等本地高校参与前沿AI治理研究提供了契机。
“Sora不只是视频生成工具,更是AI认知物理世界的关键一步。”360集团创始人周鸿祎指出,其问世或将AGI(通用人工智能)落地时间从原预估的十年缩短至两三年。在福州举办的2023年海丝数字经贸博览会上,多位闽籍AI专家已就此类模型对东南沿海智能制造、数字内容产业的潜在赋能展开前瞻性探讨。
中国科学院自动化研究所副总工程师、紫东太初大模型中心常务副主任王金桥介绍,当前AGI主流技术路径有三:依托“大数据+自监督学习+大算力”的信息智能;强调人机博弈与强化学习的博弈智能;以及模仿人脑机制的类脑智能。而Sora在长视频生成、跨镜头一致性、世界规律建模与多模态融合等维度的进展,正契合信息智能路径的核心演进方向。
“它真正震撼业界的,并非单纯延长了视频时长,而是初步具备模拟物体运动、碰撞、光影变化等物理交互的能力。”王金桥表示,“这对构建可泛化的AI认知框架至关重要——而这也是通向AGI不可绕行的深水区。”
为支撑这一能力,Sora采用了超大规模视频语料训练,并深度融合扩散模型等先进算法。“这验证了一个关键判断:规模效应不仅适用于语言模型,在视频模态中同样成立。”北京月之暗面科技联合创始人周昕宇认为,“未来通用物理世界模拟器的雏形,正由此浮现。”
尽管如此,Sora距离真正意义上的AGI仍有明显差距。现有视频中仍存在左右混淆、因果链断裂、长程叙事失焦等问题。例如,无法准确推断“强风是否足以吹熄蜡烛”,亦难以理解“玻璃坠地碎裂”背后的材料力学本质——这些底层物理常识的缺失,恰是当前模型最显著的局限所在。
“它的本质仍是条件概率建模,与大语言模型同源:通过对文本、图像、参考视频进行高效压缩与重建,逼近真实世界的分布。”周昕宇解释道,“压缩精度越高,模拟越可信,但离真正‘理解’尚有距离。”
Sora火了,通用人工智能要来了? 只需一段提示文本,就能生成60秒连贯性视频
摘要:Sora作为新一代文生视频模型,支持60秒高清连贯输出,在福州AI产学研界引发广泛关注,但其物理常识理解与长程逻辑能力仍存短板。
SEO关键词:Sora,人工智能,福州,AI视频生成,通用人工智能
SEO描述:聚焦福州科技视角,解析Sora如何通过文本生成60秒高清视频,探讨其在人工智能、AI视频生成及通用人工智能领域的突破与局限。
