图森未来于12月17日发布首个图生视频开源大模型“Ruyi”,该模型支持RTX 4090显卡运行,可生成最长5秒的视频内容。Ruyi由Casual VAE模块和Diffusion Transformer组成,总参数量约为7.1B。它支持多分辨率和多时长生成,首帧和尾帧控制,运动幅度和镜头控制等功能。尽管目前存在手部畸形、多人面部细节崩坏和不可控转场等问题,图森未来表示正在改进并在后续更新中修复。Ruyi旨在降低动漫和游戏内容的开发周期和成本,目前已开源,用户可通过Hugging Face下载。图森未来计划在下次发布中推出更多版本,以满足不同需求的创作者。
原文链接
本文链接:https://kx.umi6.com/article/10321.html
转载请注明文章出处
相关推荐
换一换
千问语音识别模型Qwen3-ASR开源!饶舌RAP歌曲也能轻松识别
2026-01-30 11:21:16
三部门:开展智能体与开源芯片、开源操作系统、开源大模型兼容适配
2026-05-08 18:36:29
超越 GPT-5 Nano,阿里通义 Qwen3-VL 系列全新成员 4B 与 8B 模型开源上线
2025-10-15 13:33:22
DeepSeek V4报告太详尽了!484天换代之路全公开
2026-04-25 12:10:04
阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一
2025-09-23 10:12:45
月之暗面新模型Kimi K2.6发布并开源
2026-04-21 09:55:37
Anthropic最先进模型Claude 5遭美国管制!智谱一句话太提气:股价暴涨32%
2026-06-15 18:06:28
北京人形开源最新VLM模型,推动具身智能再迈关键一步 !
2025-11-14 13:57:27
小米全面开源具身大模型MiMo-Embodied
2025-11-21 21:43:50
腾讯混元世界模型 1.1 版本发布并开源:单卡即可部署,秒级创造 3D 世界
2025-10-22 18:50:23
蚂蚁开源业内首个 100B 扩散语言模型 LLaDA2.0
2025-12-12 15:57:42
真如摄影、细至发丝!阿里开源新一代图像生成模型Qwen-Image
2025-12-31 21:40:29
对话Kimi付强:别把模型当宠物圈养,追逐AGI就要让模型与人类共同演化
2025-10-04 10:57:38
737 文章
923773 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47