标题:视频生成无损提速:删除多余token,训练时间减少30%,帧率越高效果越好
正文:
视频生成无损提速:删除多余token,训练时间减少30%,帧率越高效果越好
克雷西 发自 凹非寺
量子位 | 公众号 QbitAI
卡内基梅隆大学提出了一种名为Run-Length Tokenization(RLT)的视频生成模型加速方法,其精度几乎不受影响,但能显著提升训练和推理速度。
在精度几乎不变的前提下,RLT能使模型的训练时间缩短30%,推理速度提升67%。
RLT的核心原理是将视频中重复的图像块合并为一个token表示,并用位置编码表示这些token的长度,从而减少输入token的数量。
对于30fps视频,训练速度可提升1倍,长视频的训练token减少80%。
相比传统剪枝方法,RLT能以较小的精度损失实现更好的加速效果。
重复图像块合为一个token
RLT通过分块将视频划分为固定大小的图像块,然后比较相邻图像块的相似度,决定是否合并。
如果距离小于预设阈值,则认为这些图像块是重复的,并只保留第一个块对应的token。
合并后,每个token会添加长度编码,以保留完整视频信息。
最终,处理后的token序列被输入到视频Transformer中进行训练或推理。
训练时长下降30%
在训练阶段,RLT对不同规模的模型均有显著加速效果。
例如,在Kinetics-400上,ViT-B和ViT-L的训练时间分别从14.4小时和21.6小时降至10.2小时和15.4小时,精度损失不超过0.1个百分点。
在推理阶段,RLT几乎不牺牲精度,计算量和延迟降低30-60%。
对于30fps的视频,加速效果更为显著,可达100%。
论文地址:
https://arxiv.org/abs/2411.05222
代码:
https://github.com/rccchoudhury/rlt
原文链接
本文链接:https://kx.umi6.com/article/8849.html
转载请注明文章出处
相关推荐
换一换
国产全AI游戏来了?!大模型直出开放世界游戏,有声可交互
2024-12-16 09:26:36
MiniMax 发布视频生成工具 Hailuo 02,打破全球视频模型效果成本纪录
2025-06-19 09:45:37
OpenAI正式推出AI视频生成模型Sora 会员无需额外付费
2024-12-10 04:42:31
对比Sora与国产视频模型生成效果后,我对Sora祛魅了
2024-12-20 11:26:51
视频大模型画饼哪家强?Gen-3演示效果绝杀Sora
2024-06-20 09:51:53
无需训练、即插即用,新算法大幅增强视频生成质量|NUS&上海AI Lab&UT Austin
2024-12-25 22:14:22
中山大学梁小丹团队论文:让视频生成从「看起来真实」到「物理上正确」丨CVPR 2026
2026-03-30 14:53:39
下一代OpenClaw来了?“龙虾之父”称将率先支持阿里千问
2026-04-07 12:53:34
预定最强视频生成 AI 模型,OpenAI Sora 2 现踪迹
2025-07-24 11:05:38
阿里开源通义新模型:指定首尾图片生成视频
2025-04-18 12:13:31
腾讯AI视频生成曝光!与Sora同提示词PK,你来投票
2024-12-01 11:28:40
潞晨尤洋:视频生成的GPT-4时刻,3年后可以见证 | MEET 2025
2025-01-03 15:44:15
视频生成平台 Runway 举办年度 AI 电影节,6000 部参赛作品决出十强
2025-06-09 09:23:25
778 文章
957406 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47