2025年10月4日,Thinking Machines发布论文《LoRA Without Regret》,探讨低秩适配(LoRA)在特定条件下媲美全参数微调(FullFT)的性能。研究表明,LoRA在小到中等规模数据集上表现与FullFT相当,但对大批量训练容忍度较低。关键发现包括:LoRA需应用于所有层(尤其是MLP/MoE层),且其学习率通常为FullFT的10倍。此外,在强化学习场景中,即使低秩LoRA也能达到FullFT的效果。研究旨在推动LoRA在定制化场景中的广泛应用,同时深化对机器学习基础问题的理解。更多详情见博客与论文链接。
原文链接
本文链接:https://kx.umi6.com/article/26250.html
转载请注明文章出处
相关推荐
换一换
Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调
2025-10-11 09:28:41
一句话生成任务专属LoRA!Transformer作者创业公司颠覆LLM微调
2025-06-13 18:12:01
不抢电、低耗水、还送免费Codex!OpenAI设法破解AI基建抵制
2026-07-24 00:12:30
世界模型“六小龙”在WAIC吵起来了!行业红利就在非共识里
2026-07-24 15:44:24
国内首个!阿里健康氢离子达成NEJM、JAMA、BMJ三大医学顶刊内容合作
2026-07-21 15:10:45
蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠
2026-07-20 13:09:45
阿里Qoder上线全新安全能力,为每位用户配备一位专属安全工程师
2026-07-21 14:07:01
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
2026-07-20 18:23:12
全球首发技术路线+全域联盟双轮破局,AI for ADANES释放先进核能新质生产力
2026-07-20 18:27:07
美图拿出1亿元,面向全行业寻找AI影像Builder
2026-07-23 02:22:56
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
2026-07-22 15:01:30
超越π0,中国团队用1B参数模型登顶具身智能榜单
2026-07-23 14:49:03
AI 终端混战:谁在做加法,谁在重写规则
2026-07-22 11:57:57
766 文章
824391 浏览
24小时热文
更多
-
2026-07-24 15:46:50 -
2026-07-24 15:45:36 -
2026-07-24 15:44:24