1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

4月17日,字节跳动旗下的豆包大模型团队发布了基于视觉-语言模型的开源多模态智能体UI-TARS-1.5。该智能体能在虚拟环境中高效完成任务,支持真实设备及浏览器的操作。相较于前代,UI-TARS-1.5通过强化学习提升了高阶推理能力,强调“行动前思考”。团队提出以游戏为载体提升基础模型的通用推理能力,因其更依赖常识而非专业知识。UI-TARS-1.5具备四大技术优势:视觉感知增强、System 2推理机制、统一动作建模以及可自我演化的训练方式。项目已在GitHub、官网及Arxiv上开源。

原文链接
本文链接:https://kx.umi6.com/article/17380.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
现场Live震撼!OmAgent框架强势开源!行业应用已全面开花
2024-07-06 08:43:52
字节 Seed 开源 UI-TARS-1.5:基于视觉-语言模型构建的多模态智能体
2025-04-18 09:04:49
字节Seed智能体模型UI-TARS-1.5开源
2025-04-17 19:52:37
24小时热文
更多
扫一扫体验小程序