4月17日,字节跳动旗下的豆包大模型团队发布了基于视觉-语言模型的开源多模态智能体UI-TARS-1.5。该智能体能在虚拟环境中高效完成任务,支持真实设备及浏览器的操作。相较于前代,UI-TARS-1.5通过强化学习提升了高阶推理能力,强调“行动前思考”。团队提出以游戏为载体提升基础模型的通用推理能力,因其更依赖常识而非专业知识。UI-TARS-1.5具备四大技术优势:视觉感知增强、System 2推理机制、统一动作建模以及可自我演化的训练方式。项目已在GitHub、官网及Arxiv上开源。
原文链接
本文链接:https://kx.umi6.com/article/17380.html
转载请注明文章出处
相关推荐
换一换
中国信通院启动多模态智能体技术规范编制 AI智能体迎爆发元年
2025-03-11 08:17:41
英伟达发布 Eagle 2.5 视觉语言 AI 模型:8B 参数媲美 GPT-4o
2025-04-23 14:58:47
字节Seed智能体模型UI-TARS-1.5开源
2025-04-17 19:52:37
现场Live震撼!OmAgent框架强势开源!行业应用已全面开花
2024-07-06 08:43:52
中国信通院:正式启动多模态智能体技术规范编制工作
2025-03-10 18:51:48
多模态智能体加快发展:中国信通院启动技术规范编制 武汉同步发力
2025-03-10 20:56:24
中国信通院:正式启动多模态智能体技术规范编制工作 将召开技术规范研讨会
2025-03-10 17:53:32
字节Seed开源长线记忆多模态Agent,像人一样能听会看
2025-08-18 16:49:59
英伟达发布 Llama Nemotron Nano VL AI:高效精准,攻克复杂文档解析难题
2025-06-05 08:46:44
AI Agent的门票 MiniMax想先打下来
2026-06-04 17:17:31
CVPR 2026完美落幕!D4RT封神最佳论文、牛津VGG两连冠,中国本科生泰坦显卡逆袭引爆全网
2026-06-08 16:37:30
刚刚,李飞飞亲自下场定义世界模型
2026-06-04 09:56:31
波恩大学 Maren Bennewitz 教授:让机器人在遮挡世界中主动获取信息 | ICRA 2026
2026-06-05 19:22:55
787 文章
659293 浏览
24小时热文
更多
-
2026-06-09 00:54:40 -
2026-06-09 00:53:08 -
2026-06-08 23:49:41