综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
2026年1月16日,美团LongCat团队发布并开源全球首个支持“重思考”模式的模型LongCat-Flash-Thinking-2601。该模型在工具调用、智能体搜索等核心评测中达到开源SOTA水平,尤其在复杂任务中的泛化能力超越Claude,显著降低新工具适配成本。其创新的“重思考”模式通过并行思考和总结归纳两阶段优化推理过程,确保决策可靠。评估显示,该模型在编程(LCB评分82.8)、数学推理(AIME满分)、工具调用(τ²-Bench评分88.2)及搜索能力(BrowseComp评分73.1)等方面表现领先。此外,美团设计全新自动化任务合成流程验证模型泛化能力,实验结果优异。模型已完整开源,支持在线免费体验,并提供GitHub、Hugging Face等多个平台访问链接。
原文链接
10月1日,火山引擎发布豆包大模型1.6-vision,这是豆包家族首个支持工具调用的视觉深度思考模型。新模型具备更强的多模态理解与推理能力,可精准处理图片定位、剪裁等操作,模拟人类视觉推理过程,提升图像操作效率和可解释性。相比上一代Doubao-1.5-thinking-vision-pro,综合成本降低约50%,32K输入输出场景价格从5.25元降至2.6元。今年6月,火山引擎曾推出豆包1.6版本,强化复杂场景理解能力,本次升级进一步满足客户在视觉理解领域的高阶需求。
原文链接
9月30日,火山引擎正式发布豆包大模型1.6-vision。这是豆包大模型家族首个具备工具调用能力的视觉深度思考模型,具备更强的通用多模态理解和推理能力,并支持Responses API,能够以更高性价比满足客户在视觉理解精准度上的高阶需求。相比上一版模型Doubao-1.5-thinking-vision-pro,新版本综合成本降低约50%。这一更新显著提升了性能和经济性,为用户带来更优体验。
原文链接
2025年9月,智谱开源模型GLM-4.5在伯克利工具调用榜单上超越Claude Opus 4.1,运行成本仅为1.4%。该模型采用MoE架构,在前端开发、跨文件修改等场景表现优异,编程能力接近Claude 4。通过CC-Bench评测体系对比,GLM-4.5在任务完成效果和工具调用可靠性方面表现出色。研究科学家Tim Dettmers称其推理速度比Opus 4.1快3倍、比GPT-5快5倍。此外,智谱推出Claude Code套餐,价格为Claude的1/7,适用于GLM-4.5及GLM-4.5-Air,进一步降低使用门槛。GLM-4.5已接入多款主流编程工具,支持全面开发流程,为开发者提供高性价比选择。
原文链接
加载更多
暂无内容