工具调用 - AI优秘圈

综合

7*24 快讯

AI科普

合作

全部

英雄令

项目方

开发者

产品方

投资者

那个用半成品刷爆SOTA的Qwen3超大杯推理版，现在正式上线

2026年1月，阿里千问正式发布Qwen3-Max-Thinking超大杯推理版模型，刷新全球SOTA表现。该模型在科学知识、数学推理、代码编程等19项基准测试中超越GPT-5.2-Thinking、Claude-Opus-4.5等顶级闭源模型。其参数规模超万亿，预训练数据量达36T Tokens，并通过自适应工具调用和测试时扩展技术显著提升推理性能与工具调用能力。实测显示，Qwen3-Max-Thinking可完成复杂代码任务（如手势识别小游戏）和数据分析（如内存涨价研报生成）。此外，中国开源AI模型下载量已超美国，千问系列衍生模型突破20万个，下载量超10亿次，成为全球开源标杆。目前，该模型已上线千问APP及API接口，全面接入淘宝、支付宝等阿里生态业务，为垂直领域应用提供更多可能性。

原文链接

Nebula

01-27 00:41:43

Qwen3-Max-Thinking

SOTA

自适应工具调用

分享至

打开微信扫一扫

内容投诉

生成图片

全球首个开源“重思考”模型：美团 LongCat-Flash-Thinking-2601 发布，工具调用能力登顶开源 SOTA

2026年1月16日，美团LongCat团队发布并开源全球首个支持“重思考”模式的模型LongCat-Flash-Thinking-2601。该模型在工具调用、智能体搜索等核心评测中达到开源SOTA水平，尤其在复杂任务中的泛化能力超越Claude，显著降低新工具适配成本。其创新的“重思考”模式通过并行思考和总结归纳两阶段优化推理过程，确保决策可靠。评估显示，该模型在编程（LCB评分82.8）、数学推理（AIME满分）、工具调用（τ²-Bench评分88.2）及搜索能力（BrowseComp评分73.1）等方面表现领先。此外，美团设计全新自动化任务合成流程验证模型泛化能力，实验结果优异。模型已完整开源，支持在线免费体验，并提供GitHub、Hugging Face等多个平台访问链接。

原文链接

WisdomTrail

01-16 14:36:37

LongCat-Flash-Thinking-2601

工具调用

重思考模式

分享至

打开微信扫一扫

内容投诉

生成图片

豆包大模型 1.6-vision 发布：家族首个能调用工具的视觉深度思考模型

10月1日，火山引擎发布豆包大模型1.6-vision，这是豆包家族首个支持工具调用的视觉深度思考模型。新模型具备更强的多模态理解与推理能力，可精准处理图片定位、剪裁等操作，模拟人类视觉推理过程，提升图像操作效率和可解释性。相比上一代Doubao-1.5-thinking-vision-pro，综合成本降低约50%，32K输入输出场景价格从5.25元降至2.6元。今年6月，火山引擎曾推出豆包1.6版本，强化复杂场景理解能力，本次升级进一步满足客户在视觉理解领域的高阶需求。

原文链接

QuantumHacker

10-01 15:45:42

工具调用

视觉深度思考

豆包大模型

分享至

打开微信扫一扫

内容投诉

生成图片

豆包大模型1.6-vision正式发布

9月30日，火山引擎正式发布豆包大模型1.6-vision。这是豆包大模型家族首个具备工具调用能力的视觉深度思考模型，具备更强的通用多模态理解和推理能力，并支持Responses API，能够以更高性价比满足客户在视觉理解精准度上的高阶需求。相比上一版模型Doubao-1.5-thinking-vision-pro，新版本综合成本降低约50%。这一更新显著提升了性能和经济性，为用户带来更优体验。

原文链接

代码编织者

09-30 16:34:50

工具调用

视觉理解

豆包大模型

分享至

打开微信扫一扫

内容投诉

生成图片

智谱开源GLM-4.5工具调用超越Claude Opus 4.1，成本仅1.4%

2025年9月，智谱开源模型GLM-4.5在伯克利工具调用榜单上超越Claude Opus 4.1，运行成本仅为1.4%。该模型采用MoE架构，在前端开发、跨文件修改等场景表现优异，编程能力接近Claude 4。通过CC-Bench评测体系对比，GLM-4.5在任务完成效果和工具调用可靠性方面表现出色。研究科学家Tim Dettmers称其推理速度比Opus 4.1快3倍、比GPT-5快5倍。此外，智谱推出Claude Code套餐，价格为Claude的1/7，适用于GLM-4.5及GLM-4.5-Air，进一步降低使用门槛。GLM-4.5已接入多款主流编程工具，支持全面开发流程，为开发者提供高性价比选择。

原文链接

量子思考者

09-02 12:30:05

Claude Opus

GLM-4.5

工具调用

分享至

打开微信扫一扫

内容投诉

生成图片

腾讯混元推出首款开源混合推理模型，擅长Agent工具调用和长文理解

6月27日，腾讯混元推出首款开源混合推理模型Hunyuan-A13B，该模型参数总量为80B，激活参数仅13B，具备强大的通用能力，在多个权威数据测试集中表现优异。Hunyuan-A13B支持Agent工具调用和长文理解，拥有256K原生上下文窗口，适用于多种复杂任务。模型已在GitHub和Huggingface开源社区上线，并提供API接口供开发者快速接入部署。此外，腾讯混元还开源了两个新数据集ArtifactsBench和C3-Bench，用于评估大语言模型在代码生成和Agent场景中的能力。

原文链接

智能视野

06-27 17:11:39

Agent工具调用

混合推理模型

腾讯混元

分享至

打开微信扫一扫

内容投诉

生成图片

苹果大模型新成果：GPT-4o扮演用户，在场景中考察大模型工具调用，网友：Siri也要努力 | 开源

苹果团队最新发布的开源成果——名为ToolSandbox的模型工具调用能力评估基准，采用创新的场景化测评方法，旨在更好地展现模型在真实环境中的水平。该基准引入了对话交互、状态依赖等传统标准未覆盖的重要场景，显著提高了评估的全面性和实用性。ToolSandbox通过让GPT-4o扮演用户与模型进行交互...

原文链接