综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
2026年7月17日,百度文心助手任务Agent以最高分94.6%、平均分94.4%的成绩,登顶全球工程向AI智能体评测榜单PinchBench v2,成为首个获该榜单总榜第一的国产智能体,超越了Claude、通义千问及GPT等模型。该榜单重点考察智能体在数据分析、代码开发等真实场景中完成任务并交付结果的能力。文心助手依托百度搜索猎户座AI引擎的多智能体框架,展现了模型与系统工程协同的综合实力,让AI能自主执行复杂任务链。目前,其核心技术已全面应用于百度App及文心助手,用户可在线体验全球冠军智能体的高效服务。
原文链接
2026年3月,龙虾(OpenClaw)适配模型的推荐榜单PinchBench引发关注。该榜单由创业团队Kilo AI推出,从成功率、速度、价格三个维度评估全球大模型对OpenClaw的适配表现,并实时更新。截至发稿,中国模型在成功率和速度上表现突出,如MiniMax M2.1和Kimi K2.5分列成功率第二、第三,MiniMax M2.5更在速度榜夺冠;但在价格方面稍显劣势,较GPT-5-nano等国际模型高出约3倍。PinchBench专注于真实任务测试,包含查询资料、写邮件等23项任务,采用自动化检查与LLM评审结合的方式评分。榜单完全开源,用户可自行运行或添加任务,为选型提供参考。
原文链接
加载更多
暂无内容