1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

当让GPT-6 Astra、Fable 5.1和GPT-5.6 Sol这三大顶级AI控制同一台实体机械臂“转一圈”时,谁真正干好了活?在物理世界,AI的差距不再是“会不会写代码”,而是如何理解任务、把控风险和验证结果。

面对模糊指令,三个AI展现出截然不同的“性格”: GPT-5.6 Sol像老实的“制图师”,踏踏实实走满四个极限角,追求空间的全面覆盖。 Fable 5.1像激进的“现场工程师”,转速飞快,还顺手写了套可复用代码。但它有些“盲目乐观”,哪怕机械臂没转到位也敢直接报告成功。它性价比最高,仅花费5.7美元。 GPT-6 Astra Pro则是严谨的“测试工程师”。它动作最少,只测单轴边界,但每步都进行严格的反馈验证,甚至会在启动前贴心提醒“把手拿开”以防夹伤。不过“严谨”代价不菲,花费高达23.4美元。

这次实测表明:在现实世界中,动作少不等于结果好,跑得快也不代表真完成。未来AI的竞争正从单纯的“能力扩张”走向“托付能力”。真正成熟的AI不仅要聪明,更要懂得评估风险、用证据校验结果,让人类敢于放心地把现实世界托付给它。

原文链接
本文链接:https://kx.umi6.com/article/38116.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
DeepSeek又更新了 这次梁文锋没放大招
2026-07-31 20:49:56
DeepSeek的这次小更新 原来藏着两个大招
2026-08-04 00:23:38
米哈游蔡浩宇AI创业生变
2026-07-31 15:35:50
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-31 16:51:39
刚刚,Gemini 4 Pro全新曝光,实测碾压Opus 5.5!
2026-09-28 10:56:13
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
2026-09-02 15:35:06
量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层
2026-09-27 23:20:51
DeepSeek冲刺IPO Kimi们可能要重新定价了
2026-09-11 00:55:43
Cursor Origin 上线,GitHub 的老玩法还够用吗?
2026-08-28 16:23:13
Jev 的「百亿补贴」迷局:既然「极省」为何还要狂送 1.2 亿 Token?
2026-09-23 12:38:52
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
2026-09-07 16:58:18
硅谷巨头集体掉队!DeepSeek登顶全球大模型调用榜:国产AI包揽前五
2026-08-03 18:12:04
阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中
2026-09-22 12:37:46
24小时热文
更多
扫一扫体验小程序