综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
正文:2026年2月,11位顶尖数学家联合发布了一项名为First Proof的AI实验论文,引发广泛关注。该实验旨在测试当前AI系统能否独立解决10道未公开的研究级数学问题,覆盖代数组合学、谱图论等多个领域。这些问题由数学家从自身研究中提炼,避免了数据污染,并加密存储于特定网站,答案将于2月13日公开。实验显示,GPT 5.2 Pro和Gemini 3 Deepthink等顶级AI在一次性作答中难以解决多数问题,但作者认为通过人机协作可能提升表现。陶哲轩评价称,实验探索了AI在数学研究中的能力边界,未来还将设计更复杂的问题集,逐步评估AI在提出新问题和构建理论框架等高阶能力上的表现。
原文链接
10月19日,OpenAI研究人员因夸大GPT-5数学能力引发争议。管理层成员凯文・韦尔曾在社交媒体宣称,GPT-5解决了10个未解的埃尔德什问题,但数学家托马斯・布鲁姆指出这些所谓‘未解问题’实际已有答案。随后,相关推文被删除,研究人员承认错误。DeepMind CEO德米斯・哈萨比斯批评此举‘令人尴尬’,Meta AI负责人杨立昆讽刺OpenAI‘被炒作反噬’。事件凸显AI研究领域炒作与严谨性之间的矛盾。数学家陶哲轩认为,GPT-5的实际价值在于辅助文献检索等繁琐工作,而非解决复杂开放性问题,人类专家仍不可或缺。
原文链接
2025年,OpenAI的IMO金牌团队揭示其背后仅由三名核心开发者组成:Alexander Wei、Sheryl Hsu和Noam Brown,项目在竞赛前两三个月突击完成。模型成功攻克IMO难题被视为AI数学能力的重要里程碑,但在第六题上选择‘不作答’,显示出对自身能力边界的清晰认知。团队表示,这种行为避免了‘一本正经地胡说八道’,是AI的一大进步。此外,他们认为解决千禧年大奖难题仍遥不可及,因从1.5小时到数万小时思考时间的跨越难度极高。未来,团队计划将相关技术应用于更广泛的推理领域,并探索让AI学会‘提出问题’的能力。模型或开放供数学家使用,但具体细节仍在研究中。
原文链接
2025年国际数学奥林匹克(IMO)在澳大利亚落幕,AI领域迎来重要突破。OpenAI和DeepMind先后宣布其模型达到IMO金牌标准,分别获得35分,这是AI首次比肩顶尖高中生选手。OpenAI提前公布成绩引发争议,DeepMind则获IMO官方认证,但其金牌团队三名核心研究员已被Meta挖角。尽管AI取得显著进步,但专家认为这并非数学界的AlphaGo时刻,因72名人类选手同样达金牌标准,且AI仅解出5道题。此次突破证明语言模型可直接完成高难度数学推理,但仍存局限性。学术界对AI辅助数学研究褒贬不一,有人看好其潜力,也有人担忧数学自由探索精神被技术资本侵蚀。
原文链接
标题:清华与英伟达合作提出新算法:监督学习也能从错误中学习?
清华大学联合英伟达和斯坦福大学提出了一种名为NFT(Negative-aware FineTuning)的新监督学习方法。该方法基于RFT(Rejection FineTuning)算法,通过引入“隐式负向策略”来利用负向数据进行训练,从...
原文链接
无需数据标注!测试时强化学习,模型数学能力暴增159%!
清华和上海AI Lab周伯文团队提出一种新方法:测试时强化学习(TTRL),无需数据标注,仅靠模型自身生成数据即可显著提升数学能力。以Qwen-2.5-Math-7B为例,在AIME 2024竞赛题中的准确率从16.7%提升至43.3%,增幅...
原文链接
3月3日,科大讯飞宣布星火X1模型升级,数学能力全面对标DeepSeek R1和OpenAI o1。此次升级显著提升了数学答题效果,尤其在竞赛级难题上表现突出。星火X1在中小学数学作业批改、辅导及题目推荐等方面也有优势。此外,升级后的星火医疗大模型X1在医疗复杂场景推理上效果超过GPT-4o及DeepSeek R1,大幅降低医疗幻觉问题。星火教师助手也升级,实现AI教学思路更清晰详实,支持思维可视化。AI法官助理则提升了法律推理能力,贯穿案情分析、证据审查等环节。
原文链接
谷歌最新发布的Gemini模型(Exp 1114)在竞技场Imsys的评测中超越了OpenAI的o1模型,成为新的榜首。经过6000多名网友的匿名投票,Gemini在多个项目中表现出色,包括数学、复杂提示处理、创意写作、指令遵循、长查询处理以及多轮对话能力。尤其值得一提的是,Gemini在数学能力上与o1不分伯仲。尽管在编程方面表现一般,但其视觉能力突出,超越了GPT-4o。此外,Gemini拥有32k的上下文窗口,支持思维链功能。目前,该模型已在谷歌AI Studio上线,官方计划后续提供API。尽管一些用户对其表现持保留态度,但总体来看,这一成果让谷歌在AI领域再度领先。
摘要中的关键信息均保留,符合新闻三要素。摘要长度为213字。
原文链接
【新闻摘要】
OpenAI发布的新模型o1在lmsys排行榜上全面超越Claude和谷歌Gemini模型,成为数学领域的佼佼者。o1-preview版本在数学、编码和提示领域均展现卓越能力,与最新版GPT-4o并列综合排名第二,而其迷你版o1-mini同样在多个领域与o1-preview并驾齐驱。...
原文链接
标题:10行代码让大模型数学提升20%,开源研究受谷歌关注
关键信息:独立学者提出仅需10行代码就能大幅提升大模型数学能力20%的改进方案,名为"最小p采样"(min-p sampling)。此方法旨在平衡生成文本的连贯性和多样性,通过动态调整抽样阈值来实现。研究显示,该方法已在Mistral-7...
原文链接
加载更多
暂无内容