11月27日晚 ,DeepSeek悄悄地在Hugging Face 上开源了一个新模型:DeepSeek-Math-V2。这是一个数学方面的模型,也是目前行业首个达到IMO(国际奥林匹克数学竞赛)金牌水平且开源的模型 。
在同步发布的技术论文中,DeepSeek表示,Math-V2的部分性能优于谷歌旗下的Gemini DeepThink ,并展示了模型在IMO-ProofBench基准以及近期数学竞赛上的表现。
具体来看,在其中的Basic基准上,DeepSeek-Math-V2 远胜其他模型 ,达到了近99%的高分,而排在第二的谷歌旗下Gemini Deep Think (IMO Gold)分数为89%。但在更难的 Advanced 子集上,Math-V2分数为61.9% ,略逊于 Gemini Deep Think (IMO Gold)的65.7%。
在这篇名为《DeepSeek Math-V2:迈向可自验证的数学推理》的论文中,DeepSeek指出,大语言模型已经在数学推理方面取得了重大进展 ,这是人工智能的重要试验台,如果进一步推进,可能会对科学研究产生影响 。
但当前的AI在数学推理方面有着研究局限:以正确的最终答案作为奖励 ,正确的答案却不能保证正确的推理。许多数学任务,如定理证明,需要严格的分步推导,而不是数字答案 ,这使得最终答案奖励不适用。
为了突破深度推理的极限,DeepSeek认为有必要验证数学推理的全面性和严谨性 。团队提出,自我验证对于扩展测试时间计算尤为重要 ,特别是对于那些没有已知解决方案的开放问题。
此次DeepSeek推出的Math-V2就从结果导向转向了过程导向,展示了强大的定理证明能力。这一模型不依赖大量的数学题答案数据,而是通过教会AI如何像数学家一样严谨地审查证明过程 ,从而在没有人类干预的情况下,也能不断提升解决高难度数学证明题的能力 。
论文提到,Math-V2在IMO 2025和CMO 2024上取得了金牌级成绩 ,在Putnam 2024上通过扩展测试计算实现了接近满分的成绩(118/120)。
DeepSeek认为,虽然仍有许多工作要做,但这些结果表明 ,可自我验证的数学推理是一个可行的研究方向,可能有助于开发更强大的数学AI系统。
对于DeepSeek此次的动作,海外的反应是“鲸鱼终于回来了 ” 。有网友感慨,DeepSeek以10个百分点的优势击败了谷歌的IMO Gold 获奖模型DeepThink ,这不在预测范围内。“想象一下,当他们公布编程模型时会发生什么,我打赌他们绝对有编程模型。”
目前 ,行业头部厂商的模型已经又迭代了一轮,11月,先是OpenAI发布了GPT-5.1 ,几天后xAI发布Grok 4.1,就在上周谷歌发布了Gemini 3系列引爆AI圈,“也该轮到DeepSeek出牌了” 。不过 ,更受外界关注的仍然是,DeepSeek的旗舰模型到底什么时候更新,行业期待“鲸鱼”的下一个动作。
东财图解·加点干货(文章来源:第一财经)
中国股票配资网官网:正规的杠杆炒股平台-AI模型首次出现“抗命不遵”!AI安全公司称OpenAI o3模型出现异常
股票网炒股配资开户:比较靠谱的股票杠杆平台-“王者归来”之后 谷歌再下重注:世界模型将迎来“ChatGPT时刻”
股票杠杆平台股:股票配资炒股交流-上交所:本周对天普股份、上纬新材等波动幅度较大的股票进行重点监控
使用杠杆炒股是什么意思:我要配资网平台-股市“捉妖”!量化私募跑路真相曝光 利用FOF进行场外配资、操纵市场
股票加杠杆具体步骤:炒股入门知识配资平台-全球一年卖出5000多万台!罗马仕凌晨1点突然发通知:停工停产放假!
没上市的公司怎么买股票:杠杆炒股配资平台-全球首款全景无人机来了 指哪飞哪 “人机合一”
在线配资门户,安全高效的股票配资平台提示:文章来自网络,不代表本站观点。
4月25日晚,诺德股份(600110.SH)公告称,因涉嫌未按规定披露关联交易等违法违规行为,中国证监会决定对公司实际控...
国务院新闻办公室9日发布《关于中美经贸关系若干问题的中方立场》白皮书,澄清中美经贸关系事实,阐明中方对相关问题的政策立场...
记者闫桂花 王珍中国社会科学院学部委员、中国社会科学院原副院长高培勇周日在“中国发展高层论坛2025年...
3月12日,汇丰发布对于中国投资市场的最新观点。汇丰环球私人银行及财富管理中国首席投资总监匡正表示,DeepSe...
3月24日,易方达国证自由现金流ETF公开发售。该产品跟踪国证自由现金流指数,这个指数是什么?有哪些优势?投资价值如何?...