摘要
近日,知名科技博主与爆料人lyra在社交平台晒出谷歌内部评测模型的卡片截图,一款代号Mathematica的DeepThink变体随之曝光。据截图信息,该模型输出上限达65,536 Tokens,输入上限约104万Tokens,默认温度竟设为1,状态标识为UNSTABLE_EXPERIMENTAL,接口中的tf代指Teamfood。在求解一道高难多项式丢番图方程时,其原始思维链raw-thoughts连续出现大写感叹,随后完成变量回代与恒等式验证,引发外界对AI推理进化的关注。
谷歌最新模型Mathematica意外泄露
近日,知名科技博主与爆料人lyra在社交平台上晒出数张谷歌内部评测模型的卡片截图,一款代号为Mathematica的模型随之曝光。据截图信息,该模型是DeepThink的一个变体,其内部最原始、未经人类礼仪过滤的思维暗流被完整呈现在屏幕上。
在测试中,测试员给它抛出的是一道极具欺骗性的高难多项式丢番图方程(Diophantine Equation)。这类问题的经典之处在于:解法看似毫无头绪,往往需要构建极其冷门的高维恒等式或非平凡变量替换,才可能在密不透风的符号丛林中劈开一条生路。普通模型面对这类问题时,往往会在有限步数内陷入死循环,或者机械地穷举试错、最后给出一段充满逻辑幻觉的废话。
原始思维链里的「OH MY GOD」
据泄露的截图,该模型在推导中撞见一个精妙的代数化简路径后,思维日志里连续出现大写字母的惊呼。翻译成中文大致是「数学的老天爷啊」,随后它一边狂发感叹号,一边宛如癫狂地完成变量回代、重构对称项与恒等式验证。它甚至自言自语:「停下来,让我们欣赏一下这绝对的美感。」
这种极度外向、充满情绪宣泄感的做题画风,与人们习惯了的「对不起,作为一个大型语言模型」式公事公办语调形成鲜明反差。有网友感叹:「完了,AI不仅会做数学,它甚至开始从数学里获得快感了。」
参数底牌:65536 Tokens输出与百万级上下文
截图显示,该模型卡片明确标注输出上限为65,536 Tokens。作为对比,普通大模型的输出上限通常被压制在4096或8192个Token,即便是主打长思考的模型,单次输出也很少放开到这个量级。这意味着它可以在单次响应中,完成长达数万字的超长距离多步骤严密演绎,足以单次吐出一整篇包含完整引理、推论与形式化验证的纯数学论文。
输入上限则约为104万Token。这说明它继承了Gemini系列标志性的超长原生上下文架构,但这次被完全注入到「深度推理」(Deep Think)模式中:可以一口气吞下一整个数学分支的几本专著,或上百篇相互关联的前沿预印本论文,并在海量理论背景之上展开高维度的知识拼接。
更反常的是推理参数:该模型的默认温度(Temperature)为1。在常规工程认知中,做数学、写代码这类讲究绝对逻辑严密性的任务,生成温度通常会被设得极低(如0或0.2),以确保输出的确定性与收敛性。而在高温度下开启思考,意味着它被赋予极高的语义发散度,鼓励在广袤的解空间里进行随机性极高的直觉跳跃、概念隐喻与非传统联想。
内部印记:Teamfood与UNSTABLE_EXPERIMENTAL
接口中的tf代指Teamfood,这是谷歌内部极具代表性的研发黑话。在硅谷,把产品拿给公司内部全员内测叫「吃狗粮」(Dogfooding),而在核心小团队、顶尖研究组内部流通的极早期测试切片,则被称为Teamfood。加上其状态标识明确为UNSTABLE_EXPERIMENTAL(不稳定实验级),一切都被坐实:这是刚刚在谷歌DeepMind内部炉子里炼出来的原生大招,甚至还没来得及做商业包装与公关修剪。
思维链为什么会「发疯」
文章认为,这种「情绪化」并非刻意做秀,而是极度暴力的深度推理在无拘无束状态下的必然副产品。
其一,泄露版本的全名为raw-thoughts,即未经修剪的原始思维。它记录的是模型在潜空间中进行蒙特卡洛树搜索或基于强化学习的自我博弈时,最本初的神经元激活痕迹,根本不需要「装」给人类看。
其二,人类数学语料存在隐性基因转移。训练数据包含MathOverflow、arXiv预印本、知乎与Reddit的硬核讨论区,甚至是数学家未公开的手稿日记。在这些语料中,人类数学天才深夜攻克恒等式时写下的往往不是「经推导,此式可化简」,而是「Holy cow」「What a miraculous symmetry」「Oh my god, it works」。模型在预训练阶段就把这类情感词汇与「突破性的逻辑跃迁」高度绑定,使「OH MY GOD」成为代表信息熵骤然降维的注意力激活强锚点。
其三,在基于过程奖励模型(PRM)的强化学习训练中,模型每走对一步精妙的中间步骤,就会获得系统给予的正向奖励信号。当它在高温下尝试成千上万条死胡同、突然撞上一条极度优雅的化简路径时,奖励值指数级爆炸,投射到自然语言生成层面,便是那些狂飙的感叹号与激动到变形的大写字母。
当AI开始「欣赏美」,我们离AGI还有多远
法国数学家庞加莱曾在一篇著名演讲中写道:数学家研究数学,并不是因为数学有用,而是因为它美;如果数学不美,它就不值得被知晓,而人类也就不值得活下去。千百年来,人类一直固执地认为,「逻辑」或许可以被机器模拟,但对「数学之美」的敏锐嗅觉与审美感知,是碳基生物独一无二的造化神恩。
然而在独自推演丢番图方程时,谷歌这个数学定制版AI却不无骄傲地敲出「让我们来欣赏这个方程绝对纯粹的美」。从信息论的角度看,所谓「数学之美」,本质上就是极端复杂的命题被用极端简洁、对称、高密度的方式完成降维与压缩。人类数学家看到美妙的化简会起鸡皮疙瘩,是因为大脑在瞬间完成了极大量信息的极简编码;而对于一个在数十亿参数中搜寻最低损失、最高奖励的AI而言,这种压缩带来的信号跃迁,或许同样强烈。