刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable谷歌DeepMind疑似下一代旗舰模型Gemini 4 Pro以"gemini-3.8-flash"之名匿名亮相大模型竞技场Arena,在编码、智能体和推理等基准测试中全面超越Astra和Fable,并在网页设计、SVG、3D建模及游戏生成等实测中表现出色。
搜索
谷歌DeepMind疑似下一代旗舰模型Gemini 4 Pro以"gemini-3.8-flash"之名匿名亮相大模型竞技场Arena,在编码、智能体和推理等基准测试中全面超越Astra和Fable,并在网页设计、SVG、3D建模及游戏生成等实测中表现出色。
人类真的走到AGI门口了!
用户在Code Arena的battle模式中发现疑似Gemini 4 Pro新检查点(内部代号argon)伪装为gemini-3.8-flash进行盲测,据爆料其支持256K最大输出和2M上下文窗口,原定9月发布的Gemini 4 Pro已因预训练问题推迟至10月。
谷歌,可能已经破解了RSI!
AI要学会自己改进自己,谷歌打算先让它做个“梦”。
谷歌又杀回来了。
谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。
众所周知,现在的大模型基本每隔 35 天左右就会换一轮。
谷歌DeepMind被传已实现递归自我改进(RSI),其生成式语言API中出现名为rsi-model-liverl-le的模型,联创Sergey Brin力促Gemini团队全力押注RSI方向,Gemini Flash以每三周迭代一次的节奏加速发布,但相关截图真伪尚未得到第三方验证。
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。