▸ Google发布Gemini 2.5 Pro Deep Think,GPQA Diamond 82.4%超越Fable 5和GPT-5.5,科学推理重回第一。MMLU-Pro 89.8%为公开最高,HumanEval+ 94.1%破纪录。@buildfastwithai
▸ GPT-5.6(代号kindle-alpha)预测市场概率83%,月底前或发布。传言1.5M上下文窗口,重写奖励模型审计管道以修复"地精事件"对齐失败。@buildfastwithai
▸ Anthropic以$4亿全股票收购Coefficient Bio,推出Claude for Life Sciences和Claude for Healthcare,正式进军药物发现和临床诊断。@thenextweb
▸ Andrej Karpathy加入Anthropic预训练团队,任务是用Claude加速Claude自身的训练研究("模型加速模型"),已有John Jumper等三位DeepMind大将接连转投。@buildfastwithai
▸ 大模型的ROI定律:资源有限时算力流向边际收益率最高的地方。别盯着定价,要算它帮你省了多少时间。@aigc1024
总结:Google用Deep Think扳回一局,但人才外流威胁长远格局。本月底GPT-5.6若如期发布,模型大战将进入白热化。