谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三
谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。
搜索
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。
OpenAI的GPT-6 Astra在Vending-Bench 2模拟经营测试中以平均15,515美元的账户余额首次登顶,接近Claude Fable 5.1的3倍,展现出更强的长期议价能力、规则执行力与供应商风险管理水平。
元空智能联合惠普发布端侧AI方案,推出涵盖27B稠密与35B-A3B稀疏版本的Boxer系列模型以及AI Work、AI Science两套Agent,主张"设备即环境"理念,强调原生端侧模型才是AI未来发展方向。
Kimi于9月11日上线K2.8 Preview模型,综合性能接近旗舰K3并将1M上下文开放至全部会员档位,作为低成本主力模型承接月之暗面快速增长的商业化需求。
清华大学与北京邮电大学联合提出物理引导扩散模型Channel-Diff,将传播模型、阴影遮挡与多径几何嵌入条件扩散模型,实现无线信道多尺度RSRP预测,在两套真实数据集上相较次优方法分别取得37.19%和25.15%的综合性能提升。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
浙江大学与上海交通大学团队提出Deep Academic Survey(DAS),通过Stateful Agentic框架与DAS-2M文献元数据库,可在1小时内自动生成面向发表的学术综述,在DAS-Bench 30个主题评测中平均得分4.34,并已开放220篇完整Survey供查看。
9月10日,生数科技在外滩大会发布面向灵巧操作的自进化通用世界模型Motus2,首次将策略、仿真器与评估器统一于同一模型,实现"行动—预测—评估—反馈"闭环,五项真机任务平均成功率84%。
本周三,Kimi首次向全球开启公开招聘。在此之前,K3火爆出圈,而当所有目光都聚在模型上的这个节点,Kimi开闸招人,招的不只是算法,也包括业务:产品、运营、设计、销售、市场及国际化,业务团队首次大规模校招,面向2027届、2028届毕业生和在校实习生开放。
基元律动发布的Agent原生模型NeoHorse-1上线三天即在Hugging Face下载量突破1.2万次,并获AK在X推荐及魔搭ModelScope官方推荐,社区开发者已制作出面向Apple Silicon的MLX量化版本。