Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
搜索
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
红杉中国、真格基金等投资机构开始主动关注B站UP主,B站"AI创造公开赛"吸引1.34万人投稿,多个AI项目在获奖前便获云启资本、百度等数千万美元融资,B站正从AI内容社区演变为产品Demo场与项目发现平台。
北京航空航天大学史振威与邹征夏教授团队开发了面向广域地球观测的生成式基础模型MetaEarth3D,只需给定文字或卫星图即可生成无界连续一致的三维世界场景,并自带空间标注使空天AI模型空间理解能力平均提升22.85%。
ChatGPT面向在读大学生推出4个月免费Plus优惠(截止10月31日),本文实测两种领取方法,详解SheerID学生身份验证、Plus订阅及激活领取的完整流程,并建议在当前订阅快到期时再激活以避免覆盖已付费月份。
OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
清华姚班出身的彭天翼带队,Anthropic旗下Claude仅用11天、消耗60亿Token和1300万行代码,首次端到端形式化证明了困扰数学界350年的费马大定理,并产出29500条可验证中间定理,成为迄今为止最大的Lean证明。
Physical Superintelligence(PSI)完成5800万美元(约3.9亿元人民币)种子轮融资,由比尔盖茨牵头的Breakthrough Energy Ventures领投,旨在打造由AI"虚拟物理学家"组成的物理实验室,核心产品Emmy已落地数据中心优化等场景。
AI云计算提供商Crusoe完成超30亿美元融资,估值达300亿美元,本轮由Atreides Management与Valor Equity Partners共同领投,Mubadala Capital参投。