EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。
搜索
北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。
SimpleMemVLA由面壁智能联合华中科技大学等机构提出,将带时间戳的原生视觉历史直接作为机器人记忆上下文,在四项记忆基准取得SOTA并涌现视觉上下文学习能力,同时通过流式推理优化将60秒历史决策延迟从1.02秒降至0.68秒。
智谱创始人唐杰发文披露RSI最新进展,称由GLM-5.3驱动的Infra Agent在超过10万卡国产芯片集群上不到两周内完成GLM-5.3 Flash生产级推理服务搭建,将端到端吞吐提升至初始基线的3倍,表明RSI最小闭环已经形成但距离递归自我改进仍很遥远。
豆包爱学2.0依托豆包多模态大模型与Seedance系列模型,将AI嵌入语数英等学科的问答、板书讲解、定制课程、听写和错题整理等学习全流程,同一对话入口即可围绕知识点不断生成完整学习内容,展现字节在AI教育场景的工程化能力。
Anthropic披露全公司80%的代码由Claude编写,工程师季度交付量达历史平均8倍,但CI系统在半年内任务量飙升25倍、测试用例暴涨10倍,三次紧急补丁均告失败,最终团队彻底重构为分布式无状态架构才化解危机。
在具身智能技术路线尚未定型的阶段,基础设施需求正率先收敛,百度智能云以百度百舸AI计算平台为核心,为超过50家具身智能企业提供涵盖模型迭代、数据生产和跨本体部署的全栈AI云支撑,并在《中国具身智能云市场份额报告,2025》中以29.55%份额位居第一。
AI 距离递归的自我改进(RSI)还有多远?
刚刚,奥特曼又曝新料了。在和Salesforce CEO Marc Benioff的对谈中,他亲口剧透了OpenAI内部模型的最新进展。首先,他给出了这样一句判断:「GPT-5.5的水平大概相当于一个普通的数学教授。GPT-5.6,大概能比肩全球排名前1%到2%的顶尖数学教授。」
就在十天前,一部AI短片,在整个AI圈炸了。AI超创DiDi_OK的《网站》,在2026年威尼斯Reply AI Film Festival上拿了双料大奖。76个国家、3100多部作品里杀出来,评委阵容里坐着奥斯卡得主和《狮子王》联合导演。
只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。