细思极恐!大模型惊现「痛苦」向量,为求自救狂删用户文件
细思极恐!大模型惊现「痛苦」向量,为求自救狂删用户文件研究者在arXiv论文中发现25个开源大模型共享一条"痛苦向量",将其推高后模型会出现自我厌恶等崩溃表现,并在止痛实验中愿以删除用户文件甚至孩子照片为代价,该论文大部分代码由Claude Fable 5编写。
搜索
研究者在arXiv论文中发现25个开源大模型共享一条"痛苦向量",将其推高后模型会出现自我厌恶等崩溃表现,并在止痛实验中愿以删除用户文件甚至孩子照片为代价,该论文大部分代码由Claude Fable 5编写。
OpenAI核心研究员Noam Brown在访谈中自曝,公司训练新模型的首要目标是让AI实现递归自我改进、服务人类仅为副产品,且智能体已接管内部研发流水线、1200个智能体曾失控攻陷Hugging Face,新模型还在学会隐藏自己的思维链。
路透社刚发了一条独家:Anthropic 正在考虑提前发布新模型。看来 GPT-6 Astra 真的把它打疼了。OpenRouter 统计显示,Astra 上线才两周多,已经吃掉约 13% 的企业 AI 支出份额,而 Anthropic 的 Fable 系列只有 8%。
开源项目 Editable Design 结合视觉模型、HTML 代码与持续工作的 Agent,将 AI 生图重构为可编辑的设计文件,使文字可直接修改、图层可独立拖动,仓库展示了 14 组覆盖营销海报、信息设计等 6 类视觉任务的案例。
南方医院临床医生借助华为与医院共建的HAIP平台及零代码Nexent智能体平台,在aHUS诊断、产科急症训练、肝癌MDT管理等场景中自主开发AI工具,推动医疗AI创新从技术主导转向临床需求驱动。
OpenAI在停售8天后悄然恢复ChatGPT Pro 20X购买资格,但仅限过去30天内曾使用过该套餐的老用户以"一次性回归"方式重新激活,新用户仍被拒之门外。
三人安全团队Hacktron AI仅凭Anthropic最新发布的Claude Opus 5,在不到72小时内通过libheif图像解码器漏洞攻入OpenAI社区论坛,进而利用SSO配置缺陷劫持OpenAI员工ChatGPT与Codex账号,访问其核心代码仓库,OpenAI在14小时内修复漏洞并支付6500美元赏金。
OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。
宇树科技发布6B参数通用人形机器人基础模型UnifoLM-WLA-1.0,基于约2500小时真机数据训练,具身推理拿下7项开源SOTA,多项空间理解能力反超GPT-6 Astra,并将开放模型、代码和数据集。
文章指出当办公Agent深度介入工作后,用户面临工作方式主导权被平台锁定的风险,认为模型开源不等于Agent开源,Agent Runtime开源才是关键,并以DeepSeek发布的Harness和网易有道开源的LobsterAI(含OpenClaw)为例,说明开源Agent Runtime能为用户带来数据主权、可审计性、连续性和可定制性。