AI资讯新闻榜单内容搜索-GEM

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: GEM
OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。

来自主题: AI资讯
8020 点击    2026-09-13 13:04
谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。

来自主题: AI资讯
9099 点击    2026-09-13 13:04
还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测

个性化在通用AI产品中一直是个加分项。无论是ChatGPT、Gemini还是Claude,还是今年的Openclaw、Harmes都把记忆和个性化当成核心卖点,理由是它能提高可用性、参与度和用户满意度。学术界对个性化的研究,也几乎全部集中在"如何做得更好、更准、更符合用户口味"上。

来自主题: AI技术研报
9163 点击    2026-09-10 15:17
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。

来自主题: AI技术研报
9492 点击    2026-09-06 11:05
谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。

来自主题: AI技术研报
5936 点击    2026-09-06 11:04
速递|AI云计算提供商Crusoe完成超30亿美元融资,估值300亿美元

速递|AI云计算提供商Crusoe完成超30亿美元融资,估值300亿美元

速递|AI云计算提供商Crusoe完成超30亿美元融资,估值300亿美元

AI云计算提供商Crusoe完成超30亿美元融资,估值达300亿美元,本轮由Atreides Management与Valor Equity Partners共同领投,Mubadala Capital参投。

来自主题: AI资讯
9122 点击    2026-09-05 10:51
CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。

来自主题: AI技术研报
7829 点击    2026-09-04 15:51
深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

深度|近3000家付费客户之后,这家创业公司如何把服装审美写进大模型?

过去两年,AI生图的参数量与清晰度完成了指数级跨越,但真正面向服装行业却依然面临一个极其尴尬的悖论——当GPT、Gemini等顶尖大模型在通用图像生成上大放异彩时,落地到服装产业的深水区,依然满屏是令人出戏的AI味。通用的SOTA模型做得到了“逼真”,却依然做不好“商业”。

来自主题: AI资讯
6754 点击    2026-09-03 14:34