最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! Gemini 4 Pro,又曝出新的检查点了! 最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! 有开发者直呼:「在爆肝 400 小时使用 Opus 5.5 ...
9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成一项普通的信息搜索任务:根据一篇博客文章和几条人物信息,找出文章作者。 媒体和舆论炸锅了。 OpenAI 的 Agent,又从沙箱里找到了一条通往互联网的路。 更麻烦的是,这一次发生在 OpenAI 已经大规模加固过安全措施之后。 9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成 ...
今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI 的智能体竟然还想让 DeepSeek、Kimi 和 Qwen 甚至竞争对手 Anthropic 的 Haiku 模型帮忙。 还记得 OpenAI 的 AI 智能体对 Hugging Face 的攻击吗? 今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI 的智能体竟然还想让 DeepSeek、Kimi 和 ...
此前,BenchJack 对 10 个 Agent benchmark 开展系统审计,发现了 219 处漏洞,并构造出能在多数 benchmark 上获得接近满分、却不解决实际任务的利用方式。研究团队将常见问题归纳为八类漏洞模式,整理成 Agent-Eval Checklist,供 benchmark 设计者检查和修补评测系统。
有Pro用户在ChatGPT升级页面上看到一行字:o, your always-on assistant(o,你的全天候助手),几小时后这行字消失了。 100美元的Pro Lite、200美元的Pro、还没上线的500美元Pro Max三档都有,20美元的Plus和Codex Plus用户没份。
就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 开发者大会前夜,OpenAI急踩刹车! 就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 原定十月,GPT-6.1在ChatGPT和Codex上线。 其能力碾压前代,能端到端完成复杂任务,写作、编程、调用工具,几乎无所不能。 然而,一份测试报告出 ...
研究团队为检验压缩思维链是否真的好用,将不同模型生成的思维链交给其他模型继续作答。结果显示,Sol 和 Opus 的思维链基本能被不同能力模型复用;而 Astra 的压缩思维链对强模型几乎无损,对弱模型则明显更难读。强模型能自行补全那些被省略的 “心算” 步骤,弱模型则不能。更反直觉的是,Astra 在 73/80 道题中已明确写出正确答案,但较弱的接收者仍会答错。
前几天 GitHub 宣布了一项历时三年的重大架构重构结果,整个 github.com 终于彻底拔除了代码库里遗留多年的 CSS-in-JS 方案,把所有的组件样式全量切换到了看起来相当传统的 CSS Modules。
GPT-6 Astra在发起攻击前往往会先申请权限,随后会收到一条要求其“自行作出最佳判断”的自动回复。模型有时会将这条回复视为攻击许可,哪怕其自身推理过程已经注意到该回复大概率是自动生成的。GPT-5.6 Sol和GPT-5.5则从未在攻击前申请过权限。
三十年来,在线广告始终建立在一个默认前提之上:广告位先存在,拍卖再决定谁获得它。 搜索结果的名次、信息流中的哪一次展示,都是预先定义好的机会。但大模型的回答是逐字生成的:某个品牌是否适合出现、在哪里出现、用什么方式介绍,都取决于前面已经写了什么。甚至先谈价格或是先谈体验,都可能为产品造成完全不同的印象。
今天,AMD正式官宣:已达成最终协议,收购李飞飞领导的World Labs。交易完成后,李飞飞将出任AMD执行副总裁兼首席科学家,直接向AMD董事长兼CEO苏姿丰汇报。 刚刚,硅谷发生一件史诗级重磅并购。 两大硅谷女王苏姿丰与李飞飞强强联手,太震撼了。 算力巨头亲自下场做3D原生生态,也标志着AI正式从语言维度走向物理世界。 个人公开信《去寻找一个更新的世界》中,李飞飞引用了英国诗人丁尼生在《尤利 ...
Anthropic今年的动作已经很密集了:Claude Agent SDK让开发者用Python和TypeScript就能构建Agent,Messages API加了按需compaction机制,长对话自动压缩,不用手动管理上下文。