OpenAI 发布网络安全防御白皮书:AI 正在重塑攻防格局↗
OpenAI 发布《防御者窗口》报告,系统阐述 AI 如何同时增强攻击者与防御者的能力,并提出安全团队当下可落地的防御策略。在 AI 加速渗透企业的背景下,这份报告对安全团队和开发者都具有直接参考价值。

Jason 说
今天最值得警醒的是那篇「推理行为 ≠ 正确率」的论文——我们在为思维链叫好的同时,模型可能只是在表演思考。评估 AI 推理能力,别被长篇大论的 CoT 骗了,看结果。
OpenAI 发布《防御者窗口》报告,系统阐述 AI 如何同时增强攻击者与防御者的能力,并提出安全团队当下可落地的防御策略。在 AI 加速渗透企业的背景下,这份报告对安全团队和开发者都具有直接参考价值。
Groq 完成 3.5 亿美元融资,估值 35 亿美元,正式宣告从自研 AI 芯片转型为 Neocloud 服务商,并扩大以 Nvidia GPU 为基础的数据中心规模。这一转型意味着 Groq 放弃硬件差异化路线,转而加入算力云竞争赛道,对 AI 推理市场格局影响不容小觑。
Nvidia 宣布向 SoftBank 旗下数据中心开发商投资 15 亿美元,作为交换条件,该开发商将为 OpenAI 数据中心项目部署 Nvidia 芯片。这笔投资本质上是 Nvidia 用资本锁定下游算力订单,进一步巩固其在 AI 基础设施生态中的垄断地位。
AI 自动化工具 Relay 宣告关闭,创始人 Jacob Bank 率团队加入 Google Chrome 部门,并透露将推动 Chrome 与 AI 深度整合以帮助用户完成工作任务。这是近期 AI Acqui-hire 浪潮的又一案例,也预示 Chrome 将迎来更激进的 AI 功能布局。
语音 AI 工具 Wispr 完成 2.8 亿美元融资,估值达 20 亿美元。公司正在从单一听写功能扩展至会议记录等更广泛场景,推出新版会议笔记工具。语音交互赛道正在从效率工具向全流程会议 AI 演进,值得关注。
研究者提出「Behavioral Lift」指标,通过分析 15 个模型的推理轨迹发现:推理训练虽然让模型的思考过程看起来更「深思熟虑」,但这些行为与最终答对率的关联远比想象中弱。对开发者的实际意义:思维链越长不等于越可靠,评估推理模型要看行为是否真正驱动了正确结论,而非表面的「思考感」。
研究发现大型语言模型在训练过程中会自发形成类似人脑的功能模块划分——语言、逻辑推理、心智推理、物理推理各由不同区域负责。这一发现表明模块化可能是智能系统的普遍原则而非人类独有,对 AI 可解释性与 Agent 架构设计均有重要启示。
Mimir v1 是一个仅用合法授权数据从头训练的 10 亿参数模型,基于 HRM 分层推理架构,在英语任务上表现与同量级模型持平,并在丹麦语上达到新 SOTA。对独立开发者而言,这是一个可以无顾虑商用、无版权风险的开源基础模型选项。
订阅获取每日 AI 快讯推送 + 免费出海手册
📘 免费订阅