GPT-5.6 两个 API 设置让 ARC-AGI-3 得分翻三倍↗
OpenAI 披露两个 API 配置——保留推理过程(reasoning retention)和启用 compaction——可让 GPT-5.6 在 ARC-AGI-3 基准上得分提升 3 倍。这不是模型升级,而是调用姿势的进化,对开发者意义重大:同一个模型、同样的钱,换个参数就能跨越级别。

Jason 说
今天最值得存档的信号:GPT-5.6 不改模型、只调两个参数,ARC-AGI-3 得分翻三倍——这不是 benchmark 游戏,而是在告诉所有开发者:「调用姿势」才是你真正的竞争壁垒,模型能力只是上限,会不会用才是下限。
OpenAI 披露两个 API 配置——保留推理过程(reasoning retention)和启用 compaction——可让 GPT-5.6 在 ARC-AGI-3 基准上得分提升 3 倍。这不是模型升级,而是调用姿势的进化,对开发者意义重大:同一个模型、同样的钱,换个参数就能跨越级别。
OpenAI 宣布 GPT-5.6 Luna 降价 80%,Terra 降价 20%,对标 Gemini Flash 3.1 的价位。独立开发者和出海 SaaS 团队正在用这两档模型跑大量 Agent 工作流——此次降价直接压低推理成本,Sol 价格不变但性能仍占优,整体定价分层更清晰。
OpenAI 宣布向全球 10 万名学术研究者免费开放 ChatGPT 最高级模型,聚焦加速科研发现与协作。此举既是公关攻势,也在提前布局科学 AI 场景的数据与影响力——谁能在科研界站稳脚跟,谁就掌握了下一代基准测试和专业语料的话语权。
联邦法官裁定特朗普政府迄今未能提供足够证据,证明 Anthropic 构成供应链安全威胁,质疑政府禁用其 AI 技术的合法性。此案直接关系到 Claude 系列在美国政府及企业采购中的命运,也为 AI 监管边界的划定提供了司法参照。
Google 披露,2026 年 6 月借助 LLM 和 AI 工具在 Chrome 中发现并修复的漏洞数量,超过过去两年的总和。这是继微软之后又一巨头用数据验证「AI 驱动安全」的爆发式效果——对独立开发者的启示:AI fuzz/审计工具已从概念进入工程实战。
身份管理巨头 Okta 约以 2 亿美元收购 Permiso,后者专注 AI Agent 及非人类身份(Non-Human Identity)的威胁检测。随着企业大规模部署 AI Agent,NHI 安全已成刚需——Okta 此举等于提前锁定这个新兴赛道的核心能力。
这篇综述把 LLM 的「记忆」系统化拆解为四大维度:短期注意力缓存、循环状态、参数高效适配(LoRA 类)、外部可检索存储。对开发者的价值在于:当你在纠结 RAG vs 微调 vs 长上下文时,这份框架能帮你精准定位哪种记忆机制适合你的场景,避免拍脑袋决策。
当前最强模型在「从零构建程序」任务上成功率不到 1%,核心原因是把「读文档、探索行为、写代码」三步混在一起做。SpecFirst 提出先单独做行为规格提取,再进行代码合成。对 Claude Code / Cursor 用户的启示:先让 Agent 澄清需求边界,别急着让它开写,成功率差距巨大。
投资方:Insight Partners
帮助中小企业应对 AI 时代安全合规风险的伦敦初创,Insight Partners 领投,填补 SMB 市场 AI 安全工具空白。
订阅获取每日 AI 快讯推送 + 免费出海手册
📘 免费订阅