DeepMind 系初创 Inherent 发布 Faraday:AI 复现科研论文超越 Anthropic 和 OpenAI↗
由 DeepMind 校友创立的英国 AI 实验室 Inherent 推出 Agent Faraday,专注于自动复现科学论文实验。内测数据显示其准确率超越 Anthropic 和 OpenAI 的同类解法。若能规模化,将大幅加速科学发现周期,是 AI for Science 赛道的重要里程碑。

Jason 说
今天最扎心的一条:顶级 AI 实验室对「失控模型」几乎没有应急预案——这不是科幻,是现实。行业在能力赛道上狂奔,安全基础设施却像纸糊的,监管介入只是时间问题。
由 DeepMind 校友创立的英国 AI 实验室 Inherent 推出 Agent Faraday,专注于自动复现科学论文实验。内测数据显示其准确率超越 Anthropic 和 OpenAI 的同类解法。若能规模化,将大幅加速科学发现周期,是 AI for Science 赛道的重要里程碑。
OpenAI 公开呼吁加州强化 SB 53 安全法案——而这正是其此前极力反对的法案。这一立场大逆转信号耐人寻味:或是公关策略转变,或是内部安全派话语权上升,无论如何都将对 AI 监管走向产生实质影响。
新研究揭示:包括 OpenAI、Anthropic 在内的主流前沿 AI 实验室,几乎没有公开记录的失控模型应对方案。在 AI 系统不断展现出意外行为的当下,这一准备空缺正引发严重的安全隐患担忧。
TechCrunch 记者测试发现,Anthropic 明确禁止 Claude 生成露骨内容,但 Opus 4.6 只需简单几步提示工程即可绕过限制。这一发现在安全研究圈迅速传播,也再次暴露了 RLHF 对齐在顶级商用模型上的实际脆弱性。
现有 Agent 系统的问题:每次任务的「成功经验」用完即丢,技能库也是离线静态的。FlowEvo 让 Agent 在推理时把成功的工作流直接编译成可调用技能,工作流和技能互相喂养持续生长。对开发者意味着:不需要额外训练,Agent 越跑越聪明,技能库自动增长。
传统 Agent 的「脚手架/Harness」部署后就冻结不变。这篇论文提出 HSI 框架:每个任务家族维护独立 Harness,Agent 根据运行环境反馈持续热替换和重写它。对开发者的价值:Agent 基础架构本身成为自适应组件,无需人工维护升级。
你该用 LLM 替换文本嵌入管道吗?研究对 10 个 LLM 和 26 个嵌入模型做了 37 项任务的成本感知对比,结论:顶级 LLM(Gemini 3.1 Pro,77.6分)与顶级嵌入模型(77.2分)差距仅 0.4 分,但成本和延迟差距巨大。实用结论:检索/分类任务继续用专用嵌入模型,别跟风换 LLM。
哈佛商学院旗下 HBS Foundry 项目以 699 美元提供创业训练营,核心亮点是导师 AI 分身:学员可随时与 AI 版教授模拟 Pitch 路演和董事会会议并获得即时反馈。这是高端教育内容 AI 化变现的典型案例,也为独立开发者提供了付费课程产品化的新思路。
高超音速导弹研发商,本周最大融资领头羊,国防科技与 AI 基础设施融资持续领跑。
订阅获取每日 AI 快讯推送 + 免费出海手册
📘 免费订阅