AI 快讯 · 8月19日

AI 快讯 · 8月19日
💡

Jason

今天最值得划重点的是 StateM:花 15 块钱就打出 95% 的 Agent 基准分——这说明当前大多数 Agent 项目的瓶颈根本不在模型,而在执行框架写得太烂。先把架子搭好,再烧钱换模型。

🔥
Skills 生态GitHub Trending

817 个网络安全技能库开源:专为 Claude Code/Cursor/Copilot 等 Agent 打造

开源项目 Anthropic-Cybersecurity-Skills 收录 817 条结构化网络安全技能,覆盖 MITRE ATT&CK、NIST CSF 2.0 等 6 大安全框架,兼容 Claude Code、Cursor、GitHub Copilot、Gemini CLI 等 20+ 平台。安全工程师可直接将这些 Skills 接入自己的 AI Agent 工作流,显著降低安全审计和渗透测试的门槛。

🔥
Skills 生态Hacker News

Claude Code 帮 macOS 写出惠普 HP Laser 1008a 原生驱动

一位开发者用 Claude Code 为 macOS 从零编写了 HP Laser 1008a 打印机的原生驱动程序——这款打印机官方从未提供 macOS 支持。这个案例展示了 AI Coding Agent 解决「长尾硬件兼容」问题的真实能力,也说明 Claude Code 不只是写业务逻辑,逆向协议层级的系统编程同样可行。

🛠️
AI 工具动态TechCrunch AI

OpenAI 因 HuggingFace 安全事件收紧前沿模型开发监控

继 HuggingFace 发生安全漏洞事件后,OpenAI 宣布强化前沿模型的安全措施,包括在开发过程中加强模型行为监控,以及在后训练阶段更加重视对齐与安全检测。这是 AI 基础设施安全问题首次引发头部实验室主动调整内部研发流程。

📚
AI 论文HuggingFace Papers

StateM:$15 的推理成本在 Terminal-Bench 2.1 上打出 95.3% 准确率

研究发现 AI Agent 失败往往不是模型能力不够,而是「执行框架太弱」——Agent 会忘记任务状态、跳过已知步骤或提前停止。StateM 提出一种「Agent 原生运行时」,通过持久化状态、分阶段上下文管理和可恢复执行手册来包装现有模型,无需改动模型权重,仅用 $15 推理成本就在权威 Agent 基准上达到 95.3% 原始准确率。对构建长任务 Agent 的开发者有极高参考价值。

💰AI 融资速递

Etched

Series Unknown (Valuation Update)估值 $21B

投资方:Jane Street

专为 Transformer 推理设计的 AI 芯片公司,一个月内估值从约 100 亿翻倍至 210 亿美元,首个客户 Jane Street 部署后直接追加领投新一轮。

Reach Capital

Fund V (Close)$265M

教育科技和 AI 领域专注基金,Fund V 超额完成募集,将重点投资利用 AI 扩展人类潜能的创业公司。

订阅获取每日 AI 快讯推送 + 免费出海手册

📘 免费订阅