AI 快讯 · 8月2日

AI 快讯 · 8月2日
💡

Jason

今天最让我兴奋的是 OpenAI 同时在十个数学硬题上取得突破——AI 正在从「做题机器」进化成真正的数学研究者,这条路一旦走通,对密码学和复杂性理论的冲击将远超我们的想象。

🛠️
AI 工具动态OpenAI Blog

OpenAI 数学重大突破:同时攻克几何、密码学等十大难题

OpenAI 发布在数学与理论计算机科学领域的十项新成果,涵盖几何、密码学、复杂性理论等长期未解的开放性问题。这是 AI 系统首次在如此广度的纯数学领域实现突破,标志着 AI 从「解题工具」向「原创研究者」角色迈进的重要里程碑。

🔥
Skills 生态GitHub Trending

last30days-skill:跨平台 AI 情报聚合技能,Reddit/X/HN 一网打尽

last30days 是一个 AI agent 技能包,可跨 Reddit、X、YouTube、HackerNews、Polymarket 及全网研究任意话题,并以点赞数、真实资金等信号加权合成摘要,而非依赖编辑推荐。适合需要快速做竞品分析、市场调研的独立开发者和出海团队。

🛠️
AI 工具动态Latent Space

DeepSeek V4-Flash 0731 发布:新版本性能全面升级

DeepSeek 悄然发布 V4-Flash 0731 新版本,被多位开发者评价为「超棒」的轻量级任务首选模型。已有团队将其作为多 LLM Agent 系统中处理简单任务的默认选项,搭配更强模型处理复杂推理,形成分层调用策略以控制成本。

🛠️
AI 工具动态X/@bindureddy

Grok 4.6 下周发布:xAI 能否补齐并行工具调用短板?

xAI 将于下周发布 Grok 4.6,开发者社区最关注的是能否支持并行工具调用和长时任务处理——这两点被认为是当前 Grok 在大规模 Agent 循环中的核心瓶颈。如果实现,将显著提升其在复杂自动化工作流中的竞争力。

📚
AI 论文HuggingFace Papers

See2Think:多模态大模型真的用到了「中间视觉状态」吗?

当多模态模型在推理时画草图、加注释、生成中间图像,它真的在「用」这些视觉状态,还是只是摆样子?See2Think 提出统一评估框架,发现现有模型在视觉推理链路上存在严重「走过场」问题。对做多模态 Agent 和视觉推理产品的开发者来说,这意味着当前模型的视觉中间步骤不可盲目信任。

📚
AI 论文HuggingFace Papers

文件系统作为 Agent 长期记忆:可行吗?新研究给出系统性评估

越来越多部署中的 LLM Agent 用目录树 + Markdown 文件作为长期记忆存储,但这种「默认方案」从未被严格检验。新研究首次系统评估 Agent 能否在记忆不断累积、冲突、过期时维持有序存储,并测试其可持续性。对正在用文件系统做 Agent 记忆层的开发者,这是必读的实证基线。

💰AI 融资速递

Index Ventures

Fund Close$2B

完成 Wiz 退出后再募 20 亿美元跨三支基金,总可投资本达 35 亿美元,AI 初创是核心押注方向之一。

Antora Energy

Series C$550M

专为 AI 数据中心激增的能源需求而生的热能储能初创,本轮为年度最大清洁科技融资之一,将加速大规模项目部署。

订阅获取每日 AI 快讯推送 + 免费出海手册

📘 免费订阅