OpenAI 发布 GPT-Live:无轮次语音模型实现毫秒级自然对话↗
OpenAI 发布 GPT-Live 实时语音交互系统,采用「无轮次」语音模型(不再需要等待对方停顿才回应),配合低延迟架构实现连续、自然的语音对话体验。这是 OpenAI 历时六个月构建的语音 AI 基础设施,对语音 Agent 和实时交互场景开发者意义重大。

Jason 说
今天最值得盯的是 Qwen3.8-Max 即将开源:2.4T 参数、Sonnet 级性能、$2/M tokens 的价格,开源与闭源的能力差距窗口正在快速关闭,8 月可能是独立开发者切换模型栈的关键节点。
OpenAI 发布 GPT-Live 实时语音交互系统,采用「无轮次」语音模型(不再需要等待对方停顿才回应),配合低延迟架构实现连续、自然的语音对话体验。这是 OpenAI 历时六个月构建的语音 AI 基础设施,对语音 Agent 和实时交互场景开发者意义重大。
Qwen3.8-Max 以 2.4T 参数规模取代 Kimi K3 成为开源模型新领头羊,性能据称达到或超过 Claude Sonnet 级别,本周将正式开源。定价颇具竞争力:输入 $2.0/M tokens、输出 $6.0/M tokens,隐式缓存低至 $0.25/M tokens,对成本敏感的开发者极具吸引力。
AWS 宣布允许 Vibe Coding 工具 Superblocks 直接嵌入 AWS 客户的私有云环境,这是 AI 编码工具向企业级落地的重要一步。更深远的意义在于:AI 应用与底层模型正在逐步解耦,企业可以在自有基础设施上使用 AI 开发工具,数据不出私有云。
苹果终于完成了 Siri 的全面 AI 改造,功能上达到了「一个合格 AI 助手应有的水准」。但讽刺的是,这件事来得太晚——当「AI 助手能正常工作」已经不足为奇时,Siri 的补课并不令人兴奋。这折射出整个行业的速度:错过窗口期的代价就是即使补齐也失去了话题性。
Baseten 完成 $130 亿 Series F 融资,跻身推理工程领域头部玩家。Latent Space 的深度访谈涵盖自回归与扩散模型推理工程的完整技术栈,包括 KV cache 优化、批处理策略、延迟与吞吐量权衡等。推理工程正从「基础设施细节」成长为一个独立的工程专业方向。
Anthropic 研究发现,后训练对齐(RLHF)很浅,微调一下就会褪色。新方法「宪法中间训练」在预训练与后训练之间插入一个专门包含价值观内容的训练阶段(394M token 语料基于 Anthropic 宪法),在 120B 规模验证后对齐效果更稳定、更难被破坏。对需要可信部署的企业场景极为重要。
当前主流 RLVR 方法(如 GRPO)把整条响应的奖励平均分给每个 token,完全忽略不同 token 对最终结果的贡献差异。新研究提出反事实敏感度信用重分配方法,精准识别「哪些 token 真正影响了推理结果」并差异化分配奖励,显著提升长链推理(Long-CoT)训练效果。对做 RLVR 微调的开发者有直接参考价值。
欧洲分子生物学实验室(EMBL)发布 AI Librarian,专为 AI Agent 设计的生命科学知识层,对接 Europe PMC 4000 万条文献记录。传统文献库是为人类关键词检索设计的,Agent 必须学语法、多次搜索才能拼出答案。AI Librarian 将文献结构化为 Agent 可直接调用的知识接口,是 MCP/RAG 工具链在垂直领域落地的典型范例。
投资方:Marc Benioff 参投
用 AI 解决 AI 落地难题的初创公司,今日从隐身模式曝光,获 Salesforce 创始人背书,聚焦简化企业 AI 部署流程。
为 AI 模型引入「审美判断力」的人类评估平台,拥有 530 万用户,为前沿实验室提供设计领域的关键人类反馈数据。
订阅获取每日 AI 快讯推送 + 免费出海手册
📘 免费订阅