🤖 AI 资讯速览 · 2026-08-14

数据源:AIHOT(aihot.virxact.com)· 最近 7 天精选 30 条 · 生成于 2026-08-14 22:55(北京时间)

一、核心趋势(新概念)

编程/Agent 模型密集迭代,价格战正式开打
一周内 Gemini 3.7 Flash(价格减半)、GLM-5.3(开源编程第一)、DeepSeek-V4-Pro(Agent 大幅增强)、Grok 4.6 相继发布,OpenAI 与 Anthropic 又与中国厂商正面开打 API 价格战,成本弹性成为现实。
Cursor 并入 SpaceXAI,编程工具与 Grok 生态深度绑定
Cursor 被 SpaceX 收购后正式加入 SpaceXAI 团队,与 Grok 4.6 同日发布,产品路线从独立工具转向服务 Grok 生态(Grok Build / Bot / API)。
智能体框架与长程开源模型集中开源
DeepSeek Harness v0.1(MIT、"一切皆插件")、Qwen3.8-2.4T-A95B、小红书 dots3-note(280B)、Meta Muse Glimmer(30B)等主打长程智能体与工具调用的开源框架/模型一周内密集发布。
「长时运行智能体」成为竞争焦点,多智能体风险受关注
Grok 4.6、DeepSeek-V4-Pro 主打长时智能体,Cursor 推出 builds 让云智能体启动提速 3 倍;Anthropic 研究则量化了多智能体协调失效与系统性风险。
多模态生成持续突破
MiniMax Music 3.0(整曲生成)、小红书 dots.tts(连续自回归 TTS)、LTX-2.5(10 秒 720P 视频 6.8 秒生成)先后发布,开源权重成为共同卖点。
AI 工具产品化加速:从助手到可远程、可协作的工作流
Google Sheets canvas 把表格变成迷你应用、WorkBuddy 上线远程控制打通手机与电脑、Claude 浏览器侧边栏升级为跨设备 Cowork 会话,AI 逐步接管日常维护与协作流程。

二、新模型

dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理模型
公众号:小红书技术(dots.llm) · 原文 08-14 19:25
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力模型
公众号:智谱(GLM) · 原文 08-14 13:31
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。
把网络安全能力作为开源卖点,价值在于让缺乏闭源安全服务的中小团队也能开展漏洞审计,改变防御能力只集中在少数机构的现状。
DeepSeek V4 Pro 登陆硅基流动,1M 上下文模型
X:硅基流动 SiliconFlow (@SiliconFlowAI) · 原文 08-14 12:55
DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。
每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型模型
Google DeepMind:Blog(RSS) · 原文 08-14 01:04
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型模型
MiniMax:Blog(网页) · 原文 08-14 00:52
MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座模型
公众号:小红书技术(dots.llm) · 原文 08-13 17:59
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强模型
DeepSeek:API 更新日志 · 原文 08-13 19:16
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
峰谷定价把闲时成本降至高峰一半,适合批量推理、评估任务等可延迟工作负载调整执行时间,为降低 API 支出提供空间。
Cursor 与 SpaceXAI 联合发布 Grok 4.6模型
Cursor Blog · 原文 08-12 08:00
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。
微软首发自研推理模型MAI-Thinking-1模型
X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman) · 原文 08-13 00:00
我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。
微软首个自研推理模型进入 Foundry,使用 Azure 的团队在推理模型选型上多了一个自研选项,来源可完全在微软体系内验证。
xAI 发布 Grok 4.6,强化长时运行智能体能力模型
xAI:News(网页) · 原文 08-12 08:00
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI模型
IT之家(RSS) · 原文 08-12 14:46
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。
生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。

三、新产品 / 功能

Cursor 推出 builds:云智能体启动速度提升至 3 倍产品
Cursor Blog · 原文 08-13 20:00
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
把环境准备从每次会话冷启动改为后台持续快照,云代理长任务的启动成本和中断风险降低,为把更多工程流程交给自动代理提供了更可靠的运行基础。
Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用产品
Google Blog:AI(RSS) · 原文 08-14 00:45
Google Sheets 发布新功能 Sheets canvas,基于 Gemini 构建,用户只需用自然语言提示词即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用"。
与单独 BI 工具不同,Sheets canvas 直接在原表上生成可读写界面,临时仪表盘能沿用表格的共享和权限体系,降低轻量场景的搭建成本。
DeepSeek Harness v0.1 开发者预览版发布产品
X:DeepSeek (@deepseek_ai) · 原文 08-13 21:02
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
插件化把模型、工具、会话拆成可替换单元,影响在于选择智能体框架时可以从整体选型转为逐组件比较,降低被单一编排方案绑定的迁移成本。
WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式产品
公众号:数字生命卡兹克 · 原文 08-13 12:32
WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。
远程控制把 Agent 任务从电脑旁解放到手机上,连接和多设备切换比 Codex 更省事,对国内依赖 Agent 处理长任务的用户直接降低了使用门槛。
Claude in Chrome 侧边栏升级为 Claude Cowork 会话产品
Claude:Blog(网页) · 原文 08-12 00:00
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。
把浏览器扩展升级为与桌面、网页、移动共享的 Cowork 会话,解决以往侧边栏与主应用上下文割裂的问题,长流程任务可以在不同设备间接力。
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线产品
X:硅基流动 SiliconFlow (@SiliconFlowAI) · 原文 08-13 22:04
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。
缓存输入每百万 token 0.25 美元,让需要反复读取长上下文的 agent 工作流更接近可长期运行,而非只看单次生成价格。
OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型产品
OpenRouter:Announcements(RSS) · 原文 08-12 08:00
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。
这份基准把搜索预算的作用量化到分数与成本上,显示从单轮增加到 25 轮搜索,质量提升幅度超过更换模型或引擎,为 agent 搜索配置提供了更直接的取舍依据。
Meta 开源 Muse Glimmer 登陆 OpenRouter产品
X:OpenRouter (@OpenRouter) · 原文 08-12 20:00
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b
Apache 2.0许可和两项代理基准得分,为评估30B规模本地开源模型是否达到生产可用提供了直接参照,分数分别指向工具调用和编码能力。

四、其他值得关注

OpenAI and Anthropic in price war as Chinese AI rivals gain ground行业
Ars Technica:AI(RSS) · 原文 08-14 22:27
价格战让模型API的成本弹性成为现实,原先因账单压力转向中国厂商的用户,可能在OpenAI和Anthropic降价后重新比较能力与价格。
Cursor 正式加入 SpaceX,助力 Grok 生态行业
X:Michael Truell (@mntruell) · 原文 08-14 22:52
Cursor 官方宣布正式加入 SpaceX,收购已正式完成。Cursor 团队将加入 SpaceXAI 团队,共同致力于让 Grok 成为全球最实用的 AI,并改进 Grok Build、Grok Bot、Grok API 及 Cursor 等产品。
Cursor用户最关心的工具后续演进,现在与Grok生态深度绑定,产品迭代重心可能从独立工具转向服务模型能力。
Cursor 正式并入 SpaceXAI 助力 Grok行业
X:SpaceXAI (@SpaceXAI) · 原文 08-14 21:03
Cursor 正式完成被 SpaceX 收购,团队加入 SpaceXAI,共同打造 Grok 为全球最实用的 AI。合作将聚焦软件工程,并扩展至知识工作领域,同时改进 Grok Build、Grok Bot、Grok API 及 Cursor 等产品。
Cursor 被 SpaceX 收购后并入 SpaceXAI,对现有用户而言,产品路线可能转向与 Grok 深度整合,编程工具选型需要重新评估后续支持与独立性。
蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环技巧
公众号:蚂蚁百灵(Ling) · 原文 08-14 12:00
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。
从0到1带你速通DeepSeek Harness。技巧
公众号:数字生命卡兹克 · 原文 08-14 07:58
文章把Harness定位为插件化基建而非单一Agent,Cordis内核的时间与空间可组合性解释了Agent如何在运行中插拔能力,这比模板本身更值得理解。
Claude 接管应用日常维护:388 个 PR 的实践技巧
X:Boris Cherny (@bcherny) · 原文 08-14 05:27
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
这套做法的增量在于把日常维护拆成可复用的定时例程,并通过当日 PR 反馈迭代提示词,使机械性代码改动从逐条审查转向批量合并。
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能技巧
OpenAI:官网动态(RSS · 排除企业/客户案例) · 原文 08-13 19:00
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。
新兴多智能体系统的模式与问题论文
Anthropic:Research(发表成果 · 网页) · 原文 08-13 09:20
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
实验把多智能体风险从猜测变为可量化模式,协调失败并不随更强智能自然消失,这会影响人们如何设计部署中的智能体交互环境。
AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求技巧
GitHub Blog · 原文 08-13 02:00
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。
AutoGPT 的经验指出发现机制比文档完善度关键,agent 只读当前目录层级的指令,所以把 AGENTS.md 放在代码旁比继续写 wiki 更有效。
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈论文
Google Research:Blog(网页) · 原文 08-12 00:00
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。
我写了一本 AI 教科书--AI 还要多久才能写得更好?技巧
Nathan Lambert:Interconnects(RSS) · 原文 08-12 21:01
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
模型在长文写作中组织混乱、信息熵增的现实,与它们在可验证领域的飞速进步形成反差,这提示了自主解决开放式科学问题前必须迈过的能力门槛。

五、当前热点榜 Top 10

1
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型
X:Google DeepMind (@GoogleDeepMind), X:Elvis Saravia (@omarsar0, DAIR.AI), Google DeepMind:Blog(RSS)
2
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
X:智谱 Z.ai (@Zai_org), 公众号:智谱(GLM), X:Testing Catalog (@testingcatalog)
3
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强
X:X.PIN (@thexpin), IT之家(RSS), X:SemiAnalysis (@SemiAnalysis_)
4
DeepSeek Harness v0.1 开发者预览版发布
IT之家(RSS), X:Tianyi Cui(@tianyi), X:DeepSeek (@deepseek_ai)
5
xAI 发布 Grok 4.6,强化长时运行智能体能力
X:Kim (@kimmonismus), X:cb_doge (@cb_doge), X:Elon Musk (@elonmusk, xAI)
6
Cursor 正式并入 SpaceXAI 助力 Grok
X:SpaceXAI (@SpaceXAI), X:Kim (@kimmonismus), X:Lee Robinson (@leerob)
7
从0到1带你速通DeepSeek Harness。
公众号:数字生命卡兹克
8
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
X:Kim (@kimmonismus), 公众号:小红书技术(dots.llm)
9
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线
X:Clément Delangue(Hugging Face CEO) (@ClementDelangue), IT之家(RSS), X:Rohan Paul (@rohanpaul_ai)
10
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
公众号:数字生命卡兹克