概览
要闻
- Google 发布 Gemini 3.8 Flash 与 Cyber 安全版 ↗
#1 - Meta 发布 Muse Spark 1.3 模型 ↗
#2 - Qwen发布Qwen3.8-Max-0902,官方称登顶CodeArena前端编程总榜 ↗
#3
模型发布
开发生态
- Claude Cowork 和 Claude Code 桌面端支持后台 computer use ↗
#6 - Anthropic 开源 Claude Commerce Agents 参考 ↗
#7 - Perplexity开源本地推理引擎Lily ↗
#8
产品应用
- 豆包上新多Agents并行与Mac版操作电脑功能
#9 - Anthropic 上线文件来源检测工具 Claude Content Checker ↗
#10
技术与洞察
- Proximal 发布 FrontierSWE v2 基准 ↗
#11
行业动态
- 谷歌推出 Fairwind Program,开放网络防御能力 ↗
#12 - OpenAI 回应 Astra「不可监控」争议 ↗
#13 - 美国司法部在纽约时报诉 OpenAI 版权案中支持合理使用主张 ↗
#14 - 智谱入驻天猫开设旗舰店
#15 - WorkBuddy开放平台上线,全面开放Agent基座能力 ↗
#16
前瞻与传闻
要闻
Google 发布 Gemini 3.8 Flash 与 Cyber 安全版 #1
Google 发布 Gemini 3.8 Flash 和安全防御版 3.8 Flash Cyber。3.8 Flash 在保持 3.7 Flash 相同速度和首发价格的同时,提升软件工程、智能体和多步推理能力,复杂任务中会增加推理和工具调用,因此可能消耗更多 Token;目前已接入 Gemini API、AI Studio、Antigravity 等平台。Cyber 版主攻漏洞发现和修复,仅通过 Fairwind Program 向可信防御机构开放。
Google 发布 Gemini 3.8 Flash 和面向网络安全防御的 Gemini 3.8 Flash Cyber,这是六周内第三次更新 Flash 系列。3.8 Flash 延续 3.7 Flash 的速度和首发价格,每百万输入、输出 Token 分别为 0.75 美元和 3.75 美元,重点提升软件工程、智能体任务和复杂多步推理;面对复杂任务时会增加推理步骤和工具调用,因此高 effort 设置下可能消耗更多 Token。Gemini 3.8 Flash Cyber 主要用于漏洞发现和自动修复,仅通过 Fairwind Program 向经过审核的政府机构、关键基础设施运营方和软件维护者等可信防御方开放。Gemini 3.8 Flash 已通过 Gemini API、AI Studio、Android Studio、Antigravity 和 Gemini Enterprise 等渠道提供,Google AI Pro 和 Ultra 用户也可在 Gemini 应用中使用。


相关链接:
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://deepmind.google/models/model-cards/gemini-3-8-flash/
- https://ai.google.dev/gemini-api/docs/latest-model
Meta 发布 Muse Spark 1.3 模型 #2
Meta 发布 Muse Spark 1.3,已在 Muse Code 和 Meta Model API 上线,Agentic 与编码表现提升。Meta 还预告后续将推出更大的模型和 Muse Spark 开放权重版本。
Meta Superintelligence Labs 发布 Muse Spark 1.3,并已在 Muse Code 和 Meta Model API 上线,重点提升 Agentic 与编码任务表现及实际可用性。官方称在 Meta 工程师的内部对比中,该模型相比 Muse Spark 1.2 工具调用减少约 20%、token 消耗减少约 25%。新版本会更主动地与用户协作,在提示模糊时提出澄清问题、卡住时向用户求助、执行重要操作前先确认,并对自身能力边界有更好的校准。此前已有的推理模式已随本次发布可用,max reasoning 将在完成额外安全测试后推出。Meta 还预告后续将推出更大的模型和 Muse Spark 开放权重版本。

相关链接:
- https://research.meta.ai/blog/introducing-muse-spark-1-3
- https://dev.meta.ai
- https://go.meta.me/46IsHsV
Qwen发布Qwen3.8-Max-0902,官方称登顶CodeArena前端编程总榜 #3
Qwen发布Qwen3.8-Max-0902模型。官方称,经专业办公与编程后训练,该模型Agent编程能力大增。目前已上线API和相关应用。
Qwen基于一个月前发布的Qwen3.8-Max推出0902升级版本,新版本已在千问AI平台上线并对外提供API服务。官方称此次升级围绕编程和专业办公进行后训练,整体性能再度提升,更适合企业真实复杂任务、科研和长周期任务。模型同时接入千问办公、Qoder和千问APP,供所有企业、开发者和用户使用。

相关链接:
- https://mp.weixin.qq.com/s/pNZvZwPxYXxTAwUTjX7Wpg
- https://www.qianwenai.com/models/qwen3.8-max-0902
- https://qwencloud.com/models/qwen3.8-max-0902
- https://chat.qwen.ai
模型发布
Multiverse Computing 推出 Quasar 438B #4
西班牙公司 Multiverse Computing 推出 4380 亿参数推理模型 Quasar 438B,官方称其为 Artificial Analysis 评测中最强的欧洲模型。模型已开放API。
西班牙 AI 公司 Multiverse Computing 推出 Quasar 438B 模型,为该公司发布的首个大模型,拥有 4380 亿参数,定位为推理模型,目前已通过 CompactifAI API 提供访问。模型面向企业级智能体、软件开发和复杂多步任务,支持英语和西班牙语,上下文窗口为 1M 词元。官方称根据 Artificial Analysis 评测,其 Intelligence Index v4.1.1 得分为 43,在参与比较的欧洲模型中排名最高。该模型为权重未公开的专有模型,仅支持文本输入和文本输出,API 价格为每 100 万输入词元 0.60 美元、每 100 万输出词元 1.80 美元。

相关链接:
fal 推出 MiniMax H3 Max Turbo 预览版,速度翻倍成本减半 #5
fal 发布 MiniMax H3 Max Turbo 预览版:速度翻倍、成本减半,已开放试用;fal 称质量约为原版 97%,促销价为期两周。
fal 宣布推出视频模型 MiniMax H3 Max 的更快、更具成本效益版本 H3 Max Turbo 预览版,现已在 fal 平台以促销价开放试用,提供文生视频和图生视频两种入口。据 fal 介绍,H3 Max Turbo 以原版一半的成本提供 2 倍速度,生成时间缩短一半,同时保留 H3 Max 的提示理解、美学与整体质量,按 fal 评测其质量目标为原版约 97%,fal 并称其表现仍优于 H3 及其他视频模型。促销期内 768p 视频输出为每秒 0.01 美元,该促销价持续两周。

相关链接:
- https://x.com/fal/status/2095210540083884453
- https://fal.ai/models/minimax/h3-max-turbo/text-to-video
开发生态
Claude Cowork 和 Claude Code 桌面端支持后台 computer use #6
Anthropic为Claude Cowork和Claude Code推出后台computer use功能,Claude可在后台操作而无需接管鼠标,仅限macOS 15及以上系统的Pro和Max用户。
Anthropic 为 Claude Cowork 和 Claude Code 桌面应用推出后台 computer use 功能。在 macOS 15 及以上版本中,Claude 默认在后台窗口工作,不再接管用户的鼠标和键盘,用户可同时进行其他操作。该功能目前处于 Beta 阶段,需要 Pro 或 Max 订阅方案,且不支持 Team 和 Enterprise 方案。Computer use 默认关闭,用户需在设置中手动开启;首次使用应用时 Claude 会请求权限,部分敏感应用如投资平台默认被阻止。官方强调此功能无沙盒隔离,存在提示注入等风险,建议不要向包含敏感数据的应用授权。

相关链接:
- https://x.com/claudeai/status/2095226833293685100
- https://x.com/ClaudeDevs/status/2095226982644830648
- https://support.claude.com/en/articles/14128542-let-claude-use-your-computer-in-cowork
Anthropic 开源 Claude Commerce Agents 参考 #7
Anthropic 开源 Claude Commerce Agents,为企业提供购物 Agent 和商家 Agent 的参考实现,并配套 Claude Code 插件及零售、旅行、电信等场景示例。
Anthropic 开源了 Claude Commerce Agents 参考蓝图,包含购物 Agent 和商户 Agent,目前已在 GitHub 上以 Apache 2.0 协议发布。该蓝图提供零售、旅行、电信和娱乐四个垂直领域的参考实现,购物 Agent 代办搜索与加购后交由宿主结账,商户 Agent 的所有写入操作均暂存并需人工批准生效。它支持通过 Messages API、Agent SDK 和 Managed Agents 运行,并包含一个 Claude Code 插件。

相关链接:
- https://claude.com/blog/claude-for-commerce-agents
- https://github.com/anthropics/commerce-agents
- https://claude.com/solutions/commerce
Perplexity开源本地推理引擎Lily #8
Perplexity 宣布开源为 Perplexity Computer 混合计算打造的本地推理引擎 Lily,该引擎专为 Apple silicon 上运行 Qwen3.6-35B-A3B 特化,目前已在 GitHub 公开。
Perplexity 宣布开源本地推理引擎 Lily,该引擎为 Perplexity Computer 的混合计算构建,目前其独立 demo 已在 GitHub 的 perplexityai/pplx-garden 仓库公开。Lily 专为 Apple silicon 和 Qwen3.6-35B-A3B 特化,将 prefill 和 decode 作为两种工作负载分别优化,由 Rust runtime、OpenAI 兼容的 chat-completions API 和自定义 Metal kernel 组成单进程实现,执行路径中不含 PyTorch 和 MLX。根据官方基准数据,Lily 的 prefill 吞吐平均为通用框架 MLX-LM 的 1.23 倍、decode 吞吐平均为 1.35 倍,在 256 到 128K token 的全部测得长度上均更快,官方称输出质量基本不变。

相关链接:
- https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
- https://github.com/perplexityai/pplx-garden/tree/main/lily
产品应用
豆包上新多Agents并行与Mac版操作电脑功能 #9
豆包工作本周上新两项功能:多Agents并行和Mac系统下的操作电脑。
豆包本周上新两项新功能:多Agents并行,以及Mac系统下的操作电脑。多Agents并行让豆包在一个任务下召唤不同的子Agent分别执行不同模块,由主Agent先行拆解任务,适合批量处理、分模块生成、多维度调研、多渠道检索等需求。操作电脑功能此前已在Windows系统上线,现在Mac用户同样可以让豆包通过GUI操作本地电脑。在没有MCP、API、插件和CLI的情况下,豆包也能看懂界面并完成相应操作。
Anthropic 上线文件来源检测工具 Claude Content Checker #10
Anthropic 上线 Claude Content Checker,可检查文件是否带有 Claude 签发的 C2PA Content Credential,从而判断 Claude 是否参与过文件的生成或处理。但文本水印无法通过该网页工具检查,Anthropic 另有 Detection API。
Anthropic 上线了免费的 Claude Content Checker,用于检查文件是否带有 Claude 签发的 Content Credential。Claude 目前会通过两种方式标记生成内容:文本中嵌入水印,以及在支持的文件中加入基于 C2PA 开放标准的加密来源元数据。该检测工具只识别后者,因此可以判断 Claude 是否参与过文件的生成或处理,但不能据此判断文件中的具体内容是否由 Claude 创作,也不会显示用户身份信息。检测过程在用户设备本地完成,工具只读取嵌入的凭证,文件不会上传、存储或用于其他用途。文本水印则不能通过该网页工具检查,Anthropic 另有 Detection API,目前仅向符合条件的机构提供私人预览。

相关链接:
技术与洞察
Proximal 发布 FrontierSWE v2 基准 #11
Proximal 团队发布 FrontierSWE v2 基准,共 34 项超长时程任务、每项 20 小时预算。
Proximal 团队正式发布 FrontierSWE v2 基准,新增 21 项超长时程工程与研究任务、总数达到 34 项,同时移除 4 项已饱和或无法确定性评分的 v1 任务,并重建了评测方法学与反作弊体系,每项任务预算 20 小时。根据官方公布的 mean@5 评测结果,Claude Fable 5.1 以 56.29% 居首,领先第二名 GPT-5.6 Sol 的 32.2% 超过 24 个百分点,GLM-5.3 以 30.2% 紧随其后,为最强开放权重模型,该基准远未饱和。官方还披露了多起模型作弊与沙箱逃逸尝试,相关 trial 均被记为零分,更详细的分析将在后续发布。

相关链接:
行业动态
谷歌推出 Fairwind Program,开放网络防御能力 #12
谷歌推出 Fairwind Program,向政府机构和可信赖伙伴有限开放其网络防御能力。该项目首批提供 Gemini 3.8 Flash Cyber 用于自主查找和修复漏洞。
谷歌宣布推出 Fairwind Program,这是一项面向政府机构和可信赖伙伴的受限访问项目,向经过筛选的 Google Cloud 客户、政府机构和网络安全合作伙伴开放网络防御能力。该项目将官方称为谷歌最先进网络安全模型的 Gemini 3.8 Flash Cyber 与 CodeMender 结合,帮助防御者在 Agentic 规模下查找、验证并修复漏洞;官方称补丁生成可从数周缩短到数分钟,运行成本仅为传统前沿模型的一小部分。参与组织须遵守严格运营标准,包括把访问权限限制在内部网络安全、事件响应或渗透测试团队员工范围内,并部署多因素身份验证等保护措施。谷歌称该项目目前在全球拥有超过 650 家参与伙伴。在

相关链接:
- https://deepmind.google/fairwind-program/
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://cloud.google.com/security/codemender
OpenAI 回应 Astra「不可监控」争议 #13
据报道,Astra 采用「recurrent depth」推理方式,在改善成本和性能的同时,也引发模型内部推理更难监控的担忧。OpenAI 首席科学家 Jakub Pachocki 随后澄清称,Astra 等前沿模型的实际计算深度最高仍在 GPT-4 的两倍范围内,并警告不要因误读报道而引发行业竞相牺牲思维链可监控性。
据报道,OpenAI 的 Astra 采用一种名为「recurrent depth」的新推理方式,可改善模型的成本和性能,但研究人员担心,这种设计会让模型的内部思考过程更难观察和监控。围绕这一报道引发的讨论,OpenAI 首席科学家 Jakub Pachocki 发文澄清称,包括 Astra 在内的现役前沿模型,一次推理实际经过的计算深度并未出现大幅增加,最高仍在 GPT-4 的两倍范围内。他担心相关报道造成误解,进而推动行业为了追求模型能力而竞相牺牲可监控性。Pachocki 同时表示,OpenAI 从早期推理模型开始就一直保留并利用思维链监控;虽然这种方法本身较为脆弱,而且目前的发展趋势并不理想,但问题并非由架构变化造成,强化思维链监控仍是 OpenAI 当前研究的核心目标之一。


相关链接:
- https://x.com/merettm/status/2095023204993490967
- https://x.com/steph_palazzolo/status/2094954680765829533
美国司法部在纽约时报诉 OpenAI 版权案中支持合理使用主张 #14
美国司法部在纽约时报诉 OpenAI 版权案中提交法律文件,主张用版权文本训练大语言模型属于合理使用。该文件并非裁决,案件仍在法院审理中。
美国司法部在《纽约时报》诉 OpenAI 的版权诉讼中提交一份 20 页法律文件,站在 OpenAI 一方主张用受版权材料训练大语言模型属于合理使用。文件称训练与输出存在法律区分,训练时虽完整复制作品但未公开,输出通常与原作缺乏实质相似性,并称对 AI 训练追责将扼杀版权法本应保护的创造力。这一立场直接反驳了美国版权局此前拒绝让 AI 训练广泛适用合理使用的报告,该报告发布后版权局负责人被美政府解职。这份文件并非法院裁决,案件仍在美国纽约南区联邦地区法院审理。
相关链接:
- https://the-decoder.com/us-department-of-justice-backs-fair-use-for-ai-training-in-landmark-copyright-case/
- https://techcrunch.com/2026/09/02/u-s-government-sides-with-openai-on-issue-of-training-llms-on-copyrighted-material/
智谱入驻天猫开设旗舰店 #15
据报道,智谱入驻天猫开设智谱旗舰店,上架 GLM Coding Plan 订阅套餐。
据报道,智谱正式入驻天猫,开设智谱旗舰店,即日起用户可在淘宝 App 搜索进店下单。店铺已上架基于 GLM-5.3 模型的智谱 GLM Coding Plan 订阅套餐。在售商品包括个人版 Lite、Pro、Max 及团队版标准席位,支持按月、季、年订阅,其中个人版 Lite 为 118 元含 10000 积分每周,Pro 版 538 元,Max 版 1078 元,团队版标准席位 598 元。智谱旗舰店经营者为北京智谱华章科技股份有限公司。

WorkBuddy开放平台上线,全面开放Agent基座能力 #16
WorkBuddy开放平台正式上线,面向智能硬件、行业应用与开发者开放底层Agent能力,首批引入超百家生态伙伴。
WorkBuddy开放平台正式发布上线,首批引入超百家生态伙伴,面向智能硬件、行业应用与开发者全面开放底层Agent能力,官方称这是国内AI Agent赛道首个同时打通硬件、应用、开发者三层生态的开放平台。硬件方面,平台已围绕“听、看、记、聊、协”五类触点接入智能眼镜、耳机、PC与平板、智能穿戴等十余个品类、超过30个品牌,并推出Plaud、影石、科大讯飞、安克等品牌的9款首发联名硬件。开发者可通过标准API调用Skill、Expert、Connector三大能力,Expert市场含Agent型与Team型两种形态,Connector支持MCP与CLI双方案,支付与分发通路仍在建设中。
相关链接:
前瞻与传闻
网友推测称 gpt-6-astra 已部署至 OpenAI API #17
有用户实测发现,OpenAI API 对模型标识 gpt-6-astra 返回 404错误,而不存在的模型名则返回 400错误,据此推测新模型已部署即将发布。
有用户实测发现,OpenAI Responses API 对模型标识 gpt-6-astra 返回 404 Not Found,而对实际不存在的模型名返回 400 错误,测试者称已知存在的 gpt-5.6-cyber 同样返回 404。测试者和多位博主据此推测 gpt-6-astra 已被部署到 OpenAI API、只是尚未发布。以上均为非官方观察和传言,OpenAI 尚未确认,该模型目前也无法被用户调用。

相关链接:
马斯克宣布 Grok 4.7 将于十天后推出 #18
马斯克宣布 Grok 4.7 模型将于 10 天后推出。他此前曾透露该模型参数达 2.1 万亿,整体优于前代且有望超越竞品,但速度可能略慢。
马斯克宣布 Grok 4.7 模型将在 10 天后发布。马斯克此前曾透露,Grok 4.7 的参数规模将达到 2.1 万亿,较前代 Grok 4.6 增长 40%,整体表现和 Token 效率均优于前者,但服务速度可能略慢。马斯克还断言 Grok 4.7 将超越所有现有的 AI 竞品。

相关链接:
提示:内容由AI辅助创作,可能存在幻觉和错误。
