概览
要闻
- MiniMax H3 多模态视频模型预计将于今日发布权重 ↗
#1
行业动态
技术与洞察
- Andrej Karpathy 称不该再用鹈鹕骑自行车测 LLM ↗
#4
模型发布
- Qwen 等联合发布原生 Computer Use agent Qwen-CUA ↗
#5
要闻
MiniMax H3 多模态视频模型预计将于今日发布权重 #1
MiniMax预计将于今日发布新一代多模态视频模型MiniMax-H3的模型权重,截至本期内容发出前,相关页面显示仍处于即将开源状态。
MiniMax即将开源其新一代开放通用多模态视频模型MiniMax-H3,相关页面显示,预计发布时间为2026年8月3日06:00(UTC+08:00),届时用户可在ModelScope魔搭社区获取模型权重。但截至本期内容发出前,相关页面显示仍处于即将开源状态。

相关链接:
行业动态
FFmpeg感谢Cursor AI为多名开发者提供免费额度 #2
FFmpeg官方账号发文,感谢Cursor为多名FFmpeg开发者提供免费额度。FFmpeg表示,这些额度将用于支持项目的持续开发和代码审查工作。
FFmpeg官方账号公开发文,感谢Cursor AI为多名FFmpeg开发者提供免费额度。据FFmpeg表示,这些额度将支持FFmpeg项目的持续工作,包括开发与代码审查。FFmpeg称非常感谢Cursor对FFmpeg及其社区的支持。

相关链接:
前谷歌团队成员称谷歌在 ChatGPT 前已有类似产品 LMChat #3
Codex 负责人 Tibo 近期在回复网友时表示,谷歌在 ChatGPT 发布约一年前已有类似产品 LMChat,他曾在相关团队工作,但该产品因担忧冲击搜索业务未推出。
Codex 负责人 Tibo 近期在回复网友时表示,谷歌在 ChatGPT 发布约一年前已开发出类似产品,他曾在相关团队工作,最初代号为 LMChat,后改用另一代号。Tibo 称谷歌因担忧该产品冲击搜索业务而未予发布,DeepMind 也被阻止推出可能颠覆谷歌的产品。此前有网友曾援引 Jeff Dean 采访称,谷歌在 ChatGPT 之前已有内部聊天机器人。

相关链接:
- https://x.com/thsottiaux/status/2083596911060324570
- https://nytimes.com/2023/02/03/technology/chatgpt-openai-artificial-intelligence.html
技术与洞察
Andrej Karpathy 称不该再用鹈鹕骑自行车测 LLM #4
Andrej Karpathy 近日发帖称不该再用鹈鹕骑自行车测试LLM,他用 Opus 5 进行了一项3D世界生成能力测试,向其输入《指环王》第一段文本,要求用 three.js 渲染故事。他表示结果"有些粗糙但很有趣"。
Andrej Karpathy 近日发帖称不该再用鹈鹕骑自行车测试LLM,他使用 Opus 5 进行了一项3D世界生成能力测试,向其输入《指环王》第一段文本、约100万token的预算(约$10),要求用 three.js 渲染故事。Opus 5 运行了约2小时,写了5500行代码,程序化渲染出了故事场景。Karpathy 表示结果虽然粗糙但可运行,LLM需要在三维坐标系中放置和编排多边形资产并编写动画代码。Karpathy同时指出当前LLM在世界和游戏领域存在弱点,无法高效原生感知视频或在游戏内玩游戏,需缓慢截图来检查工作。

相关链接:
模型发布
Qwen 等联合发布原生 Computer Use agent Qwen-CUA #5
Qwen 团队与 XLang Lab 联合发布了原生 Computer Use agent {Qwen-CUA|"Qwen-CUA"}。该 agent 仅通过截图感知界面,用键盘和鼠标操作计算机,目前已开放技术报告与参考 demo。
Qwen Team 与 XLang Lab 联合发布了 Qwen-CUA,一款基于 Qwen 的原生 Computer Use 模型和 agent。Qwen-CUA 仅通过截图感知界面状态,不依赖 DOM 树、辅助功能元数据或任务专用 API,而是通过原生键盘和鼠标事件在浏览器、桌面应用和专业软件中执行操作。该模型基于 397B-A17B 混合专家架构,在 OSWorld-Verified 基准上取得 86.2 分,更大版本 Qwen-CUA-Max 参数量超过一万亿,在同基准上达到 87.6 分。目前仅在 GitHub 提供了技术报告和参考 demo。


相关链接:
提示:内容由AI辅助创作,可能存在幻觉和错误。
