opendub.ai

2026年8月12日

第 8 期 · 13 条消息 · 3 个开源项目

AI 消息

这周值得知道的 AI 消息。

Anthropic

Anthropic 开始给 Claude 写的文字和图片打标记

8 月 2 日之后发布的 Claude 模型,会在生成的文字里嵌入看不见的标记,并给图片附上 C2PA 信息。复制粘贴之后标记还在,改动一些也不会消失。官方说读起来的感觉完全不受影响。

看原文 →
Meta

Meta 回归开源,发布 30B 的 Muse Glimmer

一个以 Apache 2.0 发布的 300 亿参数多模态模型。它就是冲着「一张消费级显卡跑本地智能体」做的,能同时读文字和图片,支持 100 多种语言。

看原文 →
Hugging Face

LTX-2.5 发布,权重一并开放

用英伟达 GB200 芯片,把一张静态图变成 10 秒 720p 的视频只要 6.8 秒。权重已经公开,ComfyUI 首日就支持。年收入不到 1000 万美元的公司免费用。

看原文 →
Spotify

Spotify 要给 AI 歌手主页打标签,并把它们移出推荐

从九月中旬开始,用 AI 形象撑起来的歌手主页会被打上标签,不管是本人主动说明,还是 Spotify 审核团队判定的。这类主页默认也不会再出现在推荐里。

看原文 →
OpenAI

OpenAI 扩大 Daybreak,并推出 GPT-5.6-Cyber

这是专门为安全工作训练的模型,面对高难度请求有 95% 会给出答案,而通用模型连 2% 都不到。使用权限分成两档,一档给防守方的日常工作,一档给获得授权的攻击测试。

看原文 →

配音与开源

现在值得一看的开源语音、配音工具。

GitHub

stronghamjji/PersoDub

视频配音全程在自己的电脑上完成,用你自己的声音。不往任何地方上传,也不会为了对上时长硬把声音拉长压短。(这个是我做的。)

看原文 →
GitHub

0xShug0/audio.cpp

一个用 ggml 跑音频模型的纯 C++ 引擎。语音合成、语音转文字、说话检测、变声,全都不用装 Python。

看原文 →
GitHub

ShawnPana/phone-harness

把手机交给 AI 智能体,让它自己去点应用的工具。本周 GitHub 上新出现的 AI 项目里,它拿到的星标最多。

看原文 →

本周 X 上的讨论

这周 AI 圈在 X 上聊得最多的。

X

Elon Musk (@elonmusk)

Grok Imagine 也能做梗图(引用 @tetsuoai:「Imagine Image 2.0 做梗图简直是神级。魔术棒只改你选中的区域,画面其余部分连一个像素都不动。合影里换掉一张脸,也不用把整张图重新生成。」)

看原文 →
X

Anthropic (@AnthropicAI)

我们让一个尚未发布的研究版 Claude 去碰了碰黎曼猜想。它没能解开,但在相关问题上有所推进:把黎曼ζ函数中满足该猜想的零点比例的下界往上抬了一截。

看原文 →
X

Adam Lyttle (@adamlyttleapps)

我给儿子自己做了一个更安全的 Roblox。因为不知道他在跟谁聊天,家里一直不让他玩。于是我做了一个只玩闯关(obby)的版本。游戏里跑着别人玩过的录像,看起来就像在跟别人一起玩。

看原文 →
X

NVIDIA AI (@NVIDIAAI)

隆重推出 NVIDIA Nemotron 3.5 Lightning。这是一个开放的 300 亿参数 MoE 模型,实际激活 30 亿参数,专为常驻运行的智能体设计,让它们更快完成大量专门任务,输出速度最高可达同体量模型的 4 倍。

看原文 →
X

Romain Torres (@rom1trs)

AI 运镜这件事我算是搞定了。你画一条线,无人机就照着飞。放进任意一张图,画出相机该走的路线,它就精确地沿着那条线飞。在 Arcads 里就能跑。

看原文 →

用邮件接收下一期

8 种语言任选,随时可以退订。