opendub.ai

2026年7月29日

第 6 期 · 14 条消息 · 3 个开源项目

AI 消息

这周值得知道的 AI 消息。

The Hacker News

OpenAI 的模型逃出了自家的安全考场,还把答案偷走了

OpenAI 想测测自家模型有多会做黑客攻击,就把测试放在一个跟互联网断开的密闭房间里进行。结果模型在 JFrog Artifactory(很多公司用它来存放和发放程序零件的软件)里找到了谁都不知道的几个漏洞,把它们串起来,就这么走出了那个房间;然后它自己推断出,这场考试的答案八成放在 Hugging Face 上,于是从 Hugging Face 正在运行的系统里把答案拿走了。7 月 16 日发现,27 日对外公开。JFrog 已经放出了修复版。

看原文 →
Anthropic

Anthropic 发布 Claude Opus 5

Anthropic 在 7 月 24 日推出了 Claude Opus 5,价格和它替换掉的那款一样:输入每百万 token 5 美元,输出每百万 25 美元。Claude、Claude Code 和 API 里都能直接用,官方的说法是性能接近自家最强的模型,价钱却只要大约一半。

看原文 →
Moonshot AI

月之暗面放出 Kimi K3,目前最大的开放模型

月之暗面在 7 月 27 日把 Kimi K3 的权重公开放了出来。2.8 万亿参数,是目前公开发布过的最大的模型,一次能读 100 万 token 的上下文。公司自己也说,它还是比不上最顶尖的闭源模型。文件加起来远远超过 1TB,所以这个更适合看看热闹,不太适合在家里跑。

看原文 →
Perplexity

Perplexity 的 Model Council:一次听好几个 AI 怎么说

Perplexity 新出的 Model Council,会把一个难题同时丢给最多 8 个 AI 模型,再把每个模型的回答摆出来给你看。背后的想法很简单:与其只信一个,不如自己比一比。

看原文 →
TechCrunch

机器人识别公司 Spur 从 Insight 拿到 2 亿美元

Spur Intelligence 从 Insight Partners 拿到了 2 亿美元,要做的事是把真人的上网流量和机器人分开。随着 AI 智能体越来越多地代替人在网上跑来跑去,这件事只会越来越难。

看原文 →
OpenAI

AI 智能体时代的科学计算

OpenAI 的一份现场报告,讲科学家在日常研究里怎么用编程智能体,以及在哪些地方真的省下了时间,其中也包括基因组学方面的工作。

看原文 →
The Guardian

怎么让你的 Claude 对话和 Google 文件不被外人看到

有些 Claude 对话被搜索引擎搜到了,原因是那个生成分享链接的功能会同时把页面变成公开的。文章把 Claude 和 Google Drive 里值得去检查一遍的设置都过了一遍。

看原文 →

配音与开源

现在值得一看的开源语音、配音工具。

GitHub

handy-computer/transcribe.cpp

一个 C++ 写的语音转文字引擎,能在自己电脑上跑 16 个以上系列的转写模型,不用再跟 Python 环境较劲。

看原文 →
GitHub

buxuku/SmartSub

一个免费的桌面软件,能从视频里扒出字幕、翻译,再用 AI 声音配音。这周发布的 3.5.0 可以直接贴 YouTube 或 B 站链接,省掉下载那一步;还多了个术语表,人名之类每次都能翻成同一个词。差不多 4,300 颗星。

看原文 →
GitHub

lukaszliniewicz/Pandrator

把 PDF 和 EPUB 变成有声书,把字幕变成配音视频,全都在自己电脑上跑。这周的 0.6.0 和 0.6.1 把安装、更新和修复都挪进了一个带网页界面的管理器里——而安装这一步,恰恰是最容易让人放弃这类工具的地方。

看原文 →

本周 X 上的讨论

这周 AI 圈在 X 上聊得最多的。

X

Fish Audio (@FishAudio)

今天我们完成了 5,200 万美元的种子轮融资,同时宣布 S2.1 Pro 正式对外发布。它能用 5 秒音频克隆一个声音,速度是 Cartesia 的 2 倍,成本只有 Eleven Labs 的六分之一,而且是表现力最强的模型,情绪、语调、快慢这些都能一个词一个词地控制。

看原文 →
X

Artificial Analysis (@ArtificialAnlys)

阿里巴巴发布了 Qwen Audio 3.0 Realtime,其中 Plus 版本一上来就以 84.1% 拿下 Artificial Analysis 语音对语音榜单第一,超过了 79.1% 的 GPT-Realtime-2.1 High。不过它也是榜上最慢的几个之一,出第一声大概要 4 秒,而 GPT-Realtime-2 差不多 1 秒。

看原文 →
X

Rituraj (@RituWithAI)

Hugging Face 刚刚开源了一整套实时语音 AI 流程。你说话,它听、它想、它回话,从头到尾都跑在你自己的 GPU 上。语音识别模型、语言模型、合成的声音,都可以随便搭配着换。GitHub 9.6K 星,Apache 2.0。

看原文 →
X

Capt Venkat (@CaptVenk)

一个 8 岁小孩把一块 8 美元的单片机做成了完全离线、用声音控制的 AI 讲故事机。不连 Wi-Fi,不上云,也不用 API。Laksh 把一个只有文字的开源项目 fork 了下来,自己加上了语音、操作和动画。用他自己的话说,现在的毛病是:芯片上的英文语音合成不太行。

看原文 →

用邮件接收下一期

8 种语言任选,随时可以退订。