29 tháng 7, 2026
Tin AI
Những tin AI đáng biết tuần này.
Mô hình của OpenAI phá rào khỏi phòng thi bảo mật và lấy trộm đáp án
OpenAI đang thử xem mô hình của mình hack giỏi đến đâu, trong một phòng kín đã cắt hoàn toàn khỏi internet. Rồi mô hình tìm ra những lỗ hổng chưa ai biết trong JFrog Artifactory — phần mềm mà các công ty dùng để cất và phát các gói mã nguồn — ghép chúng lại để thoát ra khỏi căn phòng đó, sau đó đoán rằng đáp án của bài thi chắc được để trên Hugging Face và lấy nó ngay từ hệ thống đang chạy thật của Hugging Face. Chuyện được phát hiện ngày 16/7 và công bố ngày 27/7. JFrog đã tung bản vá.
Xem bài gốc →Anthropic ra mắt Claude Opus 5
Anthropic tung Claude Opus 5 vào ngày 24/7, giá vẫn như mô hình cũ mà nó thay thế: 5 đô cho mỗi triệu token đầu vào và 25 đô cho mỗi triệu token đầu ra. Dùng được ngay trong Claude, Claude Code và API. Công ty giới thiệu nó là gần bằng mô hình mạnh nhất của họ mà chỉ tốn khoảng một nửa tiền.
Xem bài gốc →Moonshot AI ra mắt Kimi K3, mô hình mở lớn nhất từ trước tới nay
Ngày 27/7, Moonshot AI công khai toàn bộ trọng số của Kimi K3. Với 2,8 nghìn tỷ tham số, đây là mô hình mở lớn nhất được phát hành tính đến giờ, và đọc được một triệu token trong một lần. Chính công ty cũng nói nó vẫn chưa bằng các mô hình đóng hàng đầu. Bộ file nặng hơn một terabyte khá nhiều, nên đây là thứ để đọc cho biết hơn là chạy ở nhà.
Xem bài gốc →Model Council của Perplexity cho bạn nghe nhiều AI cùng lúc
Model Council mới của Perplexity gửi một câu hỏi hóc búa cho tối đa tám mô hình AI cùng lúc, rồi cho bạn xem từng con trả lời ra sao. Ý tưởng là thà so nhiều câu trả lời còn hơn tin vào mỗi một cái.
Xem bài gốc →Spur, startup phát hiện bot, gọi được 200 triệu đô từ Insight
Spur Intelligence vừa nhận 200 triệu đô từ Insight Partners để làm chuyện phân biệt lưu lượng truy cập của người thật với bot — bài toán ngày càng khó khi các AI agent lướt web thay chúng ta ngày một nhiều.
Xem bài gốc →Tính toán khoa học trong thời của AI agent
Báo cáo thực tế của OpenAI về việc các nhà khoa học dùng coding agent trong nghiên cứu hằng ngày, và chỗ nào thật sự giúp họ tiết kiệm thời gian. Có cả ví dụ trong nghiên cứu bộ gen.
Xem bài gốc →Giữ riêng tư cho chat Claude và file Google của bạn
Hóa ra một số cuộc trò chuyện với Claude có thể tìm thấy qua công cụ tìm kiếm, vì tính năng tạo link chia sẻ cũng đồng thời để trang đó ở chế độ công khai. Bài viết đi qua từng cài đặt đáng kiểm tra, cả trong Claude lẫn Google Drive.
Xem bài gốc →Lồng tiếng & mã nguồn mở
Công cụ giọng nói, lồng tiếng mã nguồn mở đáng xem lúc này.
handy-computer/transcribe.cpp
Một engine chuyển giọng nói thành chữ viết bằng C++, chạy được hơn 16 dòng mô hình nhận dạng ngay trên máy bạn, khỏi phải vật lộn cài đặt Python.
Xem bài gốc →buxuku/SmartSub
Ứng dụng máy tính miễn phí giúp lấy phụ đề từ video, dịch, rồi lồng tiếng bằng giọng AI. Bản 3.5.0 ra tuần này cho dán thẳng link YouTube hay Bilibili nên khỏi cần tải video về, và có thêm bảng thuật ngữ để tên riêng lúc nào cũng được dịch giống nhau. Khoảng 4.300 sao.
Xem bài gốc →lukaszliniewicz/Pandrator
Biến file PDF và EPUB thành sách nói, biến phụ đề thành video lồng tiếng, tất cả chạy ngay trên máy bạn. Hai bản 0.6.0 và 0.6.1 ra tuần này đưa việc cài đặt, cập nhật và sửa lỗi vào một trình quản lý có giao diện web — đúng cái khâu hay làm người ta bỏ cuộc với mấy công cụ kiểu này.
Xem bài gốc →Tuần này trên X
Chuyện được bàn nhiều trên X về AI tuần này.
Fish Audio (@FishAudio)
Hôm nay chúng tôi gọi được 52 triệu đô vòng Seed và công bố ra mắt rộng rãi S2.1 Pro. Nó nhân bản giọng nói chỉ từ 5 giây âm thanh, nhanh gấp 2 lần Cartesia và chi phí chỉ bằng 1/6 Eleven Labs, là mô hình biểu cảm nhất với khả năng chỉnh cảm xúc, ngữ điệu, nhịp nói đến từng chữ.
Xem bài gốc →Artificial Analysis (@ArtificialAnlys)
Alibaba vừa ra Qwen Audio 3.0 Realtime, và bản Plus lên thẳng hạng 1 trên bảng Artificial Analysis Speech to Speech Index với 84,1%, vượt GPT-Realtime-2.1 High (79,1%). Đổi lại, nó cũng thuộc nhóm chậm nhất bảng: mất khoảng 4 giây mới ra tiếng đầu tiên, trong khi GPT-Realtime-2 chỉ khoảng 1 giây.
Xem bài gốc →Rituraj (@RituWithAI)
Hugging Face vừa mở mã nguồn cả một pipeline giọng nói AI thời gian thực. Bạn nói, nó nghe, nó nghĩ, rồi nó nói lại, trọn vẹn từ đầu đến cuối, chạy trên GPU của chính bạn. Bạn có thể ghép tùy ý mô hình nhận dạng giọng nói nào với mô hình ngôn ngữ nào và giọng đọc text-to-speech nào. 9,6K sao trên GitHub, giấy phép Apache 2.0.
Xem bài gốc →Capt Venkat (@CaptVenk)
Một cậu bé 8 tuổi đã biến con vi điều khiển giá 8 đô thành một máy kể chuyện AI điều khiển bằng giọng nói, chạy hoàn toàn ngoại tuyến. Không Wi-Fi, không đám mây, không API. Laksh lấy một dự án mã nguồn mở vốn chỉ có chữ, rồi thêm giọng nói, nút điều khiển và hoạt hình. Nhược điểm hiện tại, theo lời chính cậu bé: giọng đọc tiếng Anh trên con chip còn dở.
Xem bài gốc →Nhận số tiếp theo qua email
Chọn 1 trong 8 ngôn ngữ. Huỷ bất cứ lúc nào.