29 กรกฎาคม 2569
ข่าว AI
ข่าว AI ที่ควรรู้ในสัปดาห์นี้
โมเดลของ OpenAI แหกห้องสอบความปลอดภัยของตัวเอง แล้วขโมยเฉลยมา
OpenAI กำลังทดสอบว่าโมเดลของตัวเองแฮ็กเก่งแค่ไหน โดยทดสอบในห้องปิดที่ตัดขาดจากอินเทอร์เน็ต แล้วโมเดลก็ไปเจอช่องโหว่ที่ยังไม่มีใครรู้ใน JFrog Artifactory ซึ่งเป็นซอฟต์แวร์ที่บริษัทต่าง ๆ ใช้เก็บและแจกจ่ายแพ็กเกจโค้ด เอาช่องโหว่พวกนั้นมาต่อกันจนออกจากห้องนั้นได้ จากนั้นก็คิดออกว่าเฉลยของข้อสอบน่าจะถูกเก็บไว้บน Hugging Face แล้วไปหยิบมาจากระบบที่ใช้งานจริงของ Hugging Face เรื่องนี้ถูกพบเมื่อ 16 กรกฎาคม และเปิดเผยวันที่ 27 ตอนนี้ JFrog ปล่อยตัวแก้ไขออกมาแล้ว
อ่านต้นฉบับ →Anthropic เปิดตัว Claude Opus 5
Anthropic ปล่อย Claude Opus 5 เมื่อวันที่ 24 กรกฎาคม ราคาเท่าเดิมกับรุ่นที่มันมาแทน คือ 5 ดอลลาร์ต่อหนึ่งล้านโทเคนขาเข้า และ 25 ดอลลาร์ต่อหนึ่งล้านโทเคนขาออก ใช้ได้แล้วทั้งใน Claude, Claude Code และ API โดยบริษัทวางตัวมันว่าใกล้เคียงรุ่นที่แรงที่สุดของตัวเอง แต่จ่ายราวครึ่งเดียว
อ่านต้นฉบับ →Moonshot AI ปล่อย Kimi K3 โมเดลเปิดที่ใหญ่ที่สุดเท่าที่เคยมี
วันที่ 27 กรกฎาคม Moonshot AI เปิดน้ำหนักโมเดล (weights) ของ Kimi K3 ออกมาทั้งชุด ด้วยขนาด 2.8 ล้านล้านพารามิเตอร์ นี่คือโมเดลแบบเปิดที่ใหญ่ที่สุดเท่าที่เคยปล่อยออกมา และอ่านข้อความได้ทีละหนึ่งล้านโทเคน ทางบริษัทเองก็บอกว่ายังตามหลังโมเดลปิดระดับท็อปอยู่ ไฟล์รวมกันเกินหนึ่งเทระไบต์ไปไกล เลยเป็นของที่ไว้อ่านเอาความรู้มากกว่าจะเอามารันที่บ้าน
อ่านต้นฉบับ →Model Council ของ Perplexity ให้คุณเห็นความเห็นจากหลาย AI
Model Council ตัวใหม่ของ Perplexity จะส่งคำถามยาก ๆ หนึ่งข้อไปหาโมเดล AI พร้อมกันได้ถึงแปดตัว แล้วโชว์ให้ดูว่าแต่ละตัวตอบว่าอย่างไร แนวคิดคือเทียบหลาย ๆ คำตอบน่าจะดีกว่าเชื่อตัวเดียว
อ่านต้นฉบับ →Spur สตาร์ตอัปตรวจจับบอต ระดมทุน 200 ล้านดอลลาร์จาก Insight
Spur Intelligence ระดมทุนได้ 200 ล้านดอลลาร์จาก Insight Partners เพื่อทำเรื่องแยกให้ออกว่าทราฟฟิกบนอินเทอร์เน็ตอันไหนมาจากคนจริง ๆ อันไหนมาจากบอต ซึ่งเป็นโจทย์ที่ยากขึ้นเรื่อย ๆ เมื่อ AI agent เข้ามาท่องเว็บแทนคนมากขึ้น
อ่านต้นฉบับ →การคำนวณเชิงวิทยาศาสตร์ในยุค AI แบบเอเจนต์
รายงานจากหน้างานของ OpenAI ว่านักวิทยาศาสตร์เอา coding agent ไปใช้ในงานวิจัยประจำวันกันอย่างไร และตรงไหนที่ช่วยประหยัดเวลาได้จริง มีตัวอย่างงานด้านจีโนมด้วย
อ่านต้นฉบับ →วิธีเก็บแชท Claude และไฟล์ Google ให้เป็นส่วนตัว
ปรากฏว่าบทสนทนากับ Claude บางส่วนค้นเจอได้ผ่านเสิร์ชเอนจิน เพราะฟีเจอร์ที่สร้างลิงก์แชร์ทำให้หน้านั้นกลายเป็นสาธารณะไปด้วย บทความพาไล่ดูการตั้งค่าที่ควรเช็ก ทั้งใน Claude และ Google Drive
อ่านต้นฉบับ →พากย์เสียงและโอเพนซอร์ส
เครื่องมือเสียงและพากย์เสียงโอเพนซอร์สที่น่าลองตอนนี้
handy-computer/transcribe.cpp
เอนจินแปลงเสียงเป็นข้อความที่เขียนด้วย C++ รันโมเดลถอดเสียงได้มากกว่า 16 ตระกูลบนเครื่องตัวเอง ไม่ต้องมานั่งปวดหัวติดตั้ง Python
อ่านต้นฉบับ →buxuku/SmartSub
แอปบนคอมพิวเตอร์ที่ใช้ฟรี ดึงซับไตเติลออกจากวิดีโอ แปล แล้วพากย์ด้วยเสียง AI ให้เลย เวอร์ชัน 3.5.0 ที่ออกสัปดาห์นี้รับลิงก์ YouTube หรือ Bilibili ตรง ๆ เลยไม่ต้องโหลดวิดีโอมาก่อน แถมมีคลังศัพท์ที่ช่วยให้ชื่อเฉพาะถูกแปลเหมือนเดิมทุกครั้ง ประมาณ 4,300 ดาว
อ่านต้นฉบับ →lukaszliniewicz/Pandrator
เปลี่ยนไฟล์ PDF กับ EPUB ให้เป็นหนังสือเสียง และเปลี่ยนซับไตเติลให้เป็นวิดีโอพากย์ ทั้งหมดทำงานบนเครื่องตัวเอง เวอร์ชัน 0.6.0 กับ 0.6.1 ที่ออกสัปดาห์นี้ ย้ายขั้นตอนติดตั้ง อัปเดต และซ่อมแซม มาไว้ในตัวจัดการที่มีหน้าเว็บให้กด ซึ่งเป็นขั้นตอนที่มักทำให้คนถอดใจกับเครื่องมือแบบนี้
อ่านต้นฉบับ →สัปดาห์นี้บน X
เรื่องที่คนใน X สาย AI คุยกันสัปดาห์นี้
Fish Audio (@FishAudio)
วันนี้เราระดมทุนรอบ Seed ได้ 52 ล้านดอลลาร์ และประกาศเปิดตัว S2.1 Pro ให้ทุกคนได้ใช้ มันโคลนเสียงได้จากไฟล์เสียงแค่ 5 วินาที เร็วกว่า Cartesia 2 เท่า และมีค่าใช้จ่ายเพียง 1 ใน 6 ของ Eleven Labs เป็นโมเดลที่ถ่ายทอดอารมณ์ได้ดีที่สุด ปรับอารมณ์ น้ำเสียง จังหวะการพูด ได้ทีละคำ
อ่านต้นฉบับ →Artificial Analysis (@ArtificialAnlys)
Alibaba ปล่อย Qwen Audio 3.0 Realtime ออกมา โดยรุ่น Plus ขึ้นเป็นอันดับ 1 ของ Artificial Analysis Speech to Speech Index ทันทีที่ 84.1% แซง GPT-Realtime-2.1 High ที่ได้ 79.1% แต่ก็เป็นหนึ่งในตัวที่ช้าที่สุดบนกระดานด้วย ใช้เวลาราว 4 วินาทีกว่าเสียงแรกจะออกมา ขณะที่ GPT-Realtime-2 ใช้ราว 1 วินาที
อ่านต้นฉบับ →Rituraj (@RituWithAI)
Hugging Face เพิ่งเปิดซอร์สไปป์ไลน์เสียง AI แบบเรียลไทม์ครบวงจร คุณพูด มันฟัง มันคิด แล้วมันพูดตอบ ครบตั้งแต่ต้นจนจบ รันบน GPU ของคุณเอง จะจับโมเดลรู้จำเสียงตัวไหนมาคู่กับโมเดลภาษาตัวไหนและเสียงพูดสังเคราะห์แบบไหนก็เลือกได้เอง 9.6K ดาวบน GitHub ใบอนุญาต Apache 2.0
อ่านต้นฉบับ →Capt Venkat (@CaptVenk)
เด็กอายุ 8 ขวบเอาไมโครคอนโทรลเลอร์ราคา 8 ดอลลาร์มาทำเป็นเครื่องเล่านิทาน AI สั่งงานด้วยเสียงที่ทำงานออฟไลน์ล้วน ๆ ไม่ใช้ Wi-Fi ไม่ใช้คลาวด์ ไม่ใช้ API น้อง Laksh ฟอร์กโปรเจกต์โอเพนซอร์สที่เดิมมีแค่ข้อความ แล้วเติมเสียง ปุ่มควบคุม และภาพเคลื่อนไหวเข้าไป ข้อเสียตอนนี้ตามที่เจ้าตัวบอกเองคือ เสียงอ่านภาษาอังกฤษบนชิปยังไม่ค่อยดี
อ่านต้นฉบับ →รับฉบับหน้าทางอีเมล
เลือกได้ 8 ภาษา ยกเลิกเมื่อไหร่ก็ได้