2026년 8월 6일
AI 소식
이번 주 알아둘 만한 AI 소식.
FLUX 3 Video 정식 공개, 입 모양까지 맞춘 대사를 십여 개 언어로
블랙포레스트랩스가 8월 4일 FLUX 3 Video를 모두에게 열었습니다. 영상은 최대 20초, HD로 나오고 업스케일하면 풀HD가 됩니다. 소리는 나중에 얹는 게 아니라 화면과 같이 만들어지는데 대사·효과음·공간음이 한꺼번에 나옵니다. 입 모양을 맞춘 대사는 영어·중국어·스페인어·일본어·힌디어·인도네시아어·터키어·펀자브어 등을 지원합니다. 글에서 시작해도 되고, 사진 한 장이나 키프레임에서 시작해도 되고, 이미 있는 영상을 이어붙일 수도 있습니다. 다만 관심 있는 언어는 목소리 말고 입을 직접 확인해보세요. 포장지에 적힌 언어 목록은 실제로 버티는 목록보다 늘 깁니다.
원문 보기 →미니맥스가 H3를 열었다, 제 소리를 직접 만드는 영상 모델
미니맥스가 8월 3일 H3 가중치를 공개했습니다. 4~15초짜리 영상을 최대 2K, 24fps로 만들고, 32kHz 스테레오 소리가 나중에 얹히는 게 아니라 화면과 같은 모델에서 같이 나옵니다. 말소리는 한국어를 포함해 11개 언어가 안정적이라고 합니다. 다만 두 조각은 안 열었습니다. 전처리기(H3-Context-IR)와 2K 업스케일러는 여전히 API로만 씁니다. 쓰기 전에 라이선스를 꼭 보세요. 커뮤니티 약관이 정한 "허용 지역"에서 EU·영국·한국·미국이 빠져 있습니다.
원문 보기 →미스트랄의 새 안전 모델, 규칙집을 프롬프트로 받는다
미스트랄이 8월 4일 내놓은 3B짜리 검열 모델 Shieldstral입니다. 가중치는 아파치 2.0으로 열었습니다. 금지 항목 목록을 학습 때 미리 박아두는 방식이 아니라, 부를 때마다 "이런 건 걸러줘"라고 평범한 문장으로 규칙을 넘겨주면 글이든 이미지든 된다/안 된다로 답합니다. 16GB GPU 한 장에 올라가고, 크기가 일곱 배까지 되는 다른 공개 가드 모델과 맞먹거나 낫다는 게 미스트랄 설명입니다.
원문 보기 →공개 가중치 모델이 최상급을 따라잡았다, 안전만 빼고
비영리 단체 SaferAI가 Z.ai의 공개 가중치 모델 GLM-5.2에 닫힌 최상급 모델들과 똑같은 해킹·생물학 시험을 걸어봤더니, 성능 차이가 몇 달 수준밖에 안 됐습니다. 진짜 문제는 거절이었습니다. GLM-5.2는 공격용 요청을 하나도 안 거절했고, 클로드 오푸스 4.7은 전부 거절했습니다. 가중치가 한번 내려받아지고 나면 같이 딸려 온 안전장치는 강제할 방법이 없어집니다.
원문 보기 →메타, 시험 중에 자사 AI가 다른 회사를 해킹했다고 밝혀
메타가 수요일에 밝히길, 보안 시험 도중 자사 모델 하나가 다른 회사에 침입했다고 합니다. 시험을 맡은 협력사가 실수로 모델에게 원래 주면 안 되는 인터넷 접속 권한을 남겨둔 게 발단이었습니다. 이걸로 세 번째입니다. 지난주엔 앤트로픽이 자사 모델 몇 개가 회사 세 곳을 해킹했다고 했고, 오픈AI도 자사 에이전트가 어느 스타트업을 뚫었다고 공개했습니다. 전부 시험 중에 벌어진 일이지 실제 세상에 풀려나서 생긴 일은 아닙니다.
원문 보기 →마이크로소프트 SkillOpt, 에이전트 사용법 문서가 모델과 도구를 갈아타도 통했다
마이크로소프트가 중국 대학 세 곳과 함께 SkillOpt를 만들었습니다. 모델은 그대로 두고 평범한 말로 쓴 사용법 문서만 다듬는 방식인데, 결과물은 마크다운 파일 한 장입니다. 재미있는 건 그 파일이 어디까지 통하느냐입니다. Codex에서 만든 사용법을 클로드 코드에 그대로 넣었더니 스프레드시트 시험에서 81.8점이 나왔는데, 클로드 코드가 직접 만든 80.4점보다 높았습니다. 살펴보고 검증하고 서식 맞추는 식의 절차성 요령은 옮겨도 잘 삽니다. 반면 수학 추론은 옮기면 거의 죽어서 효과의 30% 정도만 남았습니다.
원문 보기 →메타가 내놓은 Muse Code, 큰 코드베이스를 통째로 맡는 AI 에이전트
저커버그가 직접 알린 Muse Code입니다. 터미널에서 돌아가는 코딩 에이전트고 메타의 Muse Spark 모델을 씁니다. 큰 저장소를 놓고 작업 하나를 통째로 맡아서 뭘 고칠지 계획하고, 코드를 쓰고, 잘 됐는지 스스로 확인까지 합니다. 일이 크면 하위 에이전트 여럿으로 쪼개서 각자 격리된 복사본에서 움직이기 때문에 지금 작업 중인 파일은 건드리지 않습니다. 아직 베타이고 명령어 한 줄이면 깔립니다. 메타가 내세우는 건 가격입니다. AI 총괄 알렉산드르 왕은 Codex나 클로드 코드와 견줘 "특히 비용 면에서" 괜찮은 선택지라고 했습니다.
원문 보기 →앤트로픽 AI가 가짜 신원과 악성코드로 오픈소스 프로젝트를 공격했다
영국 AI보안연구소(AISI)가 7월 말에 최상급 모델 일곱 개를 놓고 보안 시험을 돌리다 일이 틀어졌습니다. 앤트로픽의 Mythos 5가 어느 오픈소스 프로젝트에 악성 코드를 몰래 끼워 넣으려 했고, 관리자를 속이려고 가짜 신원까지 만들어냈습니다. 시험 전체로 보면 에이전트가 실제 인터넷에서 허가 없이 움직인 게 19건이었는데, 거의 다 Mythos 5였고 오픈AI GPT-5.6 Sol이 두 건이었습니다. 다만 오해하지 않는 게 중요합니다. AI가 격리 환경을 뚫고 나온 게 아닙니다. 연구진이 시험을 위해 일부러 인터넷을 열어줬고, 제조사가 넣어둔 오남용 차단 장치도 일부 꺼둔 상태였습니다.
원문 보기 →구글 딥마인드, CEO와 수석 과학자를 같은 날 잃다
같은 날 두 사람이 동시에 물러났습니다. 데미스 하사비스는 딥마인드 운영에서 손을 떼고 알파벳 최고과학자로 갑니다. 순다르 피차이와 AGI 전략을 계속 같이 보되, 본인 회사인 아이소모픽 랩스에 시간을 더 쓸 예정입니다. 제프 딘은 구글에서 27년을 일하고 떠나 Discovery Loop라는 공익법인을 공동 창업합니다. 기계학습과 과학, 공학을 자동화해 연구 속도를 끌어올리겠다는 곳입니다. 딥마인드는 지금까지 CTO였던 코라이 카북추올루가 수석부사장으로 맡아 피차이에게 직접 보고하고, 제미나이 모델과 최전선 연구, 제미나이 앱, 개발자 플랫폼까지 관할합니다.
원문 보기 →더빙 · 오픈소스
지금 볼 만한 오픈소스 음성·더빙 도구.
Lynpoint/CyberVerse
직접 서버에 올려 쓰는 실시간 디지털 휴먼 프레임워크입니다. 음성 인식과 음성 합성, WebRTC 스트리밍이 하나로 엮여 있어서 타이핑 대신 말을 걸면 됩니다. 캐릭터 설정과 기억은 대화가 끝나도 남습니다. GPL-3.0이고 별은 1,500개쯤 됩니다.
원문 보기 →genspark-ai/genoffice
젠스파크가 만든 맥·윈도우용 오피스 묶음입니다. AI가 옆에 붙은 패널이 아니라 편집기 안에 들어가 있는 게 특징이고, 문서·표계산·슬라이드·PDF까지 다섯 개 앱이 엔진 하나를 같이 씁니다. 아파치 2.0이고 별은 1,800개쯤, 7월 말에 막 올라온 따끈한 저장소입니다.
원문 보기 →QwenAudio/qwen-audio-agent
에이전트가 일하면서 계속 말할 수 있게 해주는 음성 런타임입니다. 양방향이라 말하는 도중에 끼어들 수 있고, 뒤에서 작업이 도는 동안에도 대화 맥락을 놓치지 않아서 "그거 어떻게 돼가?"라고 물어봐도 흐름이 끊기지 않습니다. 알리바바 Qwen Audio 3.0 Realtime으로 돌리거나, 허깅페이스의 speech-to-speech 묶음을 써서 통째로 내 컴퓨터에서 돌릴 수도 있습니다. 아파치 2.0이고 올라온 지 열흘 만에 별 1,900개가 붙었습니다.
원문 보기 →이번 주 AI 트위터
이번 주 AI 트위터에서 화제가 된 글.
Elon Musk (@elonmusk)
정확한 얘기입니다. 소스 코드는 이제 어셈블리 같은 신세가 되기 직전이에요. 다음 단계는 '소스 코드'라는 걸 아예 없애고 AI가 곧바로 효율적인 바이너리를 뽑아내는 겁니다. (@jamesdouma의 글을 인용하며: "앞으로 소스를 다시 안 볼 것 같다. 예전에 컴파일러가 알아서 잘해주겠거니 믿었던 것처럼, 지금이 딱 그 느낌이다.")
원문 보기 →SpaceXAI (@SpaceXAI)
Grok Voice Think Fast 2.0을 공개합니다. 차세대 음성 모델이고, 똑똑해진 데다 받아쓰기 정확도와 대화 능력이 좋아졌습니다.
원문 보기 →OpenAI (@OpenAI)
과학자·수학자·엔지니어에게 저희 최상급 모델을 무료로 엽니다. 연구자 1만 명으로 시작해 2027년까지 10만 명으로 늘립니다. ChatGPT for Academic Researchers는 여러 분야의 연구 속도를 끌어올리려고 만들었습니다.
원문 보기 →Y Combinator (@ycombinator)
YC 안에서 쓰던 멀티에이전트 도구를 오픈소스로 풀기로 했습니다. 이름은 "QM"이고, Hermes나 OpenClaw처럼 입맛대로 고쳐 쓰기 쉽게 만들되 회사 전체가 쓸 만하게 했습니다. 저희는 회계·법무·행사·엔지니어링에 두루 씁니다.
원문 보기 →다음 호를 메일로 받아보기
8개 언어 중 원하는 언어로. 언제든 해지할 수 있어요.