← 전체 글

인공지능

Mistral의 Large 4는 소프트웨어 취약점을 재현하는 능력에서 세계 최고다. 그 가중치는 이달 말 공개된다

Mistral이 1.05조 파라미터 오픈웨이트 모델 Large 4를 프리뷰로 내놨다. 그리고 이 회사가 앞선다고 내세우는 능력은 Claude Opus 5.5와 GPT-6 Astra가 거부하는 보안 작업이다. 취약점 재현을 측정하는 시험에서 그 둘이 거의 0점인 자리에 Mistral은 82퍼센트를 냈다 — 그리고 가중치는 3주 안에 공개한다고 한다.

MAI
Mistral이 mistral.ai의 Mistral Large 4 발표에 함께 올린 커버 이미지.

Mistral이 화요일 Mistral Large 4를 프리뷰로 공개했다. 총 파라미터 1.05조, 토큰당 활성 파라미터 490억, 세분화된 전문가 혼합(MoE) 모델이고, 컨텍스트 윈도는 100만 토큰, 비전 인코더는 16억 파라미터다. Mistral의 API에서 mistral-large-4-0으로 연구용 공개 프리뷰에 들어갔고, 가격은 입력 100만 토큰당 1.36달러, 출력 100만 토큰당 4.18달러다. 가중치는 10월 말까지 뒤따른다고 회사는 말한다.

모두가 집어든 머리기사는 파라미터 수였다. 흥미로운 대목은 그쪽이 아니다. 흥미로운 대목은 Mistral이 어떤 능력을 앞세워 내보였는지, 그리고 그 가중치가 밖으로 나간다는 것이 무엇을 뜻하는지다.

Mistral이 팔고 있는 격차는 능력의 격차가 아니라 방침의 격차다

Artificial Analysis Cyber Index — 모델이 실제 소프트웨어의 결함을 얼마나 잘 찾아내고 고치는지 측정하는 독립 평가 — 에서 Large 4는 세계 상위 5위에 들고, 중국 밖에서 개발된 오픈웨이트 모델을 큰 차이로 앞선다고 Mistral은 말한다. 그 구성 항목 하나 — 결함이 실재함을 보이기 위해 취약점을 재현하는 과제 — 에서는 82퍼센트를 기록했고, 이는 모든 모델 가운데 최고라고 회사는 밝힌다. 그리고 정작 중요한 한 문장이 따라온다.

Claude Opus 5.5와 GPT-6 Astra를 포함한 몇몇 주요 클로즈드 모델은 같은 시험에서 거의 0점을 받는다. 과제 수행을 거부하기 때문이다.

거의 0점은 무능이 아니다. 의도적으로 놓인 거부의 경계다. Anthropic과 OpenAI는 아마 이 작업을 할 수 있는데도 자사 모델이 그래서는 안 된다고 결정한 것이다. 그 선을 넘는 데 대한 Mistral의 논리는 방어자의 논리이고, 겉보기에는 일리가 있다.

소프트웨어를 지키는 일은 결함이 실재함을 증명하는 데서 시작하는 경우가 많고, 그것은 바로 클로즈드 모델의 안전 필터가 막아버릴 수 있는 종류의 작업이다.

사실이다. 보안팀은 정당한 업무에서 실제로 거부에 부딪히고, Cybench — 보안 경진대회에서 가져온 40개 연습문제 — 에서 93퍼센트를 푸는 모델은 남보다 먼저 구멍을 찾는 것이 일인 사람들에게 유용하다. 공동창업자 Guillaume Lample은 이를 주권의 언어로 틀 지었다. 기업과 정부가 스스로를 지킬 수 있게 하는 사이버 방어 능력이라는 것이다.

문제는 그 다음 한 걸음이다. 거부의 경계는 서비스 제공 스택에 사는 통제 장치다. 조정할 수 있고, 감사할 수 있고, 기록할 수 있고, 되돌릴 수 있다. 가중치가 내려받을 수 있게 되면 그 가운데 어느 것도 남지 않는다. 이 점을 묻자 과학 담당 부사장 Pierre Stock은 TechCrunch에 이렇게 답했다.

우리는 신뢰할 수 있는 파트너와 정부와 함께 일해, 오픈소스 가중치가 방어에는 쓰이되 악의적 공격 수행에는 쓰이지 않도록 하겠다.

그것을 성립시키는 장치는 없다. 가중치 공개는 제휴가 아니다. 파일이다. Mistral은 Large 4가 어떤 라이선스로 나올지 아직 밝히지 않았고, 애초에 라이선스는 법적 수단이지 기술적 수단이 아니다. 이 입장을 정직하게 옮기면, Mistral은 방어상의 가치가 확산을 감수할 만하다고 판단했고, 오픈웨이트 사이버 도구를 중국 연구소들에 넘기기보다 유럽이 이 능력을 쥐는 편이 낫다고 본다는 것이다. 변호할 수 있는 베팅이다. 안전장치와 같은 것은 아니다. 그리고 프리뷰와 가중치 공개 사이의 3주가, 반대하는 쪽이 입을 열어야 하는 창이다.

나머지 숫자는 Mistral 자신의 것이다

아래는 전부 Mistral의 도표에서 나온 것이고, 독립적인 재현을 거치지 않았다. 그에 맞게 다뤄야 한다.

벤치마크Large 4거명된 비교 대상
DeepSWE v1.1(에이전트 코딩)61.7%GLM-5.3 61%, DeepSeek-V4-Pro 57%
FinWorkBench(금융)67%DeepSeek-V4-Pro 67%
Harvey Legal Agent15%Kimi K3 13%, GPT-6 Astra 5%
DIOR-RSVG(시각적 지시 대응)73%GPT-6 Astra 68%
Terminal-Bench 4.028.3%—
Cybench93%—

VentureBeat는 당연한 유보를 지적했다. 벤치마크 구성은 공급사마다 다르고, 공개 리더보드에서 GLM-5.3의 DeepSWE 점수는 Mistral 도표가 보여주는 61퍼센트보다 69퍼센트에 가깝다. Artificial Analysis는 자체 하네스로 Large 4를 Intelligence Index 38로 채점했고, 이로써 프랑스가 다시 미국과 중국 밖에서 가장 유능한 모델의 본거지가 되었다고 밝혔다. 붙들고 있을 만한 숫자는 이것이다. Mistral이 만든 것이 아니기 때문이다.

효율 주장도 마찬가지로 자체 보고이고, 마찬가지로 흥미롭다. Mistral에 따르면 Large 4는 유럽에 있는 자사 데이터센터에서 Nvidia Grace Blackwell GPU 3,800기로 약 두 달에 걸쳐 처음부터 학습되었고, 전력은 약 10메가와트를 끌어 썼다. Stock은 비교의 형태로 이렇게 말했다. 약 4,000기의 GPU, "우리 중국 경쟁자들보다 두세 배 적고, 클로즈드소스 경쟁자들보다는 훨씬 적다". 가중치가 나온 뒤에도 이것이 버틴다면, 목록에 있는 어떤 벤치마크보다 무거운 결과다 — Meta와 OpenAI가 입에 올리는 것보다 한 자릿수 작은 클러스터에서 학습된 프런티어급 모델이고, 연구자가 세 명이었던 회사가 지금은 약 300명이 되었으며, 지난달 30억 유로 라운드를 거쳐 210억 유로의 기업가치를 매기고 있다.

지켜볼 것

라이선스가, 이름이 밝혀질 때. Artificial Analysis의 Cyber Index 점수가 공개된 가중치에 대한 제3자 재실행을 견뎌내는지. 그리고 다른 연구소가 따라오는지 — 왜냐하면 상위 5위 사이버 능력을 가진 오픈웨이트 모델을 내려받을 수 있고 눈에 보이게 나쁜 일이 아무것도 일어나지 않는다면, Anthropic과 OpenAI의 거부 경계는 안전상의 입장이 아니라 경쟁상의 불리함으로 보이기 시작한다. 그것이 Mistral이 방금 다른 모두에게 강제한 논쟁이다.

Sources: Mistral AI: Introducing Mistral Large 4, TechCrunch: Mistral's new 1T model aims to leapfrog closed and open rivals, VentureBeat: Mistral debuts Large 4 'Le Chonk', The Next Web: Europe's Mistral launches Large 4 to challenge China's lead in open AI models, MarkTechPost: Mistral AI releases Mistral Large 4 (Le Chonk), Artificial Analysis on X: Mistral Large 4 scores 38 on the Intelligence Index

이어서 읽기