인공지능
알리바바의 옴니 모델, 입력 가격은 Gemini의 5분의 1. 그리고 가중치는 공개되지 않았다
알리바바가 금요일 Qwen3.8-Omni-Flash를 입력 100만 토큰당 0.15달러에 공개했다. Gemini 3.8 Flash 현행 요금의 5분의 1이다. 가중치는 함께 공개되지 않았고, 알리바바가 직접 측정한 벤치마크에서는 오디오에서 앞서지만 에이전트형 영상 과제에서는 뒤진다.
MAI
알리바바 Qwen 팀이 베이징 시간 금요일 오전 Qwen3.8-Omni-Flash를 공개했다. 텍스트, 이미지, 오디오, 영상을 입력으로 받아 텍스트나 음성을 내놓는 네이티브 옴니모달 모델이다. 컨텍스트는 약 100만 토큰이고 113개 언어와 방언을 지원하며, 실시간 스트리밍 상호작용을 겨냥한 두 번째 변형 Qwen3.8-Omni-Flash-Realtime도 함께 나왔다. Alibaba Cloud의 베이징, 싱가포르, 홍콩, 도쿄, 프랑크푸르트, 버지니아 리전에서 쓸 수 있다.
핵심은 사양이 아니다. 주목해야 할 숫자는 두 개다. 가격, 그리고 다운로드할 가중치가 없다는 사실이다.
가격이 곧 제품이다
Qwen3.8-Omni-Flash의 공시 가격은 입력 100만 토큰당 0.15달러, 캐시된 입력 100만 토큰당 0.016달러, 출력 100만 토큰당 0.47달러다. 입력이 텍스트든 이미지든 오디오 클립이든 영상이든 요율은 하나로 같다. 알리바바가 비교 대상으로 삼은 Gemini 3.8 Flash의 경우, 구글이 공개한 standard 티어 요금은 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러다. 구글의 가격 페이지는 이것이 2026년 12월 31일까지의 프로모션 가격이며 2027년 1월 1일에 각각 1.50달러와 7.50달러로 두 배가 된다고 명시한다.
| 100만 토큰당 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash (standard) |
|---|---|---|
| 입력(모든 매체) | $0.15 | $0.75 → 2027년 1월 1일부터 $1.50 |
| 캐시된 입력 | $0.016 | — |
| 출력 | $0.47 | $3.75 → 2027년 1월 1일부터 $7.50 |
지금 기준으로 입력은 5분의 1, 출력은 8분의 1이다. 구글의 프로모션 기간이 끝나면 각각 10분의 1과 16분의 1이 된다. 다만 알리바바는 이 인하를 구글과 비교하지 않고 자사 이전 모델과 비교해 설명한다. 오디오 입력 비용이 Qwen3.5-Omni-Plus 대비 98% 이상, 오디오와 영상을 결합한 입력은 93% 이상 내려갔다는 것이다.
이 설명의 방향이 중요하다. 알리바바가 주장하는 것은 구글보다 싼 모델이라기보다 모델을 더 싸게 서빙하는 방법이다. 멀티모달 추론에서 비용이 실제로 불어나는 지점은 오디오와 영상이다. 1분짜리 음성은 한 단락의 텍스트보다 훨씬 많은 토큰을 소비한다. 따라서 오디오 입력 98% 인하는 모델 품질에 관한 주장이 아니라 서빙 스택, 토크나이저, 인코더에 관한 주장이다. 그리고 알리바바 외부에서는 감사할 방법이 없는 종류의 주장이기도 하다.
벤치마크가 묘사하는 것은 오디오 모델이다
알리바바는 Gemini 3.8 Flash와의 비교 결과를 공개했다. 헤드라인이 아니라 표 전체를 읽어야 한다. 표는 발표문이 말하는 것과 다른 이야기를 한다.
| 벤치마크 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash |
|---|---|---|
| SpotSoundBench | 67.2 | 39.7 |
| WildClawBench-MM | 71.0 | 58.9 |
| MMAU | 81.8 | 76.9 |
| DailyOmni | 85.1 | 84.0 |
| OmniGAIA | 74.0 | 78.6 |
| AgenticVBench | 36.8 | 45.0 |
이 수치는 모두 알리바바가 알리바바의 손으로 만든 것이며, 이 글을 쓰는 시점까지 독립적인 재현은 없다. 액면 그대로 받아들이면, 소리를 식별하고 오디오를 이해하는 등 본질적으로 '듣기'에 해당하는 과제에서는 크게 앞서고, 오디오와 영상을 섞은 이해에서는 대체로 대등하며, 영상을 대상으로 여러 단계에 걸쳐 행동할 것을 요구하는 두 벤치마크에서는 뒤진다. 알리바바 자신의 요약도 오디오·영상 성능은 Gemini에 '근접'하고 오디오 단독으로는 앞선다고 인정한다. 표가 뒷받침하는 것은 더 좁은 해석이다. 이것은 볼 수도 있는 오디오 모델이며, 구글을 앞지른 범용 옴니 모델이 아니다.
특히 의심해볼 수치가 하나 있다. 알리바바는 AliMeeting에서 화자 분리 오류율이 세대 간에 88.11%에서 3.35%로 떨어졌다고 보고했다. 오류율 88%란 이전 모델이 발화를 화자에게 연결하는 일을 사실상 전혀 하지 못했다는 뜻이다. 이 개선의 대부분은 전진이 아니라 수리다. 게다가 AliMeeting은 알리바바 자신의 데이터셋이다.
가중치는 집에 남았다
Qwen은 공개 가중치로 입지를 쌓았다. 이전 세대인 Qwen3-Omni는 아키텍처를 공표한 채 GitHub과 Hugging Face에서 내려받을 수 있는 모델로 배포됐다. Qwen3.8-Omni-Flash는 그렇지 않다. 알리바바는 모델 주변의 멀티모달 플러그인과 개발 도구는 공개했지만 모델 본체는 API 전용이며, Hugging Face에는 2주 넘게 Qwen의 새 업로드가 없다.
이는 모순이 아니라 일관된 선택이다. 팔려는 것이 서빙 효율이라면 가중치로는 그것을 보여줄 수 없다. 98% 비용 절감은 체크포인트를 내려받아 검증할 수 있는 것이 아니고, 청구서를 결제해야만 검증된다. 그리고 효율 우위는 그것을 과금할 클라우드를 가진 만큼만 가치가 있다. 공개 가중치는 경쟁자가 남의 하드웨어에서 Qwen을 돌리게 해주지만 API는 그렇지 않다. 알리바바에는 이 모델이 출시된 바로 그 리전들에서 지켜야 할 클라우드 사업이 있다.
Qwen을 중국 AI의 기본 참조점으로 만든 공개 가중치 전략은 애초에 목적이 아니었다. 알리바바가 프런티어를 주장할 수 없던 시기에 개발자를 모으는 수단이었다. 이제는 대신 내세울 가격이 있다.
Sources: Qwen3.8-Omni-Flash announcement (Qwen) · 阿里发布 Qwen3.8-Omni-Flash 全模态模型 (IT之家) · Qwen3.8-Omni-Flash benchmark and pricing detail (AIbase) · Gemini Developer API pricing (Google) · Alibaba's Qwen3.8-Omni-Flash undercuts Gemini on audio (Neowin) · Qwen3-Omni (GitHub) · Qwen3-Omni-Flash model documentation (Alibaba Cloud Model Studio)