Alibaba представила Qwen3.8-Omni-Flash для работы с текстом, аудио, видео и изображениями
Alibaba представила новую мультимодальную AI-модель Qwen3.8-Omni-Flash. Она способна работать с текстом, изображениями, аудио и видео в рамках одной модели и поддерживает контекстное окно до 1 миллиона токенов.
Одним из ключевых изменений стала стоимость обработки аудио и видео через API. По данным Alibaba, по сравнению с предыдущей моделью Qwen3.5-Omni-Plus стоимость обработки одного часа аудио снизилась более чем на 98%, а часа аудио вместе с видео — более чем на 93%.
Qwen3.8-Omni-Flash также получила механизм agentic understanding для работы с длинными аудио- и видеоматериалами. Вместо последовательной обработки всего файла модель определяет, какие фрагменты необходимо изучить для ответа на конкретный запрос, а затем постепенно уточняет информацию.
На тесте OmniVideoBench такой подход повысил результат модели с 63,4 до 67,8 балла. При этом количество использованных токенов снизилось со 145 736 до 79 117, или примерно на 45,7%.
По данным Alibaba, средний результат Qwen3.8-Omni-Flash вырос более чем на 25% по сравнению с предыдущим поколением сразу на 29 бенчмарках. Модель получила 82,7 балла на LongAudioSpan, оценивающем понимание длинных аудиозаписей, и 89,7 балла на AliMeeting для распознавания многоголосых встреч на китайском языке.
Alibaba также заявила, что новая модель превосходит Gemini 3.8 Flash от Google на нескольких тестах. Компания отдельно отметила результаты в обработке аудио и аудио-визуальных задачах.
Qwen3.8-Omni-Flash поддерживает распознавание речи на 74 языках и генерацию речи на 29 языках. В число поддерживаемых языков входят китайский, английский, корейский, французский, немецкий и испанский, а распознавание также работает с кантонским, уйгурским и маори.
Вместе с моделью Alibaba представила инструменты Qwen-MM-Plugins и Qwen-Live Harness. Они предназначены для создания приложений и рабочих процессов с использованием аудио и видео, включая видеомонтаж, создание музыкальных клипов, перевод коротких сериалов, анализ полнометражных фильмов и преобразование обучающих видео в структурированные заметки.
Отдельно Alibaba показала эксперимент, в котором Qwen3.8-Omni-Flash использовалась для улучшения другой AI-модели. За 12 часов система самостоятельно выбирала данные для оценки, анализировала аудиопримеры и формировала обучающие данные для улучшения распознавания сычуаньского диалекта в модели Qwen2.5-Omni-3B.
В результате четырех раундов экспериментов было создано 3413 обучающих примеров, а показатель ошибки распознавания снизился с 25,79% до 15,30%.
Qwen3.8-Omni-Flash уже доступна через API на платформе Alibaba Qianwen AI.
Источник: orcarouter.ai
