Samsung выпустила Samsone — семейство из трёх открытых малых аудиоязыковых моделей: Samsone-99M, Samsone-134M и Samsone-356M, спроектированных для запуска прямо на устройстве. Средняя модель на 134 млн параметров установила рекорд для компактного класса на бенчмарке MMAU, обойдя аудиосистемы в 20–60 раз крупнее. Веса, код обучения и Android-приложение опубликованы открыто, поэтому понимание речи, музыки и звуков окружения работает офлайн, а записи пользователя не покидают смартфон.



Что произошло
Команда Samsung в составе Piotr Masztalski, Michał K. Grzeszczyk и Olaf Sikorski выпустила семейство малых аудиоязыковых моделей Samsone: Samsone-99M, Samsone-134M и Samsone-356M. Архитектура собрана из готовых компонентов: аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров. Каждый аудиоклип сжимается до 50 аудиотокенов с разделителем SEP, поэтому звук можно вставлять в любое место текстового запроса. По данным авторов, Samsone-134M показала на бенчмарке MMAU 61,33% против 53,34% у прежнего лидера компактного сегмента Mellow, обойдя Audio Flamingo 2 на 3 млрд параметров (61,06%) и Qwen2-Audio-Instruct на 8,4 млрд (57,4%). На Galaxy S25 Ultra модель генерирует 87 токенов в секунду без аппаратных оптимизаций. Статья о моделях принята на конференцию Interspeech 2026, которая пройдёт в Сиднее с 27 сентября по 1 октября.
Контекст
Класс малых аудиоязыковых моделей, сокращённо SALM, сформировался как ответ на облачные аудиосистемы: описание звука, различение музыки и анализ шумов окружения раньше требовали либо отправки записи на сервер, либо моделей на миллиарды параметров. Ориентиром компактного сегмента была Mellow, а уровень крупных систем задавали Audio Flamingo 2 и Qwen2-Audio. Бенчмарки MMAU и MMAU-Pro измеряют понимание речи, музыки и звуков окружения, причём MMAU-Pro построен на более сложных задачах с глубоким аудио-рассуждением. Большинство моделей этого класса требуют отдельного аудиопрефикса и расходуют контекст малого языкового блока, тогда как компактное токенное представление аудио в Samsone позволяет свободно смешивать звук и текст в одном запросе. Модели семейства обучены только на публичных датасетах ReasonAQA и AudioSkills, а открытый код обучения делает результат воспроизводимым и переносимым на другие малые языковые модели.
Почему это важно для индустрии
Главный сигнал для индустрии в том, что понимание аудио перестаёт требовать миллиардных параметров и обращения к облаку. Аудио-функции можно встраивать в мобильные продукты без cost-per-call, без сетевой задержки и без отправки пользовательского звука наружу, что меняет экономику фич, которые раньше имели смысл только как облачные API. Полностью открытый стек — веса PyTorch, код обучения, экспорт в ExecuTorch и готовое Android-приложение — превращает исследование в строительный блок: продукт с пониманием речи, музыки и звуков окружения можно собрать уже сегодня. Обучение на публичных данных и открытая методика дают сообществу редкую референсную точку для scaling-law исследований компактных SALM — большинство индустриальных работ редко доходят до такого уровня прозрачности. В ближайшие полгода вероятны волна форков, квантизация, замеры на устройствах среднего класса и community-дообучения на другие языки и домены, а сравнение с Samsone на MMAU и MMAU-Pro может стать стандартной строкой в таблицах новых компактных моделей. В горизонте двух лет, если тренд на эффективность сохранится, on-device аудиопонимание способно стать стандартным слоем смартфонов, а облако останется для сложных случаев.
Почему это важно для пользователей
Попробовать Samsone можно сразу, и для этого не нужен сервер. Python API вида from samsone import Samsone134M сам скачивает чекпоинт с GitHub Release, CLI-команды samsone134M и samsone356M принимают .wav-файлы и описывают или сравнивают звук, а Android-приложение запускается на любом устройстве с API 31+. Всё выполняется локально: записи не покидают телефон, а ответы приходят без сетевой задержки. Реалистичный сценарий для разработчика или энтузиаста — за один-два дня собрать прототип узкой аудио-фичи, например офлайн-подписей к звуковым заметкам или сравнения клипов, и замерить задержку на целевых устройствах. Стоит помнить, что это точечный инструмент: модель отвечает только на английском языке строчными буквами и рассчитана на описание и сравнение звука, а не на диалог как универсальный ассистент.
Что пока неизвестно / ограничения
Рекорд подтверждён ровно на одном бенчмарке — MMAU, и переносить его на понимание аудио в целом некорректно. На более сложном MMAU-Pro Samsone-134M набрала 37,57% против 27,5% у Mellow, но заметно уступила Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%): глубокое аудио-рассуждение остаётся доменом больших моделей. Скорость генерации без аппаратных оптимизаций измерена авторами только на флагмане Galaxy S25 Ultra, публичных замеров для устройств среднего класса нет. По данным авторов, после дообучения на аудио модель теряет общие языковые навыки. Мультиязычность и расширение словаря выглядят логичным следующим шагом, однако в планах авторов они не заявлены — сценарии с community-портами и продуктовыми интеграциями остаются ожиданиями сообщества, а не анонсами Samsung.
Источники
- Samsone: A Family of Open Small Audio Language Models for On-Device Inference (arXiv:2609.21666)
- SamsungLabs/samsone — официальный репозиторий проекта на GitHub с весами, кодом обучения и Android-приложением
- Interspeech 2026 — конференция, на которую принята работа (Сидней, 27 сентября — 1 октября)
Автор
Look at AI, редакция
