16 сентября 2026 стартап Deveillance выпустил Kalypta — первое потребительское приложение класса anti-transcription. Локальная модель на устройстве в реальном времени добавляет в исходящий аудиопоток adversarial-шум, натренированный против транскриберов архитектур Whisper и NVIDIA Canary, из-за чего AI-ноттейкеры вроде Granola, Wispr Flow и Cluely хуже расшифровывают разговор. По данным компании, ошибка распознавания в живых звонках через Google Meet, Zoom и Teams AI вырастает с 4,4% до 50,5–59,7%, при этом люди продолжают понимать говорящего, хотя сам шум для них слышен. Пока это бета только для macOS на Apple Silicon, и все ключевые цифры опубликовал сам вендор.

image

Что произошло

Команда Deveillance 16 сентября 2026 года открыла бета-доступ к Kalypta — утилите, работающей как локальный privacy-фильтр исходящего аудио. Модель целиком исполняется на устройстве: она анализирует речь пользователя и подмешивает в поток adversarial-шум, обученный против моделей транскрипции архитектур Whisper и NVIDIA Canary, на которых строятся популярные ноттейкеры Granola, Wispr Flow и Cluely. В бенчмарке компании на 100 клипах корпуса Mozilla Common Voice ошибка распознавания слов (WER) в Google Meet, Zoom и Teams AI возрастала с 4,4% на чистом аудио до 50,5–59,7% в живом режиме; на предзаписанных клипах эффект сильнее — порядка 64–70% WER. В пилотном исследовании, где 7 участников читали 14 предложений через модель M2, машинная ошибка распознавания выросла на 51 процентный пункт, а человеческая — на 24,5 процентного пункта. Сами авторы признают, что в текущей бете шум слышен собеседникам, а модель обновляется почти еженедельно.

Контекст

Предыстория простая: AI-ноттейкеры за последний год превратились из диковинки в рабочую привычку, и участник звонка всё чаще узнаёт, что его слова осели в чужой базе, уже после разговора — Granola, Wispr Flow и Cluely транскрибируют встречи в фоне, как правило без согласия всех сторон. Атаки на распознавание речи через adversarial-искажения давно описаны в исследованиях безопасности, но считались лабораторной экзотикой: такие возмущения хрупки и плохо переносятся в реальное время. Kalypta — первая попытка упаковать этот приём в потребительский продукт, то есть заявка на новую категорию «локальный privacy-фильтр исходящего аудио». Технология по природе dual-use: шум, защищающий от несанкционированной записи, мешает и честному протоколированию встречи, на которое все согласились. Показательно и то, что вендор опубликовал методику оценки — метрики WER, ESTOI и PESQ на 100 клипах Common Voice под лицензией CC0; это проверяемый набор, а не голое заявление, хотя сами измерения пока исходят от заинтересованной стороны.

Почему это важно для индустрии

Для индустрии это старт гонки «adversarial-шум против ASR»: провайдерам транскрипции, от команд за Whisper-подобными моделями до NVIDIA Canary, придётся регулярно дообучаться под подобные искажения, иначе их точность на защищённых звонках будет проседать примерно вдвое. Платформам встреч — Google Meet, Zoom и Teams — предстоит формализовать политику: определять, на чьей стороне приватность и как относиться к софту, намеренно искажающему аудиотракт. Для стартапов запуск — раннее подтверждение спроса на voice privacy: первые два-три квартала — окно, когда категорию можно занять брендом и бета-листом до появления копий, но встраивать решение в свои продукты пока не во что, потому что это сигнальная бета, а не строительный блок. Отдельная ценность для ASR-команд — опубликованная методика: связка WER с ESTOI и PESQ задаёт шаблон честной оценки dual-use продуктов, где машинная ошибка измеряется вместе с качеством речи для человека. Главный же урок в том, что Kalypta решает одну проблему ценой другой: защита от машин достигается за счёт разборчивости и комфорта живых собеседников, и именно этот trade-off определит судьбу категории.

Почему это важно для пользователей

Если вы подозреваете, что коллеги молча записывают вас через Granola, Wispr Flow или Cluely, Kalypta — первый шанс стать «неслышимым» для AI, оставаясь понятным людям. Реальный путь сейчас один: записаться в бета-лист и проверить эффект на собственных сценариях, поскольку продукт распространяется через ранний доступ. Держите в голове три практических ограничения: приложение работает только на macOS с чипами Apple Silicon; шум услышат и ваши собеседники, так что вопрос «что это за фон у тебя в микро» неизбежен; ваша собственная речь становится менее разборчивой, что критично для важных переговоров. Модель обновляется почти еженедельно, поэтому эффект может заметно меняться от недели к неделе — свои замеры стоит фиксировать, а не полагаться на ощущения.

Что пока неизвестно / ограничения

Все ключевые цифры — от самого вендора: бенчмарк из 100 клипов и пилот с 7 участниками и 14 предложениями статистически являются демонстрацией, а не доказательством. Атака обучена против конкретных архитектур Whisper и NVIDIA Canary — из доступных данных не следует, что эффект переносится на другие ASR-модели, а провайдеры способны дообучиться под такие искажения. Эффект в реальном времени слабее, чем на предзаписанных клипах: около 50–60% WER против 64–70%. Оценку «модель не распознаёт 2 слова из 3» стоит воспринимать осторожно: при WER 50–60% корректно распознаётся примерно половина слов. Не раскрыты production-метрики — латентность, нагрузка на устройство, цена и сроки выхода за пределы macOS; юридический статус намеренного искажения аудио в корпоративных звонках также не определён.

Источники

Автор

Look at AI, редакция