Текст можно править глазами. Голос сразу выдаёт синтетику: странные ударения, ровные паузы, «диктор из навигатора». В этом эксперименте один и тот же абзац на русском прогнали через несколько сервисов озвучки. Слушали в наушниках, без визуальных подсказок, кто есть кто.
Текст взяли нейтральный: короткое пояснение к статье, без игры ролей и без крика. Так проще услышать базу голоса, а не театральность настроек.
Критерии: естественные паузы, ударения в обычных словах, шипящие и окончания, общая «роботность», можно ли поставить в черновик Reels/Shorts без стыда. Отдельно смотрели, не ломается ли фраза на длинном предложении.
Часть голосов читала ровно, но плоско: вроде чисто, а слушать дольше 20 секунд тяжело. Другие ставили живые паузы, зато спотыкались на терминах вроде «нейросеть» или на числительных. Бесплатные режимы чаще звучали приемлемо для черновика и слабо для финального ролика бренда. Платный слой обычно давал больше контроля: скорость, стабильность, меньше металлического призвука.
Для проверки текста на слух и черновика сторис ИИ-озвучки хватает. Для финального голоса канала или коммерции чаще нужны платный профиль или живая запись. Не выбирайте голос по демо «сказка на ночь». Гоняйте свой рабочий абзац: новости, оффер, инструкцию. Именно он покажет правду.
Ещё один быстрый тест: дайте одной модели прочитать один и тот же текст в двух скоростях и с паузами «как для сторис». Если на рабочей скорости голос разваливается, в публикации будет ещё заметнее. Если держится, его можно оставлять в коротком списке.
Сохраните два-три финалиста и один эталонный текст. Раз в квартал повторите прогон. Голоса обновляются тише, чем чат-модели, но разница между «можно в черновик» и «можно в публикацию» всё равно слышна сразу.