node404
ТекстИзображенияВидеоАудио
АУДИО · GEMINI 3.1 FLASH TTS · РЕЧЬ ИЗ ТЕКСТА

Озвучка текста нейросетью: 30 голосов, слушайте и выбирайте

gemini-ttsМОДЕЛЬ 02 / 02

Gemini 3.1 Flash TTS читает текст по-русски без акцента: 30 голосов, стиль подачи, темп, характер персонажа своими словами, теги интонации прямо в тексте и диалог на два голоса за один запуск. Ниже каждый голос озвучен одной и той же фразой, а по каждой настройке панели — пример на слух. Цена считается по длине текста: 10 знаков — секунда речи, ≈0,26 ₽ за секунду.

01Пример02Голоса03Стиль подачи04Темп05Характер06Сцена и тон07Акцент08Разброс и теги09Диалог10Нужно лицо
голоса
30
у каждого свой характер
роли
до 2
диалог в одном запуске
текст
до 10 000 знаков
≈ 17 минут речи за запуск
цена
≈0,26 ₽ / с
10 знаков текста = 1 секунда
Десять разделовлистайте вниз↓
// 01

Пример: комментатор в кадре

Профессиональная озвучка любых видеоматериалов: диалоги, неотличимые от живой речи, комментарий событий на экране. Ролик снят в Seedance 2, голос — Gemini TTS, дорожка наложена вторым рядом поверх звука ролика. Повторить просто: текст в поле, голос Charon, стиль «промо-раж», готовую дорожку из ленты Студии положить на своё видео в монтаже. Включите громкость в углу рамки.
Открыть в студии →
▶−0:05 / 0:05
ПромптСкопировать
Стритбол: бросок и комментарий
Gemini TTS · Charon · промо-раж · 5 с · видео Seedance 2 · 720p
Баскетбольный баскетболист забивает десяти-очковый!
голосCharon
стильпромо-раж · Promo/Hype
цена6 с речи по тексту, ≈1,56 ₽
Повторить в студии →
// 02

Тридцать голосов — одна фраза

Каждый голос читает одну и ту же фразу без дополнительных настроек: сравнивайте на слух, а не по описанию. Подпись у имени — характер голоса по классификации Google. Кнопка «в Студию» открывает панель с этим голосом и той же фразой.
Открыть в студии →
Здравствуйте! Это пробная фраза для сравнения голосов. Послушайте, как я звучу, и выберите меня в Студии.
01Charonинформативныйв Студию →
▶0:00 / 0:07
02Fenrirвозбуждённыйв Студию →
▶0:00 / 0:07
03Rasalgethiдикторскийв Студию →
▶0:00 / 0:07
04Gacruxзрелыйв Студию →
▶0:00 / 0:08
05Algenibс хрипотцойв Студию →
▶0:00 / 0:08
06Alnilamтвёрдыйв Студию →
▶0:00 / 0:07
07Orusтвёрдыйв Студию →
▶0:00 / 0:08
08Koreтвёрдыйв Студию →
▶0:00 / 0:07
09Sulafatтёплыйв Студию →
▶0:00 / 0:07
10Achernarмягкийв Студию →
▶0:00 / 0:08
11Achirdдружелюбныйв Студию →
▶0:00 / 0:07
12Algiebaгладкийв Студию →
▶0:00 / 0:09
13Aoedeлёгкийв Студию →
▶0:00 / 0:08
14Autonoeсветлыйв Студию →
▶0:00 / 0:08
15Callirrhoeнепринуждённыйв Студию →
▶0:00 / 0:08
16Despinaгладкийв Студию →
▶0:00 / 0:08
17Enceladusс придыханиемв Студию →
▶0:00 / 0:07
18Erinomeчистыйв Студию →
▶0:00 / 0:07
19Iapetusчистыйв Студию →
▶0:00 / 0:07
20Laomedeiaбодрыйв Студию →
▶0:00 / 0:07
21Ledaюныйв Студию →
▶0:00 / 0:07
22Puckзадорныйв Студию →
▶0:00 / 0:07
23Pulcherrimaнапористыйв Студию →
▶0:00 / 0:08
24Sadachbiaживойв Студию →
▶0:00 / 0:08
25Sadaltagerзнающийв Студию →
▶0:00 / 0:08
26Schedarровныйв Студию →
▶0:00 / 0:07
27Umbrielнепринуждённыйв Студию →
▶0:00 / 0:08
28Vindemiatrixмягкийв Студию →
▶0:00 / 0:07
29Zephyrяркийв Студию →
▶0:00 / 0:08
30Zubenelgenubiсвойскийв Студию →
▶0:00 / 0:08

Имена голосов — звёзды и спутники, пол и возраст в названии не закодированы: слушайте. Фраза одна на всех, 105 знаков, по правилу «10 знаков — секунда» это 11 с речи, то есть ≈2,86 ₽ за дорожку. Выбранный голос — основа, всё остальное ниже накладывается поверх него: стиль, темп, характер, сцена, теги. В панели голос выбирается выпадающим списком в блоке «Голос», по умолчанию стоит Charon — им же озвучены все примеры настроек на этой странице.

// 03

Стиль подачи

Один голос — Charon — и та же фраза, меняется только «Стиль подачи»: диктор, промо-раж, сочувственно, с улыбкой, шёпот, без эмоций. Первая строка — без стиля, для сравнения.
Открыть в студии →
настройка
Стиль подачи
панель → блок «Голос» → сегмент «Стиль подачи»
Стиль — манера чтения на весь запуск, а не другой голос: тембр тот же, подача другая. Один из шести вариантов или ничего.
01
без стиляв Студию →
Charon · как есть
▶0:00 / 0:07
02
дикторв Студию →
Newscaster
▶0:00 / 0:08
03
промо-ражв Студию →
Promo/Hype
▶0:00 / 0:09
04
сочувственнов Студию →
Empathetic
▶0:00 / 0:08
05
с улыбкойв Студию →
Vocal Smile
▶0:00 / 0:08
06
шёпотв Студию →
Whisper
▶0:00 / 0:08
07
без эмоцийв Студию →
Deadpan
▶0:00 / 0:09

Диктор держит ровный новостной тон, промо-раж разгоняет и давит на ударные слова, сочувственно смягчает и замедляет, с улыбкой — улыбка слышна в голосе, шёпот — тихо и близко к микрофону, без эмоций — сухо и ровно. Стиль действует на весь текст; когда подача должна смениться посреди фразы, нужны теги в тексте — раздел 08.

// 04

Темп

Тот же Charon и та же фраза, меняется только «Темп»: обычный, очередями, вразвалку, стаккато.
Открыть в студии →
настройка
Темп
панель → блок «Голос» → сегмент «Темп»
Темп меняет скорость и ритм речи, не тембр и не интонацию.
01
обычныйв Студию →
Charon · как есть
▶0:00 / 0:07
02
очередямив Студию →
Rapid Fire
▶0:00 / 0:05
03
вразвалкув Студию →
The Drift
▶0:00 / 0:18
04
стаккатов Студию →
Staccato
▶0:00 / 0:23

Очередями — быстро и короткими фразами, под рекламу и динамичный монтаж. Вразвалку — медленно и лениво, под расслабленный подкаст или ночной эфир. Стаккато — рублено, с паузами между словами, под слоганы и акценты. Обычный — как читал бы диктор без указаний. Темп сочетается со стилем: «диктор» плюс «очередями» — это уже экстренный выпуск.

// 05

Характер персонажа

Самая сильная настройка после самого голоса: описание того, кто говорит, своими словами. Три описания на одном Charon, первая строка — без характера.
Открыть в студии →
настройка
Характер персонажа
панель → блок «Голос» → поле «Характер персонажа», до 500 знаков
Кто говорит: возраст, состояние, манера. Модель подстраивает голос под описание, оставаясь в выбранном тембре.
01
без характерав Студию →
Charon · как есть
▶0:00 / 0:07
02
пожилой ораторв Студию →
«пожилой оратор с трибуны, говорит напористо»
▶0:00 / 0:09
03
ночной диспетчерв Студию →
«сонный ночной диспетчер, монотонно, вполголоса»
▶0:00 / 0:10
04
ребёнокв Студию →
«восторженный ребёнок лет восьми, торопится рассказать»
▶0:00 / 0:07

Пишите как режиссёр актёру: не «красивый голос», а кто он, сколько ему лет, что с ним сейчас и как он держится. Работают возраст, усталость, напор и прочие приметы речи. Описание — по-русски, оно не произносится, а только задаёт манеру. В диалоге у второго голоса своё поле характера.

// 06

Сцена и образец тона

Два поля в блоке «Сцена и подача»: где происходит речь и на что похожа подача. Оба заполнены в каждом примере, голос всё тот же Charon.
Открыть в студии →
настройка
Сцена · Образец тона
панель → блок «Сцена и подача» → поля «Сцена» и «Образец тона», до 500 знаков каждое
Сцена — обстановка: помещение, расстояние, толпа или тишина. Образец тона — на что должна быть похожа подача: жанр, известный тип речи.
01
без сценыв Студию →
Charon · как есть
▶0:00 / 0:07
02
площадь, 1917 годв Студию →
сцена: «площадь, 1917 год, рупор, толпа» · тон: «речь вождя: напор, рубленые фразы, призыв»
▶0:00 / 0:09
03
библиотека вечеромв Студию →
сцена: «тихая библиотека, поздний вечер» · тон: «библиотекарь вполголоса подсказывает читателю»
▶0:00 / 0:06

Сцена отвечает за громкость и «расстояние» до слушателя, образец тона — за интонацию и ритм. Их удобно ставить парой: одно и то же «пожалуйста, пройдите к выходу» на площади и в библиотеке звучит по-разному при одинаковом голосе. Это дополнение к характеру персонажа, а не замена: характер — кто говорит, сцена — где и как.

// 07

Акцент

Список акцентов у модели английский: американские, британские, трансатлантический, австралийский. На русской фразе и на английской — сравните сами.
Открыть в студии →
настройка
Акцент
панель → блок «Сцена и подача» → список «Акцент», по умолчанию «нейтральный»
Восемь вариантов из английского мира. Для русского текста практический смысл — только «нейтральный»; на английском акцент слышен отчётливо.
01
русская фраза · нейтральныйв Студию →
Charon · как есть
▶0:00 / 0:07
02
русская фраза · British (RP)в Студию →
тот же текст, акцент британский
▶0:00 / 0:08
03
русская фраза · American (South)в Студию →
тот же текст, акцент южный американский
▶0:00 / 0:08
04
английская фраза · нейтральныйв Студию →
Hello! This is a test line to compare accents. Listen to how I sound and pick me in the Studio.
▶0:00 / 0:06
05
английская фраза · British (RP)в Студию →
тот же английский текст, акцент британский
▶0:00 / 0:08

Акцент — про произношение, а не про язык: модель читает на языке текста, а список подсказывает, как именно выговаривать английский. Русские слова под британским или южным акцентом — скорее курьёз, чем инструмент; для смешанного текста с английскими вставками акцент задаёт, как они прозвучат.

// 08

Разброс интонации и теги в тексте

Ползунок «Разброс интонации» от 0 до 2 и теги в квадратных скобках прямо в тексте. Первые три строки — одна фраза на 0, 1 и 2; следующие три — та же фраза с тегами.
Открыть в студии →
настройка
Разброс интонации · Теги
панель → блок «Сцена и подача» → ползунок «Разброс интонации»; теги — в самом тексте
Ноль — ровно и предсказуемо, единица — по умолчанию, двойка — живее и с неожиданностями. Тег действует с того места, где стоит, до следующего тега.
[whisper] Здравствуйте! Это пробная фраза для сравнения голосов. [shouting] Послушайте, как я звучу! [laughing] И выберите меня в Студии.
01
разброс 0в Студию →
ровно, повторяемо
▶0:00 / 0:07
02
разброс 1 · по умолчаниюв Студию →
Charon · как есть
▶0:00 / 0:07
03
разброс 2в Студию →
живее, менее предсказуемо
▶0:00 / 0:07
04
[whisper]в Студию →
вся фраза шёпотом
▶0:00 / 0:06
05
[shouting]в Студию →
вся фраза криком
▶0:00 / 0:09
06
три тега в одной фразев Студию →
шёпот → крик → со смехом, текст слева
▶0:00 / 0:06

Разброс — это температура генерации: при нуле одинаковый текст читается почти одинаково от запуска к запуску, при двойке модель импровизирует ударениями и паузами. Теги — единственный способ сменить подачу посреди текста: стиль и темп из панели действуют на весь запуск, а [whisper], [shouting], [laughing] и подобные включаются со своего места. Пишутся по-английски, в квадратных скобках, не произносятся.

// 09

Диалог на два голоса

Переключатель «Два голоса» в панели: строки с «1:» читает первый голос, с «2:» — второй, у каждого свой стиль и характер. Здесь Charon и Kore «с улыбкой».
Открыть в студии →
настройка
Два голоса
панель → блок «Диалог» → переключатель «Два голоса», голос и стиль второго — там же
Реплики размечаются в тексте номером голоса. Строка без номера продолжает предыдущую реплику. Больше двух голосов за запуск модель не принимает.
1: Здравствуйте! Это пробная фраза для сравнения голосов. 2: А я второй голос в том же самом запуске. 1: Послушайте нас и выберите в Студии.
01
Charon + Koreв Студию →
второй голос — Kore, стиль «с улыбкой»
▶0:00 / 0:10

Цена диалога считается по сумме реплик, разметка «1:» и «2:» в знаки не входит. Третьего героя пишите отдельным запуском и склеивайте дорожки: это ограничение модели, а не панели. У второго голоса свои поля стиля и характера; сцена и образец тона общие на запуск.

// 10

Нужно говорящее лицо

Эта страница — про голос. Если его должен произносить персонаж в кадре, дорожка из Gemini TTS идёт в липсинк-модель вместе с изображением.
Открыть в студии →

Порядок один: сначала голос здесь, дорожка скачивается из ленты Студии, потом она вместе с изображением уходит в OmniHuman или Kling AI Avatar во вкладке «Видео», задача «Lip Sync». Длина ролика равна длине дорожки, цена считается по секундам звука.

Где применяют

// 01
Закадровый голос для Reels и Shorts
Текст под хронометраж, голос под настроение ролика: дикторский для обзоров, «с улыбкой» для сторис. Тридцать секунд — около 300 знаков, ≈8 ₽.
// 02
Обучающие видео и курсы
Один голос и одни настройки на все уроки — курс звучит ровно от первого до последнего. Длинный текст режется на части, характер и темп сохраняются.
// 03
Реклама: преролл, радио, Telegram
Стиль «промо-раж» и темп «очередями» дают рекламный напор без актёра. Сценка покупателя и продавца — диалог на два голоса в одном запуске.
// 04
Аудиокниги и подкасты
Глава на 10 000 знаков — один запуск, около 17 минут речи, ≈260 ₽. Характер персонажа задаёт рассказчика: возраст, манеру, настроение.
// 05
Телефония: приветствия и голосовое меню
Спокойный дикторский стиль, обычный темп, чистый русский без акцента. Реплики меню — короткими отдельными запусками, чтобы менять их по одной.
// 06
Презентации и объясняющие ролики
Закадровый текст к слайдам и продуктовым роликам: дорожка приходит файлом и ложится в монтаж как есть — как в примере со стритболом выше.
// 07
Персонажи игр и диалоги
Реплики NPC, сценки и учебные диалоги: до двух голосов за запуск, у каждого свой характер, теги [whisper] и [shouting] прямо в тексте.

Цены

Рубли — примерные и плавающие, точные цены — в токенах. Списывается только фактическая генерация, подписки нет.
Секунда речи10 знаков текста = 1 секунда, считается до запуска≈0,26 ₽
Пост на 300 знаков≈ 30 секунд речи≈8 ₽
Минута закадрового текста≈ 600 знаков≈16 ₽
Глава на 10 000 знаков≈ 17 минут, максимум за один запуск≈260 ₽
Неудачная генерацияошибка или таймаут — токены возвращаются автоматически0 ₽

Сколько стоит озвучка текста в России: цена известна до запуска — ≈0,26 ₽ за секунду речи, а секунды считаются по тексту, 10 знаков на секунду. Пост на 300 знаков — ≈8 ₽, минута закадрового текста — ≈16 ₽. Подписки нет, списывается только фактическая генерация, неудачные возвращаются автоматически.

Тарифы привязаны к официальным ценам модели и пересчитываются в рубли по курсу. Вы не платите за зарубежную карту и посредников — пополнение от 100 ₽ картой или СБП, чек по 54-ФЗ на почту.

Как начать

Начать озвучку из России можно за пару минут: аккаунт бесплатный, зарубежная карта не нужна. Один баланс работает на все модели каталога — текст, изображения, видео и аудио, а один API-ключ открывает их из кода.

01
Создайте аккаунт
Регистрация бесплатна — платите только за генерации.
02
Пополните баланс
Карта или СБП, от 100 ₽, чек по 54-ФЗ.
03
Генерируйте
В студии мышкой: промпт, настройки справа, результат в ленте.
04
Подключите API
OpenAI-совместимый эндпоинт, ключ в разделе «08 API Ключи», сниппеты на 9 языках.

OpenAI-совместимый API

Тот же код, что для OpenAI — меняются только base_url и имя модели.
curl https://api.node404.ru/v1/video/generations \ -H "Authorization: Bearer sk-****" \ -H "Content-Type: application/json" \ -d '{ "model": "gemini-tts", "prompt": "Lo-fi hip-hop beat with warm rhodes and vinyl crackle, calm", "seconds": 1 }' # ответ: {"task_id": "..."} — статус задачи: # curl https://api.node404.ru/v1/video/generations/<task_id> \ # -H "Authorization: Bearer sk-****"
→Тот же SDK, что для OpenAI: меняете base_url на api.node404.ru/v1 и имя модели
→Ключ создаётся за минуту в разделе «08 API Ключи»
→Готовые сниппеты на 9 языках — в разделе «09 API»
Получить ключ →Документация

Вопросы и ответы

Как выбрать голос?
Слушайте раздел 02: все тридцать читают одну фразу без настроек. Подпись у имени — характер по классификации Google, пол и возраст в названиях не закодированы. Кнопка «в Студию» у голоса открывает панель с ним и той же фразой.
Как считается цена?
По длине текста: 10 знаков — секунда речи, ≈0,26 ₽ за секунду. Сумма показывается до запуска и списывается ровно она; фактическая длина дорожки на цену не влияет. Неудачный запуск не списывается.
Чем стиль отличается от характера персонажа?
Стиль — один из шести готовых вариантов подачи на весь запуск. Характер — свободное описание того, кто говорит, до 500 знаков; он сильнее и гибче. Их можно сочетать: характер задаёт человека, стиль — его сегодняшнюю манеру.
Можно ли сменить подачу посреди текста?
Да, тегами в квадратных скобках прямо в тексте: [whisper], [shouting], [laughing] и подобные действуют с того места, где стоят. Стиль и темп из панели действуют на весь текст целиком.
Сколько голосов в одном запуске?
Один или два. В режиме «Два голоса» реплики размечаются в тексте строками «1:» и «2:», у второго голоса свои стиль и характер. Третьего голоса модель не принимает — его пишут отдельным запуском.
Какой длины текст можно озвучить?
До 10 000 знаков за запуск — около 17 минут речи. Длинную книгу режьте на главы; голос и настройки у всех запусков одни, поэтому главы звучат одинаково.
Где скачать дорожку и сколько она хранится?
Аудио отдаётся ссылками под нашим доменом в ленте Студии и в ответе API, ссылки живут 14 дней — важное скачивайте на диск сразу.
Как оплатить?
Рублями — картой или через СБП, с чеком по 54-ФЗ. Минимальное пополнение 100 ₽, подписки нет: списывается только фактическая генерация.
Работает ли сервис из России?
Да. Сервис работает из России напрямую, результаты отдаются с cdn.node404.ru.
Есть ли API?
Да, OpenAI-совместимый: base_url = https://api.node404.ru/v1. Готовые сниппеты на 9 языках — в разделе «09 API».
Сколько хранятся результаты?
Ссылки живут до 14 дней — скачивайте важное на диск кнопкой «Скачать».
Можно ли использовать треки коммерчески?
Да. Сгенерированные треки принадлежат вам — для роликов, подкастов, игр и фона в заведениях.
Что будет при неудачной генерации?
Если запуск упал по ошибке или таймауту, токены возвращаются автоматически — платите только за результат.
Попробовать в студии→

Озвучка текста нейросетью онлайн

Gemini 3.1 Flash TTS в node404 превращает текст в речь: 30 голосов, чистый русский без акцента, до 10 000 знаков за запуск. Стиль подачи, темп, характер персонажа и сцена задаются в панели, интонация внутри фразы — тегами в тексте. Цена — ≈0,26 ₽ за секунду, секунды считаются по длине текста.

Закадровый голос для видео и Reels

Текст под хронометраж, голос под настроение ролика: дикторский для обзоров, «с улыбкой» для сторис, «промо-раж» для рекламы. Минута закадрового текста — около 600 знаков и ≈16 ₽. Дорожка приходит файлом, который кладётся в монтаж как есть.

Аудиокниги, уроки и приветствия по телефону

Один голос и одни настройки на все главы — книга или курс звучат ровно от начала до конца. Глава на 10 000 знаков — один запуск, ≈260 ₽. Для голосового меню и приветствий подходит спокойный дикторский стиль и обычный темп.

Диалоги на два голоса

Сценка для рекламы, интро подкаста с двумя ведущими, разбор диалога для урока языка — реплики двух героев в одном запуске, у каждого свой голос, стиль и характер. Больше двух голосов за запуск модель не принимает.

API озвучки для разработчиков

Речь из кода через api.node404.ru/v1: тот же ключ, что и у остальных моделей каталога, готовые сниппеты на 9 языках. В запросе — текст, голос и настройки подачи, для диалога — реплики с номерами голосов. В ответе — ссылка на аудиофайл.

© node404 · оплата в рублях · результаты на cdn.node404.ru
≈0,26 ₽ / секунда
Gemini 3.1 Flash TTS
В студию