Gemini 3.1 Flash TTS читает текст по-русски без акцента: 30 голосов, стиль подачи, темп, характер персонажа своими словами, теги интонации прямо в тексте и диалог на два голоса за один запуск. Ниже каждый голос озвучен одной и той же фразой, а по каждой настройке панели — пример на слух. Цена считается по длине текста: 10 знаков — секунда речи, ≈0,26 ₽ за секунду.
Имена голосов — звёзды и спутники, пол и возраст в названии не закодированы: слушайте. Фраза одна на всех, 105 знаков, по правилу «10 знаков — секунда» это 11 с речи, то есть ≈2,86 ₽ за дорожку. Выбранный голос — основа, всё остальное ниже накладывается поверх него: стиль, темп, характер, сцена, теги. В панели голос выбирается выпадающим списком в блоке «Голос», по умолчанию стоит Charon — им же озвучены все примеры настроек на этой странице.
Диктор держит ровный новостной тон, промо-раж разгоняет и давит на ударные слова, сочувственно смягчает и замедляет, с улыбкой — улыбка слышна в голосе, шёпот — тихо и близко к микрофону, без эмоций — сухо и ровно. Стиль действует на весь текст; когда подача должна смениться посреди фразы, нужны теги в тексте — раздел 08.
Очередями — быстро и короткими фразами, под рекламу и динамичный монтаж. Вразвалку — медленно и лениво, под расслабленный подкаст или ночной эфир. Стаккато — рублено, с паузами между словами, под слоганы и акценты. Обычный — как читал бы диктор без указаний. Темп сочетается со стилем: «диктор» плюс «очередями» — это уже экстренный выпуск.
Пишите как режиссёр актёру: не «красивый голос», а кто он, сколько ему лет, что с ним сейчас и как он держится. Работают возраст, усталость, напор и прочие приметы речи. Описание — по-русски, оно не произносится, а только задаёт манеру. В диалоге у второго голоса своё поле характера.
Сцена отвечает за громкость и «расстояние» до слушателя, образец тона — за интонацию и ритм. Их удобно ставить парой: одно и то же «пожалуйста, пройдите к выходу» на площади и в библиотеке звучит по-разному при одинаковом голосе. Это дополнение к характеру персонажа, а не замена: характер — кто говорит, сцена — где и как.
Акцент — про произношение, а не про язык: модель читает на языке текста, а список подсказывает, как именно выговаривать английский. Русские слова под британским или южным акцентом — скорее курьёз, чем инструмент; для смешанного текста с английскими вставками акцент задаёт, как они прозвучат.
Разброс — это температура генерации: при нуле одинаковый текст читается почти одинаково от запуска к запуску, при двойке модель импровизирует ударениями и паузами. Теги — единственный способ сменить подачу посреди текста: стиль и темп из панели действуют на весь запуск, а [whisper], [shouting], [laughing] и подобные включаются со своего места. Пишутся по-английски, в квадратных скобках, не произносятся.
Цена диалога считается по сумме реплик, разметка «1:» и «2:» в знаки не входит. Третьего героя пишите отдельным запуском и склеивайте дорожки: это ограничение модели, а не панели. У второго голоса свои поля стиля и характера; сцена и образец тона общие на запуск.
Порядок один: сначала голос здесь, дорожка скачивается из ленты Студии, потом она вместе с изображением уходит в OmniHuman или Kling AI Avatar во вкладке «Видео», задача «Lip Sync». Длина ролика равна длине дорожки, цена считается по секундам звука.
Сколько стоит озвучка текста в России: цена известна до запуска — ≈0,26 ₽ за секунду речи, а секунды считаются по тексту, 10 знаков на секунду. Пост на 300 знаков — ≈8 ₽, минута закадрового текста — ≈16 ₽. Подписки нет, списывается только фактическая генерация, неудачные возвращаются автоматически.
Тарифы привязаны к официальным ценам модели и пересчитываются в рубли по курсу. Вы не платите за зарубежную карту и посредников — пополнение от 100 ₽ картой или СБП, чек по 54-ФЗ на почту.
Начать озвучку из России можно за пару минут: аккаунт бесплатный, зарубежная карта не нужна. Один баланс работает на все модели каталога — текст, изображения, видео и аудио, а один API-ключ открывает их из кода.
Gemini 3.1 Flash TTS в node404 превращает текст в речь: 30 голосов, чистый русский без акцента, до 10 000 знаков за запуск. Стиль подачи, темп, характер персонажа и сцена задаются в панели, интонация внутри фразы — тегами в тексте. Цена — ≈0,26 ₽ за секунду, секунды считаются по длине текста.
Текст под хронометраж, голос под настроение ролика: дикторский для обзоров, «с улыбкой» для сторис, «промо-раж» для рекламы. Минута закадрового текста — около 600 знаков и ≈16 ₽. Дорожка приходит файлом, который кладётся в монтаж как есть.
Один голос и одни настройки на все главы — книга или курс звучат ровно от начала до конца. Глава на 10 000 знаков — один запуск, ≈260 ₽. Для голосового меню и приветствий подходит спокойный дикторский стиль и обычный темп.
Сценка для рекламы, интро подкаста с двумя ведущими, разбор диалога для урока языка — реплики двух героев в одном запуске, у каждого свой голос, стиль и характер. Больше двух голосов за запуск модель не принимает.
Речь из кода через api.node404.ru/v1: тот же ключ, что и у остальных моделей каталога, готовые сниппеты на 9 языках. В запросе — текст, голос и настройки подачи, для диалога — реплики с номерами голосов. В ответе — ссылка на аудиофайл.