Озвучка текста - Программы и скрипты для нейросетей | Сервис для фрилансеров
Skip links
View Categories

Озвучка текста

3 мин. чтения

1. Меню «Озвучка текста» #

Раздел 🔊 Озвучка текста превращает текст в аудио (TTS). Экран из двух колонок: слева — поле ввода текста и аудиоплеер, справа — длинная панель настроек (её нужно прокручивать — там и находятся дополнительные функции).

1 поле текста, 2 «Очистить», 3 счётчики, 4 аудиоплеер; справа — 5 TTS-сервис, 6 голос, 7 язык.

1. Поле текста, 2. «Очистить», 3. счётчики #

В поле 1 вставляете текст для озвучки. ✕ Очистить 2 — стереть поле. Под полем 3 — счётчики Символов / Слов / Примерное время будущего аудио.

4. Аудиоплеер #

После генерации здесь появляется результат: кнопки ▶ Играть / ⏸ Пауза / ⏹ Стоп, полоса прогресса со временем, а также 💾 Сохранить как… и 📋 Копировать путь к файлу.

5. TTS-сервис, 6. голос, 7. язык #

TTS Сервис 5 — движок озвучки. В списке ~20 сервисов: ai33, ElevenLabs, OpenAI, OpenRouter, OmniVoice, Gemini TTS, офлайн-движки Silero и Supertonic и др. В зависимости от выбора ниже появляются доп. селекторы (напр. «Сервис ai33», «Модель TTS»). Голос 6 — конкретный голос (🔄 рядом — обновить список после добавления/клонирования). Язык 7 — язык озвучки.

⚠️  Онлайн-сервисы требуют API-ключ (задаётся в ⚙️ Настройки). Офлайн-движки (Silero, Supertonic) нужно один раз скачать кнопкой в «Дополнительных настройках». У ElevenLabs VoicerBot минимальная длина текста — 500 символов.

Дополнительные функции (прокрутите панель настроек вниз) #

1 Дополнительные настройки; 2 «Сгенерировать речь» (+ Стоп); 3 Пакетная обработка.

1. Дополнительные настройки #

Раскрытый блок: Скорость и (в зависимости от сервиса) Качество, Высота тона, Громкость; Формат аудио (MP3 / WAV / OGG); Папка для сохранения готовых файлов.

2. «🎤 Сгенерировать речь» #

Запускает озвучку введённого текста выбранным голосом. Готовое аудио появится в плеере 4. Кнопка ⏹ Стоп прерывает генерацию.

3. Пакетная обработка #

Озвучить сразу папку с текстовыми файлами: выберите папку 📂, задайте ползунком «Максимум файлов для обработки», нажмите 📦 Пакетная обработка — программа озвучит все файлы по очереди (снизу — прогресс). ⏹ Стоп прерывает пакет.

7. 🎵 Фоновое аудио и статус (в самом низу) #

Ниже пакетной обработки — блок 🎵 Фоновое аудио: галочка «Включить фоновое аудио», а при включении — выбор папки с треками, самого трека и ползунок громкости фона (форматы MP3/WAV/OGG/M4A). В самом низу панели — строка статуса (например, «Найдено 20 сервисов, настроено: 18»).

Отдельное окно «Настройки OmniVoice» (офлайн-движок с клонированием и дизайном голоса) #

Если в списке 5 выбрать сервис OmniVoice, под настройками появляется кнопка Настройки OmniVoice — она открывает отдельное окно с большим количеством параметров (его нужно прокручивать). OmniVoice — это офлайн TTS-движок (600+ языков) с двумя режимами: клонирование голоса по образцу и дизайн голоса по параметрам.

8. Статус, установка, путь и режим #

1 статус (установлен ли движок и загружена ли модель, кнопка «Проверить»); 2 «Установить OmniVoice» + «Загрузить модель»; 3 путь к OmniVoice; 4 режим работы.
  • 1 Статус — установлен ли OmniVoice и загружена ли модель (зелёный = ок). Кнопка Проверить проверяет связь.
  • 2 Установить OmniVoice ставит движок автоматически (скачивает с GitHub, создаёт изолированный .venv, ставит зависимости); Загрузить модель — тянет модель (~2–3 ГБ).
  • 3 Путь к OmniVoice — папка с движком (пусто = глобальная установка).
  • 4 Режим работыКлонирование голоса или Дизайн голоса.

9. Режим «Клонирование голоса» #

Создаёт клон по образцу голоса.

1 эталонное аудио (3–10 сек) + «Обзор…»; 2 текст эталонного аудио; 3 «+ Добавить клон»; 4 предварительная обработка.
  • 1 Эталонное аудио (3–10 сек) — короткий образец голоса, который клонируем.
  • 2 Текст эталонного аудио — необязательно; если пусто, текст распознаётся автоматически через Whisper.
  • 3 + Добавить клон — сохранить клон. 4 Предварительная обработка — убрать тишину и поправить пунктуацию.

ℹ️  Выше формы — список сохранённых клонов (кнопки «Обновить» / «Удалить») и поле «Имя клона». Готовые клоны появляются в списке Голос 6 на главном экране озвучки.

10. Режим «Дизайн голоса» #

Собирает голос «с нуля» по характеристикам, без образца.

1 режим «Дизайн голоса»; 2 параметры: Пол, Возраст, Тон голоса, Стиль, Акцент (для английского), Китайский диалект.

11. Параметры генерации и справка #

1 параметры генерации; 2 справка «Как это работает».
  • Скорость (0.5–1.5); Длительность (сек) — 0 = по скорости, иначе фиксированная; Этапы вывода (4–64, по умолч. 32 — выше = чище, но медленнее); CFG Scale (0–4, по умолч. 2.0); галочки Шумоподавление и Постобработка (удаление пауз).
  • 2 «Как это работает» — что делает кнопка установки. Требования: Python 3.10+, GPU ~4 ГБ VRAM (или CPU).
🍪 This website uses cookies to improve your web experience.