- 1. Меню «Озвучка текста»
- 1. Поле текста, 2. «Очистить», 3. счётчики
- 4. Аудиоплеер
- 5. TTS-сервис, 6. голос, 7. язык
- Дополнительные функции (прокрутите панель настроек вниз)
- 1. Дополнительные настройки
- 2. «🎤 Сгенерировать речь»
- 3. Пакетная обработка
- 7. 🎵 Фоновое аудио и статус (в самом низу)
- Отдельное окно «Настройки OmniVoice» (офлайн-движок с клонированием и дизайном голоса)
- 8. Статус, установка, путь и режим
- 9. Режим «Клонирование голоса»
- 10. Режим «Дизайн голоса»
- 11. Параметры генерации и справка
1. Меню «Озвучка текста» #
Раздел 🔊 Озвучка текста превращает текст в аудио (TTS). Экран из двух колонок: слева — поле ввода текста и аудиоплеер, справа — длинная панель настроек (её нужно прокручивать — там и находятся дополнительные функции).

1. Поле текста, 2. «Очистить», 3. счётчики #
В поле 1 вставляете текст для озвучки. ✕ Очистить 2 — стереть поле. Под полем 3 — счётчики Символов / Слов / Примерное время будущего аудио.
4. Аудиоплеер #
После генерации здесь появляется результат: кнопки ▶ Играть / ⏸ Пауза / ⏹ Стоп, полоса прогресса со временем, а также 💾 Сохранить как… и 📋 Копировать путь к файлу.
5. TTS-сервис, 6. голос, 7. язык #
TTS Сервис 5 — движок озвучки. В списке ~20 сервисов: ai33, ElevenLabs, OpenAI, OpenRouter, OmniVoice, Gemini TTS, офлайн-движки Silero и Supertonic и др. В зависимости от выбора ниже появляются доп. селекторы (напр. «Сервис ai33», «Модель TTS»). Голос 6 — конкретный голос (🔄 рядом — обновить список после добавления/клонирования). Язык 7 — язык озвучки.
⚠️ Онлайн-сервисы требуют API-ключ (задаётся в ⚙️ Настройки). Офлайн-движки (Silero, Supertonic) нужно один раз скачать кнопкой в «Дополнительных настройках». У ElevenLabs VoicerBot минимальная длина текста — 500 символов.
Дополнительные функции (прокрутите панель настроек вниз) #

1. Дополнительные настройки #
Раскрытый блок: Скорость и (в зависимости от сервиса) Качество, Высота тона, Громкость; Формат аудио (MP3 / WAV / OGG); Папка для сохранения готовых файлов.
2. «🎤 Сгенерировать речь» #
Запускает озвучку введённого текста выбранным голосом. Готовое аудио появится в плеере 4. Кнопка ⏹ Стоп прерывает генерацию.
3. Пакетная обработка #
Озвучить сразу папку с текстовыми файлами: выберите папку 📂, задайте ползунком «Максимум файлов для обработки», нажмите 📦 Пакетная обработка — программа озвучит все файлы по очереди (снизу — прогресс). ⏹ Стоп прерывает пакет.
7. 🎵 Фоновое аудио и статус (в самом низу) #
Ниже пакетной обработки — блок 🎵 Фоновое аудио: галочка «Включить фоновое аудио», а при включении — выбор папки с треками, самого трека и ползунок громкости фона (форматы MP3/WAV/OGG/M4A). В самом низу панели — строка статуса (например, «Найдено 20 сервисов, настроено: 18»).
Отдельное окно «Настройки OmniVoice» (офлайн-движок с клонированием и дизайном голоса) #
Если в списке 5 выбрать сервис OmniVoice, под настройками появляется кнопка Настройки OmniVoice — она открывает отдельное окно с большим количеством параметров (его нужно прокручивать). OmniVoice — это офлайн TTS-движок (600+ языков) с двумя режимами: клонирование голоса по образцу и дизайн голоса по параметрам.
8. Статус, установка, путь и режим #

- 1 Статус — установлен ли OmniVoice и загружена ли модель (зелёный = ок). Кнопка Проверить проверяет связь.
- 2 Установить OmniVoice ставит движок автоматически (скачивает с GitHub, создаёт изолированный
.venv, ставит зависимости); Загрузить модель — тянет модель (~2–3 ГБ). - 3 Путь к OmniVoice — папка с движком (пусто = глобальная установка).
- 4 Режим работы — Клонирование голоса или Дизайн голоса.
9. Режим «Клонирование голоса» #
Создаёт клон по образцу голоса.

- 1 Эталонное аудио (3–10 сек) — короткий образец голоса, который клонируем.
- 2 Текст эталонного аудио — необязательно; если пусто, текст распознаётся автоматически через Whisper.
- 3 + Добавить клон — сохранить клон. 4 Предварительная обработка — убрать тишину и поправить пунктуацию.
ℹ️ Выше формы — список сохранённых клонов (кнопки «Обновить» / «Удалить») и поле «Имя клона». Готовые клоны появляются в списке Голос 6 на главном экране озвучки.
10. Режим «Дизайн голоса» #
Собирает голос «с нуля» по характеристикам, без образца.

11. Параметры генерации и справка #

- Скорость (0.5–1.5); Длительность (сек) — 0 = по скорости, иначе фиксированная; Этапы вывода (4–64, по умолч. 32 — выше = чище, но медленнее); CFG Scale (0–4, по умолч. 2.0); галочки Шумоподавление и Постобработка (удаление пауз).
- 2 «Как это работает» — что делает кнопка установки. Требования: Python 3.10+, GPU ~4 ГБ VRAM (или CPU).