Постобробка голосу
Той самий схвалений дубль, три варіанти звучання. Гучність вирівняна, слова й таймінг збережено. Почніть з «Обробка» та перемикайте під час відтворення.
Власник схвалив опублікований результат і попросив зберегти цей метод для наступних голосів. Конкретного вибору між «Обробка» та «М’якше» не вказано. Як процес збережено в харнесі.
Перемикайте версії під час прослуховування — позиція збережеться.
Обробка
60-секундний мікс — MP3 · Мікс — WAV · Усі версії
Що чути в кожній версії
| Варіант | Що зроблено | Компроміс |
|---|---|---|
| До | Попередній ElevenLabs-майстер, лише вирівняний за гучністю | Залишена його різкість і попередня обробка динаміки |
| Обробка | М’яка корекція біля 3,1 кГц і динамічне приглушення свистячих | Консервативний варіант; залишає більше чіткості |
| М’якше | Сильніше приглушення свистячих і верхньої середини | Менше яскравості; на деяких навушниках може здатися глухішим |
Робота починається з вихідного файлу схваленої генерації, до попереднього фінального мастерингу. Нового TTS-дубля немає. Рівень піднято або знижено постійним коефіцієнтом, без додаткового компресора, лімітера, зміни висоти чи розтягування часу. Усі три WAV мають 2 492 160 семплів при 48 кГц — 51,920 с.
Що перевірено
Гучність WAV: −19,00 / −19,01 / −19,02 LUFS для «До / Обробка / М’якше». Тому перевага гучнішого варіанта майже усунена. В однакових контрольних ділянках із сильними високими частотами енергія смуги 4,5–8 кГц знизилася приблизно на 4,2 дБ в основній версії й на 6,2 дБ у м’якшій відносно «До». Це вимірювання вибраних ділянок, а не відсоток усунення роботизованості.
Перевірено збереження тривалості, кінцівки, пауз, запасу до перевантаження та відсутність доданого шуму на тиші. Алгоритмічні тести окремо перевіряють приглушення високочастотного сплеску зі збереженням низькочастотної голосової основи.
Додатково випробувано ElevenLabs Audio Isolation на тому самому синтетичному записі. Її не включено до фіналу: вона сильніше змінила дрібні голосові деталі, а одна аудіорецензія відзначила «водянисті» приголосні. Цей пробний API-запит використав 865 кредитів; остаточна обробка виконана локально.
Що обробка не виправить
Еквалізація та деесинг пом’якшують різкість. Вони не гарантують усунення синтетичної фактури голосних, не створюють справжніх вдихів і не повертають деталей, яких немає у вихідному MP3. Не заявляємо, що голос повністю перестав звучати роботизовано.
Автоматичні рецензії розійшлися: Gemini 3.1 Pro віддав перевагу м’якшому варіанту, Gemini 3.8 Flash не розрізнив версії надійно. Тому вибір основної версії консервативний, а не «доведений слухацький переможець». Найкорисніша перевірка — перемикання вище на вашому звичному пристрої.
WAV — монтажний PCM 24 біти / 48 кГц; MP3 — 320 кбіт/с. Це формати нового експорту, а не обіцянка відновлення інформації вихідної генерації. Контрольні суми · Сценарій · Голосова ДНК.