Вася. Голос, паузи, характер.
60 секунд українською. Мікс, голос окремо та вісім коротких проб. Завантаження WAV і MP3.
Сценарій · Голосова ДНК · Метод
Які платні клони тестувати далі: порівняння сервісів і потрібні ключі
«Ну і де я?» — 60 секунд
Синтетичний голос, музика й паузи. Некомерційна дослідна версія OmniVoice.
Голос окремо
Те саме виконання на тій самій 60-секундній шкалі, з паузами, без музики та ефектів.
«Ну і де я?» — до обробки
Початкова інтонація синтезу. Порівняйте завершення короткого внутрішнього запитання.
«Ну і де я?» — після перенесення інтонації
На синтетичний звук перенесено виміряну криву висоти й тривалість оригінальної репліки. Оригінальне аудіо сюди не вставлено.
Український StyleTTS2 — повний дубль
Фіксований профіль із чистішого інтерв’ю. Розбірливий, але рівніший і менш живий. Рання редакція тексту; наголос «місяці́в» після дев’яти тут залишено як виявлений недолік проби.
Gemini Charon — повний дубль
Стиль задано описом. Це не клон Васі; довга проба вийшла надто урочистою, є «нє» замість «ні». Рання редакція сценарію.
OmniVoice · без наголосів у запиті
Шість секунд референса з інтерв’ю; коротка проба без акцентних знаків.
OmniVoice · з наголосами
Той самий референс, текст з акцентними знаками. Один аналізатор почув «ідея» замість «і де я».
StyleTTS2 · влог
Яскравіший референс із влогового вступу. Рання проба: у запиті був помилковий наголос «перегля́дів».
StyleTTS2 · спокійна розмова
Референс із чистішого інтерв’ю. Рання проба з помилковим наголосом «перегля́дів».
StyleTTS2 · змішана подача
Частину просодичних ознак передбачає модель. Рання проба з помилковим наголосом «перегля́дів».
Gemini · Charon
Готовий голос з описом подачі; не клонування. Ранній тестовий текст.
Gemini · Iapetus
Інший готовий голос з тим самим текстом і описом; не клонування.
Gemini · Algieba
Третій готовий голос. У короткому модельному порівнянні найменше нагадував референс.
Що саме зроблено
Сценарій авторський, голос синтетичний. Для основи використано записи Васі; політичних персонажів із референсів у його образ не переносили. Відео не генерувалося.
Порівняно три сімейства синтезу: Gemini 3.8 Flash TTS, український StyleTTS2 та OmniVoice. Вісім коротких проб перевірено на однаковому базовому тексті; зроблено повні дублі, перегенерацію окремих реплік і два досліди перенесення інтонації. Короткі порівняльні файли вирівняно за гучністю, щоб гучніший голос не отримував автоматичної переваги.
Основою обрано OmniVoice з референсом чистішого інтерв'ю. Блок числових уточнень перегенеровано. Для «ну і де я?» перенесено виміряну криву висоти та тривалість із справжньої репліки на синтетичний звук. Два способи переробити фінальне «Поїхали!» не дали достатнього покращення; у фіналі залишено цілісне закінчення основного дубля. Воно все ще менш енергійне за влоговий оригінал. У фінальному голосі немає вставок справжніх висловлювань.
Gemini не видано за клон. Google уже має voice replication, але його API вимагає справжній запис згоди того самого мовця. Такого запису чи готового профілю тут не було. Тому три Gemini-проби — готові голоси з режисерськими вказівками. Подробиці перевірки.
Музика й фінальний експорт
Музику створено окремо через Lyria 3.5. Із генерації на запит 128 BPM взято чисте 15-секундне інструментальне вікно, повторено й переаранжовано фільтрацією та рівнями. Голосові теги первинної генерації вирізано; модельна перевірка підкладки після монтажу не виявила вокалу. Музика приглушується під мовлення, після останньої репліки отримує приблизно сім секунд самостійного фіналу. Короткий звук після побутової деталі синтезовано окремо.
| Експорт | Тривалість PCM | Виміряна гучність | True peak |
|---|---|---|---|
| Основний WAV, стерео, 48 кГц | 60,000 с | −14,86 LUFS | −1,49 dBTP |
| Основний MP3, 192 кбіт/с | 60 с мовного/музичного матеріалу | −15,12 LUFS | −1,61 dBTP |
| Голос WAV, моно, 48 кГц | 60,000 с | −15,89 LUFS | −1,45 dBTP |
MP3 має контейнерне доповнення; для точної монтажної шкали беріть WAV. Гучність виміряно по готових файлах, а не взято із запиту генератору. Контрольні суми всіх публічних аудіофайлів.
Чесно про якість
Тембр наближено, але це не бездоганна копія Васі. Окремі закінчення й переходи ще синтетичні; аналізатори розходяться у сприйнятті «і де я» та наголосу в «тому малому»; фінальний запуск поступається живому влогу за енергією. Зміна наголосу у запиті не завжди змінювала фактичну вимову. Дві довгі проби зі змішаними ознаками StyleTTS2 дали шум і втрату фраз — їх не включено до плеєрів. Два перегенеровані мікрофрагменти також відбракували; для внутрішнього запитання застосовано обробку основного дубля, а завершення збережено з нього без прискорення.
Перевірка поєднує аналіз звукового сигналу, транскрипцію та модельне прослуховування. Вона не замінює людську оцінку схожості; оцінки моделей іноді суперечили одна одній і навіть словникам. Highlights досі не отримано, тому історії не використані як голосова база. Що відомо про покриття · Highlights.