ВАСИЛЬ ТИМОШЕНКО · АУДІО ДЛЯ РІЛСАСинтетична творча проба

Голос Васі: від тембру до мікрофрази

Слухати аудіопроби · Сценарій · Метод і моделі

Його впізнаваність — у перемиканні подачі. У розмові — швидкі зв'язки між словами, невеликі вагання, нижчі закінчення. У вступі влога — яскравіше звернення до глядача й виразний запуск. Одна низька «впевнена» нота на весь ролик цього не передає.

Це опис опублікованого мовлення, а не висновок про особистість. Для голосового проходу прослухано моделлю вісім відеодоріжок: два вступи влогів, два інтерв'ю, трейлер про машину, побутове спостереження, короткий прямий гачок і тизер наступного гостя. Атрибуція спирається на представлення та текстові джерела. Репліки співрозмовників відокремлено; розпізнавання особи за голосом не застосовувалося.

Що виміряно

Чистіші вікна вирізано з оригінальних MP4 у моно PCM, 24 кГц. F0 — автокореляція Praat, межі 65–400 Гц, крок 10 мс. У таблиці — озвучені кадри, не вся хвиля; це характеристики конкретних уривків.

Уривок Вікно джерела Медіана F0 Діапазон 10–90% Розмах
Сповідальна розповідь Ddl8Obwpo0x, 0–19 с 127,0 Гц 107,9–168,5 Гц 7,7 півтона
Наголос на результаті те саме, 23,3–30,0 с 128,9 Гц 113,8–182,0 Гц 8,1 півтона
Пояснення невдач і спроб Ddilv1jJo3H, 11,5–27,2 с 124,4 Гц 107,8–165,3 Гц 7,4 півтона

Медіани не є ціллю, до якої потрібно механічно знизити весь синтез. У влоговому вступі оцінка вища, але там є музика: її не використано як чистий еталон частоти голосу. Збіг F0 сам по собі не доводить схожості голосів.

Карта мікрофраз

Таймкоди нижче приблизні: звірені з аудіоаналізом і сегментами ASR, а не з ручною фонемною розміткою. Напрям інтонації — спостереження моделі; точні герци окремих складів не заявляються.

Фраза / рух Де чути Що робить голос Як переносити в новий текст
«Друзі, всім привіт» DSr3IFFE3Cl, 0–3 с; Db7_WdkJkSm, початок Яскравіша атака звернення, рух до наступної фрази без урочистої зупинки Привітання має запросити, а не оголосити героя трейлера
«ну і де я?» Ddl8Obwpo0x, приблизно 11–12 с Коротка репліка внутрішнього діалогу; компактне, нижче завершення Не розтягувати кожне слово; зберегти окремі «і / де / я», не злити в «ідея»
Дев'ять місяців → шість мільйонів те саме, приблизно 19–28 с Звичайне пояснення змінюється енергійнішим числовим акцентом Пауза має відділити невдачу від результату; виділити число, а не декламувати все речення
«Поїхали!» DSr3IFFE3Cl, приблизно 57,8–59,8 с; Db7_WdkJkSm, приблизно 52–54 с Короткий запуск із виразним наголошеним «ї» і завершенням униз Після нього віддати простір біту; не перетворювати на довгий вигук
«Друзі, дивіться» DUnco1YE249, 0–1,3 с Запрошення подивитися на конкретну деталь Побутовий тон, швидкий перехід до предмета. Перебільшений вигук про балкон у цьому ж відео — окрема сценка, не базовий тембр
Коротке числове перепитування DSuJG2jE7pW, приблизно 12,6–24,5 с Запит → сума → коротке уточнення одиниці чи масштабу Українське «Скільки?» — адаптація російськомовного джерела, не нібито дослівний запис
Спокійний жарт до глядача Ddn3xGQJhIN, 0–11,3 с Близьке сухіше мовлення, усмішка в інтонації, потім музичне продовження Це власний місток Васі до форми референсів; не потрібно запозичувати голос політичного персонажа

Слова, яким потрібен контекст

«Ну», «просто», «я думаю» працюють як початок думки, поправка або розігрування власного колишнього сумніву. Не варто вставляти їх перед кожним реченням. «Залітало» переводить показники платформи в побутову мову. «Друзі» включає аудиторію в розмову. Детальні джерела й межі підрахунку — у словнику та реєстрі слів.

«Поїхали» знайдено у чотирьох різних відеопостах із транскриптом і одному підписі. Це частота постів у вибірці, не чотири незалежні епізоди й не автоматичне доведення, що кожне входження належить одному мовцю. «Не гривень» і «randoms» повторюються в підписах, але для їхньої характерної звукової вимови доказів немає.

«Вася, ти молодець» взято з письмового звернення до себе. Подяка молодшому собі та повернення до роботи — з підпису про автомобіль. Інтонацію цих нових реплік поставлено творчо: її не видаємо за відтворення знайденого оригінального запису.

Новий профіль ElevenLabs

Для нового виконання створено чотири приватні IVC-профілі. Обрано очищені влоги DSr3IFFE3Cl та Db7_WdkJkSm, разом близько 113,7 с. Оригінальний темп і висоту референсів не змінювали. Фінальна подача враховує контраст швидких уточнень, спокійнішої власної історії та яскравого завершення. Це режисерська адаптація, не точне копіювання всіх фонем.

Профілі й вихідні аудіо збережено приватно для наступного тексту. Публічні ідентифікатори голосів не розкриваються. Нова версія і порівняння · Метод вибору.

Попередні профілі, які можна використати повторно

Збережено три окремі речі: вихідні уривки з контрольними сумами, приватний профіль клонування та відкриті режисерські правила. Шість секунд чистішого інтерв'ю з точним текстом подано в OmniVoice; StyleTTS2 окремо випробувано на розмовному та влоговому матеріалі. Профілі моделей і повні джерельні аудіофайли не викладено на публічну сторінку.

Для наступного тексту треба знову перевірити наголоси, межі фраз і готовий звук. Поточний профіль не гарантує, що нове слово чи довга фраза автоматично прозвучать правильно. Подібність тембру, відповідність інтонації та точність тексту — три окремі критерії.

Межі цього проходу

Highlights не отримано: у попередньому зборі їх нуль, загальна кількість невідома. Неформальний регістр представлений доступними влогами та розмовними уривками. У голосових джерелах є монтаж, різні мікрофони й подекуди музика. Повного чистого студійного корпусу Васі немає. Автоматичні аудіорецензії можуть помилятися; це не слухацька панель і не підтвердження від самого Васі.

Архівний дослід перенесення інтонації на «ну і де я?»

Цей дослід стосується попереднього OmniVoice, не нового ElevenLabs-дубля. Додатковий прохід працює вже зі звуком: із Ddl8Obwpo0x, приблизно 11,54–12,28 с, виміряно криву F0. Її накладено на синтетичну репліку через Praat overlap-add; тривалість цієї частини наближено до оригіналу. Справжній запис у нову репліку не вставлявся.

Це конкретніше за вказівку «говори як Вася»: переноситься виміряний рух тону. В окремому модельному порівнянні після обробки відзначено ближче іронічне спадне завершення. Проби до й після доступні для слухацької оцінки. Не заявляємо ідентичного руху артикуляції, кожної фонеми чи дихання: їх таким способом не відтворено.