Голос Васі: від тембру до мікрофрази
Слухати аудіопроби · Сценарій · Метод і моделі
Його впізнаваність — у перемиканні подачі. У розмові — швидкі зв'язки між словами, невеликі вагання, нижчі закінчення. У вступі влога — яскравіше звернення до глядача й виразний запуск. Одна низька «впевнена» нота на весь ролик цього не передає.
Це опис опублікованого мовлення, а не висновок про особистість. Для голосового проходу прослухано моделлю вісім відеодоріжок: два вступи влогів, два інтерв'ю, трейлер про машину, побутове спостереження, короткий прямий гачок і тизер наступного гостя. Атрибуція спирається на представлення та текстові джерела. Репліки співрозмовників відокремлено; розпізнавання особи за голосом не застосовувалося.
Що виміряно
Чистіші вікна вирізано з оригінальних MP4 у моно PCM, 24 кГц. F0 — автокореляція Praat, межі 65–400 Гц, крок 10 мс. У таблиці — озвучені кадри, не вся хвиля; це характеристики конкретних уривків.
| Уривок | Вікно джерела | Медіана F0 | Діапазон 10–90% | Розмах |
|---|---|---|---|---|
| Сповідальна розповідь | Ddl8Obwpo0x, 0–19 с | 127,0 Гц | 107,9–168,5 Гц | 7,7 півтона |
| Наголос на результаті | те саме, 23,3–30,0 с | 128,9 Гц | 113,8–182,0 Гц | 8,1 півтона |
| Пояснення невдач і спроб | Ddilv1jJo3H, 11,5–27,2 с | 124,4 Гц | 107,8–165,3 Гц | 7,4 півтона |
Медіани не є ціллю, до якої потрібно механічно знизити весь синтез. У влоговому вступі оцінка вища, але там є музика: її не використано як чистий еталон частоти голосу. Збіг F0 сам по собі не доводить схожості голосів.
Карта мікрофраз
Таймкоди нижче приблизні: звірені з аудіоаналізом і сегментами ASR, а не з ручною фонемною розміткою. Напрям інтонації — спостереження моделі; точні герци окремих складів не заявляються.
| Фраза / рух | Де чути | Що робить голос | Як переносити в новий текст |
|---|---|---|---|
| «Друзі, всім привіт» | DSr3IFFE3Cl, 0–3 с; Db7_WdkJkSm, початок | Яскравіша атака звернення, рух до наступної фрази без урочистої зупинки | Привітання має запросити, а не оголосити героя трейлера |
| «ну і де я?» | Ddl8Obwpo0x, приблизно 11–12 с | Коротка репліка внутрішнього діалогу; компактне, нижче завершення | Не розтягувати кожне слово; зберегти окремі «і / де / я», не злити в «ідея» |
| Дев'ять місяців → шість мільйонів | те саме, приблизно 19–28 с | Звичайне пояснення змінюється енергійнішим числовим акцентом | Пауза має відділити невдачу від результату; виділити число, а не декламувати все речення |
| «Поїхали!» | DSr3IFFE3Cl, приблизно 57,8–59,8 с; Db7_WdkJkSm, приблизно 52–54 с | Короткий запуск із виразним наголошеним «ї» і завершенням униз | Після нього віддати простір біту; не перетворювати на довгий вигук |
| «Друзі, дивіться» | DUnco1YE249, 0–1,3 с | Запрошення подивитися на конкретну деталь | Побутовий тон, швидкий перехід до предмета. Перебільшений вигук про балкон у цьому ж відео — окрема сценка, не базовий тембр |
| Коротке числове перепитування | DSuJG2jE7pW, приблизно 12,6–24,5 с | Запит → сума → коротке уточнення одиниці чи масштабу | Українське «Скільки?» — адаптація російськомовного джерела, не нібито дослівний запис |
| Спокійний жарт до глядача | Ddn3xGQJhIN, 0–11,3 с | Близьке сухіше мовлення, усмішка в інтонації, потім музичне продовження | Це власний місток Васі до форми референсів; не потрібно запозичувати голос політичного персонажа |
Слова, яким потрібен контекст
«Ну», «просто», «я думаю» працюють як початок думки, поправка або розігрування власного колишнього сумніву. Не варто вставляти їх перед кожним реченням. «Залітало» переводить показники платформи в побутову мову. «Друзі» включає аудиторію в розмову. Детальні джерела й межі підрахунку — у словнику та реєстрі слів.
«Поїхали» знайдено у чотирьох різних відеопостах із транскриптом і одному підписі. Це частота постів у вибірці, не чотири незалежні епізоди й не автоматичне доведення, що кожне входження належить одному мовцю. «Не гривень» і «randoms» повторюються в підписах, але для їхньої характерної звукової вимови доказів немає.
«Вася, ти молодець» взято з письмового звернення до себе. Подяка молодшому собі та повернення до роботи — з підпису про автомобіль. Інтонацію цих нових реплік поставлено творчо: її не видаємо за відтворення знайденого оригінального запису.
Новий профіль ElevenLabs
Для нового виконання створено чотири приватні IVC-профілі. Обрано очищені влоги DSr3IFFE3Cl та Db7_WdkJkSm, разом близько 113,7 с. Оригінальний темп і висоту референсів не змінювали. Фінальна подача враховує контраст швидких уточнень, спокійнішої власної історії та яскравого завершення. Це режисерська адаптація, не точне копіювання всіх фонем.
Профілі й вихідні аудіо збережено приватно для наступного тексту. Публічні ідентифікатори голосів не розкриваються. Нова версія і порівняння · Метод вибору.
Попередні профілі, які можна використати повторно
Збережено три окремі речі: вихідні уривки з контрольними сумами, приватний профіль клонування та відкриті режисерські правила. Шість секунд чистішого інтерв'ю з точним текстом подано в OmniVoice; StyleTTS2 окремо випробувано на розмовному та влоговому матеріалі. Профілі моделей і повні джерельні аудіофайли не викладено на публічну сторінку.
Для наступного тексту треба знову перевірити наголоси, межі фраз і готовий звук. Поточний профіль не гарантує, що нове слово чи довга фраза автоматично прозвучать правильно. Подібність тембру, відповідність інтонації та точність тексту — три окремі критерії.
Межі цього проходу
Highlights не отримано: у попередньому зборі їх нуль, загальна кількість невідома. Неформальний регістр представлений доступними влогами та розмовними уривками. У голосових джерелах є монтаж, різні мікрофони й подекуди музика. Повного чистого студійного корпусу Васі немає. Автоматичні аудіорецензії можуть помилятися; це не слухацька панель і не підтвердження від самого Васі.
Архівний дослід перенесення інтонації на «ну і де я?»
Цей дослід стосується попереднього OmniVoice, не нового ElevenLabs-дубля. Додатковий прохід працює вже зі звуком: із Ddl8Obwpo0x, приблизно 11,54–12,28 с, виміряно криву F0. Її накладено на синтетичну репліку через Praat overlap-add; тривалість цієї частини наближено до оригіналу. Справжній запис у нову репліку не вставлявся.
Це конкретніше за вказівку «говори як Вася»: переноситься виміряний рух тону. В окремому модельному порівнянні після обробки відзначено ближче іронічне спадне завершення. Проби до й після доступні для слухацької оцінки. Не заявляємо ідентичного руху артикуляції, кожної фонеми чи дихання: їх таким способом не відтворено.