ВАСИЛЬ ТИМОШЕНКО · АУДІО ДЛЯ РІЛСАСинтетична творча проба

Як перевірявся голос

Слухати порівняння · Голосова ДНК · Текст і наголоси

Тут розділено клонування з аудіоприкладу, готовий голос із режисерськими вказівками та монтаж готового звуку. Вони дають різні результати й не є взаємозамінними.

Новий прохід ElevenLabs після зауваження власника

Наданий ключ реально використано. Акаунт дозволив створити чотири Instant Voice Clone; кожна відповідь API мала requires_verification: false. Це фактичний статус цих запитів, а не твердження про проходження Professional Voice Clone-верифікації. Створення IVC.

Референси: інтерв’ю Ddl8Obwpo0x, відповідь без інтерв’юера Ddilv1jJo3H, прямий монолог DYHgP-Fp6cP, вступ DSr3IFFE3Cl та вступ Db7_WdkJkSm. Два влоги після ізоляції дали приблизно 113,7 секунди матеріалу для вибраного профілю. Музичні та акустичні умови різняться; очищення не вважається автоматичним покращенням без порівняння.

17 успішних генерацій/конвертацій перевірили референс, суцільну й пореплікову подачу, знаки наголосу, режисерські теги та два seed. Окремо випробувано v3 й eleven_multilingual_sts_v2: у цьому порівнянні вони поступилися v4. Один v3-запит повернув HTTP 400 через непідтримуваний similarity; після вилучення параметра новий запит виконався. Автоматичного повторення платних запитів немає.

Фінальний v4: один цілісний input, українська, stability=0.35, similarity=0.93, seed=4401, apply_text_normalization=off. Текст без акцентних знаків; небагато тегів для цікавості, розмовної, задумливої, теплої та енергійної подачі. Вони не гарантують однакової інтонації кожної повторної генерації. v4, діалоговий API, Voice Changer.

Gemini 3.1 Pro порівняв анонімізовані дублі; Gemini 3.8 Flash окремо перевірив текст і мовлення. Це дві моделі одного постачальника, не незалежна людська панель. Вислови моделі про «ідентичний тембр», оцінку 10/10 чи готовність до комерційного використання не прийнято як доказ. Так само не прийнято заяви про точні форманти без вимірювань.

Whisper підтвердив послідовність реплік, але почув «моє» там, де інша модель чула «мої». Повні рецензії та короткі слухові перевірки розходилися в «пере́глядів»; два повторні аналізи 12-секундного вікна почули нормативний наголос. Коротке «і де я» поза контекстом лишається неоднозначним. Власну помилку розмітки пе́ріод виправлено на пері́од; вибраний API-запит не містив цієї хибної позначки.

Голос не розтягнуто й не знижено по висоті; справжні репліки не домішувалися. Монтаж використовує цілісний синтетичний дубль, фільтр нижче 70 Гц, вирівнювання гучності та тихішу музичну підкладку. Чисте мовлення й мікс перевірено окремо. Точні результати — біля плеєрів.

Нативний результат тарифу — MP3 44,1 кГц / 192 кбіт/с. PCM WAV 48 кГц підготовлено для монтажу, без обіцянки відновити втрачені MP3 дані. Лічильник збільшився на 7 566 кредитів; нову підписку не купували. Професійне навчання PVC не запускали: воно потребує окремого процесу й справжньої верифікації мовця. Вимоги PVC.

Архів попереднього досліду

Нижче збережено методи попередньої версії; основне аудіо тепер створене через ElevenLabs.

Що насправді вміє поточний Gemini

На 1 жовтня 2026 року документація Google описує реплікацію голосу для Gemini 3.8 Flash TTS і Flash Lite TTS. Потрібні два записи одного повнолітнього мовця: зразок голосу та окремий справжній запис згоди з визначеним текстом. Доступний ключ API перевірено; серед зареєстрованих голосів відповідного профілю Васі не знайдено. Офіційна документація реплікації.

Запису згоди або наявного voice_id у цьому завданні не отримано. Тому клон Васі через Google не створено. Для порівняння згенеровано Charon, Iapetus та Algieba з описом української артикуляції, інтонацій і тембру. Це готові голоси Gemini, а не приховано названі «клонами». Генерація мовлення.

Моделі з аудіореференсом

StyleTTS2, українська багатомовцева модель patriotyk. Приймає фонемний запис і акустичні/просодичні ознаки референса. Випробувано чисту розмову, гнучке змішування та влог; потім — повні дублі. Довгі версії зі змішуванням передбачених ознак дали шум, втрату фраз і нестабільність. Їх відбракували. Фіксований профіль без такого змішування дав повний розбірливий текст, але менш живу мелодику. Режисерські описи словами ця локальна модель безпосередньо не читає. Код, модель і MIT-ліцензія.

OmniVoice. Окремий механізм клонування із шести секунд чистішого інтерв'ю та точного тексту цих секунд. Короткі проби зроблено з наголосами й без них. В одному варіанті аналізатор почув злиття «і де я» в «ідея» — це показує, чому подібного тембру недостатньо. Ваги мають CC-BY-NC, код — Apache 2.0; це дослідний некомерційний варіант, а не оголошення про готовність до комерційної експлуатації. Модель, код.

Наголоси: саме те, що взято з MontageRnD

Використано тільки метод із гілки chief/3e80b5f096, ревізія b9337b193037035b84a0df31bb3f75be730a6064: stress.py, stress_listen.py і контракт вимови. Чужі музика, сценарій, голоси та обмеження на вибір провайдерів не переносилися.

У ранньому тестовому тексті помилково було «перегля́дів». Це наша помилка розмітки, а не встановлена риса вимови Васі. У повному сценарії виправлено на пере́глядів; для дев’ять мі́сяців окремо перевірено числівниковий контекст. Ізольована словоформа «місяці́в» зі словника спочатку дала хибну підказку; остаточна редакція повертає «мі́сяців» після числівника. Ранні проби залишено як історію порівняння з явним підписом. Перевірка повних запитів виконана до їхньої генерації; для перших шести коротких проб такого попереднього реєстру ще не було.

Джерела для складних випадків: перегляд — СУМ, мі́сяців після числівника — Kyiv Dictionary, покликати — контекст доконаного виду. Словник у середовищі — ukrainian-word-stress 2.1.0.

Аудіорецензії та їхні межі

Короткі порівняння отримували референс A та синтез B без назви моделі синтезу. Використано Gemini 3.8 Flash, а для додаткових перевірок — Gemini 3.1 Pro Preview. Повні дублі перевірялися на пропущені слова, стрибки тембру, шум, інтонацію та наголоси. Аналізатори також помилялися у власних твердженнях про мовну норму: один назвав правильне «пере́глядів» помилкою. Словникова перевірка та почуте наголошення розглядалися окремо. Позитивна оцінка короткої проби не переносилася автоматично на довгий текст.

Це модельне прослуховування, не незалежне людське тестування. Суб'єктивні бали не переведено у «відсоток ідентичності». Твердження аналізатора про нібито ідентичні форманти не прийнято: формантної верифікації не було. Остаточне відчуття схожості можна оцінити на сторінці з плеєрами.

Що збережено й що опубліковано

Приватно збережено точні запити, відповіді без ключів, аудіореференси, профілі моделей, проміжні дублі, результати перевірок і контрольні суми. Публічний сайт отримує тільки відібрані згенеровані експорти та пояснення. Ключі API, .env, сирі транскрипти, голосові профілі й оригінальні повні відео до публікації не входять.

Музичні варіанти створено Lyria 3.5. Запит на відсутність вокалу перевірявся по фактичному звуку: у первинних генераціях виявлено голосові теги. Це не приховується як «чистий інструментал». Остаточний монтаж і результати вимірювання наведено поруч із готовим аудіо. Документація Lyria.

Перевірка попереднього OmniVoice-експорту

Попередню OmniVoice-версію прослухано моделлю повністю: сторонніх голосів, пропущених слів і явних монтажних кліків не виявлено; фінальну репліку збережено без прискорення, разом із закінченням. Це модельний висновок, а не гарантія. Зауваження щодо менш живої емоційної динаміки залишено відкритими.

Whisper використано для часових меж слів, зі звіркою з 20-мілісекундними вікнами енергії. Він зливав «і де я» в «ідея», а на тиші після голосу одного з експериментальних експортів вигадав титр про субтитрувальницю. Перевірка PCM показує точні нулі в голосовій доріжці від 54 до 60 секунди: такого вислову в аудіо немає. Тому сирий ASR не видано за остаточний сценарій. Офіційна документація OpenAI щодо часових міток.