Загрузите 1–30 секунд чистой речи (до 15 МБ) — модель озвучит ваш текст этим голосом, без обучения.
Рендер ~5-10с с транскриптом, ~25-40с без (распознавание).