17 Jul 2026, 10:56 UTC902 views30 reactions1 Starread 7 August 2026 Forwarded from @voicestuff
🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", с Ильёй Латышевым, которую приняли на Interspeech 2026
Слова Ильи:
Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать: если кажется, что всё, что может пойти не по плану, обязательно пойдёт не по плану — скорее всего, так и будет 😄 Переносы записей, сорванные дедлайны, орган…
🔥29❤1
27 Feb 2026, 15:55 UTC≈4,360 views39 reactionsread 7 August 2026 Forwarded from @teraspace_newsPhoto
Всем привет ребятки, выложил тут датасет с ютуба, сделан через пайплайн FireRed Vad -> двойной гигаам с мерджингом (пунктуация из е2е и текст из обычной) -> алайн через квен алайн -> отчистка через clearer voice
Данные в формате опус, 48khz, mono, один спикер, у каждого опус файла есть txt файл с текстом аудио, в метадате данные в формате путь||текст(с ударениями)||время аудио в секундах
https://huggingface.co/data…
❤39
11 Oct 2025, 16:33 UTC≈7,670 views20 reactions6 Starsread 7 August 2026 Forwarded from @vf_science
Колаб для семинара, в котором мы обучим поверх кодов Mimi кодека классификатор голосов на мужской и женский 😄
Используем 8 кодбуков, обучаем 8 трансформер-энкодеров, делаем темпоральный пулинг по токенам, а затем атеншн пулинг между энкодерами. Потом обычный классификатор. Из прикольного - визуализация атеншна на разные уровни RVQ.
Научились работать с RVQ и в качестве упражнения можете посчитать разные статистики …
🔥15❤5
11 Oct 2025, 13:44 UTC≈6,210 views32 reactions1 Starread 7 August 2026 Forwarded from @vf_science
👀 Про аудио кодеки в Deep Learning School
Сегодня выложили 2 части лекции и она немножко затянулась, примерно на 100 минут :)
На лекции мы обсудили основополагающую технологию VQ-VAE и дошли до современных подходов к обучению аудиокодеков. Попутно рассмотрели специфические для них проблемы и способы их решения — такие как недифференцируемость в процессе обучения, коллапс кодовой книги, неэффективное покрытие домена…
🔥16❤8🥰5👍3
25 Aug 2025, 16:55 UTC≈55,100 views229 reactions191 Starsread 7 August 2026 Video
Наш русскоязычный датасет для TTS опубликован!
Сегодня выкладываем открытые корпуса на 4000+ часов речи, а еще синтезатор речи ESpeech-TTS-1
Наш датасет содержит больше 4000 часов русской речи. Статистика по корпусам:
Многоголосые:
ESpeech-podcasts - 3200 часов
ESpeech-webinars - 850 часов
Одноголосые:
ESpeech-igm - 220 часов
ESpeech-buldjat - 54 часа
ESpeech-upvote - 296 часов
ESpeech-tuchniyzhab - 306 часов
Да…
🔥147❤🔥31👏20❤13custom 49972893891480791716🤡5👍3👎2
24 Aug 2025, 15:43 UTC≈5,490 views26 reactions11 Starsread 7 August 2026 File
Stay tuned!
🔥19custom 49972893891480791714❤3
1 Jul 2025, 10:20 UTC≈7,730 views31 reactionsread 7 August 2026 File
Наш проект на Лето с AIRI 👾
Мы с Захаром @vf_science решили выложить постер с нашим методом, по которому, вероятно, будет наш финальный проект.
Но есть несколько дополнений, ибо места в постере мало (проговорим вживую на постерной сессии):
1. Перплексия считается по кодбуку, а не по языковой модели (И да, чем больше тем лучше)
2. MOS низкий, поскольку у нас небыло времени обучить на достаточном количестве данных, …
❤15🔥10❤🔥6
10 Jun 2025, 15:58 UTC≈5,970 views14 reactionsread 7 August 2026 Forwarded from @vf_sciencePhoto
❤️ Секция про ML в музыке на DataFest 2025!
Посмотреть запись секции: https://vkvideo.ru/video-164555658_456241380?t=5h35m33s
Отдельно доклады будут выложены на ютубе позже.
Впервые за время существования датафеста (10 лет!) мною была собрана секция про ML в музыке и сразу 5 спикеров на 1 площадке:
▪️Максим Смоляков: "AI-Generated Music: методологии оценки качества и оптимизация генерации."
▪️Алексей Попов: "Генера…
❤12🔥2
2 Jun 2025, 15:44 UTC≈6,440 views55 reactions1 Starread 7 August 2026 Спасибо Илье и донатерам за поддержку. Теперь некоторые технические детали:
* В датасете будет 2-5к часов аудио (скорее всего больше)
* Формат: mp3, 16bit depth, 44100, 320kbps
* Речь разговорная, но некоторая примесь читающей (книги) тоже будет.
* Разметка eMOS для каждого сэмпла
* Длина сэмплов 1-3 предложения
* Разметка таймстемпов слов (получена через wav2vec2)
* Разметка ударений (обычные слова по словарю, омо…
🔥40❤9👏5🤩1
2 Jun 2025, 15:43 UTC≈3,210 views17 reactionsread 7 August 2026 Forwarded from @voicestuff
🚀 Разгоняем open-source-TTS
Сегодня я инвестирую в создание открытого корпуса русской речи!
Почему это важно?
Русские TTS-модели отстают от мирового уровня примерно на два года. Главная причина - это нехватка крупных, качественных и общедоступных датасетов. Без данных сложно быстро тестировать идеи и выпускать новые модели.
Кто делает датасет?
Знакомый вам Денис @bceloss, уже собирает нужные данные. Грант позволит…
❤17
Showing the 10 most recent of 10 posts we hold for @den4ikresearch. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.