Грамадства22

Праект SONORA шукае тых, хто дапаможа «падключыць» беларускі голас да BigTech

У канале «TTS па-беларуску» з'явілася аб'ява аб запуску SONORA. Гэта праект, дзе ўдзельнікі запісваюць адкрыты беларускі датасэт для TTS — «каб беларуская гучала натуральна ў сучасных AI-сэрвісах», піша тэлеграм-канал Dzik Pic.

Здымак ілюстрацыйны. Фота: freepik.com

У чым праблема? Як сцвярджаецца на сайце, сёння ў свеце амаль не існуе якасных беларускамоўных галасавых датасэтаў, спецыяльна запісаных для навучання сучасных TTS-мадэляў. Пры гэтым у беларускай мове тысячы амографаў: аднолькавае напісанне, але розны сэнс у залежнасці ад націску. Калі мадэль памыляецца з націскам, ламаецца і гучанне, і сэнс. 

Другая праблема — фанетычная карэктнасць: мяккасць, «ў», «дз/дж», інтанацыя і рытм:

«Без якаснага студыйнага матэрыялу мадэлі паўтараюць памылкі і гучаць менш натуральна».

Так, сёння ўжо існуюць падобныя ініцыятывы, напрыклад, Donar.by альбо мадэль BexTTS. Але Sonora працягне іхні шлях і «выведзе яго на студыйны ўзровень».

Таму энтузіясты запусцілі супольнае фінансаванне, каб «арганізаваць прафесійны студыйны запіс беларускага маўлення на спецыяльна падабраных тэкстах». Карыстацца датасэтам змогуць даследчыкі, энтузіясты, стартапы і адукацыйныя ініцыятывы.

Акрамя таго, каманда плануе партнёрства з Google, OpenAI і ElevenLabs — «каб наш датасэт узмацніў іх рашэнні для беларусаў».

SONORA шукае цёплыя інтры/прамыя кантакты ў:

  • Google;
  • OpenAI;
  • ElevenLabs;
  • Speechify;
  • Meta.

«Калі ведаеце каго-небудзь у гэтых кампаніях і можаце зрабіць інтра — напішыце, калі ласка, у прыват, альбо напішыце зварот ад нас самі. Тэкст звароту тут», — просяць стваральнікі.

Вы можаце паслухаць, як гучыць беларуская мова ў тэхналогіях сёння, на стартавай старонцы.

Каментары2

  • ???
    09.03.2026
    Чаму напрыклад гэтым не займаецца Каардынацыйная Рада? Ці гендарныя квоты і лгбт важней чым беларуская мова?
  • Чарговы веласіпед
    10.03.2026
    Так а ў чым розніца паміж дадзеным праектам і Donar.by? Donar.by ж спецыяльна пашыраў функцыянал Common Voice, каб былі датасэты не толькі на распазнаванне гаворкі, але і на агучку.

    Ну а наконт "амаль не існуе якасных беларускамоўных галасавых датасэтаў", то наогул хлусня, на адным толькі Common Voice на дадзены момант запісана і праверана 1800 гадзін ад больш як 8000 чалавек. Такія вялікія датасэты ў свабодным доступе мала для якой мовы існуюць.

Цяпер чытаюць

Раскрыта маштабная карупцыйная схема, затрыманыя 44 чалавекі2

Раскрыта маштабная карупцыйная схема, затрыманыя 44 чалавекі

Усе навіны →
Усе навіны

У Германіі мужчына «наняў» ChatGPT у якасці адваката. Яму ўдалося выйграць справу2

Буйны і прэстыжны Зальцбургскі фестываль адкрые прамовай Марыя Калеснікава10

У гандлёвым цэнтры заўважылі воцат па цане аўтамабіля2

Мінчанка прывезла ў чамадане з Занзібара гекона і шукае яму новы дом2

У наездзе на ЛГБТ-прайд у Берліне падазраюць 21‑гадовага ісламіста, яго шукаюць па ўсёй Германіі18

Сын беларускіх оперных спевакоў стаў чэмпіёнам свету па фехтаванні

У Беларусі разблытваюць загадкавае злачынства — створаны сайт для дапамогі ў расследаванні2

За паўгода ў Беларусі за палітыку асудзілі 11 непаўналетніх3

Эканаміст Львоўскі: Павышаць пенсійны ўзрост ёсць куды. Можна жанчынам павысіць54

больш чытаных навін
больш лайканых навін

Раскрыта маштабная карупцыйная схема, затрыманыя 44 чалавекі2

Раскрыта маштабная карупцыйная схема, затрыманыя 44 чалавекі

Галоўнае
Усе навіны →

Заўвага:

 

 

 

 

Закрыць Паведаміць