Проект создан для фиксации и изучения современного языка, включая литературу и медиа.

Інстытут беларускай мовы (ІБМ) презентовал онлайн-платформу «Корпус беларускіх тэкстаў», которая реализуется под руководством председателя организации Светланы Лесович — кандидата филологических наук, которая до 2023 года заведовала кафедрой славянской филологии Полоцкого государственного университета.
На данный момент для исследователей, преподавателей и редакторов открыт доступ к двум субкорпусам — «Регионализм» и «Культура». Также в разработке находится устный корпус диалогических текстов, который формируется на основе белорусскоязычных подкастов.

Создание независимой базы данных продиктовано тем, что многие современные тексты, созданные за пределами страны, не попадают в официальный Белорусский N-корпус. Новый инструмент позволяет лингвистам делать синхронные срезы языка: отслеживать изменения в значениях слов, особенности употребления и появление новой лексики в различных сферах жизни.
Крупнейший из доступных субкорпусов — «Культура» — содержит уже больше миллиона слов. Он состоит примерно на 80% из письменных и на 20% из устных текстов различных стилей и жанров. Материал был собран в течение десяти месяцев в рамках европейской программы EU4Belarus — SALT II.
Как отмечает Светлана Лесович, основная цель этого субкорпуса — показать функционирование языка в первой четверти XXI века и создать основу для будущих актуальных словарей, в том числе терминологических.
Техническую поддержку проекта на волонтёрской основе осуществлял Иван Бахтин. Он создал редактор для аннотирования текстов (создания их краткого описания), который базируется на существующей «Граматычнай базе беларускай мовы». Тексты в корпусе уже частично аннотированы, однако создатели подчёркивают, что разметка ещё требует дальнейшей вычитки и совершенствования.
Воспользоваться лингвистической базой можно через сайт проекта. Для удобства работы со специфическим поисковым интерфейсом исследователи подготовили подробную инструкцию, доступную в разделе Corpus Info. Інстытут беларускай мовы продолжает наполнять базу и приглашает присоединяться к работе волонтёров, связаться можно по почте [email protected].
«Наша Нiва» — бастион беларущины
ПОДДЕРЖАТЬ
Комментарии
Пакуль, як зразумеў, толькі 240 тэкстаў, што яшчэ мала для карыснага пастаяннага выкарыстання. Спадзяваюся, будзе развівацца.
Ідэя алічбаваць вусныя блогі слушная. Цікавы досвед, ці выкарыстоўваюць аўтаматычную транскрыпцыю youtube з беларускай - яна не ідэальная, а старыя відэа распазнаныя як на расейскай з памылкамі.
Яшчэ адна будучая важная праблема сучаснага корпусу: вялікая колькасць ШІ-слопу ў сучасных медыя і блогах, які з’явіўся праз хуткія аўтаматычныя пераклады і адсутнасць карэктуры. Дадаваць яго ў корпус нельга, бо будзе спрыяць далейшаму самаатручванню мовы. А вызначыць і размеціць, дзе аўтарскія тэксты, дзе хаўтура, складана.
Не хапае адкрытага коду праекта. Афіцыйны корпус і два лепшыя анлайн-слоўнікі выкладзены на github. Гэта ўжо добрая традыцыя сучаснай беларускай філалогіі. А таксама і абарона на будучыню: сайты і тэксты з часам знікаюць, а наяўнасць архіваў і крыніц - шанс на захаванне.
І пра бяспеку. Беларускія ініцыятывы і СМІ, калі ласка, не забывайце папярэджваць пра дакументы на Google Drive (інструкцыя ў гэтым выпадку), гісторыя адкрыцця якіх можа захоўвацца ў вашых акаўнтах, што небяспечна для беларусаў у Беларусі і тых, хто ездзіць у Беларусь. Для прыкладу, тая ж старонка на github pages і бяспечней, і пражыве больш.