Наука и технологии33

Как это работает: машинный перевод иноязычных текстов

7 января 1954 года в штаб-квартире корпорации IBM в Нью-Йорке состоялся так называемый «Джорджтаунский эксперимент», в ходе которого был успешно продемонстрирован полностью автоматический перевод нескольких десятков предложений с русского языка на английский.

Перевод был примитивным: на основе словаря из 250 слов и 6 правил. Поэтому система могла перевести только несколько самых примитивных фраз. Но целью было привлечь внимания к машинному переводу и продемонстрировать его перспективность.

Теперь, благодаря интернету, каждое незнакомое слово или фразу можно за несколько секунд перевести на родной язык, и этот перевод получится довольно точный. Что же изменилось с тех пор? Какой сейчас принцип работы автоматических переводчиков и какое будущее у живых переводчиков-профессионалов?

Современные онлайн-переводчики (самый известный из которых — Google Translate) используют статистический машинный перевод, в процессе которого компьютерная программа анализирует огромный массив текстов, переведенных людьми, использует словари и грамматику в цифровом формате. Звучит сложно? Давайте разбираться.

Огромный массив текстов состоит из большого количества языковых пар — текстов, которые имеют две точные языковые версии (переведенные человеком). В качестве таких текстов обычно используются официальные документы мультиязычных стран, где перевод документации обязателен на все государственные языки. Такие переводы всегда совершенны, так как государственные документы решают судьбу отдельных людей и страны в целом. Очень полезными оказались и многоязычные документы, выпускаемые ООН.

Анализируя пары текстов, система «учится», усваивая с каждым разом все больше новых правил. Таким образом строится модель языка.

Каждая система автоматического перевода имеет модель перевода — «словарь», в котором для всех слов и фраз на одном языке перечислены возможные переводы на другой язык с указанием вероятности этих переводов. Модели перевода для каждой пары языков содержат миллионы пар слов и словосочетаний.

Если вы переводите с английского языка, например, на белорусский, будут задействованы две языковые пары: белорусский-русский и русский-английский. То есть сначала текст переводится с английского на русский, а потом — с русского на белорусский.

Такой путь наиболее рационален, так как документов, которые бы имели безукоризненные английскую и белорусскую версии — немного, и прямой перевод с английского на белорусский получался бы очень некачественным по причине недостаточной «обученности» системы.

Непосредственно переводом занимается декодер — алгоритм, который проводит анализ текста и для каждого слова подбирает все варианты перевода, упорядочивая в порядке убывания вероятности. Затем все полученные варианты декодер оценивает с помощью модели языка на частотность употребления и выбирает предложение с лучшим сочетанием вероятности и частотности.

К сожалению, в настоящее время нет сервиса автоматического перевода, который бы мог перевести текст с такой же точностью, как и человек-переводчик. Но уже сейчас некоторые компании внедряют в машинный перевод нейронные сети, которые значительно улучшают его качество.

Поэтому можно предположить, что с течением времени специалисты-переводчики будут нужны только для создания сложных художественных переводов, что значительно сократит численность людей, занятых в этой сфере. Но вряд ли это близкая перспектива. А как считаете вы?

Читайте также:

Следующая революция в информатике — нейронные сети

Комментарии3

Сейчас читают

Кто тот редактор белорусской Википедии, которого посадили на два года за «дискредитацию Беларуси»?7

Кто тот редактор белорусской Википедии, которого посадили на два года за «дискредитацию Беларуси»?

Все новости →
Все новости

Трамп, Путин, гомосексуальные контакты и другие грязные намеки — в США опубликовали 20 тысяч файлов Эпштейна36

Два пассажирских автобуса столкнулись под Минском2

Глава Euroclear: Если ЕС решит конфисковать российские активы, мы обратимся в суд29

«Зарплата в три раза выше, чем дома». Белорус рассказал, как поработал в Египте на строительстве АЭС3

«Дед будет смотреть лично. Если ему понравится…» Зенкович рассказал, как с ним записывали первое интервью в СИЗО КГБ18

Трагедия на Гомельщине: два 18‑летних парня погибли в ДТП, автомобиль разорвало на части4

У каждого поколения свой цвет: у миллениалов — розовый, у зумеров — жёлтый. А кому принадлежит «дерзкий зелёный»?10

Фермер-хипстер решил продавать костюмы с гербами Беларуси и России. Цены космические16

В минском «Евроопте» в отделе выпечки положили пакеты для мусора9

больш чытаных навін
больш лайканых навін

Кто тот редактор белорусской Википедии, которого посадили на два года за «дискредитацию Беларуси»?7

Кто тот редактор белорусской Википедии, которого посадили на два года за «дискредитацию Беларуси»?

Главное
Все новости →

Заўвага:

 

 

 

 

Закрыць Паведаміць