60 организаций хотят научить ИИ лучше понимать редкие языки

ИИ научат лучше понимать редкие языки мира и речь их носителей

Большинство современных нейросетей отлично работает с английским и несколькими десятками крупных языков. Но в мире существует около 7 000 языков, и значительная их часть практически не представлена в данных, на которых обучают искусственный интеллект.

Теперь эту проблему решили попробовать исправить сразу десятки организаций. Google, Anthropic, Microsoft, Mistral, OpenAI Foundation и другие участники объявили о совместной инициативе, цель которой — сделать ИИ доступным на языках, которые сегодня он понимает плохо или почти не понимает.

Главное:

60 организаций объединились в инициативу
3,4 млрд человек могут получить доступ к ИИ на своём языке
5 лет — срок, за который участники хотят добиться заметного прогресса

Почему искусственный интеллект знает не все языки

Нейросеть не изучает язык так, как человек. Для обучения ей требуется огромное количество текстов, аудиозаписей и других примеров реального использования языка.

С английским проблем практически нет: книг, сайтов, документов, социальных сетей и разговорных записей существует огромное количество.

А вот для многих языков Африки, Азии и других регионов цифровых материалов значительно меньше.

Причём даже поддерживаемые языки нейросети могут понимать неодинаково — это показало недавнее исследование работы ИИ на разных языках.

В результате человек может свободно говорить на своём родном языке, но нейросеть будет плохо распознавать его речь, допускать ошибки в переводе или вообще не поддерживать этот язык.

Что хотят сделать Google, Anthropic и другие участники

Новая инициатива должна объединить работу компаний, исследователей, университетов и местных языковых сообществ.

Главная задача — создать больше качественных данных для языков, которые сегодня недостаточно представлены в искусственном интеллекте.

Работа пойдёт сразу по четырём направлениям:

— создание открытых языковых баз данных;
— разработка тестов для проверки качества ИИ;
— создание моделей и приложений на основе этих данных;
— защита конфиденциальности и прав носителей языков.

Особое внимание планируют уделять не только письменному тексту, но и человеческой речи.

Почему голос иногда важнее текста

Для многих языков именно устная речь остаётся основной формой общения.

Человек может прекрасно владеть своим языком, но редко использовать его в письменной форме. Кроме того, некоторые языки имеют несколько вариантов письменности или сравнительно небольшое количество опубликованных текстов.

Поэтому для развития ИИ нужны не только книги и сайты, но и записи обычных разговоров.

Такие данные помогают системе научиться понимать произношение, акценты, диалекты, местные выражения и естественную скорость речи.

Почему недостаточно просто перевести всё с английского

Самый простой вариант — взять английский текст и автоматически перевести его на другой язык.

Но такой подход не решает проблему полностью.

Язык содержит собственные выражения, шутки, способы обращения к людям и культурные особенности. Если обучать нейросеть преимущественно переводным текстам, она может формально знать слова, но плохо понимать то, как люди действительно разговаривают.

Простой пример: ИИ может правильно перевести отдельные слова, но не понять местную шутку, устойчивое выражение или значение фразы в конкретной ситуации.

Какие компании участвуют в проекте

Компании и организации, участвующие в проекте по развитию ИИ для редких языков
Крупные технологические компании, университеты и исследовательские организации объединились для развития ИИ на редких языках.

Список участников довольно необычный, потому что вместе оказались компании, которые обычно конкурируют между собой.

Среди них Google, Anthropic, Microsoft, Mistral, NVIDIA, OpenAI Foundation, Amazon, ElevenLabs и десятки исследовательских, образовательных и общественных организаций.

Всего на старте инициативу поддержали 60 участников.

При этом они не создают одну общую нейросеть. Каждый участник будет заниматься своей частью работы: кто-то собирать языковые данные, кто-то создавать модели, кто-то тестировать их, а кто-то работать непосредственно с носителями языков.

Зачем ИИ нужны редкие языки

Проблема касается далеко не только обычного общения с чат-ботом.

Если искусственный интеллект понимает язык человека, он потенциально может помочь получить образовательные материалы, медицинскую информацию, консультации для сельского хозяйства или доступ к государственным и финансовым сервисам.

Но если система плохо понимает вопрос, польза от такого инструмента резко уменьшается.

Именно поэтому участники инициативы говорят не просто о переводе интерфейса, а о способности ИИ действительно понимать язык и речь человека.

Сможет ли ИИ когда-нибудь понимать все языки мира

Это гораздо более сложная задача, чем может показаться.

Некоторыми языками пользуются сотни миллионов человек, другими — несколько тысяч или даже несколько сотен.

Для части языков мало цифровых текстов, а для некоторых практически отсутствуют качественные записи речи.

Кроме того, язык постоянно меняется: появляются новые слова, сленг и местные варианты произношения.

Поэтому обещать, что через пять лет нейросети идеально заговорят на всех семи тысячах языков, было бы неправильно.

Но направление уже понятно: следующий этап развития искусственного интеллекта — не просто увеличение количества поддерживаемых языков, а улучшение качества работы с теми языками, которые раньше технологии почти игнорировали.

Pro-lingua.Ru – изучение английского и других языков: грамматика, лексика, правила, таблицы, упражнения онлайн
Добавить комментарий