АСТАНА – Продвижение ChatGPT в казахском языке подчёркивает более широкую проблему искусственного интеллекта: понимание языка требует также понимания культурного контекста, лежащего в его основе, заявил изданию The Astana Times футуролог и писатель Рон Имминк.
Усилия Казахстана по созданию наборов данных на казахском языке и культурно-специфичных эталонов для ИИ показывают, почему системы искусственного интеллекта должны отражать разнообразие языков и культур. Фото: сгенерировано ИИ / The Astana Times Совместный проект международной ассоциации Qazaq Tili и компании OpenAI позволил разработать специализированный комплекс эталонных тестов для оценки искусственного интеллекта, построенный с учётом лингвистических и культурных особенностей казахского языка.
Эталонные тесты изначально разрабатывались на казахском языке, а не переводились с английского. Они оценивают большие языковые модели по грамматике, естественности речи, пословицам и устойчивым выражениям, академическому и литературному переводу, детской литературе, безопасности и этнографии.
Отдельный эталонный тест из 500 вопросов проверяет знание истории, традиций и культуры Казахстана. Проект также сосредоточен на создании информационной базы для развития искусственного интеллекта на казахском языке. Казахский текстовый корпус достиг 14 миллиардов токенов, охватывая различные периоды развития языка и наследие диаспоры, а также образование, науку, технологии, экономику, право, медицину, историю, этнографию, медиа и детский контент.
Материалы включают тексты, аудио и изображения. Рауан Кенжеханулы, президент международной ассоциации Qazaq Tili, заявил в ходе презентации 3 сентября, что первоначально более 10 миллиардов токенов были собраны из архивов, музеев, библиотек и других источников после получения необходимых разрешений.
Цель состоит в улучшении работы ChatGPT на казахском языке, включая перевод, информационную работу, распознавание речи, текста и аудио, а также в сокращении культурно неточных ответов. Такой подход отражает аргумент Имминка о том, что развитие искусственного интеллекта должно учитывать культурный контекст.
«Я думаю, что речь также пойдёт о контексте и культуре. И я считаю, что мы определённо упускаем возможность. Проблема в том, что большинство систем ИИ работают на английском языке, но должно быть на языке навахо. Должны быть сотни языков, которые у нас есть. Тогда контекст станет гораздо глубже», – сказал он.
Работа Казахстана демонстрирует, как это может выглядеть на практике: развитие искусственного интеллекта на каком-либо языке – это не просто упражнение по переводу, а усилие по сохранению лингвистического и культурного контекста, который несёт в себе этот язык. Инициатива также дополняет более широкое сотрудничество Казахстана с компанией OpenAI в сфере образования.
Валери Фокке, руководитель направления образования OpenAI в Европе, на Ближнем Востоке и в Африке, охарактеризовала Казахстан как «пионера и первопроходца» в области внедрения искусственного интеллекта и отметила, что страна входит в число первых в мире, кто начал сотрудничать с OpenAI в вопросах будущего образования. По мере того как искусственный интеллект всё глубже интегрируется в образование и повседневный доступ к информации, обеспечение понимания системами различных языков и культур может стать важным не только для технологического развития, но и для сохранения цифрового представительства отдельных народов и их культурного наследия.