阿斯塔纳 – ChatGPT在哈萨克语方面日益增长的发展凸显了人工智能面临的更广泛挑战:理解一种语言也需要理解其背后的文化背景,未来学家兼作家罗恩·伊明克接受阿斯塔纳时报采访时表示。
哈萨克斯坦努力构建哈萨克语数据集和文化特定的人工智能基准测试,展示了为什么人工智能系统需要反映语言和文化的多样性。图片来源:人工智能生成的图像/阿斯塔纳时报 Qazaq Tili国际协会与OpenAI之间的联合项目开发了一套专门围绕哈萨克语语言和文化特征设计的人工智能评估基准套件。
该基准测试最初以哈萨克语开发,而非从英语翻译,评估大型语言模型在语法、语言自然性、谚语和固定表达、学术和文学翻译、儿童文学、安全和民族志方面的表现。
一套单独的500题基准测试评估对哈萨克历史、传统和文化的了解。该项目还专注于为哈萨克语人工智能构建数据基础。哈萨克语文本语料库已达到140亿个词元,涵盖语言发展的不同阶段和海外侨民遗产,以及教育、科学、技术、经济、法律、医学、历史、民族志、媒体和儿童内容。
材料包括文本、音频和图像。Qazaq Tili国际协会主席饶恩·肯泽卡努利在9月3日的演讲中表示,在获得必要许可后,最初从档案馆、博物馆、图书馆和其他来源收集了超过100亿个词元。
目标是改进ChatGPT在哈萨克语方面的表现,包括翻译、信息工作、语音、文本和音频识别,同时减少文化上不准确的回应。该方法反映了伊明克的论点,即人工智能开发必须考虑文化背景。
“我认为这还涉及语境和文化。我认为我们肯定错过了一个技巧。问题是大多数人工智能都是英语的,但它应该用纳瓦霍语。它应该用我们拥有的数百种语言。所以它能获得更深入的语境,”他说。
哈萨克斯坦的工作展示了,这在实践中意味着什么:用一种语言开发人工智能不仅仅是一个翻译练习,而是一种努力保护和传承该语言所承载的语言和文化背景的举措。该倡议还补充了哈萨克斯坦与OpenAI在教育领域的更广泛合作。
OpenAI欧洲、中东和非洲教育负责人瓦莱丽·福克将哈萨克斯坦描述为人工智能采用的“先驱和早期行动者”,并表示该国是全球首批与OpenAI就教育未来开展合作的国家之一。随着人工智能日益融入教育和日常信息获取,确保系统理解不同语言和文化不仅对技术发展很重要,而且对维护各民族及其文化遗产的数字 representation 也可能变得重要。