КОРПУС ЯК ДЗЕРКАЛО КОЛЕКТИВНОГО КОГНІТИВНОГО ДОСВІДУ В КОНТЕКСТІ РОЗВИТКУ МОВНИХ МОДЕЛЕЙ (2020–2025)
Ключові слова:
корпусна лінгвістика, лінгвокогнітивний вимір, мовні моделі (LLM), когнітивні структури, українська мова, NLP, анотаційні схемиАнотація
У статті представлено комплексний аналіз розвитку корпусної лінгвістики в Україні крізь призму лінгвокогнітивного виміру в контексті створення великих мовних моделей (LM) у період 2020–2025 років. У дослідженні аналізується еволюція українських корпусних ресурсів, методів лінгвістичної анотації й інструментів обробки природної мови, що формують основу для навчання сучасних мовних моделей. Особлива увага звертається на динамічну трансформацію корпусних даних та появу вітчизняних архітектур штучного інтелекту, зокрема MamayLM і Lapa LLM, що сприяють формуванню цифрової мовної картини світу українського суспільства та відображають специфіку національного комунікативного простору. Авторка обґрунтовує концепцію лінгвістичного корпусу як об’єктивного «дзеркала» колективного когнітивного досвіду, що зосереджує ментальні структури, культурні коди та ціннісні орієнтири нації в умовах глобальних трансформацій і цифровізації. У дослідженні визначено ключові лінгвістичні виклики української мови для систем обробки природної мови, а саме: висока флективність, морфологічна варіативність і відносно вільний порядок слів, що постають не лише як технічні труднощі для NLP-моделей, а й як прояв специфічних когнітивних механізмів організації мовлення. Проаналізовано сучасні методології корпусної розмітки, включно з багаторівневою анотацією граматичних, семантичних і емоційних параметрів тексту, що дозволяє мовним моделям точніше інтерпретувати контекст і прагматику українського мовлення. Доведено, що розвиток національних корпусів і великих мовних моделей є важливим чинником забезпечення когнітивної безпеки та цифрового суверенітету України, оскільки сприяє репрезентації унікального культурного й мовного досвіду в глобальному інформаційному просторі та формує підґрунтя для подальшого розвитку українських технологій штучного інтелекту.