Финно-угорский мир 26 июля 2026
Десять лет VepKar: как карельский и вепсский превратили тексты в языковую инфраструктуру
Открытому корпусу вепсского и карельского языков VepKar исполнилось десять лет. Проект был открыт 24 июля 2016 года — и за это время вырос из научной базы в одну из крупнейших цифровых систем для малых финно-угорских языков России.
На 25 июля в VepKar размещены 76 882 словарные статьи, 9 584 текста на 58 диалектах и более 3,08 миллиона слов. В корпус входят карельские и вепсские словари, художественные и фольклорные тексты, диалектные материалы и записи живой речи. Искать можно не только отдельные слова, но и их формы, употребление в текстах, грамматические характеристики и принадлежность к конкретному говору.
Это принципиальное отличие корпуса от обычного электронного словаря. Словарь сообщает, что слово существует и что оно означает. Корпус показывает, как, где и кем оно употреблялось, с какими словами сочеталось и как изменялось в разных говорах и жанрах.
От вепсского корпуса — к общей системе
Работа началась ещё в 2009 году с отдельного корпуса вепсского языка. Позднее исследователи Карельского научного центра РАН включили в систему собственно карельские, ливвиковские и людиковские материалы. В 2016 году объединённый ресурс получил название VepKar. Его создают совместно лингвисты, математики и программисты Института языка, литературы и истории и Института прикладных математических исследований КарНЦ РАН.
Задача проекта — не просто сохранить отсканированные книги. Тексты размечают: слова связывают со словарными статьями, определяют их начальную форму, грамматические признаки, язык, диалект и жанр. Благодаря этому архив превращается в рабочий инструмент для исследователей, преподавателей, переводчиков и разработчиков языковых технологий.
В VepKar действует и речевой корпус с аудиозаписями. На его данных создаются новые ресурсы — аудиокарта прибалтийско-финских языков Карелии, мультимедийные словари и словарь людиковского наречия.
Открыт не только сайт, но и сама база
Особая ценность VepKar — открытость проекта. Программная оболочка Dictorpus распространяется с открытым исходным кодом, а словари и тексты доступны по лицензии CC BY. Разработчики ежемесячно публикуют полные выгрузки базы: архив за июнь 2026 года занимает уже более 527 мегабайт.
Это значит, что ресурс не заперт внутри одного сайта или учреждения. Его материалы можно использовать для исследований, образовательных приложений, новых словарей и языковых технологий — при условии указания авторства.
Для малого языка это вопрос выживания в цифровой среде. Если тексты существуют только на бумаге, компьютер их не видит. Без собранных и размеченных данных невозможно качественно создавать проверку орфографии, электронные учебники, распознавание речи, переводчики и системы искусственного интеллекта.
Карельские и вепсские специалисты десять лет последовательно строили именно такую основу.
Что этот опыт говорит эрзянам
У эрзян уже есть VALKS — открытый русско-эрзянский словарь и образовательный проект, который собирает лексику, словари, учебные материалы и тексты. Его задача близка VepKar: вернуть языковые знания из разрозненных книг в доступную цифровую систему.
Но опыт Карелии показывает следующий уровень работы. Словарные карточки необходимо связывать с большими собраниями текстов, примерами реального употребления, диалектными формами и аудиозаписями. Тогда электронный словарь становится не только справочником для человека, но и фундаментом для будущих языковых технологий.
Для эрзянского это особенно важно. Огромный массив литературы, газет, фольклорных записей и научных словарей уже существует, но значительная его часть остаётся в PDF-файлах, сканах и отдельных архивах. Она доступна читателю, который знает, что искать, но почти недоступна автоматическому анализу.
VepKar доказывает: малому языку не обязательно ждать, пока крупная технологическая компания внезапно проявит к нему интерес. Сначала само сообщество и специалисты создают корпус, словари и открытые данные. И только после этого появляются условия для переводчиков, синтеза речи и искусственного интеллекта.
Не праздник, а десять лет ежедневной работы
Юбилей VepKar легко превратить в очередную новость о «сохранении национальной культуры». Но главная история здесь другая.
Корпус рос не благодаря одному гранту, фестивалю или памятной дате. В него годами добавляли тексты, проверяли словарные статьи, размечали формы, исправляли ошибки и создавали программные инструменты. Даже в июле 2026 года в базе продолжают появляться новые леммы и тексты.
За десять лет карельский и вепсский получили собственную цифровую инфраструктуру — несовершенную и ещё не завершённую, но открытую и постоянно развивающуюся.
Erz — эрзянская версия готовится.