Албанский национальный корпус
Вы находитесь на стартовой странице сайта, на котором размещен Албанский национальный корпус (АНК) объемом более 230 миллионов словоупотреблений.
Корпус предназначен для тех, кто интересуется самыми разными вопросами, связанными с албанским языком, и способен предоставить справочную информацию как профессиональным лингвистам, так и всем, кто проявляет интерес к этому языку и его истории. Собранный материал может быть использован для научных исследований лексики и грамматики, а также для изучения процессов языковых изменений, происходивших в албанском языке на протяжении предшествующих столетий.
За период с 2011 года по настоящее время в Албанский национальный корпус были включены прежде всего прозаические оригинальные тексты (художественная литература, нехудожественные тексты, пресса), представляющие албанский литературный язык, а также переводные тексты и албанская поэзия. Проект направлен на максимально широкое представление не только современных албанских письменных текстов разного жанра, но и текстов, созданных в разные периоды албанской языковой истории, а также устных разговорных и диалектных текстов, представляющих нелитературные формы современного албанского языка. В сентябре 2019 г. был открыт корпус старых письменных памятников.
Тексты АНК снабжены доступной пользователю метаразметкой и лингвистической разметкой, которая представляет собой набор помет, приписываемых отдельным словоупотреблениям.
Разметка
- автоматическая морфологическая разметка (лемматизация, часть речи, все словоизменительные категории, переводы лемм на английский язык), 93,9% словоформ имеют хотя бы один разбор учитываются слова, не содержащие цифр и символов других алфавитов
- этимологическая и деривационная разметка (разметка исконных слов и заимствований, разметка производных лексем)
- метатекстовая разметка
- частично снятая омонимия (автоматическое снятие на основе правил CG-3)
Метаданные
- название текста
- автор или название издания (для газет)
- переводчик (для переводных текстов)
- год создания (точная дата выпуска для газет)
- жанр / тип текста
Характеристики корпусов
В настоящее время доступны два корпуса: корпус современного литературного албанского языка («основной корпус») и корпус албанских письменных памятников. Они различаются представленным в них материалом и способом его представления, но имеют в целом одинаковую разметку и поисковые возможности. Вот их характеристики:
Основной корпус
Основной корпус содержит 232 млн. словоупотреблений и включает в себя следующие подкорпусы:
|
Пресса |
Художественные тексты |
Нехудожественные тексты |
Поэзия |
| Размер |
222,5 млн. слов |
4,5 млн. слов |
4,6 млн. слов |
0,3 млн. слов |
| Тексты |
|
аутентичные и переводные художественные тексты: романы, повести, рассказы, пьесы, литература для детей (Албания, Косово, Северная Македония, 1960–2010-е гг.) |
|
поэзия Албании первой половины ХХ в. (творчество Асдрени, А. З. Чаюпи, Мигьени, Ф. Ноли, Л. Порадеци); поэзия Албании, Косово и Северной Македонии, 1950–2010-е гг. |
| Регистр языка |
В большинстве случаев нормативный письменный литературный албанский или близкий к нему.
В интервью и цитатах встречаются образцы диалектной речи. |
В большинстве случаев нормативный письменный литературный албанский или близкий к нему.
В речи персонажей встречаются образцы диалектной речи или стилизация под нее. |
В большинстве случаев нормативный письменный литературный албанский или близкий к нему.
В текстах, созданных до 1950-х гг. — более ранние литературноязыковые варианты. |
В большинстве случаев нормативный письменный литературный албанский или близкий к нему.
В поэтических текстах, созданных до 1950-х гг. — более ранние литературноязыковые варианты. |
Корпус старых письменных памятников
Предполагается включить в корпус основные памятники албанской письменности: произведения Гь. Бузука, Л. Матранги, П. Буди, Ф. Барди, П. Богдани, П. Мазреку, Арберийский канун.
В настоящее время в Корпусе старых письменных памятников размещен текст «Катехизиса» Л. Матранги (1592). Книга Матранги представляет собой второй по времени крупный текст, написанный на албанском языке, и первый на тоскском диалекте.
Текст, размещенный в корпусе, базируется на так называемой рукописи А. При выкладке использована транскрипция М. де Фаана, основанная на M. Sciambra. La «Dottrina cristiana» albanese di Luca Matranga (1964) и доступная на TITUS. Мы выражаем М. де Фаану глубокую благодарность за предоставление текстового варианта своей транскрипции. При работе производилась сверка с другими изданиями катехизиса, в том числе фототипическими.
Публикации
Более подробную информацию о содержании Албанского национального корпуса и его разработке Вы можете найти в наших публикациях:
Morozova M. Shënime për standardin morfologjik të Korpusit nacional të shqipes // Seminari Ndërkombëtar për Gjuhën, Letërsinë dhe Kulturën Shqiptare. Materialet e punimeve të Seminarit XXXI Ndërkombëtar për Gjuhën, Letërsinë dhe Kulturën Shqiptare: Prishtinë, 13–27 gusht 2012 / kryered. B. Rugova. Prishtinë: Universiteti i Prishtinës: Fakulteti i filologjisë, 2012. Vëll. 31/1. F. 153–156.
Arkhangelskij T., Daniel M., Morozova M., Rusakov A. Korpusi i gjuhës shqipe: drejtimet kryesore të punës // Shqipja dhe gjuhët e Ballkanit. Albanian and Balkan Languages. Konferencë e mbajtur më 10–11 dhjetor 2011 në Prishtinë / red. R. Ismajli. Prishtinë: ASHAK, 2012. F. 635-642.
Rusakov A., Morozova M. Korpusi i gjuhës shqipe: problemet dhe rezultatet // Studime për nder të Rexhep Ismajlit me rastin e 65-vjetorit të lindjes / red. B. Rugova. Prishtinë: Koha, 2012. F. 639–649.
Морозова М. С., Русаков А. Ю., Домосилецкая М. В. Албанская именная морфология в корпусном представлении: Национальный корпус албанского языка // Албанская филология, балканистика, проблемы языкознания. К 100-летию со дня рождения члена-корреспондента РАН Агнии Васильевны Десницкой / ред. А. Х. Гирфанова, М. В. Домосилецкая, А. В. Жугра, Н. Н. Казанский, А. Ю. Русаков, Н. Л. Сухачев. СПб.: Наука, 2013. C. 120–130.
Morozova M., Rusakov А. Korpusi elektronik i shqipes: përpunimi, përmbajtja dhe përdorimi // Seminari Ndërkombëtar për Gjuhën, Letërsinë dhe Kulturën Shqiptare. Materialet e punimeve të Seminarit XXXII Ndërkombëtar për Gjuhën, Letërsinë dhe Kulturën Shqiptare: Prishtinë, 19–30.08.2013 / kryered. B. Rugova. Prishtinë: Universiteti i Prishtinës: Fakulteti i filologjisë, 2014. Vëll. 33/1. F. 85-96.
Morozova M., Rusakov A. Albanian National Corpus: Composition, Text Processing and Corpus-Oriented Grammar Development // Sprache und Kultur der Albaner. Zeitliche und räumliche Dimensionen. Akten der 5. Deutsch-albanischen kulturwissenschaftlichen Tagung (5.–8. Juni 2014, Buçimas bei Pogradec, Albanien) / Hrsg. von B. Demiraj. Wiesbaden: Harrassowitz Verlag, 2015. S. 270-308. (Albanische Forschungen, 37).
Морозова М. С., Архангельский Т. А., Даниэль М. А., Русаков А. Ю. Албанский национальный корпус: основные направления работы // Acta Linguistica Petropolitana. Труды Института лингвистических исследований РАН. 2016. Т. XII, ч. 3. С. 169–189.
Morozova M., Rusakov А. The early Albanian texts in an annotated language corpus: An attempt of processing and analysis // Altalbanische Schriftkultur - aus der Perspektive der historischen Lexikographie und der Philologie der Gegenwart - Akten der 6. deutsch-albanischen kulturwissenschaftlichen Tagung (27. September 2019, Buçimas bei Pogradec, Albanien) / Hrsg. von B. Demiraj. Wiesbaden: Harrassowitz Verlag, 2020. S. 91–102. (Albanische Forschungen, 44).
Morozova M., Rusakov A. Struktura fjalëformuese e leksikut të shqipes (rreth anotimit të Korpusit elektronik të gjuhës shqipe) // Shqipja standarde sot: konferencë shkencore me rastin e 50-vjetorit të Kongresit të Drejtshkrimit / red. nga R. Ismajli. Prishtinë: Akademia e Shkencave dhe e Arteve e Kosovës, 2023. F. 233–242.
Rusakov A., Morozova M. Albanian classical poetry in the Albanian National Corpus: Between linguistics and philology // Studime albanologjike në indoeuropianistike, filologji dhe gjuhësi kontakti. Vëllim në nderim të prof. Bardhyl Demirajt / red. nga A. Omari, Sh. Sinani, L. Hala. Tiranë: Akademia e shkencave e Shqipërisë, 2025. F. 182–197.
Как цитировать Корпус
Если Вы используете данные Албанского национального корпуса в своём исследовании, воспользуйтесь, пожалуйста, следующей ссылкой:
Морозова М. С., Русаков А. Ю., Архангельский Т. А. Албанский национальный корпус. URL: albanian.web-corpora.net (дата обращения .)
Авторы
Первоначальная версия Корпуса была создана в результате творческого содружества санкт-петербургских (Институт лингвистических исследований РАН) и московских лингвистов (Школа лингвистики НИУ ВШЭ). Для этой версии была адаптирована поисковая система Восточноармянского национального корпуса (ВАНК).
Основные идеи по созданию корпуса, разработке корпусного представления албанской грамматики, системы метаразметки и грамматической аннотации принадлежат М. С. Морозовой и А. Ю. Русакову. В обсуждении этих проблем принимали активное участие Т. А. Архангельский и М. А. Даниэль.
Текущая версия Корпуса была создана М. С. Морозовой, А. Ю. Русаковым и Т. А. Архангельским и открыта для пользователей в 2016 г. В ней используются морфологический анализатор и корпусная платформа tsakorpus, разработанные Т. А. Архангельским.
На разных этапах в создании корпуса участвовали:
- Мария Сергеевна Морозова, Санкт-Петербург (корпусное представление албанской грамматики, разработка разметки, разработка грамматического описания для парсера, составление словника для парсера, метатекстовая разметка, этимологическая разметка, деривационная разметка, разработка правил снятия омонимии, сбор и обработка текстов, веб-страница корпуса)
- Александр Юрьевич Русаков, Санкт-Петербург — Тирана (корпусное представление албанской грамматики, разработка разметки, сбор и обработка текстов)
- Тимофей Александрович Архангельский, Москва — Гамбург — Фрайзинг (разработка парсера, корпусной платформы и пользовательского интерфейса корпуса, техническая поддержка)
- Марина Валентиновна Домосилецкая, Санкт-Петербург (составление словника для парсера — имена существительные)
- Анна Вадимовна Коноваленко, Санкт-Петербург (составление словника для парсера — наречия)
- Анастасия Геннадьевна Сидько, Санкт-Петербург (составление словника для парсера — имена существительные, прилагательные, глаголы)
- Дарья Александровна Алексеева, Санкт-Петербург (сбор и обработка текстов)
- Елизавета Алексеевна Атакова, Санкт-Петербург (сбор и обработка текстов)
- Варвара Андреевна Дивеева, Санкт-Петербург (сбор и обработка текстов)
- Максим Максимович Макарцев, Москва — Ольденбург (предоставление текстов для корпуса)
- Бесим Кабаши, Мюнхен (предоставление текстов для корпуса)
- Керим Ондози, Приштина (сбор и обработка текстов)
Первоначальная версия Корпуса была создана при финансовой поддержке Программы фундаментальных исследований Президиума РАН «Корпусная лингвистика». Создатели корпуса благодарны Академии наук Албании за интерес к работе, помощь и готовность к сотрудничеству. Мы также выражаем благодарность издательству «Onufri» (Тирана) за помощь в подборе текстов.
Корпус использует техническую инфраструктуру Института лингвистических исследований Российской академии наук.
Поддержкой и развитием корпуса в настоящее время занимаются:
Мария Сергеевна Морозова (Институт лингвистических исследований РАН), morozovamaria86@gmail.com
Александр Юрьевич Русаков (Институт языка и литературы Академии наук Албании / Институт лингвистических исследований РАН), ayurusakov@gmail.com
Тимофей Александрович Архангельский (Университет Гамбурга), timarkh@gmail.com