This is a new version of the repository. Do let us know (lindat-help at ufal.mff.cuni.cz) if you encounter any issues.
What's New
lexicalConceptualResourceLINDAT / CLARIAH-CZ
Author(s):
Description:
Dataset obsahuje excelové soubory, ve kterých jsou analyticky zpracovány korpusové doklady vybraných a vzájemně korelujících českých, slovenských, ruských a běloruských adverbií a adverbiálně-prepozicionálních spojení s místním významem. Jedná se o následující výrazy: čes. blízko, blízko k, blízko od, blíž(e), blíž(e) k, daleko, daleko od, daleko za, nedaleko, nedaleko od, hluboko, hluboko v, hluboko do, hluboko pod, vpravo, vpravo od, vlevo, vlevo od, vysoko, vysoko v, vysoko do, vysoko nad; slov. blízko, blízko k, blízko od, bližšie, bližšie k, ďaleko, ďaleko od, ďaleko za, neďaleko, neďaleko od, hlboko, hlboko v, hlboko do, hlboko pod, napravo, napravo od, naľavo, naľavo od, vysoko, vysoko v, vysoko do, vysoko nad; rus. близко, близко к, близко от, ближе, ближе к, далеко, далеко от, далеко за, недалеко, недалеко от, глубоко, глубоко в, глубоко под, справа, справа от, слева, слева от, высоко, высоко в, высоко над; běl. блізка, блізка да, блізка ад, бліжэй, бліжэй да, далёка, далёка ад, далёка за, недалёка, недалёка ад, справа, справа ад, злева, злева ад, глыбока, глубока ў, глыбока пад, высока, высока ў, высока над. Doklady užití těchto výrazů strukturované v excelových souborech pocházejí z náhodných vzorků z jejich korpusových konkordancí. Velikost vzorků zpravidla činí 100 řádků. K extrakci vzorků jsou použity srovnatelné webové korpusy Aranea, a to následující: Araneum Bohemicum IV Minus (Czech, 20.03) 125, Araneum Slovacum VII Minus Beta (Slovak, 24.02) 125 M, Araneum Russicum Russicum Minus (Russia-only Russian, 15.03) 120 M, Araneum Albaruthenicum Novum MMXXI (Belarusian, 21.02) 155 M. Výše uvedené korpusy jsou volně přístupné na internetovém portálu http://unesco.uniba.sk/. Po aktualizacích jsou starší verze korpusů Aranea přístupné na vyžádání u tvůrců tohoto portálu. Každý excelový soubor má stejnou strukturu: Je rozvržen do 8 listů seskupujících korpusové doklady podle určitých rysů, a to především lexikálně-sémantického a syntaktického rázu. Tyto excelové listy mají následující pracovní názvy: místní významy_statické (zkoumané výrazy vyjadřují místo na otázku „kde“), místní významy_dynamické (zkoumané výrazy vyjadřují místo na otázku „kam“), predikativní funkce_věty bez subjektu (zkoumané výrazy se používají v predikativní funkci ve větách bez subjektu), nemístní významy (zkoumané výrazy vyjadřují nemístní významy), součást frazémů (zkoumané výrazy vystupují jako obligatorní nebo fakultativní součást frazémů), specifické použití (zkoumané výrazy se používají v rámci pojmenovacích spojení, v rámci titulků, inzerátů, popisků k fotografiím a obrázkům apod.), zmnožené syntaktické pozice_příklady (list dodatečně shrnuje doklady, ve kterých se zkoumané výrazy používají v rámci adordinačních a koordinačních skupin), šum (list registruje množství šumu, který se vyskytl ve vzorku; šum je vždy nahrazen příslušným množstvím použitelných dokladů z původní konkordance). Doklady s místním významem jsou navíc analyzovány podle následujících syntakticko-sémantických charakteristik: syntaktická funkce dominujícího členu a jeho lexikální obsazení; syntaktická funkce adverbia / adverbiálně-prepozicionálního spojení a lexikální obsazení usouvztažněného substantiva; objekt lokalizace a prostorový orientátor a jejich lexikální obsazení; lexikální obsazení členů rozvíjejících adverbiální tvary (jak v rámci adverbiálně-prepozicionálních spojení, tak mimo ně). Výše uvedený rozbor využívá teoreticko-terminologický rámec Mluvnice češtiny 3 (1986). Vícejazyčný korpusový materiál je zpracován plošně na základě jednotného analytického postupu. Dataset má charakter pracovních materiálů a představuje data, na kterých je založen výzkum v rámci disertační práce autorky. Literatura Benko, V. (2014). Aranea: Yet Another Family of (Comparable) Web Corpora. In Petr Sojka, Aleš Horák, Ivan Kopeček and Karel Pala (Eds.): Text, Speech and Dialogue. 17th International Conference, TSD 2014, Brno, Czech Republic, September 8-12, 2014. Proceedings. LNCS 8655. Springer International Publishing Switzerland. Pp. 257–264. Daneš, F., Grepl, M., & Hlavsa, Z. (1987). Mluvnice češtiny. 3, Skladba. Academia.
This item contains 76 files (2.91 MB).
Publicly Available
lexicalConceptualResourceLINDAT / CLARIAH-CZ
Author(s):
Description:
The contribution includes the data frames and the R script (Markdown file) belonging to the paper "Morphological and Pragmatic Conditioning of Reflexivity in Possessive Pronouns: Effects of Number and Form of Address in Czech" submitted to the journal Linguistics: An Interdisciplinary Journal of the Language Sciences in May 2025. During the review process, title of the paper has been changed to "Reflexive vs. non-reflexive possessives in Czech imperative utterances: effects of number and politeness". The 26-05-19 version has major updates to the analytic script and minor updates to the data sets (no changes to the data, just the to the names of conditions).
This item contains 3 files (4.88 MB).
Publicly Available
NER-annotated interview transcriptsLINDAT / CLARIAH-CZ
Author(s):
Description:
MalachNER is a collection of transcripts of interviews with 13 Holocaust survivors in 10 languages, covering approximately 37 hours of speech in total, sourced from different archives (Visual History Archive, United States Holocaust Memorial Museum, Milan Šimečka Foundation). Domain experts tagged named entities in the denoised transcripts based on domain-specific annotation guidelines with entity types Person, Organization, Location, Camp, Ghetto, Date, and Miscellaneous. The dataset includes per-language training and test splits and the annotation guidelines.
This item contains 1 file (1.73 MB).
Publicly Available
Most Viewed Items - Last Month
Author(s):
Description:
Tokenizer, POS Tagger, Lemmatizer and Parser models for 94 treebanks of 61 languages of Universal Depenencies 2.5 Treebanks, created solely using UD 2.5 data (http://hdl.handle.net/11234/1-3105). The model documentation including performance can be found at http://ufal.mff.cuni.cz/udpipe/models#universal_dependencies_25_models . To use these models, you need UDPipe binary version at least 1.2, which you can download from http://ufal.mff.cuni.cz/udpipe . In addition to models itself, all additional data and value of hyperparameters used for training are available in the second archive, allowing reproducible training.
This item contains 96 files (2.61 GB).
Publicly Available
Author(s):
show everyone
Description:
Universal Dependencies is a project that seeks to develop cross-linguistically consistent treebank annotation for many languages, with the goal of facilitating multilingual parser development, cross-lingual learning, and parsing research from a language typology perspective. The annotation scheme is based on (universal) Stanford dependencies (de Marneffe et al., 2006, 2008, 2014), Google universal part-of-speech tags (Petrov et al., 2012), and the Interset interlingua for morphosyntactic tagsets (Zeman, 2008).
This item contains 3 files (740.61 MB).
Publicly Available
Author(s):
show everyone
Description:
Universal Dependencies is a project that seeks to develop cross-linguistically consistent treebank annotation for many languages, with the goal of facilitating multilingual parser development, cross-lingual learning, and parsing research from a language typology perspective. The annotation scheme is based on (universal) Stanford dependencies (de Marneffe et al., 2006, 2008, 2014), Google universal part-of-speech tags (Petrov et al., 2012), and the Interset interlingua for morphosyntactic tagsets (Zeman, 2008).
This item contains 3 files (765.09 MB).
Publicly Available