This article was accepted into the corpus but its outbound wikilinks were never NER-processed — typical at the deepest BFS hop or when the run's entity cap was reached. No expansion funnel to show.
| Corpus Informatizzato del Sardo | |
|---|---|
| Name | Corpus Informatizzato del Sardo |
| Founded | 1990s |
| Country | Italy |
| Region | Sardinia |
| Language | Sardinian |
| Discipline | Linguistics |
Corpus Informatizzato del Sardo
The Corpus Informatizzato del Sardo is a computerized linguistic corpus focused on the Sardinian language, created to serve researchers at institutions such as Università degli Studi di Cagliari, Università degli Studi di Sassari, and collaborative projects involving Istituto Superiore Regionale Etnografico (ISRE), Accademia della Crusca, and archives like Biblioteca Nazionale Centrale di Firenze. It provides a structured body of texts linking Sardinian varieties with documentary sources from Cagliari Cathedral, Palazzo Ducale (Sassari), and collections held by Museo Archeologico Nazionale di Cagliari, supporting comparative work alongside corpora such as Corpus del Italiano Scritto and initiatives like CLARIN and ELRA.
The corpus aggregates written and spoken Sardinian data covering dialects represented in regions including Cagliari, Nuoro, Sassari, Oristano, and localities like Barbagia, Gallura, and Campidano. It is used by scholars affiliated with Università Ca' Foscari Venezia, Università degli Studi di Milano, Istituto Nazionale di Studi Etruschi e Italici, and projects funded by bodies such as the Ministero dell'Università e della Ricerca and the European Research Council. The resource aligns with standards promoted by organizations like ISO, TEI and research infrastructures exemplified by DARIAH.
Development began in the 1990s with fieldwork led by researchers connected to Giuseppe Serra, Max Leopold Wagner-inspired scholarship, and teams from Centro di Studi Filologici Sardi. Early phases involved partnerships with archival institutions including Archivio di Stato di Cagliari and international collaborators at University of Oxford, Harvard University, and Università di Salamanca. Subsequent funding rounds and methodological updates involved calls from the European Commission, cooperation with Instituto Cervantes-linked researchers, and integration efforts with corpora curated at Biblioteca Apostolica Vaticana and regional libraries such as Biblioteca Comunale di Sassari.
The corpus comprises oral recordings, transcriptions, literary texts, legal documents, folkloric tales, and administrative records drawn from municipal archives in Alghero, Olbia, and Bosa, plus ecclesiastical sources from Diocese of Ales-Terralba and Diocese of Alghero-Bosa. Literary contributions include works by authors in the tradition of Giovanni Pascoli comparisons, texts by Sardinian writers referenced alongside Salvatore Satta, Gabriella Ghermandi, and manuscripts related to Carta de Logu studies. Sources also include radio broadcasts from RAI Sardegna, field recordings collected with equipment from Max Planck Institute for Psycholinguistics, and transcriptions harmonized with corpora like the British National Corpus for cross-linguistic contrast.
Annotation follows guidelines inspired by Text Encoding Initiative, ISO 639-3 language tagging, morphosyntactic annotation models used by Universal Dependencies, and named-entity conventions comparable to those in the Prague Dependency Treebank. Teams included specialists trained at SIL International workshops, computational linguists from Fondazione Bruno Kessler, and lexicographers with ties to Accademia della Crusca. The corpus applies phonetic transcription influenced by International Phonetic Alphabet practice, prosodic annotation comparable to protocols at Max Planck Institute for Psycholinguistics, and metadata schemas interoperable with CLARIN and ELRA repositories.
Access is provided to researchers from universities such as Università degli Studi di Cagliari and institutions like ISRE under licensing agreements modeled on norms from Creative Commons and data policies similar to those of Dryad and Zenodo. Tools for query and analysis include concordancers inspired by AntConc, annotation environments akin to AnnCorra, and web interfaces interoperable with Tesserae-style platforms and services offered by CLARIN-IT. Data sharing practices have been negotiated with regional administrations including Regione Sardegna and cultural institutions like Fondazione di Sardegna.
Researchers in comparative Romance studies at Università degli Studi di Bologna, sociolinguistics projects affiliated with Università di Firenze, and phonology groups at Università di Padova have used the corpus to study dialectal variation, language contact with Italiano and Catalan as seen in Alghero, and historical linguistics tied to Latin and Byzantine influences. It has informed lexicography, grammar-writing, revitalization programs run by Comune di Cagliari and educational initiatives at Scuola Normale Superiore di Pisa. Citations appear in publications from presses like Ilisso and academic journals including Rivista di Linguistica and Journal of Romance Studies.
Maintenance is coordinated by consortia involving Università degli Studi di Sassari, Università degli Studi di Cagliari, regional cultural bodies such as Sardegna Ricerche, and international partners from Max Planck Institute for Evolutionary Anthropology. Future directions include richer multimodal annotation, alignment with larger infrastructures like European Language Grid, integration with language technology efforts at Google Research-adjacent labs and Meta AI collaborations, and expanded outreach to municipal archives in Oristano and Nuoro for endangered-dialect documentation.
Category:Sardinian language Category:Corpora