This article was accepted into the corpus but its outbound wikilinks were never NER-processed — typical at the deepest BFS hop or when the run's entity cap was reached. No expansion funnel to show.
| ARTFL Project | |
|---|---|
| Name | ARTFL Project |
| Established | 1978 |
| Location | University of Chicago |
| Discipline | Digital humanities; French studies |
| Language | French; English |
ARTFL Project
The ARTFL Project is a long-running digital humanities initiative focused on creating searchable corpora and computational tools for French-language texts. It supports research in French literature, linguistics, history, and cultural studies by providing text collections, concordancers, annotation utilities, and corpora management services that serve scholars affiliated with universities, libraries, museums, and archives.
The ARTFL Project cultivates resources for scholars across institutions such as the University of Chicago, Bibliothèque nationale de France, University of Pennsylvania, Yale University, Harvard University, Columbia University, Princeton University, Stanford University, University of Oxford, Sorbonne University, École Normale Supérieure, University of Toronto, Université de Montréal, McGill University, University of California, Berkeley, University of California, Los Angeles, Brown University, Cornell University, Duke University, Johns Hopkins University, University of Michigan, University of Illinois Urbana-Champaign, University of Edinburgh, King's College London, University of Geneva, Université de Lausanne, University of Lyon, Université Grenoble Alpes, École Polytechnique, Sciences Po, National Library of Australia, British Library, Library of Congress, Bibliothèque municipale de Lyon, Bibliothèque publique d’information, New York Public Library, Los Angeles Public Library, Chicago Public Library, Bibliothèque cantonale et universitaire, Bodleian Library, Cambridge University Library, Vatican Library, Princeton Theological Seminary, Museum of Fine Arts, Boston, Musée d'Orsay, Louvre Museum, Centre Pompidou, Institut national d'histoire de l'art, Institut d'Études Politiques de Paris.
Founded in the late 1970s at the University of Chicago by a team including computer scientists and literary scholars, the project evolved alongside initiatives like Project Gutenberg, Text Encoding Initiative, Humanities Computing, Digital Humanities Summer Institute, ACH, European Science Foundation, National Endowment for the Humanities, Andrew W. Mellon Foundation, National Science Foundation, and collaborations with centers such as ARTFL partners at University of Pennsylvania and Université de Montréal. Early milestones paralleled work at IBM, Xerox Palo Alto Research Center, Bell Labs, RAND Corporation, and were influenced by research at MIT, Stanford Research Institute, Carnegie Mellon University, University of California, Santa Barbara, Indiana University Bloomington, University of Virginia, University of North Carolina at Chapel Hill, University of Texas at Austin, Ohio State University, University of Washington, University of California, San Diego, New York University, City University of New York, Rutgers University.
Major development phases include digitization efforts akin to Google Books initiatives, adoption of standards from the Text Encoding Initiative, implementation of search engines influenced by Lucene, and integration of corpus linguistics methods developed at Lancaster University, Université Paris 8, Université Paris 1 Panthéon-Sorbonne, Université Lille, Université Strasbourg, and Université Bordeaux Montaigne.
The collections comprise full-text editions, critical editions, periodicals, correspondence, and pamphlets by authors and entities such as Voltaire, Jean-Jacques Rousseau, Honoré de Balzac, Gustave Flaubert, Marcel Proust, Victor Hugo, Émile Zola, Alexandre Dumas, Stendhal, Molière, Denis Diderot, Charles Baudelaire, Arthur Rimbaud, Paul Verlaine, Alphonse de Lamartine, François-René de Chateaubriand, Alfred de Musset, George Sand, Sainte-Beuve, André Gide, Albert Camus, Jean-Paul Sartre, Simone de Beauvoir, Louis-Ferdinand Céline, Jacques Derrida, Michel Foucault, Roland Barthes, Julia Kristeva, Émile Durkheim, Alexis de Tocqueville, François Mauriac, Paul Valéry, Charles Péguy, Émile Zola, Colette, Anatole France, Pierre Corneille, Jean Racine, Pierre de Ronsard, François Villon, Nicolas Boileau, Marcel Aymé, Raymond Queneau, André Breton, Louis Aragon, Arthur Koestler, Simone Weil, Maurice Blanchot, Henri Bergson, Gustave Flaubert.
Collections also include periodicals like Le Figaro, Le Monde, Mercure de France, La Revue des Deux Mondes, Journal des débats, L'Humanité, La Nouvelle Revue Française, La Gazette de France, Le Petit Journal, La Presse, La Croix.
Technologies employed reflect advances from projects at MIT, Stanford University, University of Cambridge Computer Laboratory, University of Edinburgh School of Informatics, and software ecosystems like Apache Lucene, MySQL, PostgreSQL, Elasticsearch, Python Software Foundation, R Project for Statistical Computing, Perl, Java, PHP, TEI Consortium, Unicode Consortium, XML, XSLT, SVG, HTML5, Dublin Core, OAI-PMH, GitHub, Docker, Amazon Web Services, Google Cloud Platform, Microsoft Azure, Hadoop, Spark, Natural Language Toolkit, Stanford NLP Group, Gensim, MALLET, TreeTagger, MElt, FOSS communities.
Tools provided include concordancers, collocation analyzers, n-gram viewers, named-entity recognition adapted from resources at INRIA, CNRS, Centre National du Livre, and morphological analyzers drawing on lexica such as Le Trésor de la langue française and editions from Atlas linguistique de la France.
The project has supported dissertations, monographs, and articles cited in venues like PMLA, Modern Language Review, French Studies, Romance Quarterly, Revue d'Histoire Littéraire de la France, Cahiers du Cinéma, Critical Inquiry, MLN, Journal of French Language Studies, Comparative Literature, History Workshop Journal, American Historical Review, Speculum, Economic History Review, Journal of Modern History, Annales. Histoire, Sciences Sociales, and conferences such as Digital Humanities Conference, ACL, LREC, COLING, TEI Conference, DH Benelux, EADH.
Scholars affiliated with institutions including École des hautes études en sciences sociales, Institute for Advanced Study, Centre National de la Recherche Scientifique, Max Planck Society, All Souls College, Oxford, King's College Cambridge, Trinity College Dublin, University of Melbourne, Australian National University, University of Cape Town, University of São Paulo, Pontifical Catholic University of Chile have used its corpora for studies of authorship attribution, stylistics, thematic mapping, and reception history.
Access policies combine open-access resources and licensed collections managed under agreements with entities like Gallica, JSTOR, ProQuest, EBSCO, Project Muse, HathiTrust, Google Books Library Project, Internet Archive, Perseus Digital Library, Europeana, CELLO, and institutional repositories at Harvard Library, Yale Library, Princeton University Library, University of Chicago Library. Services include searchable interfaces, API endpoints, custom corpus creation, user accounts for scholars at University of Chicago, University of Pennsylvania, Université de Montréal, University of Oxford, Sorbonne University, as well as training workshops modeled on programs at Digital Humanities Summer Institute and outreach at ALA Annual Conference.
Funding and partnerships have involved agencies and foundations such as the Andrew W. Mellon Foundation, National Endowment for the Humanities, National Science Foundation, U.S. Department of Education, Canadian Social Sciences and Humanities Research Council, European Research Council, Agence Nationale de la Recherche, Fondation Maison des Sciences de l'Homme, Collège de France, Centre Pompidou, Bibliothèque nationale de France, Grosvenor Library, J. Paul Getty Trust, Rothschild Foundation, and collaborations with commercial digitization firms that have worked with Google, ProQuest, Microfilm International, Shelfie providers and vendor platforms allied to OCLC and Ex Libris.
Category:Digital humanities projects