Contenu de l'article

Titre Méthodologie d'harmonisation et de traitement des données orales du CÉFC
Auteur Christophe Benzitoun, Carole Etienne
Mir@bel Revue Langages
Numéro no 219, septembre 2020 Orféo : un corpus et une plateforme pour l'étude du français contemporain
Page 39-52
Résumé Le céfc comprend des données de plusieurs sources différentes, ce qui permet d'observer au moins en partie la diversité du français. La résolution des problèmes inhérents à l'hétérogénéité de ces données est donc intrinsèque à la constitution de cette ressource et motivée par son objectif. Cet article décrira, étape par étape, l'approche méthodologique qui a permis de construire une ressource orale homogène en mutualisant différentes sources afin de procéder à des annotations automatiques cohérentes et de faciliter les analyses d'un corpus oral de plusieurs millions de mots.
Source : Éditeur (via Cairn.info)
Résumé anglais The céfc corpus includes data from several different sources to make observable the diversity of oral French at least partly, solving the problems inherent to the heterogeneity of these data is intrinsic to the constitution of this resource and motivated by its objective. This article will describe, step by step, the methodological approach that enables us to build a homogeneous resource by pooling these different sources in order to provide coherent automatic annotations and to facilitate the analysis of an oral corpus of several million words.
Source : Éditeur (via Cairn.info)
Article en ligne http://www.cairn.info/article.php?ID_ARTICLE=LANG_219_0039