CAENNAIS

Publication publiée :16 octobre 2023
Post category: Projet de recherche/Projet en cours

(Corpus Audio d’Étudiants Natifs et non-NAtifs en InteractionS)

Projet pédagogique

Le projet CAENNAIS est un projet pédagogique commencé en octobre 2023 et réalisé par une équipe de recherche constituée de membres du Laboratoire CRISCO et des étudiants en Science du Langage et en Orthophonie de l’Université de Caen Normandie. Le corpus CAENNAIS est un corpus longitudinal d’interactions entre des locuteurs francophones natifs et des apprenants en immersion en France. Le projet a pour but de produire et de mettre à disposition des chercheurs un corpus d’apprenants transcrit et annoté ainsi que de former les étudiants stagiaires aux bonnes pratiques de la collecte, la transcription et l’annotation des données orales et au travail d’équipe.

2023-2024

Lors de la première phase du projet (septembre 2023-mai 2024) six groupes de participants ont été recrutés et enregistrés par les étudiants stagiaires Orlanne Pinsault et Florian Peck trois fois au cours de l’année résultant en 18 heures d’enregistrements dont 90 minutes ont été transcrites en suivant un guide de transcription développé par l’équipe (voir Orlanne Pinsault 2024, Constitution d’un corpus oral longitudinal d’apprenants du français : défis et enjeux des outils numériques dans la constitution de corpus. Mémoire de M2).

2024-2025

En 2024-2025 l’équipe s’est penchée sur le développement d’une chaîne de traitement pour la diarisation (identification de tours de paroles) et transcription semi-automatiques adaptée à un corpus longitudinal d’interactions de locuteurs de différents niveaux de compétences. Cette démarche implique des campagnes de correction des transcriptions automatiques et homogénéisation des pratiques pour permettre un réentraînement progressif de modèles des outils automatiques (PyAnnote, Whisper). Trois heures d’enregistrements ont été diarisés et transcrits.

Une chaîne de traîtement DIAxASR a été mise en place, un pipeline Python permettant :

la diarisation automatique de fichiers audio à l’aide d’un modèle Pyannote Audio;
la segmentation des enregistrements avec export des segments audio et des métadonnées (.tsv, .eaf);
la transcription automatique avec un modèle Whisper (fine-tuné);
la mise à jour des fichiers ELAN (.eaf) avec les transcriptions.

2025-2026

En 2025-2026 l’équipe CAENNAIS poursuit la transcription des données tout en les préparant pour l’archivage. Une mise à disposition d’une partie des données est prévue pour la fin 2026.

Dissemination

En juin 2025, l’équipe CAENNAIS a participé au colloque FRAPEOR à l’Universoté d’Orléans avec une intervention intitulée « L’art du dialogue interculturel : adapter les outils de transcription automatique aux données de l’oral spontané » (consulter le programme du colloque). En novembre 2025, Maxence Multin et Rayan Ziane ont présenté un poster sur l' »Adaptation d’outils pour le traitement de la parole spontanée et la création d’un corpus d’interaction » aux Rencontres de jeunes chercheurs en paroles à Paris.

Recherche

En mai 2025, Orlanne Pinsault a soutenu son mémoire de M2 intitulé « Constitution d’un corpus oral longitudinal d’apprenants du français : défis et enjeux des outils numériques dans la constitution de corpus ». Deux mémoires de M2 en Sciences du Langage utilisant les données du corpus CAENNAIS ont été soutenus en septembre 2025 par Maxence Multin (« Intégration du corpus ESLO_REPAS dans le finetuning du modèle de segmentation du projet CAENNAIS: Vers la diversification ou l’homogénéisation des données de finetuning? ») et Florian Peck (« L’évolution des phénomènes interactionnels dans un corpus oral longitudinal : Chevauchements, interruptions et sujets de conversation »).

Équipe

Catrine Bang Nielsen – responsable scientifique

Rayan Ziane – ingénieur

Natasha Romanova – coordinatrice

Florian Peck (stage de 100 heures, M2 SDL parcours LTD, Université de Caen)

Orlanne Pinsault (stage de 100 heures, M2 SDL parcours FLE, Université de Caen)

Cécile Dennebouy (stage recherche, Ortophonie, Université de Caen)

Solen Devaux (stage recherche, Ortophonie, Université de Caen)

Quentin Fouqueau (stage recherche, Ortophonie, Université de Caen)

Lisa Boucicaud (stage de recherche, Orthophonie, Université de Caen)

Eva Bougyon (stage de recherche, Orthophonie, Université de Caen)

Lucie Chapalain (stage de recherche, Orthophonie, Université de Caen)

Célia Dhommée (stage de recherche, Orthophonie, Université de Caen)

Marie-Amélie Grout (stage de recherche, Orthophonie, Université de Caen)

Capucine Leclercq (stage découverte, 70 heures, L3 SDL, Université de Caen)

Ismaël Letenneur (stage de 100 heures, M2 SDL parcours TAL, Université de Caen)

Maxence Multin (stage de 100 heures, M2 SDL parcours TAL, Université de Caen)

Romane Ostrogradsky (stage de recherche, Orthophonie, Université de Caen)

Léna Thommeret (stage de recherche, Orthophonie, Université de Caen)

Fanny Weber (stage de recherche, Orthophonie, Université de Caen)

Mojgan Eliaspour (stage de 50 heures, M1 SDL parcours LTD, Université de Caen)

Madeleine Lysebo (stage de 50 heures, M1 SDL parcours FLE, Université de Caen)

Mélissa Menclé (stage de 50 heures, M1 SDL parcours ATL, Université d’Orléans)

Agathe Mercier ((stage de recherche, Orthophonie, Université de Caen)

Si vous souhaiter participer au projet ou effectuer un stage non-rémunéré, n’hésitez pas à nous contacter.

Lecture

4 minutes

Cookie	Type	Durée	Description
__Secure-YEC	tiers	13 mois	Le cookie « __Secure-YEC » est utilisé pour détecter les spams, les fraudes et les abus afin de garantir que les annonceurs ne soient pas facturés à tort pour des impressions ou des interactions frauduleuses ou invalides avec les publicités, et que les créateurs YouTube participant au programme Partenaire YouTube soient rémunérés de manière équitable.
_pk_id.*	persistant	1 an 27 jours	Utilisé par Matomo pour stocker des informations sur l’utilisateur, telles que l’identifiant unique du visiteur.
_pk_ref*	persitant	6 mois	Utilisé par Matomo pour stocker les informations d’attribution, le référent initialement utilisé pour visiter le site Web.
_pk_ses.*	session	30 minutes	Cookies de courte durée utilisés par Matomo pour stocker temporairement les données de la visite.
_pk_testcookie_domain	session	moins d'une minute	Utilisé par Matomo pour vérifier si le navigateur du visiteur prend en charge les cookies.
affluenceswebapi_ga	tiers	session	Les widgets web (webAPI) ont pour objectif de diffuser les informations d'affluence (taux d'occupation, horaires, temps d'attente) sur des sites web tiers. Un tag Google Analytics est intégré à cette webAPI afin de mesurer le nombre de consultations des outils pour assurer leur bon fonctionnement et pertinence. - Aucune donnée personnelle n'est traitée, consultée ou stockée via l'utilisation des webAPIs et du tag Google Analytics - Les adresses IP des utilisateurs sont anonymisées afin de garantir leur confidentialité
affluenceswebapi_ga_0DZGM777JP	tiers	session	Les widgets web (webAPI) ont pour objectif de diffuser les informations d'affluence (taux d'occupation, horaires, temps d'attente) sur des sites web tiers. Un tag Google Analytics est intégré à cette webAPI afin de mesurer le nombre de consultations des outils pour assurer leur bon fonctionnement et pertinence. - Aucune donnée personnelle n'est traitée, consultée ou stockée via l'utilisation des webAPIs et du tag Google Analytics - Les adresses IP des utilisateurs sont anonymisées afin de garantir leur confidentialité
BIGipServer*	session	session	Le cookie BIGipServer* est principalement utilisé pour l'équilibrage de charge. Lorsqu'un utilisateur accède à un site web ou à une application qui utilise des dispositifs F5 BIG-IP, ce cookie aide à diriger les requêtes de l'utilisateur vers le même serveur backend pour la durée de la session. Cela assure la cohérence et la continuité de la session utilisateur.
cli_user_preference	persistant	1 an	Ce cookie est défini par le plugin GDPR Cookie Consent. L'objectif de ce cookie est d'enregistrer si l'utilisateur a donné ou non son consentement à l'utilisation des cookies. Il ne stocke aucune donnée personnelle.
cookielawinfo-checkbox-fonctionnel	persistant	1 an	Le cookie est défini par le consentement du cookie GDPR pour enregistrer le consentement de l'utilisateur pour les cookies dans la catégorie «Fonctionnel».
cookielawinfo-checkbox-necessaire	persistant	1 an	Ce cookie est défini par le plugin GDPR Cookie Consent. Les cookies sont utilisés pour stocker le consentement de l'utilisateur pour les cookies dans la catégorie «Nécessaire».
cookielawinfo-checkbox-publicite	persistant	1 an	Défini par le plugin de consentement aux cookies GDPR, ce cookie est utilisé pour stocker le consentement de l'utilisateur pour les cookies de la catégorie «Publicité».
CookieLawInfoConsent	persistant	1 an	CookieYes définit ce cookie pour enregistrer l'état du bouton par défaut de la catégorie correspondante et le statut du CCPA. Il fonctionne uniquement en coordination avec le cookie principal.
csrftoken	tiers	1 an	Ce cookie est associé à la plate-forme de développement Web Django pour python. Utilisé pour aider à protéger le site Web contre les attaques de falsification de requêtes entre sites.
dmvk	tiers	session	Clé vidéo aléatoire utilisée pour empêcher l’interruption de la vidéo regardée par un utilisateur final lorsqu’il navigue entre les réseaux de différents fournisseurs d’accès Internet.
PHPSESSID	session	session	Ce cookie est natif des applications PHP. Le cookie est utilisé pour stocker et identifier l'identifiant de session unique d'un utilisateur dans le but de gérer la session utilisateur sur le site Web. Le cookie est un cookie de session et est supprimé lorsque toutes les fenêtres du navigateur sont fermées.
pll_language	persistant	1 an	Le cookie pll _language est utilisé par Polylang pour se souvenir de la langue sélectionnée par l'utilisateur lorsqu'il revient sur le site web, et également pour obtenir des informations sur la langue lorsqu'elles ne sont pas disponibles d'une autre manière.
ts	tiers	13 mois	Il s'agit d'un cookie mis en place par Dailymotion. Cookie de segment de trafic utilisé principalement pour le déploiement progressif, une fonctionnalité technique critique qui empêche les pannes de service massives pendant la mise en œuvre de nouveaux développements ou de nouvelles fonctionnalités.
usprivacy	tiers	13 mois	Il s'agit d'un cookie de consentement mis en place par Dailymotion pour stocker la chaîne de consentement CCPA (informations obligatoires sur le fait qu'un utilisateur final est ou n'est pas un consommateur californien et qu'il exerce ou n'exerce pas son droit statutaire).
v1st	tiers	13 mois	Il s’agit de votre identifiant numérique unique sur le Service Dailymotion. Il est utilisé pour délivrer le Service Dailymotion, et, en particulier pour : – la détection et la prévention des fraudes ; – la sécurité du Service Dailymotion ; – le respect des obligations légales (par exemple, l’obligation de réponse aux réquisitions judiciaires en matière d’accès aux vidéos) ; – l’identification de l’âge d’un utilisateur final
viewed_cookie_policy	persistant	1 an	Le cookie est défini par le plugin GDPR Cookie Consent et est utilisé pour stocker si l'utilisateur a consenti ou non à l'utilisation de cookies. Il ne stocke aucune donnée personnelle.
VISITOR_PRIVACY_METADATA	tiers	6 mois	YouTube définit ce cookie pour enregistrer le consentement de l'utilisateur à l'utilisation de cookies pour le domaine actuel.
wordpress_test_cookie	session	session	Ce cookie est utilisé par WordPress pour vérifier si les cookies sont activés dans le navigateur de l’utilisateur.
wp_lang	session	session	Pour enregistrer les paramètres linguistiques.

Cookie	Type	Durée	Description
__Secure-ROLLOUT_TOKEN	tiers	6 mois	__Secure-ROLLOUT_TOKEN est utilisé par YouTube pour gérer le déploiement progressif de nouvelles fonctionnalités et mises à jour. Ce cookie permet d'affecter les utilisateurs à des groupes de test spécifiques pour des fonctionnalités expérimentales, telles que des modifications de l'interface utilisateur ou du lecteur vidéo. Le préfixe __Secure- indique que le cookie est uniquement transmis via une connexion HTTPS sécurisée, ce qui renforce la sécurité des données.
test_cookie	tiers	15 minutes	Le test_cookie est défini par doubleclick.net et est utilisé pour déterminer si le navigateur de l'utilisateur prend en charge les cookies.
VISITOR_INFO1_LIVE	tiers	5 mois 27 jours	Un cookie mis en place par YouTube pour mesurer la bande passante qui détermine si l'utilisateur obtient la nouvelle ou l'ancienne interface du lecteur.
YSC	tiers	session	Le cookie YSC est mis en place par Youtube et est utilisé pour suivre les vues des vidéos intégrées sur les pages Youtube.
yt.innertube::nextId	tiers	jamais	Ce cookie, défini par YouTube, enregistre un identifiant unique pour stocker des données sur les vidéos de YouTube que l'utilisateur a vues.
yt.innertube::requests	tiers	jamais	Ce cookie, défini par YouTube, enregistre un identifiant unique pour stocker des données sur les vidéos de YouTube que l'utilisateur a vues.

Cookie	Type	Durée	Description
_42b19	session	session	Il permet de stocker des informations temporaires spécifiques à la session de l'utilisateur, telles que les préférences de navigation, les choix ou les paramètres spécifiques, afin de fournir une expérience utilisateur cohérente et personnalisée. Ce cookie est essentiel pour assurer le bon fonctionnement de certaines fonctionnalités du site web pendant la session active et est supprimé automatiquement lorsque l'utilisateur ferme son navigateur.
activeCollapseAside	session	session	Le cookie activeCollapseAside permet de sauvegarder l'état d'un panneau latéral ou d'une barre latérale.
NEXT_LOCALE	persitant	1 an	Il permet de stocker la langue locale préférée de l'utilisateur et de la récupérer lors de ses visites ultérieures sur le site.
yt-remote-cast-available	tiers	session	Le cookie yt-remote-cast-available est utilisé pour enregistrer les préférences de l'utilisateur concernant la disponibilité de la fonction de diffusion sur son lecteur vidéo YouTube.
yt-remote-cast-installed	tiers	session	Le cookie yt-remote-cast-installed est utilisé pour stocker les préférences de l'utilisateur en matière de lecteur vidéo à l'aide d'une vidéo YouTube intégrée.
yt-remote-connected-devices	tiers	jamais	YouTube définit ce cookie pour stocker les préférences vidéo de l'utilisateur à l'aide de la vidéo YouTube intégrée.
yt-remote-device-id	tiers	jamais	YouTube définit ce cookie pour stocker les préférences vidéo de l'utilisateur à l'aide de la vidéo YouTube intégrée.
yt-remote-fast-check-period	tiers	session	Le cookie yt-remote-fast-check-period est utilisé par YouTube pour enregistrer les préférences de l'utilisateur concernant le lecteur vidéo pour les vidéos YouTube intégrées.
yt-remote-session-app	tiers	session	Le cookie yt-remote-session-app est utilisé par YouTube pour stocker les préférences de l'utilisateur et les informations relatives à l'interface du lecteur vidéo YouTube intégré.
yt-remote-session-name	tiers	session	Le cookie yt-remote-session-name est utilisé par YouTube pour enregistrer les préférences de l'utilisateur concernant le lecteur vidéo à l'aide d'une vidéo YouTube intégrée.
ytidb::LAST_RESULT_ENTRY_KEY	tiers	jamais	Le cookie ytidb::LAST_RESULT_ENTRY_KEY est utilisé par YouTube pour stocker le dernier résultat de recherche sur lequel l'utilisateur a cliqué. Ces informations sont utilisées pour améliorer l'expérience utilisateur en fournissant des résultats de recherche plus pertinents à l'avenir.

(Corpus Audio d’Étudiants Natifs et non-NAtifs en InteractionS)

Projet pédagogique

2023-2024

2024-2025

2025-2026

Dissemination

Recherche

Équipe

Dans la même catégorie

Projet de modélisation graphique de la polysémie évolutive

Journées d’études de la thématique 2

Projet VOLI

CONDÉ, La constitution d’un droit européen : Six siècles de coutumiers normands