par Nodical
Recherche · 2027-2028

ASDIC. Le modèle qui écoute pour reconnaître.

Au téléphone, tout se joue en quelques secondes. Les modèles du marché ont été conçus pour de la parole lue, en anglais. Nous construisons le nôtre, pour la conversation téléphonique, en français, en espagnol et en anglais, entraîné et hébergé en Europe.

En développement · projet de recherche 2027-2028

Impulsion envoyéeÉcho : un humainÉcho : répondeur ou bruit
Aujourd'hui
Objectif
  1. T+0,0 sdécroché
    T+0,0 sdécroché
  2. T+0,4 s« Allô ? »
    T+0,4 s« Allô ? »
  3. T+8 srépondeur reconnu (médiane sur nos campagnes)
    T+2 srépondeur reconnu, moins de 3 % d'erreur
  4. T+1,3 sdélai de réponse, 9 fois sur 10
    T+0,5 sdélai de réponse, sans couper la parole
  5. T+135 stransfert à un conseiller (médiane)
    au bon momenttransfert avec un résumé de deux lignes

Les valeurs « aujourd'hui » sont mesurées sur nos appels de septembre 2026. Les objectifs sont des objectifs : ils seront publiés avec les mesures, pas avant.

Le problème

La moitié des appels décrochés durent dix secondes ou moins.

Les modèles de reconnaissance vocale ont appris sur de la parole lue, en large bande, surtout en anglais. Au téléphone, le son est étroit, les gens se coupent la parole, et une décision doit tomber en moins d'une seconde. Chaque seconde de compréhension perdue coûte un contact.

60 287appels décrochés par un humain, septembre 2026
10 sdurée médiane d'un appel décroché
8 sur 10appels de moins de vingt secondes
8 savant qu'un répondeur soit reconnu aujourd'hui

Relevé sur la base de production de Nodical, 14 campagnes, sans lire le contenu des conversations.

Ce qu'il fait

Cinq décisions, pendant l'appel.

  1. dès le décroché

    Humain ou répondeur

    ASDIC dit à qui l'agent parle, avec un indice de confiance. Aujourd'hui la décision tombe en huit secondes en médiane. L'objectif : moins de deux secondes.

  2. pendant qu'elle parle

    Ce que veut la personne

    Intéressée, pas intéressée, à rappeler, mauvais numéro, demande un humain, ne veut plus être contactée : l'intention est reconnue en direct, avec les réponses aux questions d'éligibilité.

  3. à chaque tour

    Quand elle a fini de parler

    Ni couper la parole, ni laisser un blanc. Attendre le silence ne suffit pas : c'est le point faible de tous les agents vocaux, et le cœur de notre travail.

  4. au bon moment

    Le transfert vers un humain

    Quand un conseiller doit reprendre, ASDIC le dit, avec un résumé de deux lignes pour qu'il n'arrive pas à froid.

  5. partout

    Trois langues

    Français, espagnol, anglais : le même modèle, les mêmes performances, sans reconstruire un modèle par langue.

Point de départ

Ce que nous mesurons, et ce que nous visons.

VerrouAujourd'hui (mesuré)Objectif
Humain ou répondeurdécision à 8 s (médiane), 14 s pour 9 appels sur 10moins de 2 s, moins de 3 % d'erreur
Délai de réponse0,14 s en médiane, 1,32 s 9 fois sur 10, hors détection de fin de parolemoins de 0,5 s, en coupant la parole moins de 5 % du temps
Transfert1,19 % des appels décrochés, à 135 s (médiane)plus de 9 transferts sur 10 jugés pertinents
Intention et éligibilitépas de mesure sans corpus annotéfixé après la mesure de référence
Souveraineté0 % de modèle propre100 % pour le modèle de compréhension

Objectifs proposés à partir des mesures de septembre 2026 et de l'état de l'art ; ils seront validés avec l'équipe recrutée.

Le nom

Pourquoi ASDIC.

1917

La première machine qui écoutait pour reconnaître

L'ASDIC est l'ancêtre du sonar, mis au point pendant la Première Guerre mondiale avec l'apport décisif du physicien français Paul Langevin. Il envoie un son, écoute l'écho, et décide en quelques secondes s'il entend une vraie cible ou seulement du bruit.

2027

Le même travail, sur une conversation

Notre modèle fait la même chose au téléphone : il écoute, distingue tout de suite un humain d'un répondeur, repère une intention réelle au milieu de la conversation, et prévient au bon moment.

Europe

Une technologie que nous tenons

Le modèle, ses poids et son corpus appartiennent à Nodical. Il est entraîné sur la puissance de calcul européenne et hébergé dans l'Union européenne. Aucun fournisseur unique ne peut le couper.

Ce qui existe

Ce que disent les mesures publiées.

×5 à ×6

Le modèle ouvert de référence en reconnaissance vocale se trompe sur 2,7 % des mots en lecture, mais sur 13,8 à 17,6 % en conversation téléphonique, et sur 28,7 % sur de vrais appels de service client en qualité téléphone.

OpenAI, article Whisper (tableau 8) ; Krutrim, 2026
3 à 5 s

Le temps que prend la détection de répondeur des opérateurs, avec 94 % de réussite annoncés, mesurés seulement en Amérique du Nord. Aucun chiffre publié pour les messageries françaises ou espagnoles.

Twilio, documentation AMD
55,6 %

La part des fois où l'on coupe la parole à tort en répondant après 300 ms de silence. Pour descendre à 5 %, il faut attendre 1,6 seconde.

LiveKit, banc d'essai eot-bench

Aucune mesure de référence publique n'existe pour le téléphone en français. Constituer ce corpus fait partie de la recherche.

Programme

Vingt-quatre mois, six étapes.

  1. Mois 1 à 8

    Données

    Un corpus d'appels pseudonymisés, annoté en français, puis en espagnol et en anglais. Il n'en existe aucun en accès libre pour le téléphone en français.

  2. Mois 2 à 4

    Référence

    Les modèles du marché mesurés sur ce corpus : le point de départ chiffré.

  3. Mois 4 à 14

    Modèle français

    Conception et entraînement des quatre premières fonctions.

  4. Mois 12 à 20

    Multilingue

    Espagnol et anglais, accents compris.

  5. Mois 10 à 22

    Temps réel

    Intégration dans Nodical et essais en conditions réelles, sur de vraies campagnes.

  6. Mois 20 à 24

    Évaluation

    Les mesures finales, publiées ; la protection du modèle ; le déploiement.

Avec l'appui d'un laboratoire public d'Île-de-France spécialisé en traitement de la parole, en cours de sélection. Entraînement sur la puissance de calcul européenne.

Ce qu'il ne fait pas

Trois lignes que nous ne franchirons pas.

Aucune voix imitée

ASDIC écoute et comprend. Il ne produit jamais une voix et n'apprend jamais à en imiter une.

Aucune décision sur la personne

Il aide l'agent à mener la conversation. Il ne décide rien à propos de la personne appelée.

Aucune coordonnée dans les données

Les appels qui servent à l'entraînement sont pseudonymisés : noms, numéros et adresses sont retirés avant toute annotation. Toute personne peut s'y opposer par un simple email.

Pour qui

D'abord Nodical. Ensuite, tout logiciel qui doit comprendre un appel.

Dans Nodical

Les oreilles et le jugement de l'agent

ASDIC remplace la partie « écouter et juger » des agents vocaux de Nodical. La voix reste produite par la synthèse vocale.

En API

Pour d'autres logiciels

Accueil téléphonique, santé, services publics, urgence : tout système qui reçoit ou passe des appels en français, en espagnol ou en anglais.

En Europe

Sans dépendre d'un fournisseur

Un modèle hébergé dans l'Union européenne, avec ses poids et son corpus, pour les organisations qui ne peuvent pas envoyer leurs conversations ailleurs.

Équipe

Nous recrutons deux ingénieur(e)s IA, parole et langage.

Le projet est dirigé par Douglas Demart, président de Nodical. Deux ingénieur(e)s rejoignent l'équipe à Paris : la première en janvier 2027 (modèle français), la seconde en 2027 (multilingue et temps réel). Corpus réel de plus de 60 000 appels par mois, calcul européen, laboratoire partenaire, possibilité de publier.

  1. Janvier 2027 · Paris

    Ingénieur(e) IA — parole et langage

  2. 2027 · Paris

    Ingénieur(e) IA — multilingue et temps réel

Écrire pour candidater

Vous avez des appels en français, en espagnol ou en anglais et vous voulez suivre le projet, ou y contribuer ?

Un email suffit. Nous répondons nous-mêmes, et nous ne publions rien qui n'ait été mesuré.