TTS français : lequel garde-t-on ?

Mêmes 12 phrases, même référence vocale (extrait réel de James), clonage zero-shot. Écoute, puis valide ou refuse chaque système.

Ce que disent les mesures

SystèmeDébit séquentielDébit en lot de 12Gain du batchingLatence par énoncé

Le débit est le rapport entre les secondes d'audio produites et le temps réel écoulé : 8× signifie qu'une seconde de calcul produit huit secondes de parole. Kyutai est mesuré différemment (vrai streaming via moshi-server, TTFB ~440 ms), il figure ici comme repère d'écoute.

À l'écoute

Les deux premiers blocs utilisent un texte parlé (hésitations, reprises, mots d'appui écrits dans le texte) et la référence propre. Les suivants lisent de la prose écrite — c'est la comparaison qui compte.