TTS français : lequel garde-t-on ?
Mêmes 12 phrases, même référence vocale (extrait réel de James), clonage zero-shot. Écoute, puis valide ou refuse chaque système.
Ce que disent les mesures
| Système | Débit séquentiel | Débit en lot de 12 | Gain du batching | Latence par énoncé |
|---|
Le débit est le rapport entre les secondes d'audio produites et le temps réel écoulé : 8× signifie qu'une seconde de calcul produit huit secondes de parole. Kyutai est mesuré différemment (vrai streaming via moshi-server, TTFB ~440 ms), il figure ici comme repère d'écoute.
À l'écoute
Les deux premiers blocs utilisent un texte parlé (hésitations, reprises, mots d'appui écrits dans le texte) et la référence propre. Les suivants lisent de la prose écrite — c'est la comparaison qui compte.