· publié sur LinkedIn

On parle pas assez du speech-to-text

Le nouveau speech-to-text marche vraiment. Et ce que ça dit du rapport de force entre éditeurs et utilisateurs.

On parle pas assez du speech-to-text.

Pas le truc de 2015 qui comprenait un mot sur trois. Le nouveau. Celui qui marche vraiment.

Tu passes du français à l’anglais mid-phrase ? OK. Tu balances “Kubernetes”, “index.ts”, “Loki” ? OK. L’IA retranscrit le mot exact.

Les avancées de ces 12 derniers mois ont rendu le truc réellement utilisable. Et Mistral vient de sortir Voxtral, qui fait mieux qu’OpenAI sur la transcription. Cocorico. 🐓

Aujourd’hui, dicter son texte c’est un truc de niche. Quelques devs, quelques early adopters.

Mais réfléchis 2 secondes.

Préparer une présentation PowerPoint ? Tu dictes. Décrire une formule Excel ? Tu dictes. Expliquer une feature à coder ? Tu dictes.

C’est juste plus rapide d’expliquer que de taper. Surtout quand + de contexte = mieux.

Dans 3 ans, je parie que la majorité des gens dicteront tout. Les devs adoptent juste les outils plus vite que les autres. Comme d’hab.

L’autre truc intéressant, c’est ce que ça dit sur l’industrie du logiciel.

Il existe des apps comme SuperWhisper. 9$/mois. Produit solide, bien pensé, vraie stratégie de distribution. Un vrai business.

Moi j’ai utilisé pendant quelques semaines. Et puis je me suis dit : j’utilise 20% des features. Et si je recréais juste ça ?

J’ai lancé Claude Code en quasi-autonomie. Une journée. Moi je faisais la QA et j’orientais sur les technos. J’ai jamais écrit une ligne de Swift de ma vie.

Résultat : Whisper Voice, une app native Mac + Windows. Fonctionnelle.

Aujourd’hui c’est des produits simples qu’on peut recréer comme ça. Demain ce sera des produits plus complexes. Le rapport de force entre éditeurs et utilisateurs est en train de changer.

Bref. J’ai mis l’app en open source si ça vous intéresse.

Whisper Voice. Gratuit. Mac + Windows. Tu rentres ta clé API (OpenAI ou Mistral), tu parles, le texte apparaît.