Aller au contenu
    VOIX
    Guide IA – Série ChatGPT 8/14

    Mode vocal ChatGPT : la conversation orale en 2026

    Vous êtes en voiture, les mains sur le volant. Vous pensez à un email à envoyer. Mais, au lieu de le noter mentalement pour plus tard, vous dites « ChatGPT, rédige un email à Marc pour repousser la réunion de mardi à jeudi ». ChatGPT répond à voix haute, vous ajustez le ton, et le brouillon vous attend quand vous arrivez. Ce huitième article de la série couvre tout ce que le mode vocal change dans un usage quotidien de ChatGPT.

    Le mode vocal de ChatGPT a franchi une étape majeure le 8 juillet 2026 avec GPT-Live. L’interface séparée avec le « orbe bleu » n’est plus le mode par défaut : la voix est intégrée directement dans le chat. Vous parlez, le texte apparaît en temps réel, et vous pouvez basculer entre voix et clavier sans interrompre la conversation. Ajoutez la traduction simultanée, les cartes visuelles, le Record Mode pour les réunions et ChatGPT sur CarPlay, et vous obtenez un assistant vocal qui n’a plus grand-chose à voir avec Siri ou Alexa.

    Précision technique importante : depuis le 8 juillet 2026, le mode vocal s’appuie sur GPT-Live, une nouvelle génération de modèles vocaux à architecture full-duplex, capables d’écouter et de parler en même temps. Deux versions coexistent : GPT-Live-1, par défaut sur les forfaits Go, Plus et Pro, puis GPT-Live-1 mini, par défaut pour les utilisateurs Free. GPT-Live remplace l’ancien Advanced Voice Mode et alimente désormais ChatGPT Voice. Son fonctionnement repose sur deux couches : une couche d’interaction qui gère la conversation en continu, et une couche de délégation qui confie les questions complexes (recherche web, raisonnement approfondi) à un modèle de pointe en arrière-plan, puis réintègre la réponse dans le fil sans casser le rythme.

    Comment le mode vocal fonctionne

    La voix est intégrée dans le chat. Plus besoin de basculer vers un écran séparé. Vous appuyez sur l’icône micro à côté du champ de texte, vous parlez. ChatGPT répond alors à l’oral tout en affichant la transcription en temps réel. Avec l’architecture full-duplex de GPT-Live, il peut glisser des acquiescements naturels (« mmh », « oui ») pendant que vous parlez, gérer une interruption sans vous couper, ou rester silencieux quand vous prenez un temps de réflexion.

    Nouveauté visible : pendant que la voix continue, ChatGPT peut afficher des cartes pour illustrer un sujet — météo, résultats sportifs, cours de bourse, plan. Vous gardez la conversation orale tout en ayant l’information à l’écran. La recherche web, la mémoire, les images et les uploads restent également accessibles pendant une session vocale.

    Si vous préférez l’ancienne interface en plein écran (l’orbe), elle reste accessible via Paramètres > Voix > Mode séparé. Certains comptes voient encore le mode hérité par défaut pendant le déploiement mondial de GPT-Live. Sur iOS et Android, vous pouvez afficher les sous-titres des réponses en appuyant sur le bouton « cc » en haut à droite pendant une conversation vocale—pratique dans les environnements bruyants ou quand vous préférez lire en même temps.

    Choisir sa voix

    ChatGPT propose neuf voix au ton naturel, remasterisées pour GPT-Live, avec des tonalités et personnalités distinctes. Vous les choisissez lors de votre première conversation vocale ou dans Paramètres > Voix. Certaines sont plus chaleureuses, d’autres plus neutres. Testez-en deux ou trois pour trouver celle qui ne vous fatigue pas à l’écoute. Voice adapte également son style (longueur, débit, ton) aux instructions que vous lui donnez en cours de conversation.

    Ce que GPT-Live change à l’oral

    Les générations précédentes de la voix fonctionnaient en tour par tour : vous parliez, le système attendait la fin, calculait, puis répondait. Ce schéma produisait des temps morts et des coupures gênantes sur une simple pause. GPT-Live traite le son en continu : il amorce une réponse plus vite, module son débit pendant que vous reprenez la parole, puis gère les chevauchements comme dans une vraie conversation. Le gain le plus net n’est pas « la belle voix », mais la gestion du tour de parole—ce qui sépare un standard téléphonique d’un échange fluide.

    Les capacités visuelles : caméra, vidéo, partage d’écran

    Le mode vocal ne se limite pas à l’audio. Sur mobile (iOS et Android), les abonnés Plus, Pro et Business ont accès à trois capacités visuelles.

    • Upload de photos — Prenez une photo ou uploadez une image pendant la conversation vocale. ChatGPT l’analyse et en parle. Un ticket de caisse, une étiquette produit, un plan d’architecture — tout est analysable, y compris avec GPT-Live.
    • Vidéo en temps réel — Appuyez sur l’icône caméra pendant une conversation vocale. ChatGPT voit ce que vous montrez et répond en conséquence : une machine à café inconnue, un problème de plomberie, un devoir de maths, et il vous guide étape par étape à voix haute.
    • Partage d’écran — Menu trois points > Partager l’écran. ChatGPT voit votre écran et commente ce qui s’y affiche. Utile pour de l’aide sur une interface, un tableur, ou un bug visuel.
    Vidéo et partage d’écran : encore sur le mode hérité

    Au lancement, GPT-Live ne prend pas encore en charge la voix associée à la vidéo ni au partage d’écran. Pour utiliser ces deux fonctions aujourd’hui, basculez sur un mode vocal hérité (Advanced Voice Mode) via Paramètres > Voix. OpenAI annonce leur arrivée sur GPT-Live prochainement. L’upload de photos, lui, fonctionne bien avec GPT-Live.

    Ces fonctionnalités visuelles sont disponibles sur mobile uniquement. Le web desktop se limite à la conversation vocale avec transcription. L’usage de la vidéo et du partage d’écran est plafonné quotidiennement par utilisateur—au-delà du quota, ces fonctions se désactivent temporairement jusqu’au reset.

    Voice + Custom GPTs

    C’est l’une des évolutions les plus attendues par les utilisateurs avancés. Le mode vocal fonctionne avec les Custom GPTs. Vous ouvrez votre GPT personnalisé, vous activez le micro, et vous parlez directement à cet assistant sur mesure—pas à ChatGPT générique. Le GPT dispose d’ailleurs d’une voix dédiée, distincte des autres voix disponibles dans ChatGPT.

    Quelques limites persistent. Les custom actions (intégrations API externes configurées dans un GPT) ne sont pas encore supportées en mode vocal. Le Code Interpreter reste indisponible pendant une session vocale. Pour tout le reste—base de connaissances du GPT, instructions personnalisées, ton spécifique—le mode vocal respecte la configuration du GPT. Cela ouvre des usages concrets : un GPT formateur qui vous interroge à voix haute, un GPT coach qui vous entraîne à l’oral, un GPT expert métier que vous consultez mains libres.

    La traduction en temps réel

    C’est l’un des cas d’usage les plus immédiatement utiles du mode vocal. Dites à ChatGPT « Traduis ce que je dis en espagnol » et il devient interprète. Vous parlez en français, il traduit à l’oral en espagnol, et avec GPT-Live il peut traduire une phrase pendant qu’elle est encore prononcée. La traduction continue automatiquement jusqu’à ce que vous demandiez d’arrêter ou de changer de langue.

    Le système fonctionne sur une large palette de langues. La qualité est bonne pour les conversations courantes et professionnelles. Pour les échanges techniques très spécialisés ou les langues à tonalité (mandarin), la précision peut varier—surtout dans des environnements bruyants, et l’intonation hors anglais reste perfectible.

    Cas d’usage concret : vous recevez un partenaire étranger dans vos locaux. Vous activez le mode vocal de ChatGPT sur votre téléphone posé sur la table, et il traduit la conversation dans les deux sens. Ce n’est pas un interprète professionnel, mais pour un échange informel ou une réunion de cadrage, ça fonctionne.

    Record Mode : transcrire et résumer vos réunions

    Le Record Mode, disponible sur l’app de bureau et progressivement sur les autres plateformes, enregistre des conversations en direct—réunion, brainstorm, note vocale—et produit une transcription éditable, avec résumé automatique.

    Étape 01
    Enregistrer

    Activez Record Mode avant ou pendant une réunion. ChatGPT capture l’audio ambiant — votre voix et celles de vos interlocuteurs. Disponible sur les plans Plus, Pro, Business (les admins Business peuvent désactiver la fonctionnalité).

    Étape 02
    Transcrire

    ChatGPT transcrit la conversation et la structure. La transcription apparaît dans un document éditable, que vous pouvez retravailler comme n’importe quel texte.

    Étape 03
    Exploiter

    Demandez à ChatGPT de produire un compte-rendu structuré, des actions à suivre, un email de suivi, ou un résumé exécutif à partir de la transcription. Tout reste dans votre conversation — réutilisable dans un Project.

    Le Record Mode n’est pas taillé pour les équipes qui enregistrent systématiquement toutes leurs réunions. Mais pour capturer ponctuellement un brainstorm, une interview, ou une note vocale longue, c’est un gain de temps considérable.

    Conversations en arrière-plan et CarPlay

    Deux fonctionnalités qui rendent le mode vocal vraiment exploitable en mobilité.

    Background Conversations. Activé dans Paramètres > Voix, le mode permet de poursuivre une conversation vocale même quand vous verrouillez votre téléphone ou ouvrez une autre application. Pratique pour garder ChatGPT comme compagnon de marche, de course ou de conduite sans devoir maintenir l’app ouverte au premier plan.

    ChatGPT sur CarPlay. Depuis le 2 avril 2026, ChatGPT est disponible sur Apple CarPlay (iOS 26.4 ou ultérieur). Vous pouvez démarrer une nouvelle conversation vocale directement depuis l’interface CarPlay, ou reprendre une conversation existante commencée en mode vocal sur l’app mobile. Android Auto n’est pas encore couvert à date.

    Les cas d’usage en voiture : dictée d’emails ou de messages, brainstorm oral sur un sujet à préparer, questions factuelles pendant un trajet, planification d’itinéraire. C’est une alternative bien plus intelligente que Siri pour les interactions qui demandent du contexte ou du raisonnement.

    Les limites du mode vocal — ce qui ne fonctionne pas (encore)

    Le mode vocal a des contraintes à connaître avant de bâtir un workflow dessus.

    Ce que le mode vocal gère mal

    Avec GPT-Live, la recherche web, la mémoire, les images et les uploads restent accessibles à la voix, mais le Code Interpreter et les custom actions des Custom GPTs ne le sont pas. La vidéo et le partage d’écran ne sont pas encore pris en charge sur GPT-Live et passent, pour l’instant, par un mode vocal hérité. En pratique, le mode vocal fonctionne surtout dans sa propre bulle : pour une analyse de fichier lourde, bascule en texte, puis reprends la voix si nécessaire.

    Raisonnement approfondi. GPT-Live délègue les questions complexes à un modèle de raisonnement en arrière-plan, mais pour une analyse de données dense ou une résolution de problème en plusieurs étapes, vous obtiendrez de meilleurs résultats en texte. La voix reste idéale pour les tâches conversationnelles.

    Interruptions résiduelles. L’architecture full-duplex réduit fortement les coupures, mais elle n’est pas parfaite : un testeur a rapporté une IA un peu trop bavarde qui riait de ses blagues en parlant encore, un comportement depuis bridé par OpenAI. Parler en phrases claires aide toujours. Sur iPhone, activer le mode micro « Isolation vocale » via le Centre de contrôle réduit les interruptions causées par les bruits ambiants.

    Intonation hors anglais. Les premières démos ont montré des ratés d’accent sur certaines langues (une démo en hindi avec un fort accent américain). La qualité progresse, mais la prosodie multilingue reste perfectible.

    Disponibilité par plan. Tous les utilisateurs connectés ont accès au mode vocal : GPT-Live-1 mini par défaut sur Free, GPT-Live-1 sur Go, Plus et Pro. Les utilisateurs Free ont un quota quotidien avec bascule vers un modèle plus léger une fois la limite atteinte, tandis que Plus et Pro bénéficient d’un accès nettement plus large. La vidéo et le partage d’écran restent réservés aux plans payants sur mobile. GPT-Live arrive progressivement sur Business, Enterprise et Edu.

    Cinq cas d’usage qui changent votre quotidien

    1. Dictée intelligente mains libres. En voiture, en cuisine, en marchant. « Rédige un email de relance pour le prospect X en mentionnant notre dernière démo. » Le résultat vous attend en texte dans le chat quand vous êtes prêt à l’éditer. Pour aller plus loin sur la formulation de ces demandes, voir les techniques de prompt ChatGPT.

    2. Brainstorm oral. Pensez à voix haute avec ChatGPT. « Je cherche un angle original pour présenter notre bilan Q1 au comité de direction. » La conversation vocale est plus fluide que la saisie pour l’exploration d’idées, et le full-duplex la rend enfin naturelle. Basculez en texte quand vous voulez structurer.

    3. Coaching et préparation. Préparez une présentation en la faisant à voix haute à ChatGPT. Demandez-lui de critiquer votre argumentation, de poser les questions qu’un investisseur poserait, de signaler les faiblesses. Le mode vocal simule un interlocuteur en temps réel.

    4. Apprentissage des langues. Pratiquez une conversation dans une langue étrangère. ChatGPT adapte son niveau, corrige vos erreurs, puis peut basculer en mode traduction si vous bloquez. C’est l’un des usages où le mode vocal excelle par rapport au texte.

    5. Assistance visuelle sur le terrain. Avec la vidéo en temps réel (via le mode hérité pour l’instant), montrez un problème technique—une erreur sur un écran, un appareil à configurer, un document à interpréter—et obtenez de l’aide vocale immédiate. L’équivalent d’un appel à un collègue expert, disponible à toute heure.

    Ce que vous pouvez faire maintenant

    Activez le mode vocal et testez trois choses : dictez un email ou un message au lieu de le taper. Lancez un brainstorm oral sur un sujet que vous repoussez depuis une semaine. Et si vous avez configuré des Custom GPTs, ouvrez celui que vous utilisez le plus souvent et parlez-lui—vous découvrirez un usage que le texte ne permet pas. Profitez-en pour tester la fluidité de GPT-Live sur une vraie conversation, interruptions comprises.

    Article suivant
    Les blocs d’écriture et de code de ChatGPT

    Écrire et coder à côté de ChatGPT au lieu de parler avec : les blocs d’édition transforment ChatGPT d’un outil de conversation en un outil de production.

    Découvrir les blocs d’édition ChatGPT
    Mise à jour : 12 juillet 2026
    Étiquettes: