Aller au contenu
    VISION
    Guide IA · Série Qwen 5/7

    Qwen pour les images, les documents et la voix

    Une facture scannée à transformer en tableau, des notes manuscrites à retranscrire, un graphique sans ses données, une vidéo d’une heure à résumer : Qwen traite tout cela dans le même modèle depuis Qwen3.5, sans passer par une version spécialisée. La famille Omni ajoute la conversation vocale en temps réel, en français, et Alibaba publie aussi des modèles de synthèse vocale et d’images. Ce guide présente ce que Qwen sait lire et entendre, avec des prompts prêts à copier et les limites à connaître.

    Jusqu’en 2025, il fallait choisir un modèle Qwen-VL pour analyser une image, et un modèle texte pour le reste. Depuis Qwen3.5, les modèles principaux sont conçus dès l’origine pour lire le texte, les images et la vidéo. Qwen3.8-27B, que l’on installe sur un ordinateur, comprend ainsi des schémas, des documents et des vidéos d’une heure.

    Le précédent article de la série portait sur le code. Celui-ci couvre tout ce qui n’est pas du texte : l’analyse visuelle de documents, la voix, puis la génération d’images.

    Ce que Qwen sait voir

    Qwen lit les photos, les captures d’écran, les PDF scannés, les tableaux, les graphiques, les schémas techniques et les vidéos. Il reconnaît aussi l’écriture manuscrite et les textes dans plus de 200 langues. Vous y accédez de trois façons : en joignant le fichier dans Qwen Studio, en l’envoyant par l’API, ou en local avec un modèle Qwen3.5, Qwen3.6 ou Qwen3.8 dans Ollama ou LM Studio.

    La famille Qwen3-VL existe toujours, mais elle n’est plus indispensable. Pour un nouveau projet, les modèles principaux font le même travail et savent en plus raisonner, coder et piloter des outils.

    Cinq usages concrets

    Extraire les données d’une facture

    Les factures de fournisseurs différents ont chacune leur mise en page, ce qui met en échec les outils de reconnaissance de texte classiques. Qwen extrait les champs sans modèle préalable, à condition de lui donner un schéma précis.

    Extrais les informations de cette facture et renvoie uniquement un
    JSON, sans texte avant ni après :
    {"fournisseur": {"nom": "string", "siret": "string ou null"},
     "facture": {"numero": "string", "date": "AAAA-MM-JJ"},
     "lignes": [{"description": "string", "quantite": "number",
                 "prix_unitaire_ht": "number"}],
     "totaux": {"ht": "number", "tva": "number", "ttc": "number"}}
    Si un champ n'apparaît pas, mets null.
    Ne calcule rien et ne déduis rien : recopie seulement.

    La dernière consigne compte beaucoup. Sans elle, le modèle peut recalculer un total qui lui paraît faux ou compléter un numéro absent.

    Retranscrire un document manuscrit

    Notes de réunion, courrier ancien, registre d’état civil : Qwen déchiffre l’écriture manuscrite avec une précision correcte, à condition de lui demander de signaler ses doutes.

    Retranscris fidèlement le texte manuscrit de cette image.
    Respecte l'orthographe d'origine, même fautive.
    Écris [?] à la place des passages illisibles.
    Garde les sauts de ligne et la structure.
    À la fin, liste les mots dont tu n'es pas sûr.

    Lire un graphique sans ses données

    Un graphique copié en image, sans le fichier source, se transforme en tableau exploitable. Demandez en plus au modèle de repérer ce qui pourrait tromper le lecteur.

    1. Relève dans un tableau toutes les valeurs lisibles sur ce
       graphique, en précisant pour chacune si la lecture est exacte
       ou estimée.
    2. Donne trois constats chiffrés sur ce que montrent les données.
    3. Signale tout élément trompeur : axe tronqué, échelle
       logarithmique, légende ambiguë.

    Convertir un tableau scanné

    Un tableau imprimé puis scanné, ou étalé sur plusieurs pages d’un PDF, se reconstitue en Markdown ou en CSV. Précisez comment traiter les cellules fusionnées et les chiffres illisibles, puis vérifiez les totaux vous-même.

    Résumer une vidéo

    Avec une fenêtre d’un million de tokens, Qwen3.8 analyse des vidéos d’une heure. Demandez un résumé horodaté, la liste des intervenants ou les passages où un sujet précis est abordé. Pour une réunion enregistrée, un bon outil de transcription reste plus fiable sur le mot à mot.

    Les limites à connaître

    Qwen lit bien, mais il peut se tromper sur un chiffre à moitié effacé ou inventer une valeur plausible là où l’image est floue. Pour toute donnée comptable, juridique ou médicale, vérifiez les chiffres clés sur le document d’origine. Les petits modèles locaux, sous les 9 milliards de paramètres, font aussi nettement plus d’erreurs de lecture que Qwen3.8-Max ou Qwen3.8-27B.

    Parler à Qwen : la gamme Omni

    Les modèles Omni écoutent, regardent et répondent à voix haute dans un même flux, sans passer par une transcription intermédiaire. Qwen3.5-Omni, sorti le 30 mars en versions Plus, Flash et Light, comprend la parole dans 113 langues et dialectes et parle dans 36 langues, dont le français. Il n’existe que par l’API, sans poids ouverts.

    Qwen3.8-Omni-Flash a pris le relais le 18 septembre. Il accepte un million de tokens de contexte et dépasse Qwen3.5-Omni-Plus de 26 % en moyenne sur 30 évaluations, selon Alibaba. Il ajoute aussi le clonage de voix. Le même jour, Alibaba a lancé Qwen3.8-LiveTranslate, un modèle d’interprétation simultanée.

    L’API temps réel fonctionne en WebSocket ou en WebRTC, depuis les régions de Singapour et de Pékin. Elle reconnaît et parle le français, et Qwen3.5-Omni propose 55 voix. Vous pouvez interrompre le modèle en cours de phrase, comme dans une vraie conversation, et lui montrer ce que filme votre caméra. Dans Qwen Studio, la conversation vocale et vidéo est accessible sans rien configurer.

    Voix et transcription en open source

    Alibaba publie aussi deux familles de petits modèles audio à installer soi-même, sous licence Apache 2.0.

    • Qwen3-TTS, sorti le 22 janvier en tailles 0,6B et 1,7B, transforme un texte en voix dans 10 langues, dont le français. Il sait cloner une voix ou en créer une à partir d’une description, avec une latence d’environ 97 millisecondes.
    • Qwen3-ASR, sorti le 29 janvier en tailles 0,6B et 1,7B, transcrit la parole dans 52 langues et dialectes, dont le français.

    Leur petite taille permet de les faire tourner sur un ordinateur ordinaire. Pour comparer avec les services en ligne, notre sélection des meilleurs générateurs de voix par IA recense les outils grand public.

    Générer des images avec Qwen

    La famille Qwen-Image génère et retouche des images, avec des licences très différentes d’une version à l’autre.

    Modèle Accès Licence
    Qwen-Image-2.0 (février) Poids ouverts, génération et retouche en 2K Apache 2.0, usage commercial autorisé
    Qwen-Image-3.0 (juillet) Qwen Studio uniquement, sans poids publiés Service d’Alibaba
    Qwen-Image-2.1 (septembre) Poids ouverts, 7 milliards de paramètres, fonds transparents Licence de recherche, usage commercial interdit sans accord

    Pour un usage professionnel en local, Qwen-Image-2.0 reste donc la version à privilégier. Qwen-Image-3.0 est la plus avancée, mais elle ne s’utilise que dans le chat, et Alibaba n’a publié aucun résultat de benchmark à son sujet. Notre top 20 des générateurs d’images IA la situe face aux autres outils du marché.

    Notre avis

    L’intégration de la vision dans les modèles principaux est une vraie simplification : un seul modèle lit vos documents, raisonne dessus et produit le résultat au format voulu. Pour extraire des factures ou numériser des archives, un modèle Qwen local offre en outre une confidentialité que les services en ligne ne garantissent pas. Côté voix, Alibaba présente Qwen3.8-Omni-Flash comme presque aussi bon que Gemini Flash sur l’audio et la vidéo, mais son API temps réel reste servie depuis l’Asie.

    Ce qu’il faut retenir

    Tous les modèles Qwen récents lisent les images, les documents et les vidéos. Donnez-leur un format de sortie précis et interdisez-leur de deviner, puis vérifiez les chiffres importants. Pour la voix, Qwen3.8-Omni-Flash gère la conversation en temps réel en français, tandis que Qwen3-TTS et Qwen3-ASR s’installent chez vous. Pour les images, Qwen-Image-2.0 est la seule version récente utilisable commercialement en local.

    Article suivant — 6/7
    Les agents Qwen : QwenPaw et QwenWork

    L’assistant personnel à héberger soi-même, l’agent de bureau d’Alibaba et le framework pour développeurs : ce qu’ils font et lequel choisir.

    Les agents Qwen ↗
    Mise à jour : 23 septembre 2026
    Étiquettes: