Neurocourse

Voix et images : parlez et montrez

ChatGPT fait plus que lire du texte : vous pouvez lui parler par la voix comme à une personne et travailler avec des images — à la fois en examinant vos photos et en en créant de nouvelles à partir d'une description. Nous abordons ces deux modes et quand chacun permet de gagner du temps.

Jusqu'à présent dans ce cours, vous avez interagi avec l'IA par texte. Mais ChatGPT dispose de deux autres canaux — la voix et les images. Ce sont eux qui transforment une simple fenêtre de chat en un assistant toujours à portée de main.

Mode vocal : pas une dictée, mais une conversation

Nous avons activé la voix lors de la leçon sur les applications. Approfondissons, car deux choses sont souvent confondues ici. La dictée (l'icône microphone dans le champ de saisie) ne fait que transformer votre parole en texte — vous parlez, des lettres apparaissent, et à partir de là, c'est un chat ordinaire. Le mode vocal (l'icône casque/onde sonore) est une conversation complète : vous parlez, l'IA vous répond à voix haute avec une voix réelle, et vous pouvez l'interrompre en pleine phrase — elle s'arrête et change de sujet. La différence, c'est comme envoyer un SMS ou téléphoner.

Pourquoi le mode vocal change les habitudes

Taper une requête détaillée demande un effort. La dire est naturel. En 40 secondes de conversation, vous exposez trois fois plus de contexte que vous n'auriez tapé, et rappelez-vous la règle de la leçon sur le premier dialogue : plus de contexte, réponse plus pertinente. Cela libère aussi vos mains et vos yeux : en voiture, devant les fourneaux, en poussant une poussette, l'IA devient quelqu'un à qui vous parlez plutôt qu'une application que vous fixez.

À quoi ressemble une bonne session vocale

  • Répéter à voix haute. « Faisons un entretien blanc. Vous êtes un responsable RH exigeant, posez une question à la fois, je répondrai à voix haute, et vous évaluerez mes réponses à la fin. » Une pratique orale en direct que vous n'obtiendrez jamais par texte.
  • Brainstormer en déplacement. Vous marchez et réfléchissez à voix haute, l'IA capte vos idées et suggère des pistes. Les idées sont saisies tant qu'elles sont fraîches.
  • Élucider quelque chose en chemin. « Expliquez la différence entre le leasing et un prêt, en termes simples » — dans le train, sans écran.

Avant de poursuivre : à quel moment demain vos mains seront-elles occupées mais votre esprit libre ?

C'est là que le mode vocal devient une habitude — en conduisant, en cuisinant, en faisant la queue, en courant.

Images, première partie : l'IA analyse votre photo

Déposez une image dans le chat (le trombone, ou l'appareil photo dans l'application) et posez une question à son sujet. Ce n'est pas un gadget, c'est un outil de travail :

  • Photographiez une erreur déroutante sur votre écran — « qu'est-ce que cela signifie et comment puis-je le corriger ? »
  • Prenez en photo un plat dans un restaurant avec un menu étranger — « qu'est-ce que c'est, et y a-t-il des noix dedans ? »
  • Montrez-lui un graphique d'un rapport — « décrivez la tendance que j'observe ».
  • Photographiez l'intérieur de votre réfrigérateur — « que puis-je cuisiner pour le dîner avec ça ? »

Le modèle lit ce qui est sur l'image et répond avec des mots. Captures d'écran, photos, diagrammes, notes manuscrites — tout est permis.

Images, deuxième partie : l'IA dessine à partir d'une description

L'autre facette est la génération : décrivez-le avec des mots et ChatGPT dessine l'image à partir de rien. « Dessinez un logo pour un café : minimaliste, une tasse et des montagnes, tons chauds » — une image en quelques secondes. Cela arrive plus souvent qu'on ne le pense : une illustration pour un post, un logo brouillon, une carte d'anniversaire, un diagramme pour une présentation, une référence pour votre designer.

Tout comme avec le texte, l'itération (revenir sur la réponse, comme vu dans la leçon sur le premier dialogue) est ce qui fonctionne : « plus lumineux », « supprimez l'arrière-plan », « essayez un style différent ».

Où les images atteignent leurs limites

Deux limites honnêtes, pour que vous ne soyez pas déçu. Premièrement : les images générées sont des illustrations, pas des photographies d'événements réels, et les petits détails (le texte à l'intérieur de l'image et les doigts notamment) sont encore imparfaits — vérifiez avant de publier. Deuxièmement : lorsqu'il lit une photo, la même règle s'applique que pour le texte dans la leçon sur les 10 tâches — vérifiez les faits. « Identifiez ce champignon, est-il comestible » est une mauvaise idée : le prix de l'erreur est votre santé, et le modèle peut se tromper. Pour l'alimentation, la médecine et les documents juridiques, l'IA assiste, mais un professionnel décide.

Questions fréquentes sur la voix et les images

  • « Les gens autour de moi peuvent-ils l'entendre ? » Non — le son passe par vos écouteurs ou le haut-parleur de votre téléphone, comme pour tout appel.
  • « Puis-je parler avec un accent, ou mal ? » Oui, le modèle gère très bien la parole réelle, les pauses et les lapsus — parlez comme vous le faites habituellement.
  • « Puis-je télécharger une image générée et l'utiliser ? » Télécharger, oui, via le bouton d'enregistrement ; mais avant de la publier pour une entreprise, vérifiez les conditions du service et rappelez-vous ces petits détails imparfaits.
  • « Pourquoi l'IA n'a-t-elle pas détecté quelque chose sur ma photo ? » Généralement la qualité : les photos sombres, floues ou prises de travers sont mal interprétées — reprenez-la bien de face et avec une bonne lumière.

Faites ceci maintenant

Deux minutes, deux gestes. Un : activez le mode vocal et demandez à voix haute une explication sur tout ce qui vous intéresse — écoutez simplement ce que cela procure. Deux : photographiez quelque chose près de vous (une étiquette, un reçu, une page de livre) et posez une question à son sujet. Vous venez d'utiliser les trois canaux : texte, voix, image.

Practice · 5 задач

Short questions on the lesson — with an explanation for every answer.