Stem en afbeeldingen: spreek en toon
ChatGPT doet meer dan tekst lezen: je kunt er via spraak mee praten als een persoon en werken met afbeeldingen — zowel je foto's analyseren als nieuwe tekenen op basis van een beschrijving. We behandelen beide modi en wanneer elke modus tijd bespaart.
Tot deze les heb je met de AI gepraat via tekst. Maar ChatGPT heeft nog twee kanalen: spraak en afbeeldingen. Die maken van een slim chatvenster een assistent die altijd voor je klaarstaat.
Spraakmodus: geen dicteren, maar een gesprek
We hebben spraak al aangezet in de les over apps. Laten we nu dieper ingaan, want twee dingen worden hier vaak door elkaar gehaald. Dicteren (het microfoonicoon in het invoerveld) zet je spraak gewoon om in tekst — je praat, er verschijnen letters, en vanaf daar is het een gewoon chatgesprek. Spraakmodus (het koptelefoon-/golfvormicoon) is een volledig gesprek: je spreekt, de AI antwoordt hardop met een echte stem, en je kunt haar midden in een zin onderbreken — ze stopt en schakelt over. Het verschil is sms'en versus bellen.
Waarom spraak je gewoontes verandert
Een gedetailleerde vraag uittypen is werk. Het zeggen is natuurlijk. In 40 seconden praten geef je drie keer zoveel context als je zou hebben getypt, en onthoud de regel uit de les over de eerste dialoog: meer context, scherper antwoord. Het maakt ook je handen en ogen vrij: in de auto, bij het fornuis, terwijl je een kinderwagen duwt, wordt de AI iemand met wie je praat in plaats van een app waar je naar staart.
Hoe een goede spraaksessie eruitziet
- Hardop oefenen. „Laten we een sollicitatiegesprek oefenen. Jij bent een strenge HR-manager, stel één vraag tegelijk, ik antwoord hardop, en aan het einde beoordeel je mijn antwoorden.” Live spreekvaardigheid oefenen die je nooit via tekst krijgt.
- Brainstormen onderweg. Je loopt en denkt hardop, de AI pikt het op en stelt wendingen voor. Ideeën worden vastgelegd terwijl ze nog vers zijn.
- Iets uitzoeken onderweg. „Leg het verschil uit tussen leasing en een lening, in simpele woorden” — in de trein, zonder scherm.
Voordat je verder leest: wanneer zijn morgen je handen bezig, maar je hoofd vrij?
Dat is waar spraakmodus een gewoonte wordt — autorijden, koken, in de rij staan, hardlopen.
Afbeeldingen, deel één: de AI bekijkt je foto
Sleep een afbeelding naar de chat (de paperclip, of de camera in de app) en stel er een vraag over. Dit is geen trucje, maar een werktool:
- Fotografeer een verwarrende foutmelding op je scherm — „wat betekent dit en hoe los ik het op?”
- Maak een foto van een gerecht in een restaurant met een buitenlandse menukaart — „wat is dit, en zitten er noten in?”
- Laat het een grafiek uit een rapport zien — „beschrijf de trend die ik zie”.
- Fotografeer de binnenkant van je koelkast — „wat kan ik hiervan koken voor het avondeten?”
Het model leest wat er op de afbeelding staat en antwoordt in woorden. Screenshots, foto's, diagrammen, handgeschreven notities — alles is mogelijk.
Afbeeldingen, deel twee: de AI tekent vanuit een beschrijving
De keerzijde is generatie: beschrijf het in woorden en ChatGPT tekent de afbeelding uit het niets. „Teken een logo voor een koffiebar: minimalistisch, een kopje en bergen, warme tinten” — een afbeelding in seconden. Het komt vaker voor dan je denkt: een illustratie voor een bericht, een ruw logo, een verjaardagskaart, een diagram voor een presentatie, een referentie voor je ontwerper. Net als bij tekst is iteratie (opnieuw de antwoorden bekijken, uit de les over de eerste dialoog) wat werkt: „helderder”, „verwijder de achtergrond”, „probeer een andere stijl”.
Waar afbeeldingen hun grenzen bereiken
Twee eerlijke beperkingen, zodat je niet teleurgesteld raakt. Ten eerste: gegenereerde afbeeldingen zijn illustraties, geen foto's van echte gebeurtenissen, en kleine details (tekst in de afbeelding en vooral vingers) komen nog steeds imperfect uit — controleer dit voordat je publiceert. Ten tweede: wanneer het een foto leest, geldt dezelfde regel als bij tekst in de les over de 10 taken — controleer de feiten.
„Identificeer deze paddenstoel, is hij eetbaar” is een slecht idee: de prijs van een fout is je gezondheid, en het model kan fout zijn. Bij voedsel, medicijnen en juridische documenten assisteert de AI, maar een professional beslist.
Veelgestelde vragen over spraak en afbeeldingen
- „Kunnen mensen om me heen het horen?” Nee — het geluid gaat naar je oortjes of de luidspreker van je telefoon, net als bij elk gesprek.
- „Kan ik met een accent spreken, of slecht?” Ja, het model verwerkt echte spraak, pauzes en versprekingen prima — praat zoals je praat.
- „Kan ik een gegenereerde afbeelding downloaden en gebruiken?” Downloaden, ja, via de opslaan-knop; maar voordat je het voor een bedrijf publiceert, controleer je de servicevoorwaarden en onthoud je die imperfecte kleine details.
- „Waarom heeft de AI iets op mijn foto niet opgemerkt?” Meestal de kwaliteit: donkere, wazige of scheve opnames worden slecht gelezen — maak hem opnieuw recht en bij goed licht.
Doe dit nu
Twee minuten, twee tikken. Eén: zet de spraakmodus aan en vraag hardop om uitleg over iets waar je nieuwsgierig naar bent — luister gewoon hoe dat voelt. Twee: fotografeer iets bij je in de buurt (een etiket, een bonnetje, een bladzijde uit een boek) en stel er een vraag over. Je hebt zojuist alle drie de kanalen gebruikt: tekst, spraak, afbeelding.
Short questions on the lesson — with an explanation for every answer.