Stemme og bilder: snakk og vis
ChatGPT gjør mer enn å lese tekst: du kan snakke med den via stemme som en person og jobbe med bilder – både ved å undersøke bildene dine og tegne nye fra en beskrivelse. Vi dekker begge moduser og når hver av dem sparer tid.
Frem til denne leksjonen har du snakket med AI-en via tekst. Men ChatGPT har to kanaler til – stemme og bilder. De gjør et smart chatvindu om til en assistent som alltid er tilgjengelig.
Stemmemodus: ikke diktering, men en samtale
Vi slo på stemme tilbake i app-leksjonen. Nå skal vi gå dypere, for to ting blir ofte blandet sammen her. Diktering (mikrofonikonet i inntastingsfeltet) gjør bare talen din om til tekst – du snakker, bokstaver dukker opp, og derfra er det en vanlig chat. Stemmemodus (hodetelefon-/bølgeformikonet) er en full samtale: du snakker, AI-en svarer høyt med en ekte stemme, og du kan avbryte den midt i en setning – den stopper og bytter. Forskjellen er som å sende tekstmelding versus å ringe.
Hvorfor stemme endrer vanene dine
Å skrive en detaljert forespørsel er arbeid. Å si det er naturlig. På 40 sekunder med snakking legger du frem tre ganger så mye kontekst som du ville ha skrevet, og husk regelen fra den første dialogleksjonen: mer kontekst, skarpere svar. Det frigjør også hender og øyne: i bilen, ved komfyren, når du triller barnevogn, blir AI-en noen du snakker med i stedet for en app du stirrer på.
Slik ser en god stemmesesjon ut
- Øve høyt. «La oss ta et prøveintervju. Du er en tøff HR-sjef, still ett spørsmål om gangen, jeg svarer høyt, og du vurderer svarene mine til slutt.» Øvelse i å snakke live som du aldri får fra tekst.
- Idémyldring i farten. Du går og tenker høyt, AI-en fanger det opp og foreslår vendinger. Ideer blir fanget mens de er ferske.
- Finne ut av noe i farten. «Forklar forskjellen mellom leasing og lån, med enkle ord» – på toget, uten skjerm involvert.
Før du leser videre: når i morgen vil hendene dine være opptatt, men hodet ditt fritt?
Det er da stemmemodus blir en vane – kjøring, matlaging, køståing, løping.
Bilder, del én: AI-en ser på bildet ditt
Slipp et bilde inn i chatten (bindersikonet, eller kameraet i appen) og spør om det. Dette er ikke et partytriks, det er et arbeidsverktøy:
- Fotografer en forvirrende feil på skjermen din – «hva betyr dette og hvordan fikser jeg det?»
- Ta bilde av en rett på en restaurant med en utenlandsk meny – «hva er dette, og inneholder det nøtter?»
- Vis den et diagram fra en rapport – «beskriv trenden jeg ser på».
- Fotografer innsiden av kjøleskapet ditt – «hva kan jeg lage til middag av dette?»
Modellen leser hva som er på bildet og svarer med ord. Skjermbilder, bilder, diagrammer, håndskrevne notater – alt er lov.
Bilder, del to: AI-en tegner fra en beskrivelse
Den andre siden er generering: beskriv det med ord, og ChatGPT tegner bildet fra ingenting. «Tegn en logo for en kaffebar: minimalistisk, en kopp og fjell, varme fargetoner» – et bilde på sekunder. Det dukker opp oftere enn du tror: en illustrasjon til et innlegg, en grov logo, et bursdagskort, et diagram til en presentasjon, en referanse for designeren din. Akkurat som med tekst er iterasjon (å gå en runde til på svaret, fra den første dialogleksjonen) det som fungerer: «lysere», «fjern bakgrunnen», «prøv en annen stil».
Her når bilder sine grenser
To ærlige begrensninger, slik at du ikke blir skuffet. For det første: genererte bilder er illustrasjoner, ikke fotografier av virkelige hendelser, og små detaljer (tekst inne i bildet og spesielt fingre) blir fortsatt uperfekte – sjekk før du publiserer. For det andre: når den leser et bilde, gjelder den samme regelen som med tekst tilbake i 10-jobber-leksjonen – verifiser fakta. «Identifiser denne soppen, er den spiselig» er en dårlig idé: prisen for å ta feil er helsen din, og modellen kan ta feil. Med mat, medisin og juridiske dokumenter assisterer AI-en, men en profesjonell bestemmer.
Vanlige spørsmål om stemme og bilder
- «Kan folk rundt meg høre det?» Nei – lyden går til øretelefonene dine eller telefonens høyttaler, som en hvilken som helst samtale.
- «Kan jeg snakke med aksent, eller dårlig?» Ja, modellen håndterer ekte tale, pauser og feil helt fint – snakk slik du snakker.
- «Kan jeg laste ned et generert bilde og bruke det?» Laste ned, ja, via lagre-knappen; men før du publiserer det for en bedrift, sjekk tjenestens vilkår og husk de uperfekte små detaljene.
- «Hvorfor oppdaget ikke AI-en noe på bildet mitt?» Vanligvis kvalitet: mørke, uskarpe eller vinklede bilder leses dårlig – ta det på nytt rett forfra i godt lys.
Gjør dette nå
To minutter, to trykk. Én: slå på stemmemodus og spør høyt om en forklaring på noe du er nysgjerrig på – bare lytt til hvordan det føles. To: fotografer noe i nærheten av deg (en etikett, en kvittering, en side i en bok) og spør om det. Du har nettopp brukt alle tre kanalene: tekst, stemme, bilde.
Short questions on the lesson — with an explanation for every answer.