Głos i obrazy: mów i pokazuj
ChatGPT potrafi więcej niż tylko czytać tekst: możesz rozmawiać z nim głosem jak z człowiekiem i pracować z obrazami — zarówno analizując swoje zdjęcia, jak i tworząc nowe na podstawie opisu. Omówimy oba tryby i to, kiedy każdy z nich oszczędza czas.
Do tej lekcji rozmawiałeś z AI za pomocą tekstu. Ale ChatGPT ma jeszcze dwa kanały – głos i obrazy. To one zmieniają sprytne okno czatu w asystenta, który jest zawsze pod ręką.
Tryb głosowy: nie dyktowanie, a rozmowa
Włączyliśmy głos już na lekcji o aplikacjach. Teraz zagłębmy się w temat, bo dwie rzeczy często są tu mylone. Dyktowanie (ikona mikrofonu w polu wprowadzania) po prostu zamienia twoją mowę na tekst – mówisz, pojawiają się litery i od tego momentu to zwykły czat. Tryb głosowy (ikona słuchawek/fali dźwiękowej) to pełna rozmowa: mówisz, AI odpowiada na głos prawdziwym głosem, a ty możesz jej przerwać w pół zdania – zatrzyma się i przełączy. Różnica jest jak między pisaniem SMS-a a rozmową telefoniczną.
Dlaczego głos zmienia nawyki
Wpisywanie szczegółowego zapytania to praca. Wypowiedzenie go jest naturalne. W ciągu 40 sekund mówienia przedstawiasz trzy razy więcej kontekstu, niż byś wpisał, i pamiętaj o zasadzie z lekcji o pierwszej rozmowie: więcej kontekstu, trafniejsza odpowiedź. Uwalnia to też twoje ręce i oczy: w samochodzie, przy kuchence, pchając wózek, AI staje się kimś, z kim rozmawiasz, a nie aplikacją, w którą się wpatrujesz.
Jak wygląda dobra sesja głosowa
- Próbowanie na głos. „Zróbmy próbną rozmowę kwalifikacyjną. Jesteś wymagającym menedżerem HR, zadawaj jedno pytanie naraz, ja będę odpowiadać na głos, a na koniec ocenisz moje odpowiedzi”. Praktyka mówienia na żywo, której nigdy nie uzyskasz z tekstu.
- Burza mózgów w ruchu. Idziesz i myślisz na głos, AI to wychwytuje i sugeruje kolejne kroki. Pomysły są łapane, póki są świeże.
- Rozwiązywanie problemów w drodze. „Wyjaśnij różnicę między leasingiem a kredytem, prostymi słowami” – w pociągu, bez użycia ekranu.
Zanim przeczytasz dalej: kiedy jutro twoje ręce będą zajęte, ale głowa wolna?
Właśnie wtedy tryb głosowy staje się nawykiem – podczas jazdy, gotowania, stania w kolejce, biegania.
Obrazy, część pierwsza: AI patrzy na twoje zdjęcie
Wrzuć obraz do czatu (spinacz, albo aparat w aplikacji) i zapytaj o niego. To nie jest sztuczka na imprezę, to narzędzie do pracy:
- Zrób zdjęcie niezrozumiałego błędu na ekranie – „co to znaczy i jak to naprawić?”
- Zrób zdjęcie dania w restauracji z zagranicznym menu – „co to jest i czy zawiera orzechy?”
- Pokaż mu wykres z raportu – „opisz trend, który widzę”.
- Zrób zdjęcie wnętrza swojej lodówki – „co mogę z tego ugotować na obiad?”
Model odczytuje, co jest na zdjęciu i odpowiada słowami. Zrzuty ekranu, zdjęcia, diagramy, odręczne notatki – wszystko wchodzi w grę.
Obrazy, część druga: AI rysuje z opisu
Drugą stroną medalu jest generowanie: opisz to słowami, a ChatGPT narysuje obraz od podstaw. „Narysuj logo dla kawiarni: minimalistyczne, filiżanka i góry, ciepłe odcienie” – obraz w kilka sekund. Przyda się częściej, niż myślisz: ilustracja do posta, wstępny projekt logo, kartka urodzinowa, diagram do prezentacji, inspiracja dla twojego projektanta. Podobnie jak z tekstem, działa iteracja (ponowne podejście do odpowiedzi, z lekcji o pierwszej rozmowie): „jaśniej”, „usuń tło”, „spróbuj innego stylu”.
Gdzie obrazy mają swoje ograniczenia
Dwa szczere ograniczenia, żebyś się nie rozczarował. Po pierwsze: generowane obrazy to ilustracje, a nie zdjęcia prawdziwych wydarzeń, a drobne szczegóły (szczególnie tekst w obrazie i palce) nadal wychodzą niedoskonałe – sprawdź przed publikacją. Po drugie: gdy odczytuje zdjęcie, obowiązuje ta sama zasada co z tekstem z lekcji o 10 zadaniach – weryfikuj fakty. „Zidentyfikuj tego grzyba, czy jest jadalny” to zły pomysł: ceną za pomyłkę jest twoje zdrowie, a model może się mylić. W przypadku jedzenia, leków i dokumentów prawnych AI pomaga, ale to profesjonalista decyduje.
Częste pytania o głos i obrazy
- „Czy ludzie wokół mnie to słyszą?” Nie – dźwięk trafia do słuchawek lub głośnika telefonu, jak każda rozmowa.
- „Czy mogę mówić z akcentem, albo niewyraźnie?” Tak, model doskonale radzi sobie z prawdziwą mową, pauzami i potknięciami – mów tak, jak mówisz.
- „Czy mogę pobrać wygenerowany obraz i go użyć?” Pobrać, tak, za pomocą przycisku zapisu; ale przed opublikowaniem go w celach biznesowych sprawdź warunki usługi i pamiętaj o tych niedoskonałych drobnych szczegółach.
- „Dlaczego AI nie zauważyło czegoś na moim zdjęciu?” Zazwyczaj chodzi o jakość: ciemne, rozmazane lub ukośne ujęcia są źle odczytywane – zrób zdjęcie ponownie, prosto i w dobrym świetle.
Zrób to teraz
Dwie minuty, dwa kliknięcia. Pierwsze: włącz tryb głosowy i zapytaj na głos o cokolwiek, co cię ciekawi – po prostu posłuchaj, jak to brzmi. Drugie: zrób zdjęcie czegoś w pobliżu (etykiety, paragonu, strony książki) i zapytaj o to. Właśnie użyłeś wszystkich trzech kanałów: tekstu, głosu, obrazu.
Short questions on the lesson — with an explanation for every answer.