Neurocourse

Voz e imágenes: habla y muestra

ChatGPT hace más que leer texto: puedes hablarle por voz como a una persona y trabajar con imágenes — tanto examinando tus fotos como creando nuevas a partir de una descripción. Cubrimos ambos modos y cuándo cada uno ahorra tiempo.

Hasta esta lección, has estado hablando con la IA por texto. Pero ChatGPT tiene dos canales más: la voz y las imágenes. Son lo que convierte una ventana de chat inteligente en un asistente siempre a mano.

Modo de voz: no es dictado, es una conversación

Activamos la voz en la lección de las apps. Ahora vamos a profundizar, porque aquí se confunden dos cosas. El dictado (el icono del micrófono en el cuadro de entrada) solo convierte tu voz en texto: hablas, aparecen letras y, a partir de ahí, es un chat normal. El modo de voz (el icono de los auriculares/onda) es una conversación completa: hablas, la IA te responde en voz alta con una voz real, y puedes interrumpirla a mitad de frase: se detiene y cambia. La diferencia es como enviar un mensaje frente a hacer una llamada.

Por qué el modo de voz cambia la forma de usarlo

Escribir una solicitud detallada es un trabajo. Decirla es natural. En 40 segundos de conversación, expones el triple de contexto que habrías escrito, y recuerda la regla de la lección del primer diálogo: más contexto, respuesta más precisa. También te libera las manos y los ojos: en el coche, en la cocina, empujando un carrito, la IA se convierte en alguien con quien hablas en lugar de una app que miras fijamente.

Cómo es una buena sesión de voz

  • Ensayar en voz alta. «Hagamos una entrevista de prueba. Eres un gerente de RRHH exigente, haz una pregunta cada vez, yo responderé en voz alta y revisaremos mis respuestas al final». Práctica de conversación en vivo que nunca obtendrías con texto.
  • Lluvia de ideas en movimiento. Caminas y piensas en voz alta, la IA lo capta y sugiere giros. Las ideas se capturan mientras están frescas.
  • Resolver algo sobre la marcha. «Explícame la diferencia entre leasing y préstamo, en palabras sencillas» — en el tren, sin pantalla de por medio.

Antes de seguir: ¿cuándo tendrás las manos ocupadas pero la mente libre mañana?

Ahí es donde el modo de voz se convierte en un hábito: conduciendo, cocinando, haciendo cola, corriendo.

Imágenes, primera parte: la IA mira tu foto

Suelta una imagen en el chat (el clip, o la cámara en la app) y pregunta sobre ella. Esto no es un truco de fiesta, es una herramienta de trabajo:

  • Fotografía un error desconcertante en tu pantalla — «¿qué significa esto y cómo lo arreglo?»
  • Haz una foto a un plato en un restaurante con un menú extranjero — «¿qué es esto y lleva frutos secos?»
  • Muéstrale un gráfico de un informe — «describe la tendencia que estoy viendo».
  • Fotografía el interior de tu nevera — «¿qué puedo cocinar para cenar con esto?»

El modelo lee lo que hay en la imagen y responde con palabras. Capturas de pantalla, fotos, diagramas, notas manuscritas: todo vale.

Imágenes, segunda parte: la IA dibuja a partir de una descripción

La otra cara es la generación: descríbelo con palabras y ChatGPT dibuja la imagen de la nada. «Dibuja un logo para una cafetería: minimalista, una taza y montañas, tonos cálidos» — una imagen en segundos. Aparece más a menudo de lo que crees: una ilustración para una publicación, un logo provisional, una tarjeta de cumpleaños, un diagrama para una presentación, una referencia para tu diseñador. Igual que con el texto, la iteración (volver a la respuesta, de la lección del primer diálogo) es lo que funciona: «más brillante», «quita el fondo», «prueba un estilo diferente».

Límites de las imágenes

Dos límites claros, para que no te decepciones. Primero: las imágenes generadas son ilustraciones, no fotografías de eventos reales, y los pequeños detalles (el texto dentro de la imagen y los dedos, especialmente) aún salen imperfectos; revisa antes de publicar. Segundo: cuando lee una foto, se aplica la misma regla que con el texto en la lección de los 10 trabajos: verifica los hechos.

«Identifica este champiñón, ¿es comestible?» es una mala idea: el precio de equivocarse es tu salud, y el modelo puede fallar. Con alimentos, medicamentos y documentos legales, la IA asiste, pero un profesional decide.

Preguntas frecuentes sobre voz e imágenes

  • «¿La gente de mi alrededor puede oírlo?» No, el sonido va a tus auriculares o al altavoz de tu teléfono, como cualquier llamada.
  • «¿Puedo hablar con acento, o mal?» Sí, el modelo maneja el habla real, las pausas y los errores sin problema; habla como hables.
  • «¿Puedo descargar una imagen generada y usarla?» Descargar, sí, a través del botón de guardar; pero antes de publicarla para un negocio, revisa los términos del servicio y recuerda esos pequeños detalles imperfectos.
  • «¿Por qué la IA no detectó algo en mi foto?» Normalmente es por la calidad: las fotos oscuras, borrosas o anguladas se leen mal; vuelve a hacerla de frente y con buena luz.

Haz esto ahora

Dos minutos, dos toques. Uno: activa el modo de voz y pide en voz alta una explicación de algo que te pique la curiosidad; solo escucha cómo se siente. Dos: fotografía algo cerca de ti (una etiqueta, un recibo, una página de un libro) y pregunta sobre ello. Acabas de usar los tres canales: texto, voz, imagen.

Practice · 5 задач

Short questions on the lesson — with an explanation for every answer.