Guía de generación de imágenes de OpenAI
1. Introducción
Los modelos de generación de imágenes gpt de OpenAI están diseñados para producir imágenes de calidad profesional y flujos de trabajo creativos altamente controlables. Son adecuados tanto para tareas de diseño profesional como para la creación iterativa de contenido, y admiten tanto la renderización de alta calidad como casos de uso de menor latencia, según el flujo de trabajo.
Las capacidades clave incluyen:
- Fotorrealismo de alta fidelidad con iluminación natural, materiales precisos y una rica representación del color
- Compensaciones flexibles entre calidad y latencia, lo que permite una generación más rápida con configuraciones más bajas, superando aun así la calidad visual de los modelos de imagen de generaciones anteriores
- Preservación robusta de rostros e identidades para ediciones, consistencia de personajes y flujos de trabajo de varios pasos
- Activos PNG y WebP con fondo transparente (vista previa) con
gpt-image-2para logotipos reutilizables, recortes de productos, pegatinas y gráficos de presentación - Renderización de texto confiable con letras nítidas, diseño consistente y fuerte contraste dentro de las imágenes
- Visuales estructurados complejos, incluyendo infografías, diagramas y composiciones de paneles múltiples
- Control de estilo preciso y transferencia de estilo con un mínimo de indicaciones (prompts), compatible con todo, desde sistemas de diseño de marca hasta estilos de bellas artes
- Fuerte conocimiento y razonamiento del mundo real, lo que permite representaciones precisas de objetos, entornos y escenarios
Esta guía destaca patrones de prompts, mejores prácticas y ejemplos de prompts extraídos de casos de uso de producción reales para gpt-image-2. Es nuestro modelo de imagen más capaz, con una calidad de imagen más fuerte, un rendimiento de edición mejorado y un soporte más amplio para flujos de trabajo de producción. La configuración de calidad low es especialmente fuerte para casos de uso sensibles a la latencia, mientras que medium y high siguen siendo buenas opciones cuando la máxima fidelidad es importante.
1.1 Parámetros del modelo de imagen de OpenAI
Esta sección es una referencia para los modelos de imagen cubiertos en esta guía, enfocada en:
- nombre del modelo
- valores
outputQualityadmitidos - valores
input_fidelityadmitidos - comportamiento de
size/ resolución admitido - requisitos de
backgroundyoutput_formatpara activos transparentes - casos de uso recomendados por flujo de trabajo
Resumen del modelo
A partir del 21 de abril de 2026, OpenAI tiene disponibles los siguientes modelos de imagen.
| Modelo | outputQuality |
input_fidelity |
Resoluciones | Uso recomendado |
|---|---|---|---|---|
gpt-image-2 |
low, medium, high |
Deshabilitado. input_fidelity no funciona para este modelo porque la salida ya es de alta fidelidad por defecto |
Cualquier resolución que satisfaga las restricciones a continuación | Recomendado por defecto para nuevas construcciones. Úsalo para la generación y edición de la más alta calidad, imágenes con mucho texto, fotorrealismo, composición, ediciones sensibles a la identidad y flujos de trabajo donde menos reintentos importan más que el costo más bajo posible. |
gpt-image-1.5 |
low, medium, high |
low, high |
1024x1024, 1024x1536, 1536x1024, auto |
Mantenlo para flujos de trabajo validados existentes durante la migración. Para trabajos nuevos, prefiere gpt-image-2, especialmente cuando la calidad, la fiabilidad de la edición o el tamaño flexible importan. |
gpt-image-1 |
low, medium, high |
low, high |
1024x1024, 1024x1536, 1536x1024, auto |
Solo compatibilidad heredada. Si estás comenzando un nuevo flujo de trabajo o actualizando prompts, pasa a gpt-image-2; mantén gpt-image-1 solo cuando necesites estabilidad a corto plazo mientras validas la actualización. |
gpt-image-1-mini |
low, medium, high |
low, high |
1024x1024, 1024x1536, 1536x1024, auto |
Úsalo cuando el costo y el rendimiento son la principal restricción: generación de variantes en grandes lotes, ideación rápida, vistas previas, personalización ligera y activos de borrador que no requieren el mejor rendimiento de generación o edición. |
Fondos transparentes con gpt-image-2 (vista previa)
Los fondos transparentes están disponibles en vista previa para gpt-image-2. Para generar o editar una imagen con un fondo transparente:
- Configura
background="transparent". - Configura
output_format="png"(el valor predeterminado) ooutput_format="webp". Ambos admiten transparencia;jpegno. - Omite
output_compressionpara la salida PNG. WebP admite compresión opcional. - Solicita explícitamente un sujeto aislado sobre un fondo completamente transparente, sin paisajes, fondos sólidos, tableros de ajedrez o sombras no deseadas.
- Para ediciones, preserva explícitamente el fondo transparente en cada prompt para que los pasos posteriores no introduzcan un nuevo fondo.
- Mantén la imagen devuelta como un archivo PNG o WebP y preserva su canal alfa durante todo el procesamiento posterior.
Opciones de tamaño gpt-image-2
gpt-image-2 admite cualquier resolución pasada en el parámetro size siempre que se cumplan todas estas restricciones:
- La longitud máxima del borde debe ser inferior a
3840px - Ambos bordes deben ser un múltiplo de
16 - La relación entre el borde largo y el borde corto no debe ser mayor que
3:1 - El total de píxeles no debe exceder
8,294,400 - El total de píxeles no debe ser inferior a
655,360
Si la imagen de salida excede los 2560x1440 píxeles (3,686,400 píxeles totales), comúnmente conocido como 2K, trátala como experimental porque los resultados pueden ser más variables por encima de este tamaño.
Tamaños populares de gpt-image-2
Estos son puntos de referencia útiles que se ajustan a las restricciones anteriores:
| Etiqueta | Resolución | Notas |
|---|---|---|
| Retrato HD | 1024x1536 |
Opción de retrato estándar |
| Paisaje HD | 1536x1024 |
Opción de paisaje estándar |
| Cuadrado | 1024x1024 |
Buen valor predeterminado de propósito general |
| 2K / QHD | 2560x1440 |
Formato de pantalla ancha popular y límite superior de fiabilidad recomendado para gpt-image-2 |
| 4K / UHD | 3840x2160 |
Objetivo experimental de gama alta. Si la regla de borde máximo se aplica literalmente como < 3840, redondea al tamaño válido más cercano, como 3824x2144 |
Cuándo usar cada modelo
- Elige
gpt-image-2como el valor predeterminado para la mayoría de los flujos de trabajo de producción. Es el modelo más fuerte en general y el objetivo de actualización adecuado para los equipos que actualmente usangpt-image-1.5ogpt-image-1para salidas de alta calidad. - Elige
gpt-image-2con calidad: baja cuando la velocidad y la economía unitaria dominan la decisión. Esta configuración tiene buena calidad para muchos casos de uso y es una buena opción para la generación y experimentación de alto volumen. También puedes probargpt-image-1-minipara estos casos de uso, pero hemos visto que la calidad: baja funciona igual de bien. - Mantén
gpt-image-1.5ogpt-image-1solo para compatibilidad con versiones anteriores mientras validas las migraciones de prompts, pruebas de regresión de salidas o mantienes flujos de trabajo antiguos que aún no están listos para migrar.
Ruta de actualización recomendada desde gpt-image-1.5 y gpt-image-1
Para los flujos de trabajo que actualmente usan gpt-image-1.5 o gpt-image-1, la recomendación es:
- Actualiza a
gpt-image-2para activos orientados al cliente, generación fotorrealista, flujos con mucha edición, creatividad sensible a la marca, trabajo de texto en imagen y cualquier flujo de trabajo donde una mejor calidad en la primera pasada reduzca la revisión manual o las repeticiones. - Considera
gpt-image-1-minien lugar de los modelos heredados solo cuando el objetivo principal es reducir el costo para grandes lotes de imágenes exploratorias o de menor importancia. - Durante la migración, mantén los prompts en gran medida iguales al principio, luego ajústalos solo después de haber comparado la calidad de salida, la latencia y las tasas de reintento en tu carga de trabajo real.
2. Fundamentos de los prompts
Los siguientes fundamentos de los prompts son aplicables a los modelos de generación de imágenes GPT. Se basan en patrones que aparecieron repetidamente en las pruebas alfa en generación, ediciones, infografías, anuncios, imágenes humanas, maquetas de UI y flujos de trabajo de composición.
Estructura + objetivo: Escribe los prompts en un orden consistente (fondo/escena → sujeto → detalles clave → restricciones) e incluye el uso previsto (anuncio, maqueta de UI, infografía) para establecer el "modo" y el nivel de pulido. Para solicitudes complejas, usa segmentos cortos etiquetados o saltos de línea en lugar de un párrafo largo.
Formato del prompt: Usa el formato que sea más fácil de mantener. Los prompts mínimos, los párrafos descriptivos, las estructuras tipo JSON, los prompts de estilo de instrucción y los prompts basados en etiquetas pueden funcionar bien siempre que la intención y las restricciones sean claras. Para los sistemas de producción, prioriza una plantilla fácil de escanear sobre una sintaxis de prompt ingeniosa.
Especificidad + señales de calidad: Sé concreto sobre materiales, formas, texturas y el medio visual (foto, acuarela, render 3D), y agrega "palancas de calidad" específicas solo cuando sea necesario (por ejemplo, grano de película, pinceladas texturizadas, detalle macro). Para el fotorrealismo, incluye la palabra "fotorrealista" directamente en el prompt para activar fuertemente el modo fotorrealista del modelo. Frases similares como "fotografía real", "tomada con una cámara real", "fotografía profesional" o "foto de iPhone" también pueden ayudar, pero las especificaciones detalladas de la cámara pueden interpretarse libremente, así que úsalas principalmente para el aspecto y la composición de alto nivel en lugar de una simulación física exacta.
Latencia vs. fidelidad: Para casos de uso sensibles a la latencia o de alto volumen, comienza con
quality="low"y evalúa si cumple con tus requisitos visuales. En muchos casos, proporciona suficiente fidelidad con una generación significativamente más rápida. Para texto pequeño o denso, infografías detalladas, retratos de primer plano, ediciones sensibles a la identidad y salidas de alta resolución, comparamediumohighantes de enviar.Composición: Especifica el encuadre y el punto de vista (primer plano, amplio, de arriba hacia abajo), la perspectiva/ángulo (a la altura de los ojos, ángulo bajo) y la iluminación/ambiente (difuso suave, hora dorada, alto contraste) para controlar la toma. Si el diseño importa, indica la ubicación (por ejemplo, "logotipo arriba a la derecha", "sujeto centrado con espacio negativo a la izquierda"). Para escenas amplias, cinematográficas, con poca luz, lluvia o neón, agrega detalles adicionales sobre la escala, la atmósfera y el color para que el modelo no sacrifique el ambiente por el realismo superficial.
Personas, pose y acción: Para personas en escenas, describe la escala, el encuadre del cuerpo, la mirada y las interacciones con objetos. Ejemplos: "cuerpo completo visible, pies incluidos", "tamaño de niño en relación con la mesa", "mirando el libro abierto, no a la cámara" o "manos agarrando naturalmente el manillar". Estos detalles ayudan con la proporción del cuerpo, la geometría de la acción y la alineación de la mirada.
Restricciones (qué cambiar vs. preservar): Declara exclusiones e invariantes explícitamente (por ejemplo, "sin marca de agua", "sin texto adicional", "sin logotipos/marcas comerciales", "preservar identidad/geometría/diseño/elementos de marca"). Para ediciones, usa "cambiar solo X" + "mantener todo lo demás igual", y repite la lista de preservación en cada iteración para reducir la deriva. Si la edición debe ser quirúrgica, también di que no se altere la saturación, el contraste, el diseño, las flechas, las etiquetas, el ángulo de la cámara o los objetos circundantes.
Fondos transparentes: Para
gpt-image-2, la transparencia está disponible en vista previa. Emparejabackground="transparent"conoutput_format="png"(el valor predeterminado) ooutput_format="webp";jpegno admite transparencia. Describe el sujeto como aislado sobre un fondo completamente transparente y excluye explícitamente paisajes, fondos sólidos, tableros de ajedrez y sombras no deseadas. Para ediciones, repite "preservar el fondo transparente" para que el flujo de trabajo no introduzca ni preserve una escena opaca. Omiteoutput_compressionpara PNG; WebP admite compresión opcional.Texto en imágenes: Pon el texto literal entre comillas o en MAYÚSCULAS y especifica los detalles de tipografía (estilo de fuente, tamaño, color, ubicación) como restricciones. Para palabras difíciles (nombres de marcas, ortografías poco comunes), deletrea letra por letra para mejorar la precisión de los caracteres. Usa calidad
mediumohighpara texto pequeño, paneles de información densos y diseños con múltiples fuentes.Entradas de múltiples imágenes: Haz referencia a cada entrada por índice y descripción ("Imagen 1: foto del producto... Imagen 2: referencia de estilo...") y describe cómo interactúan ("aplicar el estilo de la Imagen 2 a la Imagen 1"). Al componer, sé explícito sobre qué elementos se mueven dónde ("pon el pájaro de la Imagen 1 en el elefante de la Imagen 2").
Itera en lugar de sobrecargar: Los prompts largos pueden funcionar bien, pero la depuración es más fácil cuando comienzas con un prompt base limpio y refinas con seguimientos pequeños de un solo cambio ("hacer la iluminación más cálida", "eliminar el árbol extra", "restaurar el fondo original"). Usa referencias como "mismo estilo que antes" o "el sujeto" para aprovechar el contexto, pero vuelve a especificar los detalles críticos si comienzan a desviarse.
3. Configuración
Ejecuta esto una vez. Esto:
- crea el cliente de la API
- crea
output_images/en la carpeta de imágenes. - agrega una pequeña ayuda para guardar imágenes base64
Coloca cualquier imagen de referencia utilizada para ediciones en input_images/ (o actualiza las rutas en los ejemplos). Al guardar salidas transparentes, usa una extensión .png o .webp que coincida con el formato de salida seleccionado y preserva los bytes de imagen devueltos; convertir una imagen RGBA a RGB descarta su fondo transparente.
import os
import base64
from openai import OpenAI
client = OpenAI()
os.makedirs("../../images/input_images", exist_ok=True)
os.makedirs("../../images/output_images", exist_ok=True)
def save_image(result, filename: str) -> None:
"""
Saves the first returned image to the given filename inside the output_images folder.
"""
image_base64 = result.data[0].b64_json
out_path = os.path.join("../../images/output_images", filename)
with open(out_path, "wb") as f:
f.write(base64.b64decode(image_base64))
from IPython.display import HTML, Image, display
def display_image_grid(items, width=240):
cards = []
for item in items:
title = item.get("title", "")
label = f'<div style="font-weight:600;margin-bottom:8px">{title}</div>' if title else ""
cards.append(
'<div style="text-align:center">'
+ label
+ f'<img src="{item["path"]}" width="{width}" style="max-width:100%;height:auto;" />'
+ '</div>'
)
display(HTML('<div style="display:flex;flex-wrap:wrap;gap:16px;align-items:flex-start">' + ''.join(cards) + '</div>'))
Los ejemplos a continuación usan nuestro modelo de imagen más capaz gpt-image-2
4. Casos de uso — Generar (texto → imagen)
4.1 Infografías
Usa infografías para explicar información estructurada a una audiencia específica: estudiantes, ejecutivos, clientes o el público en general. Los ejemplos incluyen explicaciones, pósteres, diagramas etiquetados, líneas de tiempo y activos de "wiki visual". Para diseños densos o texto pesado en la imagen, se recomienda establecer la calidad de generación de salida en "alta".
prompt = """
Create a detailed Infographic of the functioning and flow of an automatic coffee machine like a Jura.
From bean basket, to grinding, to scale, water tank, boiler, etc.
I'd like to understand technically and visually the flow.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "infographic_coffee_machine_gpt-image-2.png")
Imagen de salida:

4.2 Traducción en imágenes
Se utiliza para localizar diseños existentes (anuncios, capturas de pantalla de UI, empaques, infografías) a otro idioma sin reconstruir el diseño desde cero. La clave es preservar todo excepto el texto —mantener el estilo tipográfico, la ubicación, el espaciado y la jerarquía consistentes— mientras se traduce literalmente y con precisión, sin palabras adicionales, sin reajustes a menos que sea necesario, y sin ediciones no intencionadas de logotipos, iconos o imágenes.
prompt = """
Translate the text in the infographic to Spanish. Do not change any other aspect of the image.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/output_images/infographic_coffee_machine_gpt-image-2.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "infographic_coffee_machine_sp_gpt-image-2.png")
Imagen de salida:

4.3 Imágenes fotorrealistas que se sienten “naturales”
Para obtener un fotorrealismo creíble, indica al modelo como si se estuviera capturando una foto real en el momento. Usa lenguaje fotográfico (lente, iluminación, encuadre) y pide explícitamente textura real (poros, arrugas, desgaste de la tela, imperfecciones). Evita palabras que impliquen pulido de estudio o puesta en escena. Cuando el detalle importa, establece quality="high".
prompt = """
Create a photorealistic candid photograph of an elderly sailor standing on a small fishing boat.
He has weathered skin with visible wrinkles, pores, and sun texture, and a few faded traditional sailor tattoos on his arms.
He is calmly adjusting a net while his dog sits nearby on the deck. Shot like a 35mm film photograph, medium close-up at eye level, using a 50mm lens.
Soft coastal daylight, shallow depth of field, subtle film grain, natural color balance.
The image should feel honest and unposed, with real skin texture, worn materials, and everyday detail. No glamorization, no heavy retouching.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "photorealism-gpt-image-2.png")
Imagen de salida:

4.4 Conocimiento del mundo
Los modelos de generación de imágenes GPT pueden combinar un fuerte razonamiento con el conocimiento del mundo. Por ejemplo, cuando se les pide que generen una escena ambientada en Bethel, Nueva York, en agosto de 1969, pueden inferir Woodstock y producir una imagen precisa y apropiada para el contexto sin que se les diga explícitamente sobre el evento.
prompt = """
Create a realistic outdoor crowd scene in Bethel, New York on August 16, 1969.
Photorealistic, period-accurate clothing, staging, and environment.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "world_knowledge-gpt-image-2.png")
Imagen de salida:

4.5 Generación de logotipos
Una sólida generación de logotipos proviene de restricciones de marca claras y simplicidad. Describe la personalidad y el caso de uso de la marca, luego pide una marca limpia y original con una forma fuerte, espacio negativo equilibrado y escalabilidad en diferentes tamaños. Usa un archivo PNG o WebP con fondo transparente cuando el logotipo necesite ser reutilizado en diferentes sitios web, campañas o fondos de presentación.
Puedes especificar el parámetro "n" para indicar el número de variaciones que deseas generar.
prompt = """
Create an original, non-infringing logo for a company called Field & Flour, a local bakery.
The logo should feel warm, simple, and timeless. Use clean, vector-like shapes, a strong silhouette, and balanced negative space.
Favor simplicity over detail so it reads clearly at small and large sizes. Flat design, minimal strokes, no gradients unless essential.
Fully transparent background. Deliver a single centered logo with generous padding, clean alpha edges, and no solid backdrop, scenery, checkerboard, or watermark.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
background="transparent",
output_format="png",
n=4, # Generate 4 versions of the logo
)
# Save all 4 images to separate files
for i, item in enumerate(result.data, start=1):
image_base64 = item.b64_json
image_bytes = base64.b64decode(image_base64)
with open(f"../../images/output_images/logo_generation_{i}_gpt-image-2.png", "wb") as f:
f.write(image_bytes)
Imágenes de salida:
| Opción 1 | Opción 2 | Opción 3 | Opción 4 |
|---|---|---|---|
![]() |
![]() |
![]() |
![]() |
4.6 Generación de anuncios
La generación de anuncios funciona mejor cuando el prompt se escribe como un resumen creativo en lugar de una especificación de imagen puramente técnica. Describe la marca, la audiencia, la cultura, el concepto, la composición y el texto exacto, luego deja que el modelo tome decisiones creativas basadas en el gusto dentro de esos límites. Esto es útil para la exploración temprana de campañas porque el modelo puede interpretar las señales de la audiencia, inferir la dirección de arte y proponer detalles visuales que hacen que el anuncio se sienta considerado en lugar de simplemente renderizado.
Para obtener resultados más sólidos, incluye el posicionamiento de la marca, el ambiente deseado, el público objetivo, la escena y el eslogan en el mismo prompt. Si el texto debe aparecer en la imagen, cítalo exactamente y pide una tipografía limpia y legible.
prompt = """
Give me a cool in culture ad / fashion shot for a brand called Thread.
It's a hip young street brand. The ad shows a group of friends hanging out together with the tagline "Yours to Create."
Make it feel like a polished campaign image for a youth streetwear audience: stylish, contemporary, energetic, and tasteful.
Use clean composition, strong color direction, natural poses, and premium fashion photography cues.
Render the tagline exactly once, clearly and legibly, integrated into the ad layout.
No extra text, no watermarks, no unrelated logos.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "thread_ad_gpt-image-2.png")
Imagen de salida:

4.7 De historia a tira cómica
Para la generación de historias a cómics, define la narrativa como una secuencia de ritmos visuales claros, uno por panel. Mantén las descripciones concretas y centradas en la acción para que el modelo pueda traducir la historia en paneles legibles y bien ritmados.
prompt = """
Create a short vertical comic-style reel with 4 equal-sized panels.
Panel 1: The owner leaves through the front door. The pet is framed in the window behind them, small against the glass, eyes wide, paws pressed high, the house suddenly quiet.
Panel 2: The door clicks shut. Silence breaks. The pet slowly turns toward the empty house, posture shifting, eyes sharp with possibility.
Panel 3: The house transformed. The pet sprawls across the couch like it owns the place, crumbs nearby, sunlight cutting across the room like a spotlight.
Panel 4: The door opens. The pet is seated perfectly by the entrance, alert and composed, as if nothing happened.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "comic_reel-gpt-image-2.png")
Imagen de salida:

4.8 Maquetas de UI
Las maquetas de UI funcionan mejor cuando describes el producto como si ya existiera. Concéntrate en el diseño, la jerarquía, el espaciado y los elementos de interfaz reales, y evita el lenguaje de arte conceptual para que el resultado parezca una interfaz utilizable y lanzada en lugar de un boceto de diseño.
prompt = """
Create a realistic mobile app UI mockup for a local farmers market.
Show today’s market with a simple header, a short list of vendors with small photos and categories, a small “Today’s specials” section, and basic information for location and hours.
Design it to be practical, and easy to use. White background, subtle natural accent colors, clear typography, and minimal decoration.
It should look like a real, well-designed, beautiful app for a small local market.
Place the UI mockup in an iPhone frame.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "ui_farmers_market_gpt-image-2.png")
Imagen de salida:

4.9 Visuales científicos / educativos
Los visuales científicos y educativos son muy adecuados para biología, química, explicaciones en el aula, sistemas de iconos científicos planos, diagramas y recursos de aprendizaje. Indícalos como un resumen de diseño instruccional: define la audiencia, el objetivo de la lección, el formato visual, las etiquetas requeridas y las restricciones científicas. Para obtener los mejores resultados, pide un sistema visual limpio y plano con un estilo de icono consistente, flechas claras, etiquetas legibles y suficiente espacio en blanco para que los estudiantes puedan escanear el concepto rápidamente.
Cuando la precisión importa, enumera explícitamente los componentes requeridos y di lo que no debe incluirse. Usa quality="high" para etiquetas densas, diagramas o activos que se usarán en diapositivas o materiales del curso.
prompt = """
Create a simple biology diagram titled "Cellular Respiration at a Glance" for high school students.
Show how glucose turns into energy inside a cell. Include glycolysis, the Krebs cycle, and the electron transport chain.
Use arrows to connect the steps, and label the main molecules: glucose, pyruvate, ATP, NADH, FADH2, CO2, O2, and H2O.
Make it look like a clean classroom handout or slide, with a white background, simple icons, clear labels, and easy-to-read text.
Avoid tiny text, extra decoration, or anything that makes the diagram hard to understand.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1536x1024",
quality="high",
)
save_image(result, "scientific_educational_cellular_respiration_gpt-image-2.png")
Imagen de salida:

4.10 Diapositivas, diagramas, gráficos e imágenes de productividad
Los elementos visuales de productividad funcionan mejor cuando el prompt se escribe como una especificación de artefacto en lugar de una solicitud de ilustración. Nombra el entregable exacto (diapositiva, diagrama de flujo de trabajo, gráfico, imagen de página), define el lienzo y la jerarquía, proporciona el texto o los datos reales y describe el lenguaje visual. Estos prompts deben incluir restricciones prácticas: tipografía legible, espaciado pulido, sin desorden decorativo y sin tratamiento genérico de fotos de archivo.
Para diapositivas, gráficos y activos con muchos diagramas, incluye los números y las etiquetas directamente en el prompt. Usa un tamaño horizontal para las salidas tipo presentación y quality="high" cuando la imagen contenga texto pequeño, leyendas, ejes o notas al pie.
prompt = """
Create one pitch-deck slide titled **"Market Opportunity"** that feels like a real Series A fundraising slide from a YC-backed startup.
Use a clean white background, modern sans-serif typography like Inter, and a crisp, minimal layout. The slide should include:
* A TAM/SAM/SOM concentric-circle diagram in muted blues and grays
* Specific, believable market sizing numbers:
* **TAM:** $42B
* **SAM:** $8.7B
* **SOM:** $340M
* A clean bar chart below showing market growth from **2021 to 2026**, with a subtle upward trend
* Small footnotes: **"AGI Research, 2024"** and **"Internal analysis"**
* A company logo placeholder in the bottom-right corner
The design should look like it belongs in a deck that actually raised money: highly readable text, clear data hierarchy, polished spacing, and professional startup-style visual language.
Avoid clip art, stock photography, gradients, shadows, decorative elements, or anything that feels generic or overdesigned.
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1536x864",
quality="high",
)
save_image(result, "market_opportunity_slide_gpt-image-2.png")
Imagen de salida:

5. Casos de uso — Editar (texto + imagen → imagen)
5.1 Transferencia de estilo
La transferencia de estilo es útil cuando quieres mantener el lenguaje visual de una imagen de referencia (paleta, textura, pinceladas, grano de película, etc.) mientras cambias el sujeto o la escena. Para obtener los mejores resultados, describe lo que debe permanecer consistente (señales de estilo) y lo que debe cambiar (contenido nuevo), y agrega restricciones estrictas como el fondo, el encuadre y "sin elementos adicionales" para evitar la deriva.
prompt = """
Use the same style from the input image and generate a man riding a motorcycle on a white background.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/pixels.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "motorcycle_gpt-image-2.png")
Imagen de entrada:
![]()
Imagen de salida:

5.2 Prueba de ropa virtual
La prueba virtual es ideal para vistas previas de comercio electrónico donde la preservación de la identidad es crítica. La clave es bloquear explícitamente a la persona (rostro, forma del cuerpo, pose, cabello, expresión) y permitir cambios solo en las prendas, luego exigir un ajuste realista (drapeado, pliegues, oclusión) más una iluminación/sombras consistentes para que el atuendo parezca usado de forma natural, no pegado.
prompt = """
Edit the image to dress the woman using the provided clothing images. Do not change her face, facial features, skin tone, body shape, pose, or identity in any way. Preserve her exact likeness, expression, hairstyle, and proportions. Replace only the clothing, fitting the garments naturally to her existing pose and body geometry with realistic fabric behavior. Match lighting, shadows, and color temperature to the original photo so the outfit integrates photorealistically, without looking pasted on. Do not change the background, camera angle, framing, or image quality, and do not add accessories, text, logos, or watermarks.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/woman_in_museum.png", "rb"),
open("../../images/input_images/tank_top.png", "rb"),
open("../../images/input_images/jacket.png", "rb"),
open("../../images/input_images/tank_top.png", "rb"),
open("../../images/input_images/boots.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "outfit_gpt-image-2.png")
Imágenes de entrada:
| Cuerpo completo | Artículo 1 |
|---|---|
![]() |
![]() |
| Artículo 2 | Artículo 3 |
![]() |
![]() |
Imagen de salida:

5.3 Dibujo → Imagen (Renderizado)
Los flujos de trabajo de boceto a renderizado son excelentes para convertir dibujos toscos en conceptos fotorrealistas manteniendo la intención original. Trata el prompt como una especificación: preserva el diseño y la perspectiva, luego agrega realismo especificando materiales, iluminación y entorno plausibles. Incluye "no agregar nuevos elementos/texto" para evitar reinterpretaciones creativas.
prompt = """
Turn this drawing into a photorealistic image.
Preserve the exact layout, proportions, and perspective.
Choose realistic materials and lighting consistent with the sketch intent.
Do not add new elements or text.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/drawings.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "realistic_valley_gpt-image-2.png")
Imagen de entrada:

Imagen de salida:

5.4 Maquetas de productos (fondo transparente + integridad de la etiqueta)
La extracción de productos y la preparación de maquetas se utilizan comúnmente para catálogos, mercados y sistemas de diseño. El éxito depende de la calidad del borde (silueta limpia, sin franjas/halos) y la integridad de la etiqueta (el texto permanece nítido e inalterado). Los fondos transparentes están disponibles en vista previa para gpt-image-2; solicita background="transparent" con output_format="png" (el valor predeterminado) o output_format="webp" para crear directamente un recorte de producto reutilizable. jpeg no admite fondos transparentes. Pide un sujeto aislado, preserva la geometría y la etiqueta del producto existente, y omite fondos sólidos, tableros de ajedrez y sombras innecesarias. Omite output_compression para la salida PNG; WebP admite compresión opcional.
prompt = """
Extract the product from the input image and isolate it on a fully transparent background.
Output: centered product, crisp silhouette, no halos/fringing.
Preserve product geometry and label legibility exactly.
Add only light polishing. Do not add a solid backdrop, checkerboard, scenery, or shadow.
Do not restyle the product; remove the background and preserve clean alpha transparency.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/shampoo.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
background="transparent",
output_format="png",
)
save_image(result, "extract_product_gpt-image-2.png")
Imagen de entrada:

Imagen de salida:

5.5 Creatividades de marketing con texto real en la imagen
Las creatividades de marketing con texto real en la imagen son excelentes para la conceptualización rápida de anuncios, pero la tipografía necesita restricciones explícitas. Pon el texto exacto entre comillas, exige una renderización literal (sin caracteres adicionales) y describe la ubicación y el estilo de la fuente. Si la fidelidad del texto es imperfecta, mantén el prompt estricto e itera; pequeños ajustes de redacción/diseño suelen mejorar la legibilidad.
prompt = """
Create a realistic billboard mockup of the shampoo on a highway scene during sunset.
Billboard text (EXACT, verbatim, no extra characters):
"Fresh and clean"
Typography: bold sans-serif, high contrast, centered, clean kerning.
Ensure text appears once and is perfectly legible.
No watermarks, no logos.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/shampoo.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "billboard_gpt-image-2.png")
Imagen de entrada:

Imagen de salida:

5.6 Transformación de iluminación y clima
Se utiliza para volver a escenificar una foto para diferentes ambientes, estaciones o variantes de la hora del día (por ejemplo, soleado → nublado, día → anochecer, claro → nevado) manteniendo intacta la composición de la escena. La clave es cambiar solo las condiciones ambientales —dirección/calidad de la iluminación, sombras, atmósfera, precipitación y humedad del suelo— mientras se preserva la identidad, la geometría, el ángulo de la cámara y la ubicación de los objetos para que siga pareciendo la misma foto original.
prompt = """
Make it look like a winter evening with snowfall.
"""
result = client.images.edit(
model="gpt-image-2",
input_fidelity="high",
image=[
open("../../images/output_images/billboard_gpt-image-2.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "billboard_winter_gpt-image-2.png")
Imagen de salida:

5.7 Eliminación de objetos
La composición de personas en escenas es útil para guiones gráficos, campañas y escenarios de "qué pasaría si" donde la preservación facial/de identidad es importante. Ancla el realismo especificando un aspecto fotográfico fundamentado (iluminación natural, detalles creíbles, sin gradación cinematográfica) y bloquea lo que no debe cambiar del sujeto. Cuando está disponible, una mayor fidelidad de entrada ayuda a mantener la semejanza durante ediciones de escenas más grandes.
prompt = """
Remove the flower from man's hand. Do not change anything else.
"""
result = client.images.edit(
model="gpt-image-2",
input_fidelity="high",
image=[
open("../../images/output_images/man_with_blue_hat.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "man_with_no_flower_gpt-image-2.png")
Imágenes de entrada y salida:
| Entrada original | Imagen de salida |
|---|---|
![]() |
![]() |
5.8 Insertar a la persona en una escena
La composición de personas en escenas es útil para guiones gráficos, campañas y escenarios de "qué pasaría si" donde la preservación facial/de identidad es importante. Ancla el realismo especificando un aspecto fotográfico fundamentado (iluminación natural, detalles creíbles, sin gradación cinematográfica) y bloquea lo que no debe cambiar del sujeto. Cuando está disponible, una mayor fidelidad de entrada ayuda a mantener la semejanza durante ediciones de escenas más grandes.
prompt = """
Generate a highly realistic action scene where this person is running away from a large, realistic brown bear attacking a campsite. The image should look like a real photograph someone could have taken, not an overly enhanced or cinematic movie-poster image.
She is centered in the image but looking away from the camera, wearing outdoorsy camping attire, with dirt on her face and tears in her clothing. She is clearly afraid but focused on escaping, running away from the bear as it destroys the campsite behind her.
The campsite is in Yosemite National Park, with believable natural details. The time of day is dusk, with natural lighting and realistic colors. Everything should feel grounded, authentic, and unstyled, as if captured in a real moment. Avoid cinematic lighting, dramatic color grading, or stylized composition.
"""
result = client.images.edit(
model="gpt-image-2",
input_fidelity="high",
image=[
open("../../images/input_images/woman_in_museum.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "scene_gpt-image-2.png")
Imagen de salida:
from IPython.display import Image, display
display(Image(filename="../../images/output_images/scene_gpt-image-2.png", width=500))
5.9 Referencia y composición de múltiples imágenes
Se utiliza para combinar elementos de múltiples entradas en una sola imagen creíble, ideal para flujos de trabajo de "insertar este objeto/persona en esa escena" sin volver a generar todo. La clave es especificar claramente qué trasplantar (el perro de la imagen 2), dónde debe ir (justo al lado de la mujer en la imagen 1) y qué debe permanecer sin cambios (escena, fondo, encuadre), mientras se igualan la iluminación, la perspectiva, la escala y las sombras para que la composición parezca capturada naturalmente en la foto original.
prompt = """
Place the dog from the second image into the setting of image 1, right next to the woman, use the same style of lighting, composition and background. Do not change anything else.
"""
result = client.images.edit(
model="gpt-image-2",
input_fidelity="high",
image=[
open("../../images/output_images/test_woman.png", "rb"),
open("../../images/output_images/test_woman_2.png", "rb"),
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "test_woman_with_dog_gpt-image-2.png")
Imágenes de entrada y salida:
| Entrada original | Eliminar rayas rojas | Cambiar color del sombrero |
|---|---|---|
![]() |
![]() |
![]() |
6. Casos de uso adicionales de alto valor
6.1 "Intercambio" de diseño de interiores (ediciones de precisión)
Se utiliza para visualizar cambios de muebles o decoración en espacios reales sin volver a renderizar toda la escena. El objetivo es el realismo quirúrgico: intercambiar un solo objeto mientras se preservan el ángulo de la cámara, la iluminación, las sombras y el contexto circundante para que la edición parezca una fotografía real, no un rediseño.
prompt = """
In this room photo, replace ONLY white with chairs made of wood.
Preserve camera angle, room lighting, floor shadows, and surrounding objects.
Keep all other aspects of the image unchanged.
Photorealistic contact shadows and fabric texture.
"""
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/input_images/kitchen.jpeg", "rb"),
],
prompt=prompt,
size="1536x1024",
quality="medium",
)
save_image(result, "kitchen-chairs_gpt-image-2.png")
Imágenes de entrada y salida:
| Imagen de entrada | Imagen de salida |
|---|---|
![]() |
![]() |
6.2 Tarjeta de felicitación 3D emergente (maqueta estilo producto)
Ideal para conceptos de marketing estacional y vistas previas de impresión. Enfatiza el realismo táctil (capas de papel, fibras, pliegues e iluminación suave de estudio) para que el resultado se lea como un producto físico fotografiado en lugar de una ilustración plana.
scene_description = (
"a cozy Christmas scene with an old teddy bear sitting inside a keepsake box, "
"slightly worn fur, soft stitching repairs, placed near a window with falling snow outside. "
"The scene suggests the child has grown up, but the memories remain."
)
short_copy = "Merry Christmas — some memories never fade."
prompt = f"""
Create a Christmas holiday card illustration.
Scene:
{scene_description}
Mood:
Warm, nostalgic, gentle, emotional.
Style:
Premium holiday card photography, soft cinematic lighting,
realistic textures, shallow depth of field,
tasteful bokeh lights, high print-quality composition.
Constraints:
- Original artwork only
- No trademarks
- No watermarks
- No logos
Include ONLY this card text (verbatim):
"{short_copy}"
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "christmas_holiday_card_teddy_gpt-image-2.png")
Imagen de salida:

6.3 Figura de acción coleccionable / Llavero de peluche (concepto de merchandising)
Se utiliza para la ideación temprana de merchandising y las visualizaciones de propuestas. Se centra en las señales de fotografía de productos premium (materiales, empaques, claridad de impresión) mientras se mantienen los diseños originales y no infractores. Funciona bien para probar rápidamente múltiples variantes de personajes o empaques.
# ---- Inputs ----
character_description = (
"a vintage-style toy propeller airplane with rounded wings, "
"a front-mounted spinning propeller, slightly worn paint edges, "
"classic childhood proportions, designed as a nostalgic holiday collectible"
)
short_copy = "Christmas Memories Edition"
# ---- Prompt ----
prompt = f"""
Create a collectible action figure of {character_description}, in blister packaging.
Concept:
A nostalgic holiday collectible inspired by the simple toy airplanes
children used to play with during winter holidays.
Evokes warmth, imagination, and childhood wonder.
Style:
Premium toy photography, realistic plastic and painted metal textures,
studio lighting, shallow depth of field,
sharp label printing, high-end retail presentation.
Constraints:
- Original design only
- No trademarks
- No watermarks
- No logos
Include ONLY this packaging text (verbatim):
"{short_copy}"
"""
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "christmas_collectible_toy_airplane_gpt-image-2.png")
Imagen de salida:

6.4 Arte de libro infantil con consistencia de personajes (flujo de trabajo de múltiples imágenes)
Diseñado para pipelines de ilustración de varias páginas donde la deriva del personaje es inaceptable. Un "ancla de personaje" reutilizable garantiza la continuidad visual en escenas, poses y páginas, al tiempo que permite la variación ambiental y narrativa.
1️⃣ Ancla de personaje: establece el personaje principal reutilizable
Objetivo: Fijar la apariencia, proporciones, atuendo y tono del personaje.
# ---- Inputs ----
prompt = """
Create a children’s book illustration introducing a main character.
Character:
A young, storybook-style hero inspired by a little forest outlaw,
wearing a simple green hooded tunic, soft brown boots, and a small belt pouch.
The character has a kind expression, gentle eyes, and a brave but warm demeanor.
Carries a small wooden bow used only for helping, never harming.
Theme:
The character protects and rescues small forest animals like squirrels, birds, and rabbits.
Style:
Children’s book illustration, hand-painted watercolor look,
soft outlines, warm earthy colors, whimsical and friendly.
Proportions suitable for picture books (slightly oversized head, expressive face).
Constraints:
- Original character (no copyrighted characters)
- No text
- No watermarks
- Plain forest background to clearly showcase the character
"""
# ---- Image generation ----
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "childrens_book_illustration_1_gpt-image-2.png")
Imagen de salida:

2️⃣ Continuación de la historia: reutiliza el personaje, avanza la narrativa
Objetivo: Mismo personaje, nueva escena + acción. La apariencia del personaje debe permanecer sin cambios.
# ---- Inputs ----
prompt = """
Continue the children’s book story using the same character.
Scene:
The same young forest hero is gently helping a frightened squirrel
out of a fallen tree after a winter storm.
The character kneels beside the squirrel, offering reassurance.
Character Consistency:
- Same green hooded tunic
- Same facial features, proportions, and color palette
- Same gentle, heroic personality
Style:
Children’s book watercolor illustration,
soft lighting, snowy forest environment,
warm and comforting mood.
Constraints:
- Do not redesign the character
- No text
- No watermarks
"""
# ---- Image generation ----
result = client.images.edit(
model="gpt-image-2",
image=[
open("../../images/output_images/childrens_book_illustration_1_gpt-image-2.png", "rb"), # use image from step 1
],
prompt=prompt,
size="1024x1536",
quality="medium",
)
save_image(result, "childrens_book_illustration_2_gpt-image-2.png")
Imagen de salida:

Conclusión
En este notebook, demostramos cómo usar los modelos de generación de imágenes gpt para construir flujos de trabajo de edición y generación de imágenes controlables y de alta calidad que se mantienen en entornos de producción reales. El manual enfatiza la estructura del prompt, las restricciones explícitas y los pequeños cambios iterativos como las herramientas principales para controlar el realismo, el diseño, la precisión del texto y la preservación de la identidad. Cubrimos patrones de generación y edición, que van desde infografías, fotorrealismo, maquetas de UI y logotipos hasta traducción, transferencia de estilo, prueba virtual, composición y cambios de iluminación. A lo largo de los ejemplos, el manual refuerza la importancia de separar claramente lo que debe cambiar de lo que debe permanecer invariante, y de reafirmar esas invariantes en cada iteración para evitar la deriva. También destacamos cómo la calidad y la configuración de fidelidad de entrada permiten compensaciones deliberadas entre la latencia y la precisión visual según el caso de uso. Juntos, estos ejemplos forman un manual práctico y repetible para aplicar los modelos de generación de imágenes gpt en flujos de trabajo de imágenes de producción.














