# Modelos de imagen para construir skills — agosto 2026 Investigación web (no memoria), agosto 2026. Objetivo: decidir el top-up para SKILLS repetibles, no una imagen suelta. Carril A = ilustración de base + diagramas conceptuales (escena diseñada, estilo consistente entre familia, edición iterativa sobre imagen aprobada, texto SIEMPRE fuera de la imagen — el rótulo va en SVG encima). Carril B = dirección visual UI (moodboards, pantallas ficticias). ## Lo que ya tenemos — línea base del delta | Servicio | Modelo | Precio/imagen | API | Referencia/edición | Vector | Carril | |---|---|---|---|---|---|---| | Gemini API (pago) | gemini-3-pro-image | oficial $0.134 (2K) / $0.24 (4K), −50% en Batch ([openrouter](https://openrouter.ai/google/gemini-3-pro-image-preview)) | Sí | Sí, nativa | No | A+B | | Google AI Studio | Nano Banana 2 | gratis, manual, ~10 req/min | No | Sí | No | A+B boceto | | RunPod A100 (propio) | FLUX.2 dev | ~$0.013 (1,3 céntimos) | Sí, propia | Parcial (Kontext) | No | A | | Krea | Krea 1 | gratis, 100/día | No, solo web | Básica | No | A boceto | | Higgsfield | — | plan gratis, sin créditos | — | — | — | — | ## Candidatos investigados | Servicio | Modelo actual | Precio/imagen | API | Ref./edición | Vector/estilos | Carril | |---|---|---|---|---|---|---| | OpenAI | GPT Image 2 (21-abr-2026) | $0.006–$0.211 según calidad ([hiapi](https://www.hiapi.ai/en/blog/gpt-image-2-api-pricing)) | Sí | Sí, hasta 16 img. de referencia + máscara inpaint/outpaint ([runware](https://runware.ai/docs/models/openai-gpt-image-2)) | No | A+B | | Recraft | V4.1 / V4.1 Pro | raster $0.035–$0.21, vector $0.08–$0.30 ([oficial](https://www.recraft.ai/docs/api-reference/pricing)) | Sí | Sí, img2img/inpaint/outpaint | SVG real + estilo de marca propio, entrenable ([recraft](https://www.recraft.ai/blog/new-tools-for-brand-style-consistency-and-control)) | A diagramas, B marca | | Higgsfield | agrega GPT Image 2, Nano Banana Pro, Seedance 2.0, Flux.2 Pro | $15–99/mes según plan, por créditos ([imagine.art](https://www.imagine.art/blogs/higgsfield-ai-pricing)) | Sí, MCP/CLI propio ([higgsfield.ai/mcp](https://higgsfield.ai/mcp)) | Según modelo interno | No propio | A+B exploración | | Ideogram | 4.0 (3-jun-2026) | $0.03–$0.10 ([oficial](https://ideogram.ai/api-pricing/)) | Sí | Sí, Character API ([ideogram](https://ideogram.ai/features/character/)) | No, pero líder en tipografía y #1 en Design Arena ([ideogram](https://ideogram.ai/news/ideogram-4.0/)) | B | | Midjourney | v8.1 | $10–120/mes suscripción | NO pública, solo prueba empresarial cerrada ([10b.ai](https://10b.ai/blog/does-midjourney-have-an-api), [aibase](https://www.aibase.com/news/19742)) | — | No | descartado | | Black Forest Labs | FLUX.2 Pro/Flex/Max | $0.03/$0.05/$0.07 por megapíxel ([pricepertoken](https://pricepertoken.com/flux-pricing)) | Sí | Sí, Kontext | No | A alojado | | ByteDance | Seedream 4.5/5.0, Seedance 2.0 | $0.02–$0.07 ([gate.ai](https://gate.ai/blog/seedream-4-5-bytedance-specs-pricing-api-use-cases)) | Sí, Volcano Ark/BytePlus + agregadores ([wavespeed](https://wavespeed.ai/blog/image-model-access/seedream-5-0-pro-api-guide/)) | Sí | No | A alternativa | ## El delta que compra cada top-up **GPT Image 2.** Instrucción compleja: modo "thinking" que planea la composición antes de generar, resuelve escenas de varios elementos y relaciones espaciales mejor que Gemini y FLUX ([mindstudio](https://www.mindstudio.ai/blog/what-is-gpt-image-2), [fp8.co](https://fp8.co/articles/GPT-Image-2-vs-Gemini-3-Pro-Image-Generation-Benchmark)). Edición con hasta 16 imágenes de referencia + máscara real de inpaint/outpaint — sirve para iterar sobre una imagen ya aprobada ([fal.ai](https://fal.ai/models/openai/gpt-image-2/edit)). ToS: no identificar personas reales; contenido legal, médico, educativo o de seguridad pública debe pasar por revisión humana antes de publicarse — aplica directo a páginas de gobierno ([usage-policies](https://openai.com/policies/usage-policies/)). **Recraft V4.1.** Único con salida SVG vectorial real (no un vectorizador posterior) más un "brand style" propio, entrenado desde nuestras imágenes y reutilizable por ID en cada llamada ([recraft docs](https://www.recraft.ai/docs/api-reference/pricing)). Resuelve justo la regla del texto-nunca-en-la-imagen: el diagrama sale en formas vectoriales editables, el rótulo se pone encima en SVG de verdad, no hay raster que se rompa al ampliar. Ningún otro candidato iguala esto — el resto son vectorizadores post-hoc, no generación vectorial nativa ([flowith](https://flowith.io/blog/10-best-recraft-alternatives-ai-vector-brand-asset-generation-2026/)). **Higgsfield.** El delta es agregación + automatización: MCP/CLI propio conecta directo a Claude sin gestionar 5 llaves de API distintas ([higgsfield.ai/mcp](https://higgsfield.ai/mcp)). Los créditos cubren GPT Image 2, Nano Banana Pro, Seedance 2.0 y Flux.2 Pro en una sola cuenta. Pero cambió de estructura de precio varias veces en 2026 ([imagine.art](https://www.imagine.art/blogs/higgsfield-ai-pricing), [scopeful](https://www.scopeful.org/tools/higgsfield)) — mala base para presupuestar un skill de producción; sirve para explorar antes de comprar API directa. **Ideogram 4.0.** El delta es tipografía y tablero de interfaz: primer puesto en Design Arena, pensado para maquetas con texto legible — botones, etiquetas, menús ([ideogram.ai](https://ideogram.ai/news/ideogram-4.0/)). Carril A prohíbe texto en la imagen, así que este punto fuerte sirve solo a Carril B. **Midjourney.** Sin API pública amplia, solo pruebas empresariales cerradas sin fecha ni precio conocido ([10b.ai](https://10b.ai/blog/does-midjourney-have-an-api)). No sirve para un skill repetible — se descarta, como sospechaba la misión. **FLUX Pro/Flex/Max (Black Forest Labs).** Delta operativo, no de capacidad, sobre nuestro FLUX.2 en RunPod: el mismo modelo alojado, sin arrancar pod ni cold-start, con +4 ELO de calidad sobre la versión abierta que ya corremos ([lumenfall](https://lumenfall.ai/compare/flux.2-dev/flux.2-pro)). Cuesta ~2.3× lo que pagamos por trabajo en RunPod. Útil como respaldo puntual, no para reemplazar el pod propio. **Seedream / Seedance.** Delta estético: reportes lo ubican por delante de GPT-Image-1 y Gemini 2.5 en luz e impacto visual ([wavespeed](https://wavespeed.ai/blog/posts/gpt-image-vs-seedream-comparison-2026/)). Precio bajo y acceso occidental real vía Volcano Ark/BytePlus sin VPN ([aibase](https://news.aibase.com/news/26788)). No añade una capacidad que no tengamos ya — top-up opcional, no prioritario. ## Gemini 3 Pro Image vs GPT Image 2 — ¿ya lo iguala? Brecha real, no empate. GPT Image 2 gana en instrucción compleja y composición porque razona antes de generar; Gemini 3 Pro gana en velocidad (4.3× más rápido) y layout de texto ([fp8.co](https://fp8.co/articles/GPT-Image-2-vs-Gemini-3-Pro-Image-Generation-Benchmark), [postquick](https://www.postquick.ai/blog/ai-image-generation-comparison)). La brecha se cierra pero no cerró. Y en precio oficial, Gemini 3 Pro Image ($0.134/img a 2K, [openrouter](https://openrouter.ai/google/gemini-3-pro-image-preview)) no siempre sale más barato: GPT Image 2 en calidad media cuesta $0.053, menos de la mitad. Para el volumen normal, Gemini basta; para la escena difícil con instrucción compleja, GPT Image 2 vale el top-up selectivo. ## Recomendación por carril **Carril A.** Base Gemini 3 Pro Image (ya pagado); top-up selectivo en GPT Image 2 pay-as-you-go solo para escenas difíciles; sumar Recraft pay-as-you-go para diagramas vectoriales. Sin suscripción nueva. **Carril B.** Motor principal Ideogram 4.0 pay-as-you-go (tipografía + diseño de interfaz); top-up selectivo en GPT Image 2 para composición compleja de pantalla. **Descartar.** Midjourney (sin API), Higgsfield como base de skill (precio inestable, sirve solo para explorar), Seedream (no añade delta que no tengamos ya — revisar si el precio institucional lo justifica más adelante).