"IA" se usa para describir todo, desde un filtro de spam hasta un chatbot o la herramienta que hizo ese vídeo viral de tu feed. Aquí está la única cosa específica que significa "IA generativa", cómo aprenden realmente estos modelos, y dónde encajan las herramientas de este sitio.
La mayor parte de la IA con la que la mayoría de la gente interactúa a diario es discriminativa, no generativa — mira algo que ya existe y hace un juicio sobre ello: ¿este correo es spam?, ¿esta foto contiene una cara?, ¿debería recomendarse este vídeo a continuación? La IA generativa es un trabajo diferente: en vez de juzgar contenido existente, produce contenido nuevo — un párrafo de texto, una imagen, un clip de vídeo, una grabación de voz — a partir de un prompt o una entrada inicial. ChatGPT escribiendo un correo, Midjourney dibujando una imagen, y Runway o Veo generando un clip de vídeo son todos IA generativa. Un filtro de spam no lo es, aunque siga siendo "IA" en el sentido más amplio.
Entrenar un modelo generativo significa mostrarle un número enorme de ejemplos reales de lo que sea que deba producir — miles de millones de frases para un modelo de texto, conjuntos de datos enormes de imágenes o vídeo para un modelo de imagen o vídeo — y ajustar los parámetros internos del modelo (puede haber miles de millones) para que sea progresivamente mejor prediciendo patrones dentro de esos datos: qué palabra viene plausiblemente a continuación, qué valores de píxel pertenecen plausiblemente junto a qué otros valores de píxel. Fundamental: el modelo no está almacenando y reproduciendo ejemplos de entrenamiento específicos como un buscador devuelve una página web almacenada. Está aprendiendo patrones estadísticos lo bastante generales como para aplicarlos a un prompt totalmente nuevo que nunca encontró durante el entrenamiento — lo cual es tanto la fuente de su utilidad (puede manejar peticiones genuinamente novedosas) como la fuente de sus fallos más raros (siempre está produciendo su mejor conjetura estadística, incluso cuando esa conjetura es errónea).
Un modelo generativo no está consultando nada ni comprobando un hecho — está produciendo la continuación estadísticamente más plausible del prompt que se le dio, basándose enteramente en patrones aprendidos durante el entrenamiento. Para los modelos de texto, esto aparece como información incorrecta afirmada con confianza, a menudo llamada "alucinación". Para los modelos de imagen y vídeo, aparece como el mismo puñado de fallos visuales recurrentes en contenido completamente no relacionado: dedos de más o malformados, joyas y texto pequeño que se deforman o salen como galimatías, detalles finos que no resisten un examen atento. Estos no son bugs aleatorios específicos de una herramienta — son artefactos de lo que es estructuralmente difícil que este tipo de modelo acierte exactamente: el detalle fino, preciso y gobernado por reglas (un número exacto de dedos, formas de letra exactas) es un objetivo estadístico mucho más difícil de acertar de forma consistente que uno amplio y tolerante (una pose general, una paleta de colores general).
Los generadores de vídeo con IA (Runway, Pika, Kling, Seedance, Veo y otros) son IA generativa aplicada específicamente a vídeo: entra una descripción de texto o una imagen de referencia, y sale un clip de vídeo nuevo y corto — fotogramas que el modelo construyó, no metraje que se filmó. Es la misma idea subyacente que un generador de texto o imagen, solo con la complejidad añadida de que cada fotograma tiene que mantenerse visualmente consistente con los fotogramas de alrededor. Mira nuestro explicador dedicado sobre cómo funciona realmente la generación de vídeo con IA para la mecánica, o nuestro recorrido por las herramientas reales, apto para principiantes, si solo quieres saber qué hay detrás de los vídeos que inundan tu feed.
Vale la pena ser preciso sobre esto, porque los dos se confunden: la eliminación de fondo con IA (lo que hace RemoveGifBG) está construida sobre una familia de técnicas de red neuronal estrechamente relacionada, pero no es generativa en el mismo sentido. Su trabajo es clasificación, no creación — para cada píxel de una imagen o fotograma de vídeo, decide si es parte del sujeto o parte del fondo, y entonces conserva uno y descarta el otro. No está inventando píxeles nuevos como un generador de imagen inventa una escena entera a partir de un prompt de texto; está tomando una decisión de conservar-o-descartar sobre píxeles que ya existen. Mira cómo funciona realmente la eliminación de fondo con IA para los detalles, y por qué es un problema mucho más difícil en vídeo y GIFs que en una sola foto.
La versión corta
Mira Cómo Funciona la Generación de Vídeo con IA
Relacionados: Cómo funciona la eliminación de fondo con IA · Cómo se hacen los vídeos con IA (guía para principiantes) · Todas las guías
Es una categoría de modelos de IA entrenados para producir contenido nuevo — texto, imágenes, vídeo, audio, código — en vez de solo clasificar o analizar contenido existente. Un filtro de spam ("¿este correo es spam o no?") es IA pero no generativo. Una herramienta que escribe un correo, dibuja una imagen o genera un vídeo a partir de una descripción es generativa: la salida es material nuevo que el modelo construye, no una etiqueta aplicada a algo que ya existía.
El entrenamiento expone al modelo a una cantidad enorme de contenido de ejemplo existente (texto, imágenes o vídeo, según lo que deba generar) y ajusta millones o miles de millones de parámetros internos para que el modelo sea progresivamente mejor prediciendo patrones dentro de esos datos — qué palabra sigue plausiblemente a otras palabras, qué valores de píxel siguen plausiblemente a otros valores de píxel. No está memorizando y reproduciendo ejemplos específicos; está aprendiendo patrones estadísticos lo bastante generales como para aplicarlos a prompts totalmente nuevos que nunca vio durante el entrenamiento.
Porque el modelo está generando la siguiente salida estadísticamente más plausible, no consultando nada ni verificando un hecho. Para el texto, eso aparece como información errónea afirmada con confianza ("alucinación"). Para imágenes y vídeo, aparece como el mismo puñado de errores visuales recurrentes — dedos de más, texto deformado, joyas que no mantienen su forma — porque esos son exactamente los tipos de detalle fino y estructuralmente preciso que es más difícil mantener estadísticamente consistente a lo largo de una imagen o clip generado entero.
No exactamente, aunque es un primo cercano. La eliminación de fondo con IA usa la misma familia de técnicas de red neuronal (entrenada con cantidades enormes de datos de ejemplo, haciendo predicciones a nivel de píxel) pero su trabajo es clasificación, no generación: para cada píxel, ¿es primer plano o fondo? No está creando píxeles nuevos como hace un generador de imagen — está decidiendo qué conservar de una imagen que ya existe.