Generación de datos sintéticos
La generación de datos sintéticos con LLM es una tecnología para la creación artificial de datos que imitan las características estadísticas y estructurales de los datos reales, pero sin contener información personal real. Este enfoque, que aprovecha las capacidades de los grandes modelos de lenguaje (LLM), se ha convertido en una herramienta clave en el aprendizaje automático moderno para resolver problemas de escasez de datos, privacidad y el alto costo del etiquetado manual[1].
Definición y antecedentes
¿Qué son los datos sintéticos?
Los datos sintéticos son información generada artificialmente que reproduce las propiedades estadísticas y los patrones del conjunto de datos original y real. El Instituto Nacional de Estándares y Tecnología de EE. UU. (NIST) los define como datos que conservan las propiedades estadísticas del original, pero no revelan detalles individuales[2]. A diferencia de la simple anonimización, la síntesis de datos crea registros completamente nuevos, lo que proporciona un mayor nivel de protección de la privacidad.
¿Por qué surgió la necesidad?
El creciente interés en la generación sintética se debe a varios factores:
- Escasez de datos: En muchos campos, especialmente en los muy especializados, no hay suficientes datos etiquetados de calidad para entrenar modelos robustos.
- Alto costo del etiquetado: El etiquetado manual de datos es un proceso laborioso y costoso.
- Requisitos de privacidad: Las normativas legales y éticas (por ejemplo, el RGPD) limitan el uso de datos reales que contienen información personal, médica o financiera.
- Desequilibrio de clases: En los datos reales, algunos eventos importantes pero raros (edge cases o casos extremos) pueden estar insuficientemente representados, lo que dificulta que el modelo los aprenda.
Los LLM, entrenados en enormes corpus de texto y código, se han convertido en una herramienta poderosa para abordar estos problemas, ya que son capaces de generar contenido coherente y diverso que imita los estilos y las distribuciones de los datos reales.
Principales métodos de generación con LLM
Existen varios enfoques clave para la creación de datos sintéticos utilizando LLM.
1. Generación basada en prompts (Prompt-based)
Este es un método directo en el que el LLM genera datos a partir de una solicitud de texto (prompt).
- Zero-shot (desde cero): El modelo genera ejemplos basándose únicamente en la descripción de la tarea, sin proporcionar muestras. Este enfoque fomenta la diversidad, pero puede llevar a resultados menos relevantes.
- Few-shot (con pocos ejemplos): En el prompt se incluyen varios ejemplos (muestras) de la salida deseada. Esto guía al modelo y aumenta la relevancia de los datos generados, pero conlleva el riesgo de duplicación y pérdida de diversidad, ya que el modelo tiende a copiar patrones[1].
2. Generación aumentada por recuperación (Retrieval-Augmented)
Este método tiene como objetivo mejorar la exactitud fáctica de los datos sintéticos y reducir el riesgo de alucinaciones. El modelo no se basa únicamente en su conocimiento interno, sino que utiliza un contexto proporcionado de una fuente externa confiable. Por ejemplo, para generar un par «pregunta-respuesta», primero se extrae un párrafo relevante de Wikipedia y luego se le pide al LLM que formule una pregunta y una respuesta basadas estrictamente en ese texto.
3. Refinamiento iterativo y autoaprendizaje (Self-Refinement)
Esta clase de métodos utiliza un bucle de retroalimentación para mejorar la calidad de los datos. El ejemplo más conocido es el método Self-Instruct[1].
- El modelo genera un conjunto inicial de datos.
- Estos datos se utilizan para el ajuste fino (fine-tuning) del propio modelo (o una copia de este).
- Se analizan los errores y las debilidades del modelo en los datos generados.
- Se le pide al modelo que genere nuevos ejemplos más complejos, similares a aquellos en los que cometió errores.
Fue siguiendo este esquema que se creó el famoso conjunto de datos Stanford Alpaca: 52,000 pares de «instrucción-respuesta» generados por el modelo GPT-3, que permitieron ajustar el modelo abierto LLaMA para que actuara como un asistente que sigue instrucciones.
4. Postprocesamiento y filtrado
Después de la generación de datos, siempre se aplica un filtrado para descartar ejemplos de baja calidad. Los métodos varían desde los más simples (eliminación de duplicados, verificación de formato) hasta los más complejos, como:
- Uso de un modelo crítico: Se entrena un clasificador separado que distingue los datos reales de los sintéticos y descarta las muestras menos realistas.
- Filtrado por confianza: Se conservan solo aquellos ejemplos para los cuales el LLM predice la respuesta/etiqueta correcta con alta confianza.
- Ponderación de datos: A los ejemplos sospechosos de contener errores o alucinaciones se les asigna un peso menor en la función de pérdida durante el entrenamiento para reducir su impacto negativo (método SunGen).
5. Aprendizaje con retroalimentación de ejecución (Execution Feedback)
Este método es especialmente eficaz para la generación de código de software. A diferencia del texto en lenguaje natural, el código tiene un criterio formal de corrección: se puede ejecutar. El ciclo es el siguiente:
- El LLM genera código para resolver una tarea.
- El código se ejecuta automáticamente y se verifica con pruebas.
- Las soluciones correctas se incluyen en el conjunto de entrenamiento. Las incorrectas se descartan, o el modelo recibe una señal (recompensa o reward) para corregir el error.
Aplicaciones de los datos sintéticos
- Mejora de tareas en condiciones de escasez de datos: Los datos sintéticos son más eficaces cuando hay pocos datos reales etiquetados. Las investigaciones muestran que añadir 100 ejemplos sintéticos a 100 ejemplos reales puede aumentar la precisión de un clasificador entre un 3 % y un 26 %[3].
- Creación de conjuntos de instrucciones (Instruction Tuning): Proyectos como Alpaca y Code Alpaca han demostrado que con los LLM se pueden crear conjuntos de datos grandes y de alta calidad para entrenar modelos asistentes prácticamente desde cero.
- Búsqueda de información y respuesta a preguntas (QA): El método InPars utiliza LLM para generar consultas de búsqueda para documentos existentes. Esto permite crear automáticamente pares «pregunta-documento relevante» para entrenar sistemas de búsqueda.
- Protección de la privacidad: En medicina y finanzas, los datos sintéticos se utilizan para entrenar modelos sin acceder a datos personales reales. Por ejemplo, el Departamento de Asuntos de Veteranos de EE. UU. generó datos médicos sintéticos durante la pandemia de COVID-19 para compartir información[2].
Ventajas y riesgos
Ventajas
- Reducción de costos y aceleración del desarrollo: La generación de datos por un modelo es significativamente más barata y rápida que el etiquetado manual.
- Escalabilidad: Los datos sintéticos se pueden generar en volúmenes prácticamente ilimitados.
- Controlabilidad: El desarrollador puede ajustar de manera flexible la composición, el estilo y la complejidad de los datos generados.
- Cumplimiento de la privacidad: Proporcionan una alternativa anonimizada para trabajar con datos sensibles.
- Robustez de los modelos (Robustness): El entrenamiento con ejemplos sintéticos diversos e incluso "engañosos" hace que los modelos sean menos propensos al sobreajuste y más resistentes a datos de entrada anómalos.
Limitaciones y riesgos
- Inexactitudes fácticas (alucinaciones): Los LLM pueden generar hechos incorrectos que, al ser incluidos en el conjunto de entrenamiento, se arraigan en los nuevos modelos.
- Realismo insuficiente: Los textos sintéticos pueden ser demasiado esquemáticos, formales o no reflejar toda la diversidad del lenguaje natural, lo que reduce la capacidad de generalización del modelo.
- Amplificación de sesgos sistémicos (Bias): Los LLM heredan y pueden amplificar los estereotipos sociales y prejuicios presentes en sus datos de entrenamiento.
- Riesgo de "colapso del modelo": Fenómeno en el que el reentrenamiento de modelos con datos generados por versiones anteriores de los mismos conduce a una degradación gradual de la calidad y al "olvido" de fenómenos raros.
- Posibles fugas de privacidad: Sin medidas especiales (como la privacidad diferencial), los LLM pueden reproducir accidentalmente fragmentos de datos reales de su conjunto de entrenamiento, lo que conlleva un riesgo de desanonimización[4].
Perspectivas y líneas de investigación
- Automatización de la selección de prompts: Desarrollo de métodos que encuentren automáticamente los prompts óptimos para generar datos de alta calidad.
- Generación sintética multimodal: Ampliación de las metodologías a la generación de datos combinados (texto + imagen, audio, video).
- Desarrollo de métricas de calidad: Creación de benchmarks estandarizados para evaluar la utilidad, diversidad y realismo de los datos sintéticos.
- Gestión de sesgos: Elaboración de métodos para controlar y reducir los sesgos en los datos generados, por ejemplo, mediante la generación de ejemplos contrafactuales.
- Implementación segura en la industria: Desarrollo de estándares legales y éticos para el uso de datos sintéticos en áreas críticas.
Enlaces externos
- Artículo de revisión: Synthetic Data Generation Using Large Language Models (2025)
- Blog de Google Research sobre la generación de datos con privacidad diferencial
Bibliografía
- Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
- Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
- Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
- Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
- Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
- Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
- Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
- Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
- Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
- Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.
Referencias
- ↑ 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 de marzo de 2025. [1]
- ↑ 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [2]
- ↑ Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [3]
- ↑ Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [4]