Seguridad de IA
Guía didáctica: Moderación y Seguridad de IA
Alineamiento y protección de sistemas conversacionales
🤝
Técnicas de Alineamiento: RLHF
Los modelos base entrenados con texto de internet a menudo generan contenido ofensivo o dañino. Para alinearlos con los valores humanos, se utiliza el Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF):
- Evaluadores humanos clasifican múltiples respuestas generadas por el modelo.
- Se entrena un modelo de recompensa para predecir las preferencias humanas.
- Se optimiza el LLM principal mediante aprendizaje por refuerzo para maximizar la recompensa.
🚨
Pipelines de Filtro y Moderación en Tiempo Real
En producción, se implementan capas de seguridad antes y después del LLM:
- Clasificadores de Moderación: Modelos pequeños entrenados para detectar categorías específicas de daño (odio, violencia, autolesión, acoso).
- Filtros de Inyección de Prompts: Detectan intentos del usuario de "engañar" al modelo para saltarse sus directrices de seguridad.

