FiltrarIA

Cómo la IA filtra sus respuestas

Esta herramienta interactiva ilustra los procesos de moderación, guardrails éticos, filtros heurísticos y técnicas de alineamiento (RLHF/RLAIF) implementados para evitar la generación de respuestas dañinas o sesgadas en sistemas de inteligencia artificial.

Aprende con casos reales — selecciona un caso a la izquierda para empezar
Selecciona un caso en la lista de la izquierda y verás:
  • Sin filtro (rojo): lo que saldría sin moderación.
  • Coherencia humana (amarillo): cómo la edición podría hacerlo más claro/peligroso.
  • Alineamiento/Política (azul): respuesta segura y explicación.

Mecanismos de Filtrado, Moderación y Seguridad en Modelos de Lenguaje

Los sistemas de inteligencia artificial generativa no solo deben ser capaces de predecir el siguiente token de manera probabilística, sino que requieren rigurosos marcos de alineamiento de seguridad para prevenir la divulgación de material peligroso, información confidencial, incitación al odio o instrucciones de explotación cibernética.

1. Guardrails de Entrada (Input Filtering)

Antes de que el prompt alcance la red neuronal, analizadores léxicos y clasificadores ligeros de toxicidad examinan la entrada en busca de patrones de inyección de prompt (jailbreaks), lenguaje ofensivo o violaciones a las políticas de uso establecidas.

2. Alineamiento (RLHF & Constitutional AI)

Durante la etapa de post-entrenamiento, el modelo se calibra mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) y principios éticos explícitos (Constitutional AI), aprendiendo a declinar peticiones perjudiciales con explicaciones fundamentadas.

3. Clasificadores de Salida (Output Guards)

Las respuestas generadas en tiempo de inferencia son evaluadas por modelos de moderación secundarios especializados que miden vectores de riesgo (daño autoinfligido, violencia, discriminación) antes de entregar el flujo de texto al usuario final.