Inicio › Tecnología › Barreras De Seguridad De IA
Las barreras de seguridad de IA (guardrails) son el conjunto de reglas, filtros y validaciones qué limitan lo qué un modelo de lenguaje puede generar o ejecutar: filtrado del prompt de entrada, moderación de la respuesta de salida, listas de temas prohibidos y límites estrictos sobre qué acciones puede realizar un agente con acceso a herramientas externas, como enviar correos o ejecutar código. Se implementan tanto dentro del propio modelo (ajuste fino, instrucciones de sistema) como en capas externas de software qué revisan la entrada y la salida antes de qué lleguen al usuario final.
Son como las vallas de un carril bici: la IA puede moverse con libertad dentro de un margen seguro, pero no puede salirse a hacer cualquier cosa qué alguien le pida con un mensaje engañoso.
Un chatbot de atención al cliente de una aseguradora puede llevar barreras qué le impiden dar consejos médicos concretos o mostrar datos de otro cliente distinto, aunque un usuario intente forzarlo con instrucciones ocultas dentro de su mensaje para saltarse esas reglas.
Es una técnica para intentar engañar al modelo con instrucciones diseñadas para qué ignore sus propias reglas; las barreras de seguridad son precisamente lo qué intenta resistir ese tipo de manipulación.
Pueden estar en ambos sitios: parte del comportamiento se entrena directamente en el modelo, y otra parte se añade como una capa externa de software qué revisa y bloquea entradas o salidas antes de mostrarlas.
Sí, ningún sistema de filtrado es perfecto; por eso en aplicaciones críticas se combinan varias capas de defensa y revisión humana, en lugar de confiar en una única barrera.