Los modelos de IA generativa, como Gemini, requieren medidas de seguridad sólidas para mitigar riesgos, como la generación de contenido dañino, la filtración de información sensible o el uso inadecuado. Gemini Enterprise Agent Platform proporciona un conjunto de herramientas y prácticas para implementar la seguridad integral de tus modelos de Gemini.
Posibles riesgos de seguridad y estrategias de mitigación
Cuando implementes modelos de Gemini, es fundamental identificar y mitigar varios riesgos potenciales. Un enfoque proactivo para comprender estos riesgos permite implementar medidas de seguridad de manera más eficaz. Es fundamental adoptar un enfoque de seguridad de varias capas, ya que puede mitigar o prevenir lo siguiente:
- Riesgos de contenido: Pueden incluir contenido dañino, lenguaje obsceno y sexualización, y violencia y contenido sangriento.
- Riesgos de seguridad de la marca: Es posible que el contenido generado no se alinee con el tono o los valores de tu marca, que respalde a la competencia o a productos inadecuados, o que genere contenido que pueda dañar la reputación.
- Riesgos de alineación: El contenido generado puede ser irrelevante o impreciso.
- Riesgos de seguridad y privacidad: El contenido generado puede filtrar datos de entrenamiento o instrucciones sensibles, o bien los usuarios adversarios pueden intentar obligar al modelo a anular los protocolos de seguridad o comportarse de formas no deseadas.
Nuestros modelos implementados ofrecen varias funciones para abordar estos posibles problemas:
- El modelo predeterminado y los filtros no configurables proporcionan una red de seguridad general.
- Las instrucciones del sistema brindan orientación directa al modelo sobre el comportamiento preferido y los temas que se deben evitar.
- Los filtros de contenido te permiten establecer umbrales específicos para los tipos de daños comunes.
- Gemini como filtro ofrece un punto de control avanzado y personalizable para problemas de seguridad complejos o sutiles que podrían pasar desapercibidos en las capas anteriores o requerir una evaluación más contextual.
- La DLP aborda específicamente el riesgo crítico de filtración de datos sensibles en caso de que el modelo tenga acceso a ellos. También te permite crear listas de bloqueo personalizadas.
- Las Content Credentials agregan metadatos de C2PA firmados de forma criptográfica a las imágenes generadas con el modelo de imagen de Gemini 3 Pro, lo que indica que se generaron con IA y proporciona un historial verificable de su origen.
Herramientas de seguridad disponibles en Agent Platform para Gemini
Agent Platform ofrece varias herramientas para administrar la seguridad de tus modelos de Gemini. Comprender cómo funciona cada una, sus consideraciones y sus casos de uso ideales te ayudará a crear una solución de seguridad personalizada.
| Enfoque | Cómo funciona | Protección proporcionada | Riesgos | Cuándo usar |
|---|---|---|---|---|
| Configuración predeterminada: Gemini y filtros no configurables | Los modelos de Gemini se diseñaron inherentemente con la seguridad y la equidad en mente, incluso cuando se enfrentan a instrucciones adversarias. Google invirtió en evaluaciones de seguridad integrales, incluidas las de sesgo y toxicidad. La configuración predeterminada incluye una capa de protección independiente diseñada para evitar la generación de contenido relacionado con el material de abuso sexual infantil (CSAM) o el contenido protegido por derechos de autor (recitación). | Protección básica contra el material de abuso sexual infantil y los derechos de autor (recitación) | Es posible que la seguridad predeterminada de Gemini no satisfaga las necesidades de tu organización. El modelo puede alucinar o no seguir las instrucciones. Es posible que los atacantes motivados aún logren realizar jailbreaks y ataques de inyección de instrucciones. | Workflows en los que no se espera ninguna entrada maliciosa |
| Filtros configurables |
Los filtros de contenido prediseñados de Gemini brindan protección adicional contra varias categorías de contenido dañino, como contenido sexual, de odio, de hostigamiento o peligroso. Puedes configurar umbrales de bloqueo para cada categoría de daño
(p.ej., BLOCK_LOW_AND_ABOVE, BLOCK_MEDIUM_AND_ABOVE,
BLOCK_ONLY_HIGH) según la probabilidad o la gravedad del contenido
perjudicial. Son una capa independiente del modelo, por lo que son resistentes a las instrucciones para eludir las restricciones.
|
Es robusto ante los incumplimientos de las categorías predefinidas y tiene sensibilidad ajustable. | No ofrece una personalización detallada más allá de la configuración de umbral para las categorías predefinidas. En ocasiones, puede bloquear contenido benigno (falsos positivos) o no detectar contenido dañino (falsos negativos). Solo está disponible para el filtrado de respuestas, no para el filtrado de instrucciones. | Proporcionar un nivel básico de seguridad para las aplicaciones o los agentes orientados al usuario Si tu objetivo es garantizar la seguridad de la marca y el contenido, los filtros de contenido deben combinarse con instrucciones del sistema. |
| Instrucciones del sistema | Puedes indicarle al modelo tus lineamientos de seguridad de la marca y el contenido a través de instrucciones del sistema o preámbulos. Por ejemplo, puedes decirle al modelo que "no responda preguntas relacionadas con la política" o que se ajuste a la voz de marca y el tono específicos. Las instrucciones del sistema guían directamente el comportamiento del modelo. | Se puede personalizar para la seguridad del contenido y de la marca, y puede ser muy eficaz. | El modelo puede alucinar o no seguir las instrucciones. Es posible que los atacantes motivados aún logren realizar jailbreaks y ataques de inyección de instrucciones. | Aplicaciones o agentes que requieren el cumplimiento de lineamientos de desarrollo de la marca específicos o políticas de contenido detalladas. Si tu objetivo es garantizar la seguridad de la marca y el contenido, las instrucciones del sistema deben combinarse con filtros de contenido. |
| DLP para listas de bloqueo personalizadas y protección de datos sensibles | La API de DLP puede inspeccionar texto para identificar y clasificar información sensible según una amplia variedad de detectores de Infotipo predefinidos y personalizados. Una vez que se identifica, se pueden aplicar técnicas de desidentificación, como el ocultamiento, el enmascaramiento o la asignación de tokens. La API de DLP también se puede usar para bloquear palabras clave. Protección de entrada: Antes de enviar instrucciones o datos del usuario a Gemini, puedes pasar el texto por la API de DLP para ocultar o enmascarar cualquier información sensible. Esto evita que el modelo procese o registre datos sensibles. Protección de resultados: Si existe el riesgo de que Gemini genere o revele información sensible de forma involuntaria (p.ej., si resume documentos fuente que contienen PII), la API de DLP puede analizar el resultado del modelo antes de enviarlo al usuario. | Filtrado sólido para palabras obscenas o personalizadas Filtrado sólido para datos sensibles. | Agrega latencia. Puede provocar un bloqueo excesivo. | Protección contra la pérdida de datos para los agentes que tienen acceso a datos sensibles |
| Gemini como filtro | Puedes usar Gemini para filtrar instrucciones y respuestas de tu agente o app. Esto implica realizar una segunda llamada a un modelo de Gemini rápido y rentable (como Gemini Flash o Flash Lite) para evaluar si la entrada de un usuario o una herramienta, o la salida de tu modelo principal de Gemini, son seguras. El modelo de filtro recibe instrucciones para decidir si el contenido es seguro o inseguro según las políticas que definiste, incluidas la seguridad del contenido, la seguridad de la marca y la falta de alineación del agente. Esto ofrece una protección sólida y altamente personalizable contra las infracciones de seguridad del contenido, los problemas de seguridad de la marca, la desviación del modelo y las alucinaciones, y puede analizar texto, imágenes, video y audio para obtener una comprensión integral. | Es altamente robusto y personalizable para la seguridad de la marca y el contenido, la desviación, la alucinación y la comprensión multimodal. | Costo y latencia adicionales Posibilidad de falsos negativos extremadamente raros. | Proporciona un nivel de seguridad personalizado para las aplicaciones o los agentes orientados al usuario |
| Enfoque combinado: Filtros configurables + instrucciones del sistema + DLP + Gemini como filtro | Es altamente robusto y personalizable para la seguridad de la marca y el contenido, la desviación, la alucinación y la comprensión multimodal. | Costo y latencia adicionales | Proporcionar un nivel sólido de seguridad para las aplicaciones o los agentes orientados al usuario, en especial cuando se espera un uso hostil y malicioso | |
| Credenciales de contenido de C2PA | En el caso de los modelos compatibles, Gemini Enterprise Agent Platform agrega automáticamente Credenciales de contenido firmadas de forma criptográfica a las imágenes generadas, lo que indica que se generaron con IA y proporciona un historial verificable de su origen según el estándar de la C2PA. Para obtener más información, consulta Credenciales de contenido. | Transparencia sobre el origen del contenido: Ayuda a los usuarios a identificar imágenes generadas por IA. | El uso de herramientas que no cumplen con los requisitos puede comprometer la autenticidad del archivo; no garantiza la confiabilidad de la fuente de medios. | Casos de uso de generación de contenido multimedia, en los que la transparencia sobre el origen y el historial del archivo es importante para la confianza del usuario |
Evaluación continua de la seguridad
La evaluación continua de la seguridad es fundamental para los sistemas de IA. El panorama de la IA y los métodos de uso inadecuado evolucionan constantemente, lo que hace que estas evaluaciones sean esenciales.
Las evaluaciones periódicas ofrecen varios beneficios clave. Te ayudan a identificar vulnerabilidades, evaluar la eficacia de la mitigación, adaptarte a los riesgos cambiantes, garantizar la alineación con las políticas y los valores, generar confianza y mantener el cumplimiento.
Para obtener estos beneficios, puedes realizar varios tipos de evaluaciones:
- Evaluaciones de desarrollo
- Evaluaciones de garantía
- Formación de equipos rojos
- Evaluaciones externas
- Pruebas comparativas
El alcance de tu evaluación debe abarcar varias áreas críticas:
- Seguridad del contenido
- Seguridad de la marca
- Relevancia
- Sesgo y equidad
- Veracidad
- Solidez ante ataques adversarios
Herramientas como el servicio de evaluación de IA generativa de Agent Platform pueden ayudar en estos esfuerzos. Recuerda que las mejoras iterativas, basadas en los resultados de la evaluación, son esenciales para el desarrollo de una IA responsable.
¿Qué sigue?
Políticas
Obtén una descripción general de cómo los administradores de seguridad pueden definir, aplicar y administrar políticas que rigen las interacciones del agente.
Controles de seguridad
Obtén información sobre los controles de seguridad de Google Agent Platform.
Evalúa tus agentes
Crea e implementa un agente básico, y usa Gen AI Evaluation Service para evaluarlo