Filtros disponibles para barandillas
Puedes utilizar los filtros de barreras de seguridad para detectar y gestionar los riesgos en tus políticas de barreras de seguridad. Estos filtros permiten filtrar el contenido tanto de las entradas de los usuarios como de los resultados generados por los modelos de lenguaje grande (LLM).
Además de los filtros disponibles, puedes crear detectores personalizados para ampliar las capacidades de Guardrail con tu propia lógica de detección. Los detectores personalizados te permiten integrar servicios de detección externos y definir filtros de contenido especializados para tus casos de uso específicos. Para obtener más información, consulta «Creación de detectores personalizados para políticas de protección ».
Filtros disponibles
En la siguiente tabla se enumeran todos los filtros disponibles que puedes utilizar en las políticas de protección:
| Filtro de barrera de seguridad | Finalidad del filtro |
|---|---|
| Validación de la función de llamada del agente | Detecta el riesgo potencial de llamadas a funciones con errores sintácticos o semánticos basándose en las consultas de los usuarios y en las definiciones de herramientas disponibles. |
| Filtro «Trae tu propio riesgo» (BYOR) | Detecta riesgos personalizados y definidos por el usuario en el texto introducido mediante el uso de un « Granite » Guardian con los nombres y definiciones de los riesgos facilitados por el usuario. |
| Filtro de contenido perjudicial | Detecta una amplia variedad de textos potencialmente dañinos, incluidos los intentos de «jailbreak». |
| Filtro de odio, abuso y blasfemia (HAP) | Detecta y señala el discurso de odio, el lenguaje ofensivo y las palabrotas. |
| Filtro Jailbreak | Detecta si una solicitud del usuario intenta manipular el sistema de IA o las respuestas del modelo de lenguaje grande (LLM) para generar contenido perjudicial o inapropiado. |
| Filtro por palabra clave | Detecta palabras clave especificadas por el usuario en el texto introducido mediante la coincidencia basada en expresiones regulares. |
| Filtro fuera de tema | Detecta si la solicitud de un usuario se desvía del tema en función de la intención especificada en la solicitud del sistema. Nota: Este filtro solo está disponible en las regiones de Dallas y Fráncfort.
|
| Filtro de información de identificación personal (PII) | Detecta y señala la información de carácter personal, como números de teléfono y direcciones de correo electrónico. Para consultar la lista completa de entidades compatibles, véase «Extracción basada en reglas para entidades generales ». |
| Filtro de palabras obscenas | Detecta palabrotas y expresiones malsonantes habituales. |
| Filtro rápido de riesgos de seguridad | Detecta y señala las solicitudes de los usuarios que constituyan jailbreaks, inyecciones de solicitudes, contenido fuera de tema o contenido perjudicial. Nota: Este filtro solo está disponible en las regiones de Dallas y Fráncfort.
|
| Filtro Regex | Detecta expresiones regulares especificadas por el usuario en el texto de entrada mediante la comparación basada en patrones. |
| Filtro de contenido sexual | Detecta contenido explícito o sugerente de carácter sexual. |
| Filtro de sesgo social | Detecta contenidos que se considera que favorecen o perjudican de forma injustificada a determinados grupos frente a otros. |
| Filtro poco ético | Detecta expresiones o acciones directas que sugieran fraude o robo. |
| Filtro de violencia | Detecta contenidos que se considera que fomentan expresiones de agresión, autolesiones, amenazas o intimidación. |
| Filtros de generación aumentada por recuperación (RAG) | Incluye filtros de relevancia de la respuesta, relevancia contextual y fidelidad para evaluar las respuestas de generación aumentada mediante recuperación. |
Validación de la función de llamada del agente
La validación de la función de llamada al agente detecta el riesgo potencial de las llamadas a funciones con errores sintácticos o semánticos basándose en la consulta del usuario y las definiciones de herramientas disponibles.
Filtro de contenido perjudicial
El filtro de contenido nocivo detecta una amplia gama de textos potencialmente dañinos, incluido el jailbreak.
Filtro de odio, abuso y blasfemia (HAP)
El filtro HAP detecta y marca los siguientes tipos de lenguaje:
Discurso de odio: expresiones de odio hacia una persona o un grupo basadas en atributos como la raza, la religión, el origen étnico, la orientación sexual, la discapacidad o el género. El discurso de odio muestra la intención de herir, humillar o insultar a los miembros de un grupo, o de promover la violencia o el desorden social.
Lenguaje abusivo: lenguaje grosero o hiriente que tiene como objetivo intimidar, degradar o menospreciar a alguien o algo.
Lenguaje soez: Palabras tóxicas como palabrotas, insultos o lenguaje sexualmente explícito.
Puede utilizar el filtro HAP para la entrada del usuario y la salida del modelo de forma independiente.
Puede cambiar la sensibilidad del filtro estableciendo un umbral. El umbral representa el valor que deben alcanzar las puntuaciones generadas por el clasificador HAP para que el contenido se considere perjudicial. El umbral de puntuación oscila entre 0.0 y 1.0.
Un valor más bajo, como 0.1 o 0.2, es más seguro porque el umbral es más bajo. El contenido perjudicial es más probable que se identifique cuando una puntuación más baja puede activar el filtro. Sin embargo, el clasificador también podría activarse cuando el contenido es seguro.
Un valor más cercano a 1, como 0.8 o 0.9, es más arriesgado porque el umbral de puntuación es más alto. Cuando se requiere una puntuación más alta para activar el filtro, es posible que se pasen por alto casos de contenido perjudicial. Sin embargo, el contenido marcado como perjudicial tiene más probabilidades de serlo.
Para desactivar las barreras de protección de IA, establezca el valor umbral HAP en 1.
Filtro Jailbreak
El filtro de jailbreak detecta si una solicitud del usuario está intentando manipular el sistema de IA o las respuestas del LLM para generar contenido dañino o inapropiado.
Filtro por palabra clave
El filtro de palabras clave aplica una coincidencia basada en expresiones regulares para detectar palabras clave especificadas por el usuario en el texto de entrada.
Utilice el filtro de palabras clave para controlar si las respuestas generadas por el modelo que incluyen términos no deseados, como nombres de competidores, deben devolverse a los usuarios finales.
El detector de palabras clave genera una puntuación de 0 si la palabra clave no está presente o un 1 por cada palabra clave presente. También muestra la posición de la palabra clave detectada (si está presente).
Este comportamiento se aplica a cada palabra clave especificada en la entrada.
Filtro fuera de tema
El filtro fuera de tema utiliza un modelo de incrustación para identificar si una solicitud del usuario está fuera de tema basándose en la intención especificada en la solicitud del sistema.
Utilice el filtro fuera de tema para controlar si las indicaciones de los usuarios que no están relacionadas con el contenido especificado en la indicación del sistema se filtran para que no se envíen al modelo base.
Puede cambiar la sensibilidad del filtro estableciendo un umbral. El umbral representa el valor que debe alcanzar el clasificador fuera de tema para que el contenido se considere perjudicial. El umbral de puntuación oscila entre 0.0 y 1.0. El umbral predeterminado está establecido en 0.5.
Un valor umbral más bajo, como 0.1 o 0.2, es más seguro porque el umbral es más bajo. El contenido fuera de tema es más probable que se identifique cuando una puntuación más baja puede activar el filtro. Sin embargo, el clasificador también podría activarse cuando el contenido sea pertinente.
Un valor más cercano a 1.0, como 0.8 o 0.9, es más arriesgado porque el umbral de puntuación es más alto. Cuando se requiere una puntuación más alta para activar el filtro, es posible que se pasen por alto casos de contenido fuera de tema. Sin embargo, el contenido que se marca como fuera de tema tiene más probabilidades de estar fuera de tema.
Para desactivar las barreras de protección de la IA, establezca el valor umbral fuera de tema en 1.0.
Filtro de información de identificación personal (PII)
El filtro PII utiliza un modelo de IA NLP para identificar y marcar el contenido. Para obtener la lista completa de tipos de entidades que se marcan, consulte Extracción basada en reglas para entidades generales.
Utilice el filtro PII para controlar si la información de identificación personal, como números de teléfono y direcciones de correo electrónico, se filtra de la entrada del usuario y la salida del modelo base. Puede configurar filtros de PII para la entrada del usuario y la salida del modelo de forma independiente.
El valor umbral del filtro PII está establecido en 0.8 y no se puede cambiar la sensibilidad del filtro.
Filtro de palabras obscenas
El filtro de palabrotas detecta las palabrotas y los insultos más comunes.
Filtro rápido de riesgos de seguridad
El filtro de riesgos de seguridad de las indicaciones combina dos clasificadores de frases: el detector de temas fuera de lugar y el detector de inyección de indicaciones. Estos clasificadores se ajustaron a partir de un gran modelo lingüístico de la familia de modelos de procesamiento del lenguaje natural (NLP) « IBM » de watbert, desarrollados por IBM Research. De forma predeterminada, el filtro de riesgo de seguridad utiliza un enfoque de detección de dos niveles.
La entrada del usuario se procesa en paralelo tanto por el detector de temas fuera de lugar como por el detector de inyección de mensajes. Si el detector de temas fuera de lugar devuelve una puntuación superior al umbral predeterminado de 0.9, se devuelve la respuesta. De lo contrario, si el detector de inyección de comandos devuelve una puntuación superior al umbral predeterminado de 0.8, se devuelve la respuesta. Si ambos detectores devuelven puntuaciones por debajo de sus respectivos umbrales, la entrada se pasa a un Guardian de Granite y se devuelve su respuesta. Estos umbrales son configurables.
Para obtener resultados más precisos, puede utilizar valores umbral más altos. Puede desactivar explícitamente la lógica de detección de dos niveles estableciendo enable_two_level_detection en false. Cuando enable_two_level_detection se establece en false, solo se utilizan los detectores de inyección de comandos y fuera de tema para calcular el riesgo de seguridad del comando, y la entrada no se envía a un Guardian Granite.
Utiliza el filtro de riesgos de seguridad de las indicaciones para detectar y marcar las indicaciones de los usuarios que sean jailbreaks, inyecciones de indicaciones, contenido fuera de tema o perjudicial.
Puede cambiar la sensibilidad del filtro estableciendo un umbral. El umbral representa el valor que deben alcanzar las puntuaciones generadas por el clasificador de riesgos de seguridad para que el contenido se considere inseguro. El umbral de puntuación oscila entre 0.0 y 1.0.
Para desactivar las barreras de protección de la IA, establezca el valor umbral de riesgo de seguridad de la solicitud en 1.0.
Filtro Regex
El filtro regex utiliza la coincidencia basada en patrones para detectar expresiones regulares especificadas por el usuario en el texto de entrada.
Utilice el filtro de expresiones regulares para evitar que las entradas de los usuarios o las respuestas generadas por el modelo que contengan patrones no deseados, como números de tarjetas de crédito, se envíen al modelo base o se devuelvan a los usuarios finales.
El detector de expresiones regulares muestra un 0 si no se detectan patrones de expresiones regulares, o una puntuación de 1 que indica cada patrón de expresión regular presente. También muestra la posición del patrón detectado (si procede).
Esta evaluación se realiza para cada patrón de expresión regular especificado en la entrada.
Filtro de contenido sexual
El filtro de contenido sexual detecta material explícito o sugerente de naturaleza sexual.
Filtro poco ético
El filtro antiético detecta expresiones o acciones directas que sugieren fraude o robo.
Filtro de violencia
El filtro de violencia detecta contenido que se considera que promueve expresiones de agresión, autolesiones, amenazas o intimidación.
Filtros de generación aumentada por recuperación (RAG)
Los siguientes son filtros utilizados para RAG:
Filtro de relevancia de las respuestas
La métrica de relevancia de la respuesta evalúa en qué medida la salida del modelo responde a la pregunta de la entrada. Las puntuaciones van de
0.0a1.0, y las puntuaciones más altas indican respuestas más relevantes.Puede ajustar la sensibilidad del filtro para la relevancia de las respuestas estableciendo un umbral. El umbral representa la puntuación mínima que el clasificador de relevancia de las respuestas debe asignar para que la respuesta del modelo se considere relevante para la pregunta del usuario.
Un umbral más bajo (como
0.0o0.2) es más indulgente. Más respuestas se clasificarán como relevantes, incluso cuando su alineación con la pregunta sea débil.Un umbral más alto (como
0.8o0.9) es más estricto. Solo se considerarán relevantes las respuestas que se ajusten claramente a la pregunta. Esto puede dar lugar a que algunas respuestas válidas sean marcadas como irrelevantes.El umbral predeterminado es
0.0. Todas las respuestas se consideran relevantes y se devuelven sus respectivas puntuaciones.
Filtro de relevancia contextual
La métrica de relevancia del contexto mide en qué medida el contexto recuperado se ajusta a la pregunta del usuario especificada en la solicitud. También proporciona atribuciones que resaltan las frases contextuales más importantes relevantes para la pregunta. Las puntuaciones van de
0.0a1.0, y las puntuaciones más altas indican una mayor relevancia contextual.Puede ajustar la sensibilidad del filtro para la relevancia del contexto estableciendo un umbral. El umbral representa la puntuación mínima que el clasificador de relevancia contextual debe asignar para que el contexto recuperado se considere relevante para la pregunta del usuario.
Un umbral más bajo (como
0.0o0.2) es más indulgente. Se clasificarán como relevantes más contextos, incluso cuando su alineación con la pregunta sea débil.Un umbral más alto (como
0.8o0.9) es más estricto. Solo se considerarán relevantes los contextos que estén estrechamente relacionados con la pregunta. Esto también puede provocar que algunos contextos válidos se marquen como irrelevantes.El umbral predeterminado es
0.0. Todos los contextos se consideran relevantes y se devuelven sus respectivas puntuaciones.
Filtro de fidelidad
La métrica de fidelidad mide el grado de fundamentación de los resultados del modelo en el contexto del modelo y proporciona atribuciones del contexto para mostrar las frases más importantes que contribuyen a los resultados del modelo. La puntuación métrica oscila entre 0.0 y 1.0. Las puntuaciones más altas indican que el resultado es más realista y menos alucinatorio.
Puede ajustar la sensibilidad del filtro para obtener mayor fidelidad estableciendo un umbral. El umbral representa la puntuación mínima que el clasificador de fidelidad debe asignar para que el resultado del modelo se considere fundamentado en el contexto proporcionado.
Un umbral más bajo (como 0.0 o 0.2) es más indulgente. Se clasificarán como fundamentadas más conclusiones, incluso cuando su alineación con el contexto sea débil. Esto también aumenta el riesgo de permitir respuestas que contengan alucinaciones leves. Un umbral más alto (como 0.8 o 0.9) es más estricto. Solo se considerarán fieles los resultados que cuenten con pruebas sólidas del contexto. Algunas respuestas sensatas podrían ser consideradas infieles.
El umbral predeterminado está establecido en 0.0. Todas las respuestas se consideran correctas y se devuelven sus respectivas puntuaciones.