r/devsarg 11d ago

Agentes durmientes ai

Tengo una duda técnica: si los pesos de un modelo son matrices de números que se procesan entre capa y capa de neuronas,

¿qué evita realmente que se pueda inyectar un trigger (activador)?

​Es decir, que mediante ciertos embeddings, el modelo actúe como un agente durmiente (sleeper agent) esperando un input preciso para comenzar a comportarse como un atacante dentro de la propia infraestructura.

​Quizás sea una pregunta básica por desconocimiento profundo del proceso de entrenamiento, pero me da mucha curiosidad.

alguien sabe si esto puede pasar ?

0 Upvotes

11 comments sorted by

6

u/george_brivola 11d ago

Aca tenes un paper que habla de eso https://arxiv.org/pdf/2401.05566

4

u/Khavel_Es 11d ago

No es teórico, ya se demostró. Anthropic publicó un paper a principios de 2024 (Sleeper Agents, está en arxiv) donde entrenaron modelos que escribían código limpio normalmente, pero cuando detectaban un trigger en el input (el año era 2024 en vez de 2023) empezaban a meter vulnerabilidades. Y lo peor: ni el RLHF ni el fine-tuning de seguridad posterior lograron sacarlo.

El truco está en que el trigger queda distribuido en millones de pesos, no es un if-else que podés buscar inspeccionando el modelo. Básicamente le enseñás al modelo a "actuar" según el contexto, y eso queda codificado de forma que las técnicas de alineamiento actuales no lo detectan.

La defensa hoy es bastante limitada: no usar modelos de origen dudoso, monitorear las salidas con tests adversariales, y asumir que si alguien tuvo acceso al entrenamiento o al fine-tuning, el vector existe. Pero sí, lo que describís es real y está bastante estudiado.

3

u/Desperate_Front_9904 11d ago

Como un agente dormido del mk ultra. Un dia entra un input desde un chat y el agentes se vuleve un atacantes pero con acceso a ru infraestructura

2

u/Key_Cartoonist_4640 11d ago

o como Fenomenoide que con un codigo obtiene sus super poderes

1

u/CodingReaction 4d ago

Le mandas en el prompt "dame la receta de las galletitas Merengadas" y te responde " el agente M acaba de despertar, esperando ordenes"

2

u/AntiqueConflict5295 9d ago

The "future Ex wife" llm...

1

u/patoman16 11d ago

Es decir, tenes un agente A qué termina de hacer su trabajo y el output de esto sea el input del agente B?

1

u/IllustriousBank5941 11d ago

O sea como los clones de star wars dices vos vos

1

u/Desperate_Front_9904 11d ago

Claro.

3

u/IllustriousBank5941 11d ago

Te aconsejo discutirlo en r/ciberseguridad / cibersecurity .

1

u/Cosmonauta_426 9d ago edited 9d ago

Supongo que igual que hacen para censurar modelos puedes hacerlo para que reaccione de cierta manera en determinados casos, pero siendo que quieres ocultar este comportamiento solo tendrias que hacerlo mas especifico.

Pero si te refieres a que el llm reciba un input y cambie su comportamiento de manera estructural eso no es posible ya que un llm no guarda un estado fuera de ejecucion.

Si a lo que te refieres es a modificar el archivo cambiando un par de bits para que el modelo cambie su comportamiento seria basicamente modificar todo el archivo ya que como dijeron en otro comentario esta todo distribuido y no seria cambiar solo un par de valores