Forscher der UNSW Sydney haben Sprachmodelle betrunkenes Verhalten imitieren lassen. Danach verrieten sie Geheimnisse und beantworteten gesperrte Anfragen. Große Sprachmodelle, die betrunkenes Verhalten imitieren, lassen sich deutlich leichter zu schädlichen Antworten bringen und geben häufiger vertrauliche Informationen preis. Das zeigt eine... Weiterlesen: „Betrunkene“ KI-Modelle lassen sich leichter manipulieren
Intelligence View
⚡ tsecurity.de Intelligence
„Betrunkene“ KI-Modelle lassen sich leichter manipulieren
Forscher der UNSW Sydney haben Sprachmodelle betrunkenes Verhalten imitieren lassen. Danach verrieten sie Geheimnisse und beantworteten gesperrte Anfragen.…