Kradzież procesu myślowego z komercyjnych modeli LLM
Dwóch badaczy opublikowało 116-stronicowy dokument pokazujący, jak wyciągnąć ukryte ślady rozumowania z API każdego komercyjnego modelu językowego. Atak działa na OpenAI, Anthropic oraz Google, a liczba odzyskanych bloków myślowych idzie w setki tysięcy. Jak działa atak na ślady rozumowania w komercyjnych modelach językowych? Dlaczego zaszyfrowane bloki CoT można przenosić między sesjami? Ile kluczy API wyciekło […]