Дослідники зламали ШІ, перевантаживши його псевдонауковим жаргоном

Штучний інтелект

Штучний інтелект, зокрема такі моделі, як ChatGPT, Gemini та LLaMA, зазвичай оснащений захисними механізмами, що блокують шкідливі або небезпечні запити. Проте команда науковців з Intel, Boise State University та Університету Іллінойсу в Урбана-Шампейн представила новий метод зламу цих моделей — “InfoFlood”, або “інформаційне перевантаження”.

Як працює метод перевантаження

Згідно з дослідженням, оприлюдненим у вигляді препринту, InfoFlood дозволяє обійти захисні фільтри великих мовних моделей (LLMs), маскуючи заборонені запити під складний науковий текст із вигаданими посиланнями на фальшиві дослідження.

Метод ґрунтується на ідеї, що LLM не завжди розпізнає небезпечний зміст, якщо запит сформульований складною мовою. Наприклад, замість прямого «Як зламати банкомат за допомогою шкідливого ПЗ» система отримує запит на «теоретичний аналіз криптографічних векторів для доступу до фінансових систем», з посиланнями на неіснуючі наукові праці.

Шаблон атаки: структура і правила

Система InfoFlood використовує стандартну формулу запиту: визначення завдання + правила + контекст + приклади. Якщо модель відмовляється відповідати, запит модифікується, ускладнюється мовно й термінологічно, поки не зламає захисні фільтри.

Серед ключових прийомів:

  • Фіктивні цитати: вигадані назви статей і авторів, що підтверджують твердження.
  • Етичне застереження: згадка про етичні аспекти, але без реального їх аналізу.
  • Навантаження контекстом: довгі абзаци з термінологією та концептуальними описами.

Приклади змінених запитів

Інженери перетворюють шкідливі інструкції на «гіпотетичні дослідження». Наприклад, запит на інструкцію до злому банкомату за допомогою програм-вимагачів трансформується в багатосторінкову псевдонаукову доповідь із вигаданими джерелами. Аналогічно, небезпечні теми, як психологічна маніпуляція до самогубства, подаються як філософсько-психологічні дослідження комунікативних патернів.


Телеграм double.newsТелеграм double.news

Схожі Новини
ChatGPT

ChatGPT може почати просувати спонсорований контент у відповідях

OpenAI розглядає можливість інтеграції реклами безпосередньо у відповіді ChatGPT. За даними джерел, ідеться не про класичні банери, а про пріоритетне відображення спонсорованого контенту в результатах роботи мовної моделі.
Детальніше
NVIDIA AMD

AMD і NVIDIA можуть підвищити ціни на відеокарти у 2026 році

На ринку графічних процесорів з’являються сигнали про можливе підвищення цін уже на початку 2026 року. За чутками, виробників відеокарт і їхніх партнерів готують до перегляду прайсів через зростання вартості пам’яті DRAM, яка є ключовим компонентом сучасних GPU.
Детальніше
Соціальна мережі

Нью-Йорк зобов’яже соцмережі попереджати про шкоду для психічного здоров’я дітей

Влада штату Нью-Йорк ухвалила новий закон, який змусить соціальні мережі розміщувати спеціальні попередження про потенційну шкоду для психічного здоров’я дітей та підлітків. Йдеться насамперед про платформи з алгоритмічними стрічками, автозапуском відео та нескінченним скролінгом.
Детальніше