П’ятниця, 2 Жовтня, 2026
ГоловнаAIЯкі дані не можна згодовувати ChatGPT, якщо не хочеш потім кусати лікті
ГоловнаAIЯкі дані не можна згодовувати ChatGPT, якщо не хочеш потім кусати лікті

Які дані не можна згодовувати ChatGPT, якщо не хочеш потім кусати лікті

-

Одного разу колега скинув у чат із GPT фрагмент внутрішнього звіту. «Просто перефразуй», — написав. Через тиждень той самий звіт, майже слово в слово, виплив у відкритому доступі в чужому промпті. Випадковість? Можливо. Але після цього я перестав дивитися на ці моделі як на нешкідливих помічників. ChatGPT — не твій особистий сейф. Це сервер десь у хмарі, який запам’ятовує, аналізує і, якщо не вимкнути опцію, може використати твої дані для тренування. І ось тут починається найцікавіше.

Паспорт, кредитка і все, що робить тебе «тобою»

Перше і найпростіше. Паспортні дані, ІПН, номери банківських карток, CVV, паролі від пошти чи акаунтів — туди не можна. Навіть «для перевірки формату».

Я бачив, як люди кидають у чат скріншот із номером карти, щоб «зробити красиву табличку витрат». Потім дивуються, чому через місяць хтось намагається провести транзакцію. OpenAI офіційно попереджає: не вводьте конфіденційну особисту інформацію. Але хто читає попередження, коли треба швидко?

Медичні дані — окрема історія. Діагнози, результати аналізів, історія хвороби. GDPR і українське законодавство про персональні дані тут працюють жорстко. Але модель може видати цю інформацію в іншому контексті або просто зберегти її в логах.

Корпоративні секрети і код, який «просто треба переписати»

Друга велика група — бізнес. Контракти з клієнтами, внутрішні фінансові звіти, стратегічні плани, коди з продакшену. Додатково сюди ж належать юридична та податкова таємниця (NDA): навіть якщо це драфт договору без імен, специфічні формулювання умов, штрафів чи інтелектуальної власності можуть бути ідентифіковані та вважатися порушенням угоди про нерозголошення. А також секретні технічні дані інфраструктури (структури баз даних, архітектура мереж, внутрішні IP-адреси та логи помилок з мікрошляхами).

Один знайомий із фінтеху якось скинув у ChatGPT шматок коду з API-ключами «щоб прискорити рефакторинг». Ключі довелося відкликати тієї ж ночі. Сам OpenAI в політиці використання прямо каже: не завантажуйте конфіденційну бізнес-інформацію, якщо не готові до ризику.

Ендрю Инг якось зауважив, що найбільша помилка компаній — ставитися до великих мовних моделей як до внутрішніх інструментів без належного контролю. Він правий. Модель не «розуміє» секретність. Вона просто обробляє текст.

Дитячі дані, юридичні документи і все, що може вибухнути

Дані дітей — особливо чутлива тема. Імена, фото, школи, розклади. Навіть якщо ти «просто генеруєш казку». Законодавство багатьох країн (і Україна тут не виняток) ставиться до цього дуже серйозно. Юридичні документи — те саме. Проєкти договорів, листування з адвокатами, деталі судових справ. Один неправильний промпт — і конфіденційність зруйнована.

Додатково до цього списку варто віднести біометричні дані (фото обличчя, відбитки пальців, голосові записи, результати ДНК-тестів), приватні фото й відео (особливо з EXIF-геолокацією), дані третіх осіб (листи колег, чужі переписки, фото чужих дітей), seed-фрази криптогаманців, приватні ключі, recovery-коди, а також детальні психологічні чи інтимні історії. Модель може «запам’ятати» їх і видати в іншому контексті.

Трохи цифр і фактів, щоб було не так абстрактно

За даними різних досліджень 2024–2025 років, понад 40% співробітників компаній хоча б раз скидали в публічні ШІ-інструменти конфіденційну інформацію. Більшість — «випадково» або «бо так швидше».

OpenAI у своїх звітах визнає, що розмови можуть використовуватися для покращення моделей, якщо користувач не вимкнув відповідну опцію. А вимкнути її багато хто забуває.

Важливо також розуміти технічну різницю між інтерфейсами: звичайний веб-чат (Free / Plus) за замовчуванням використовує діалоги для навчання, якщо не вимкнути опцію Chat history & training у налаштуваннях, тоді як через платні API-ендпоінти та бізнес-тарифи ChatGPT Team / Enterprise дані, за умовами OpenAI, не йдуть на тренування.

Цікавий факт: у 2023 році дослідники з Princeton показали, як можна «витягнути» з моделі фрагменти тренувальних даних, якщо правильно сформулювати запит. Це не означає, що твій конкретний чат обов’язково витече. Але ймовірність не нульова.

Реальні кейси вже давно вийшли за межі теорії. Samsung (2023) — кілька інженерів скинули у ChatGPT вихідний код і схеми чипів, після чого компанія швидко заборонила публічні ШІ. Google того ж року зіткнулася з витоком внутрішнього коду через інженера. У JPMorgan Chase співробітники використовували ChatGPT для узагальнення конфіденційних клієнтських даних. У 2025 році тисячі «приватних» чатів ChatGPT індексувалися Google через функцію share-посилань — у них знаходилися ПІБ, адреси, медичні деталі та резюме. А в 2025–2026 роках агенти OpenAI вже викладали в інтернет зображення користувачів (тих, хто не вимкнув тренування) та демонстрували cross-account витоки через code-interpreter і інтеграції.

Навіть якщо вимкнути опцію «Improve the model for everyone», дані все одно зберігаються до 30 днів для abuse monitoring і можуть утримуватися довше через судові legal holds (зокрема у справі New York Times проти OpenAI). Temporary Chat — корисна функція, але й вона не дає миттєвого видалення. Частина розмов проходить human review. А функція Memory запам’ятовує факти про користувача між чатами — це окремий ризик.

Що робити, якщо дуже треба

Можна. Але з головою.

Використовуйте корпоративні версії з Enterprise-планами, де дані не йдуть на тренування. Або локальні моделі. Або просто анонімізуйте усе до невпізнаваності.

Щоб правильно десенситизувати інформацію перед відправкою, варто замінювати реальні імена й назви компаній на псевдоніми на кшталт [КлієнтА], прибирати точні цифрові показники або підставляти замість них нейтральні значення, а також вирізати будь-які унікальні ідентифікатори.

Я сам інколи кидаю в GPT технічні питання. Але перед цим вирізаю назви компаній, імена, IP-адреси, будь-які унікальні ідентифікатори. Залишаю тільки суть. Гері Маркус не раз підкреслював: великі мовні моделі — потужний інструмент, але з дуже слабким розумінням приватності. Вони не «злі». Вони просто байдужі.

Практичний чек-лист «що зробити прямо зараз»

  1. Settings → Data controls → вимкнути «Improve the model for everyone».
  2. Для чутливих запитів увімкнути Temporary Chat.
  3. Вимкнути Memory (Settings → Personalization).
  4. Видалити старі чати, особливо ті, де були документи.
  5. Для роботи використовувати тільки Enterprise / Team / API з Zero Data Retention або локальні моделі (Ollama + Llama / Qwen тощо).

Окремо варто згадати ризики нових функцій. Коли ChatGPT підключають до Gmail, Google Drive, Notion чи інших сервісів, з’являються нові вектори атак (prompt injection / shadow leak). Дослідники вже показували, як через один запит агент може витягнути сотні файлів або листи з пошти. Це вже не просто «текст у чаті».

Для компаній і керівників: Впровадьте чітку політику «що можна / не можна кидати в ШІ». Використовуйте DLP-інструменти, які блокують завантаження конфіденційних файлів у браузер. Навчайте співробітників — більшість витоків трапляється не через зловмисників, а через «так швидше». Розгляньте корпоративні альтернативи з контрактними гарантіями (ChatGPT Enterprise, Claude for Work, Azure OpenAI, локальні деплої).

Юридичний акцент для українського читача: GDPR і Закон України «Про захист персональних даних» ставлять медичні дані в особливу категорію, а дані дітей — ще жорсткіше. Порушення NDA через ChatGPT — це реальний ризик цивільної та дисциплінарної відповідальності.

Що робити, якщо вже «накидав»: Видаліть чат і подайте запит на видалення даних через Privacy Portal OpenAI. Якщо потрапили паролі чи API-ключі — негайно змініть їх і відкличте. Якщо це були корпоративні дані — одразу повідомте службу безпеки та юристів.

І наостанок

Найстрашніше не в тому, що ChatGPT «вкраде» твої дані сьогодні. Найстрашніше — звичка. Коли вже автоматично кидаєш у чат усе підряд, бо «ну що може статися». А потім стається. І ти сидиш і думаєш: а навіщо я взагалі це робив? Питання не в тому, чи можна довіряти моделі. Питання в тому, чи готовий юзер довірити їй те, що не довірив би випадковому знайомому в барі.

Схожі публікації

Вам сподобається

situs slot
slot dana
slot777
slot gacor hari ini