Zagrożenia·24 września 2026·6 min

W USA o trenowaniu AI na cudzych treściach rozstrzygnie sąd. W Polsce wolno je kopiować, dopóki właściciel praw tego nie zastrzeże

Odtajnione 17 września pismo New York Timesa cytuje dyrektora z Microsoftu o „kradzieży” i szefa ChatGPT o produktach zastępujących wydawców. Polski przepis ustawia ten spór inaczej: kopiowanie do eksploracji danych jest dozwolone, dopóki właściciel nie zapisze sprzeciwu w formie czytelnej dla programu.

Na skróty

  • 17 września do akt zbiorczej sprawy przeciw OpenAI i Microsoftowi w sądzie federalnym w Nowym Jorku (sygnatura 25-md-3143) trafiła publiczna wersja 92-stronicowego pisma New York Timesa i czterech innych wydawców, z odsłoniętymi cytatami.
  • Pismo cytuje Brenta Hechta z Microsoftu: wciąganie cudzej pracy do modeli to według niego „zdumiewająca kradzież na niespotykaną skalę”. Szef ChatGPT Nick Turley pisał, że produkty OpenAI są „w dużej mierze zamiennikiem”.
  • Microsoft odpowiada, że słowa Hechta wyrażają zdanie jednego pracownika i nie są analizą prawną. OpenAI twierdzi we własnym wniosku, że trenowanie służy innemu celowi niż artykuł i nie wyrządziło szkody, jaką prawo bierze pod uwagę.
  • W Polsce kopiowanie rozpowszechnionych utworów do eksploracji tekstów i danych jest dozwolone z mocy art. 26³ ustawy o prawie autorskim, chyba że uprawniony to zastrzegł. W internecie zastrzeżenie musi mieć format do odczytu maszynowego, wraz z metadanymi.
  • OpenAI, Microsoft, Google i Anthropic podpisały unijny kodeks praktyk i zobowiązały się używać robotów czytających plik robots.txt. Pismo wydawców zarzuca jednak OpenAI, że przez archiwum Common Crawl ominęło ten mechanizm.
  • Plik robots.txt nie chroni przed podróbkami. Większość kopii koszulek marki odzieżowej z Sydney zniknęła z Temu dopiero po zgłoszeniu naruszenia znaku towarowego.

Brent Hecht, dyrektor ds. nauk stosowanych w Microsofcie, przewidywał w wewnętrznym dokumencie, że miliony ludzi uznają wciąganie ich pracy do dużych modeli językowych za „zdumiewającą kradzież na niespotykaną skalę”. Od tych słów zaczyna się pismo, które New York Times i cztery inne wydawnictwa złożyły w Nowym Jorku przeciw Microsoftowi i OpenAI. Tam sędzia oceni, czy takie kopiowanie mieści się w fair use, amerykańskiej zasadzie pozwalającej w niektórych przypadkach korzystać z cudzych utworów bez zgody. W Polsce decyduje wcześniej właściciel treści.

Co ludzie OpenAI i Microsoftu pisali między sobą

Sprawa ma sygnaturę 25-md-3143 i toczy się przed sędzią Sidneyem H. Steinem w federalnym sądzie okręgowym dla Południowego Dystryktu Nowego Jorku. Łączy kilka pozwów. Pierwszy złożył Times w grudniu 2023. Wydawcy wnoszą o wyrok w trybie uproszczonym (summary judgment), czyli rozstrzygnięcie na podstawie dokumentów, bez pełnego procesu. Najmocniejsze fragmenty ich pisma były zaczernione do 17 września. Tego dnia pełnomocniczka Timesa przesłała sędziemu wersję odsłoniętą wszędzie tam, gdzie nikt nie wnosił o utajnienie.

Nick Turley, szef ChatGPT, pisał, że produkty OpenAI są dla wydawców „egzystencjalnym zagrożeniem” i „w dużej mierze zamiennikiem, kropka”, a będą nim coraz bardziej, w miarę jak będą lepsze. Satya Nadella, prezes Microsoftu, przyznał pod przysięgą, że rozmowa z czatem zastępuje wchodzenie do źródła. Hecht napisał, że wygrana pozwanych mogłaby „zrobić kompletną kpinę z idei »fair use«”. Dane pochodzą od samego Microsoftu. Odsetek kliknięć w linki do serwisów Timesa był w czacie Copilot o 87 do 93 procent niższy niż w zwykłej wyszukiwarce Bing.

„It is highly unusual that an end-product threatens the economic foundations of its essential suppliers, but that is the situation we have created for our LLM business with respect to its ‘content supply chain.’”
- Wewnętrzny dokument Microsoftu, cytowany w piśmie wydawców, Sprawa 25-md-3143, dokument 1977-1, 17 września 2026

Pozwani czytają te same fakty inaczej. OpenAI przekonuje we własnym wniosku, że artykuły powstały dla ludzkich czytelników, a trenowanie służyło czemuś innemu: wydobyciu ogólnych wzorców języka i wiedzy o świecie. Takie użycie jest według firmy „wysoce przekształcające” i nie wyrządziło szkody, jaką prawo bierze pod uwagę. Microsoft odpowiedział dziennikowi Financial Times, że słowa Hechta wyrażają zdanie jednego pracownika i nie są analizą prawną. Hecht jest badaczem i nie zasiada w zarządzie. Na początku września rząd USA poparł w tej sprawie tezę, że trenowanie na tekstach chronionych to fair use. Sędziowie w USA dotąd przeważnie ją przyjmowali. Pismo wydawców jest dokumentem strony: cytaty dobrali prawnicy, a załączniki z pełnym kontekstem pozostają utajnione.

Zamiast fair use jest wyjątek z prawem sprzeciwu

Fair use to ogólna zasada: amerykański sąd w każdej sprawie osobno waży cztery kryteria, w tym wpływ na rynek oryginału. Ciężar wykazania, że kopiowanie się w niej mieści, spoczywa na pozwanych. W Polsce jest inaczej. Ustawa o prawie autorskim wymienia wyjątki przepis po przepisie. Kopiowania do eksploracji danych dotyczy art. 26³, obowiązujący od 20 września 2024 i przenoszący art. 4 unijnej dyrektywy 2019/790. Wolno na jego podstawie zwielokrotniać rozpowszechnione utwory w celu eksploracji tekstów i danych, czyli automatycznej analizy, z której wychodzą wzorce, tendencje i korelacje, chyba że uprawniony zastrzegł inaczej.

Przy treściach w internecie przepis stawia warunek formy. Zastrzeżenie ma być wyraźne, w formacie przeznaczonym do odczytu maszynowego, wraz z metadanymi. Ustawa o otwartych danych opisuje taki format jako plik ustrukturyzowany tak, żeby program mógł rozpoznać i pobrać z niego dane. Konkretnego pliku ani protokołu przepis nie wymienia. Motyw 18 dyrektywy, a za nim uzasadnienie rządowego projektu z maja 2024, podają jako przykłady metadane i warunki korzystania ze strony.

Obowiązki po drugiej stronie nakłada unijne rozporządzenie o AI (AI Act). Jego art. 53 każe dostawcom modeli ogólnego przeznaczenia, czyli dużych modeli jak te za ChatGPT i Copilotem, prowadzić politykę przestrzegania prawa autorskiego i rozpoznawać zastrzeżenia właścicieli treści. Obowiązek działa od 2 sierpnia 2025. Motyw 105 dodaje, że po zastrzeżeniu dostawca potrzebuje zgody właściciela. Szczegóły opisuje kodeks praktyk z 10 lipca 2025, uznany przez Komisję za odpowiednie narzędzie. Sygnatariusze zobowiązują się w nim używać robotów czytających plik robots.txt, czyli instrukcję dla robotów w katalogu głównym strony, zgodnie ze standardem RFC 9309. Lista sygnatariuszy na stronie Komisji, zaktualizowanej 31 lipca 2026, obejmuje między innymi OpenAI, Microsoft, Google, Anthropic, Amazon i Mistral AI. Mety na niej nie ma.

Czytaj też

Australia rozważa, by twórcy sami wypisywali się z trenowania AI. Sposobu na wypisanie się jeszcze nie ma

Dokument rządowy zakłada, że treści w sieci są dostępne dla firm AI domyślnie, chyba że autor je cyfrowo zabezpieczy. Posiadacze praw mówią, że to niewykonalne. W tle rozmowy o 50 miliardach dolarów na centra danych.

Czego zastrzeżenie nie załatwia

Plik robots.txt działa od chwili, w której robot go odczyta. Anthropic pisze w swojej pomocy, że blokada robota ClaudeBot wyłącza z treningu przyszłe materiały strony. Wcześniejszych kopii plik nie usuwa. Według pisma wydawców OpenAI latami pobierało zbiory Common Crawl, fundacji udostępniającej za darmo archiwum stron, i planowało trzymać je „na zawsze”.

Pismo zarzuca też OpenAI, że przez Common Crawl i anonimowe pobieranie ominęło mechanizm robots.txt. Wydawcy twierdzą, że wykonali instrukcje wypisania się podane przez pozwanych, a roboty obu firm dalej pobierały ich strony do odpowiedzi czatów. W 2024 roku OpenAI zapowiedziało Media Manager, narzędzie do zgłaszania, czy właściciel zgadza się na użycie swoich treści. Według pisma projekt porzucono. To twierdzenia jednej strony. W Unii kodeks praktyk zaznacza, że prawo autorskie i zastrzeżenia obowiązują także wobec treści zebranych przez podmioty trzecie, a potem użytych do trenowania.

Osobna sprawa to podróbki. Według Guardiana z 18 września właściciel marki odzieżowej z Sydney znalazł na Temu między 2025 a początkiem 2026 roku tysiące kopii swoich koszulek. Twierdzi, że trafił tam cały katalog marki, około 4000 produktów, z jej opisami, zdjęciami i nazwą. Podejrzewa, że sklep zeskrobał program AI. Kopiowanie wzorów na sprzedaż nie mieści się w definicji eksploracji danych z polskiej ustawy, więc wyjątek z art. 26³ takiego kopiowania nie obejmuje. Sam plik robots.txt jest prośbą, nie blokadą: standard RFC 9309 zaznacza, że jego reguły nie są formą kontroli dostępu. Większość ofert zniknęła po masowym zgłoszeniu naruszenia znaku towarowego, bo sprzedawcy używali nazwy marki. Temu podaje, że usunął oferty i objął prace marki stałym monitoringiem.

Jak zapisać zastrzeżenie

  1. Dopisz roboty zbierające dane do pliku robots.txt

    W pliku robots.txt dodaj osobną grupę dla każdego z robotów: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) i CCBot (Common Crawl). Każda grupa to dwie linie, na przykład User-agent: GPTBot oraz Disallow: /. Anthropic zaznacza, że plik trzeba umieścić w każdej subdomenie.

  2. Zostaw roboty wyszukiwarek

    Nie blokuj OAI-SearchBot ani Googlebota, jeśli strona ma się pojawiać w wyszukiwarce ChatGPT i w Google. OpenAI podaje, że ustawienia dla GPTBot i OAI-SearchBot działają niezależnie. Google podaje, że Google-Extended nie wpływa na obecność strony w wyszukiwarce ani na jej pozycję.

  3. Wpisz zastrzeżenie do regulaminu strony

    W warunkach korzystania ze strony zapisz wprost, że zwielokrotnianie treści w celu eksploracji tekstów i danych, o którym mowa w art. 26³ ustawy o prawie autorskim, jest zastrzeżone.

  4. Skargę kieruj do dostawcy modelu

    Sygnatariusze kodeksu praktyk zobowiązali się wyznaczyć punkt kontaktowy dla właścicieli praw i przyjmować drogą elektroniczną skargi na nieprzestrzeganie zobowiązań (środek 1.5 rozdziału o prawie autorskim).

  5. Nazwę marki zarejestruj jako znak towarowy

    W przypadku opisanym przez Guardiana oferty z Temu zniknęły po zgłoszeniu naruszenia znaku towarowego, bo sprzedawcy używali nazwy marki.

Źródła

  1. Sąd Okręgowy USA dla Południowego Dystryktu Nowego Jorku, „News Plaintiffs’ Combined Summary Judgment Brief”, sprawa 25-md-3143, dokument 1977-1, 17.09.2026 (źródło pierwotne)
  2. Sąd Okręgowy USA dla Południowego Dystryktu Nowego Jorku, list pełnomocniczki wydawców do sędziego Steina w sprawie publicznej wersji pisma, dokument 1977, 17.09.2026 (źródło pierwotne)
  3. Sąd Okręgowy USA dla Południowego Dystryktu Nowego Jorku, „Defendants’ Memorandum of Points and Authorities in Support of Motion for Summary Judgment”, dokument 1980, 17.09.2026 (źródło pierwotne)
  4. The Decoder, „AI training built on fair use looks shaky when the companies’ own people call it »astonishing theft«”, 18.09.2026
  5. TechCrunch, „Microsoft exec called AI scraping »the largest theft of labor in human history«, new unredacted filings reveal”, 17.09.2026
  6. The Hollywood Reporter, „Did OpenAI Pull Off the Biggest IP Heist of All-Time?”, 18.09.2026
  7. The Next Web, „A Microsoft scientist called AI training the largest theft of labor”, 21.09.2026
  8. The Guardian, „»Brutal«: thousands of T-shirt designs stolen and listed on Temu, Sydney label claims”, 18.09.2026
  9. Dziennik Ustaw (Kancelaria Sejmu, ELI), „Ustawa z dnia 4 lutego 1994 r. o prawie autorskim i prawach pokrewnych”, tekst jednolity Dz.U. 2025 poz. 24, art. 26³, 06.12.2024 (źródło pierwotne)
  10. Dziennik Ustaw (Kancelaria Sejmu, ELI), „Ustawa o otwartych danych i ponownym wykorzystywaniu informacji sektora publicznego”, tekst jednolity Dz.U. 2023 poz. 1524, art. 2 pkt 7, 16.06.2023 (źródło pierwotne)
  11. Sejm RP, „Rządowy projekt ustawy o zmianie ustawy o prawie autorskim i prawach pokrewnych oraz niektórych innych ustaw”, druk nr 406 z uzasadnieniem, 16.05.2024 (źródło pierwotne)
  12. EUR-Lex, „Dyrektywa Parlamentu Europejskiego i Rady (UE) 2019/790 w sprawie prawa autorskiego i praw pokrewnych na jednolitym rynku cyfrowym”, art. 4 i motyw 18, 17.04.2019 (źródło pierwotne)
  13. EUR-Lex, „Rozporządzenie Parlamentu Europejskiego i Rady (UE) 2024/1689 w sprawie sztucznej inteligencji”, art. 53, art. 113 i motyw 105, 13.06.2024 (źródło pierwotne)
  14. Komisja Europejska, „The General-Purpose AI Code of Practice”, strona kodeksu z listą sygnatariuszy, aktualizacja 31.07.2026 (źródło pierwotne)
  15. Komisja Europejska, kodeks praktyk dla modeli AI ogólnego przeznaczenia, rozdział „Copyright”, 10.07.2025 (źródło pierwotne)
  16. OpenAI, „Overview of OpenAI Crawlers”, stan na 24.09.2026 (źródło pierwotne)
  17. Google, „Google’s common crawlers”, część o Google-Extended, stan na 24.09.2026 (źródło pierwotne)
  18. Anthropic, „Does Anthropic crawl data from the web, and how can site owners block the crawler?”, stan na 24.09.2026 (źródło pierwotne)
  19. Common Crawl, „CCBot”, stan na 24.09.2026 (źródło pierwotne)
  20. IETF, „RFC 9309: Robots Exclusion Protocol”, wrzesień 2022 (źródło pierwotne)

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.