Świat·27 września 2026·4 min

Oksford oddał OpenAI skany dzieł bez praw autorskich i przemilczał trenowanie. Polona daje podobne zbiory każdemu, bez umowy

Do czerwca 2025 roku Oksford przekazał OpenAI 125 tysięcy skanów dawnych rozpraw, a w komunikacie o współpracy nie wspomniał o trenowaniu modeli. Biblioteka Narodowa pozwala pobierać dzieła z domeny publicznej każdemu, także do celów komercyjnych.

Na skróty

  • Do czerwca 2025 roku Biblioteka Bodlejańska przekazała OpenAI 125 tysięcy skanów dawnych rozpraw doktorskich, a według dokumentów uczelni posłużyły one do zasilenia zbioru treningowego firmy.
  • Komunikat Oksfordu z 4 marca 2025 roku mówił o digitalizacji dla studentów i badaczy, bez słowa o uczeniu modeli.
  • Według uczelni materiał nie jest chroniony prawem autorskim, OpenAI nie ma do niego wyłączności, a skany w ciągu kilku miesięcy trafią do sieci.
  • Kwoty za same skany żadna ze stron nie podaje; znana jest pula 50 milionów dolarów na cały program NextGenAI dla piętnastu instytucji.
  • Polona dokłada ponad 17 milionów skanów rocznie, a dzieła z domeny publicznej wolno z niej brać także komercyjnie, bez umowy.
  • Dla porównania: 125 tysięcy skanów to mniej niż trzy dni pracy Polony.

Do czerwca 2025 roku Biblioteka Bodlejańska w Oksfordzie przekazała OpenAI 125 tysięcy skanów dawnych rozpraw doktorskich z uczelni europejskich i amerykańskich. Według wewnętrznych dokumentów uczelni materiał posłużył do „zasilenia zbioru treningowego OpenAI”. Komunikat Oksfordu z 4 marca 2025 roku obiecywał digitalizację dla studentów i badaczy. O uczeniu modeli nie było w nim ani słowa.

Sprawę opisał 26 września 2026 roku „Guardian”. Dziennik dotarł do protokołów z posiedzeń uczelni, uzyskanych na wniosek o dostęp do informacji publicznej. Pracownicy, w tym członkowie komitetu nadzorującego Bodleian, zgłaszali w nich obawy o reputację Oksfordu i o cele klimatyczne uczelni, bo umowa dotyczy technologii zużywającej dużo energii.

Co Oksford oddał, a czego nie

Rzecznik uczelni podaje trzy argumenty. Materiału jest niewiele. Nie jest chroniony prawem autorskim. OpenAI nie ma do niego wyłączności. Prawa do skanów zostają przy bibliotece, a w ciągu kilku miesięcy biblioteka zacznie publikować je w sieci. Uczelnia odrzuca zarzut ukrywania czegokolwiek przed opinią publiczną i studentami. Według rzecznika głównym celem była digitalizacja, a pracownicy otwarcie mówili, że projekt dostarczy też danych treningowych.

Czy i ile Oksford dostaje za same skany, żadna ze stron nie podaje. Znana jest tylko rama. Oksford należy do NextGenAI, konsorcjum OpenAI i piętnastu instytucji badawczych, na który firma przeznaczyła 50 milionów dolarów w grantach, mocy obliczeniowej i dostępie do swoich modeli. Z tej puli mogą korzystać oksfordzcy badacze prowadzący wspólne projekty z OpenAI, a 3 tysiące pracowników uczelni dostaje ChatGPT Edu, wersję czatu dla szkół wyższych.

Komunikat z marca 2025 roku zapowiadał digitalizację między innymi 3,5 tysiąca rozpraw z lat 1498–1884. Według „Guardiana” zeskanowano też 10 tysięcy szesnastowiecznych ballad ulicznych. W protokołach jest jednak mowa o czymś większym: o możliwej masowej digitalizacji zbiorów liczących 23 miliony pozycji i o czacie „Ask the Bod”.

OpenAI płaci za skanowanie, bo praw nie ma za co kupić

Dzieło w domenie publicznej nie ma właściciela praw majątkowych. Każda firma może na nim trenować bez niczyjej zgody, pod warunkiem że tekst jest w wersji cyfrowej. Tu leży sedno. Oksford sam zapowiadał, że digitalizowane kolekcje nie były wcześniej dostępne w internecie. Digitalizacja jest droga, a treści z sieci są coraz mocniej zapchane tekstami pisanymi przez modele. Stare książki stają się przez to cenniejsze jako dane.

Amerykańskie biblioteki rozwiązały ten sam układ inaczej. Harvard opublikował w czerwcu 2025 roku zbiór Institutional Books 1.0: prawie milion książek z domeny publicznej, ponad 394 miliony stron, do pobrania dla każdego w serwisie Hugging Face. Inicjatywę Harvardu wspierają darowizny Microsoftu i OpenAI, przekazane bez warunków. Biblioteka Publiczna w Bostonie zastrzegła, gdy OpenAI zgłosiło się do niej po raz pierwszy, że wszystko, co zeskanuje, będzie dostępne dla wszystkich. Oksford znalazł się pośrodku: brak wyłączności i zapowiedź publikacji, ale OpenAI dostało skany pierwsze, a opinia publiczna dowiedziała się o trenowaniu z dokumentów wydobytych przez dziennikarzy.

Polona oddaje takie zbiory każdemu, bez umowy

W Polsce dawne zbiory skanuje Biblioteka Narodowa. Polona, biblioteka cyfrowa Biblioteki Narodowej, rośnie średnio o 2 tysiące obiektów dziennie i ponad 17 milionów skanów rocznie. Ma warstwę tekstową z rozpoznawania pisma, czyli tekst do skopiowania, a nie tylko obraz strony. Według Biblioteki Narodowej większość zbiorów należy do domeny publicznej i można je za darmo pobierać i dowolnie wykorzystywać.

Skala skanowania: Oksford dla OpenAI i Polona dla wszystkich

125 tys.

skanów rozpraw przekazanych przez Bodleian do OpenAI do czerwca 2025

ponad 17 mln

skanów rocznie w Polonie, według Biblioteki Narodowej

17 milionów skanów rocznie to średnio około 46,6 tysiąca dziennie. W tym tempie Polona dokłada 125 tysięcy skanów w niecałe trzy dni. Źródła: „Guardian”, Biblioteka Narodowa.

Biblioteka Narodowa pisze wprost, że z dzieł w domenie publicznej można korzystać także w celach komercyjnych, bez pytania kogokolwiek o zgodę. Każdy obiekt ma pole „prawa do utworu”. Publikacji udostępnianych za zgodą wydawcy albo spadkobierców nie da się pobrać i nie wolno ich używać komercyjnie.

Według twórców modelu PLLuM polskie prawo od nowelizacji z 20 września 2024 roku pozwala kopiować treści do trenowania modeli, dopóki właściciel praw tego nie zastrzeże. Przy dziełach z domeny publicznej nie ma kto takiego zastrzeżenia złożyć. Do otwartej wersji PLLuM, modelu należącego do Ministerstwa Cyfryzacji, dane pochodziły z trzech źródeł: zasobów instytucji z konsorcjum, tekstów od wydawców na podstawie umów licencyjnych i otwartych zbiorów danych. Umowy są więc potrzebne przy tekstach współczesnych. Stare druki są wolne i czekają tylko na skaner.

OpenAI dostało od Oksfordu teksty, do których nikt nie ma praw, i to bez wyłączności. Kłopot uczelni zaczął się od jednego zdania. Tego, którego nie napisała w marcu 2025 roku.

Czytaj też

W USA o trenowaniu AI na cudzych treściach rozstrzygnie sąd. W Polsce wolno je kopiować, dopóki właściciel praw tego nie zastrzeże

Odtajnione 17 września pismo New York Timesa cytuje dyrektora z Microsoftu o „kradzieży” i szefa ChatGPT o produktach zastępujących wydawców. Polski przepis ustawia ten spór inaczej: kopiowanie do eksploracji danych jest dozwolone, dopóki właściciel nie zapisze sprzeciwu w formie czytelnej dla programu.

Źródła

  1. The Guardian, „Oxford lets OpenAI train its AI models on Bodleian Library”, 26.09.2026
  2. Bodleian Libraries, „Oxford and OpenAI launch collaboration to advance research and education”, 04.03.2025 (źródło pierwotne)
  3. WBUR / Associated Press, „AI chatbots need more books to learn from. These Mass. libraries are opening their stacks”, 13.06.2025
  4. Biblioteka Narodowa, „POLONA”, opis usługi, odczyt 27.09.2026 (źródło pierwotne)
  5. Biblioteka Narodowa, „Jak twórczo wykorzystać dzieła z polona.pl”, 01.03.2018 (źródło pierwotne)
  6. PLLuM, „Zakończenie projektu PLLuM”, 09.01.2025 (źródło pierwotne)

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.