Oksford oddał OpenAI skany dzieł bez praw autorskich i przemilczał trenowanie. Polona daje podobne zbiory każdemu, bez umowy
Do czerwca 2025 roku Oksford przekazał OpenAI 125 tysięcy skanów dawnych rozpraw, a w komunikacie o współpracy nie wspomniał o trenowaniu modeli. Biblioteka Narodowa pozwala pobierać dzieła z domeny publicznej każdemu, także do celów komercyjnych.
Na skróty
- Do czerwca 2025 roku Biblioteka Bodlejańska przekazała OpenAI 125 tysięcy skanów dawnych rozpraw doktorskich, a według dokumentów uczelni posłużyły one do zasilenia zbioru treningowego firmy.
- Komunikat Oksfordu z 4 marca 2025 roku mówił o digitalizacji dla studentów i badaczy, bez słowa o uczeniu modeli.
- Według uczelni materiał nie jest chroniony prawem autorskim, OpenAI nie ma do niego wyłączności, a skany w ciągu kilku miesięcy trafią do sieci.
- Kwoty za same skany żadna ze stron nie podaje; znana jest pula 50 milionów dolarów na cały program NextGenAI dla piętnastu instytucji.
- Polona dokłada ponad 17 milionów skanów rocznie, a dzieła z domeny publicznej wolno z niej brać także komercyjnie, bez umowy.
- Dla porównania: 125 tysięcy skanów to mniej niż trzy dni pracy Polony.
Do czerwca 2025 roku Biblioteka Bodlejańska w Oksfordzie przekazała OpenAI 125 tysięcy skanów dawnych rozpraw doktorskich z uczelni europejskich i amerykańskich. Według wewnętrznych dokumentów uczelni materiał posłużył do „zasilenia zbioru treningowego OpenAI”. Komunikat Oksfordu z 4 marca 2025 roku obiecywał digitalizację dla studentów i badaczy. O uczeniu modeli nie było w nim ani słowa.
Sprawę opisał 26 września 2026 roku „Guardian”. Dziennik dotarł do protokołów z posiedzeń uczelni, uzyskanych na wniosek o dostęp do informacji publicznej. Pracownicy, w tym członkowie komitetu nadzorującego Bodleian, zgłaszali w nich obawy o reputację Oksfordu i o cele klimatyczne uczelni, bo umowa dotyczy technologii zużywającej dużo energii.
Co Oksford oddał, a czego nie
Rzecznik uczelni podaje trzy argumenty. Materiału jest niewiele. Nie jest chroniony prawem autorskim. OpenAI nie ma do niego wyłączności. Prawa do skanów zostają przy bibliotece, a w ciągu kilku miesięcy biblioteka zacznie publikować je w sieci. Uczelnia odrzuca zarzut ukrywania czegokolwiek przed opinią publiczną i studentami. Według rzecznika głównym celem była digitalizacja, a pracownicy otwarcie mówili, że projekt dostarczy też danych treningowych.
Czy i ile Oksford dostaje za same skany, żadna ze stron nie podaje. Znana jest tylko rama. Oksford należy do NextGenAI, konsorcjum OpenAI i piętnastu instytucji badawczych, na który firma przeznaczyła 50 milionów dolarów w grantach, mocy obliczeniowej i dostępie do swoich modeli. Z tej puli mogą korzystać oksfordzcy badacze prowadzący wspólne projekty z OpenAI, a 3 tysiące pracowników uczelni dostaje ChatGPT Edu, wersję czatu dla szkół wyższych.
Komunikat z marca 2025 roku zapowiadał digitalizację między innymi 3,5 tysiąca rozpraw z lat 1498–1884. Według „Guardiana” zeskanowano też 10 tysięcy szesnastowiecznych ballad ulicznych. W protokołach jest jednak mowa o czymś większym: o możliwej masowej digitalizacji zbiorów liczących 23 miliony pozycji i o czacie „Ask the Bod”.
OpenAI płaci za skanowanie, bo praw nie ma za co kupić
Dzieło w domenie publicznej nie ma właściciela praw majątkowych. Każda firma może na nim trenować bez niczyjej zgody, pod warunkiem że tekst jest w wersji cyfrowej. Tu leży sedno. Oksford sam zapowiadał, że digitalizowane kolekcje nie były wcześniej dostępne w internecie. Digitalizacja jest droga, a treści z sieci są coraz mocniej zapchane tekstami pisanymi przez modele. Stare książki stają się przez to cenniejsze jako dane.
Amerykańskie biblioteki rozwiązały ten sam układ inaczej. Harvard opublikował w czerwcu 2025 roku zbiór Institutional Books 1.0: prawie milion książek z domeny publicznej, ponad 394 miliony stron, do pobrania dla każdego w serwisie Hugging Face. Inicjatywę Harvardu wspierają darowizny Microsoftu i OpenAI, przekazane bez warunków. Biblioteka Publiczna w Bostonie zastrzegła, gdy OpenAI zgłosiło się do niej po raz pierwszy, że wszystko, co zeskanuje, będzie dostępne dla wszystkich. Oksford znalazł się pośrodku: brak wyłączności i zapowiedź publikacji, ale OpenAI dostało skany pierwsze, a opinia publiczna dowiedziała się o trenowaniu z dokumentów wydobytych przez dziennikarzy.
Polona oddaje takie zbiory każdemu, bez umowy
W Polsce dawne zbiory skanuje Biblioteka Narodowa. Polona, biblioteka cyfrowa Biblioteki Narodowej, rośnie średnio o 2 tysiące obiektów dziennie i ponad 17 milionów skanów rocznie. Ma warstwę tekstową z rozpoznawania pisma, czyli tekst do skopiowania, a nie tylko obraz strony. Według Biblioteki Narodowej większość zbiorów należy do domeny publicznej i można je za darmo pobierać i dowolnie wykorzystywać.
Skala skanowania: Oksford dla OpenAI i Polona dla wszystkich
125 tys.
skanów rozpraw przekazanych przez Bodleian do OpenAI do czerwca 2025
ponad 17 mln
skanów rocznie w Polonie, według Biblioteki Narodowej
17 milionów skanów rocznie to średnio około 46,6 tysiąca dziennie. W tym tempie Polona dokłada 125 tysięcy skanów w niecałe trzy dni. Źródła: „Guardian”, Biblioteka Narodowa.
Biblioteka Narodowa pisze wprost, że z dzieł w domenie publicznej można korzystać także w celach komercyjnych, bez pytania kogokolwiek o zgodę. Każdy obiekt ma pole „prawa do utworu”. Publikacji udostępnianych za zgodą wydawcy albo spadkobierców nie da się pobrać i nie wolno ich używać komercyjnie.
Według twórców modelu PLLuM polskie prawo od nowelizacji z 20 września 2024 roku pozwala kopiować treści do trenowania modeli, dopóki właściciel praw tego nie zastrzeże. Przy dziełach z domeny publicznej nie ma kto takiego zastrzeżenia złożyć. Do otwartej wersji PLLuM, modelu należącego do Ministerstwa Cyfryzacji, dane pochodziły z trzech źródeł: zasobów instytucji z konsorcjum, tekstów od wydawców na podstawie umów licencyjnych i otwartych zbiorów danych. Umowy są więc potrzebne przy tekstach współczesnych. Stare druki są wolne i czekają tylko na skaner.
OpenAI dostało od Oksfordu teksty, do których nikt nie ma praw, i to bez wyłączności. Kłopot uczelni zaczął się od jednego zdania. Tego, którego nie napisała w marcu 2025 roku.
Czytaj też
W USA o trenowaniu AI na cudzych treściach rozstrzygnie sąd. W Polsce wolno je kopiować, dopóki właściciel praw tego nie zastrzeże
Odtajnione 17 września pismo New York Timesa cytuje dyrektora z Microsoftu o „kradzieży” i szefa ChatGPT o produktach zastępujących wydawców. Polski przepis ustawia ten spór inaczej: kopiowanie do eksploracji danych jest dozwolone, dopóki właściciel nie zapisze sprzeciwu w formie czytelnej dla programu.
Źródła
- The Guardian, „Oxford lets OpenAI train its AI models on Bodleian Library”, 26.09.2026
- Bodleian Libraries, „Oxford and OpenAI launch collaboration to advance research and education”, 04.03.2025 (źródło pierwotne)
- WBUR / Associated Press, „AI chatbots need more books to learn from. These Mass. libraries are opening their stacks”, 13.06.2025
- Biblioteka Narodowa, „POLONA”, opis usługi, odczyt 27.09.2026 (źródło pierwotne)
- Biblioteka Narodowa, „Jak twórczo wykorzystać dzieła z polona.pl”, 01.03.2018 (źródło pierwotne)
- PLLuM, „Zakończenie projektu PLLuM”, 09.01.2025 (źródło pierwotne)
Czy ten tekst Ci pomógł?
Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.