
Dyskusja o AI i prawach autorskich zwykle koncentruje się na jednym pytaniu: czy wolno trenować model na cudzej twórczości bez zgody autora. Sprawa Anthropic pokazała jednak drugi, mniej oczywisty problem. Modele językowe potrzebują dużych zasobów wartościowych treści stworzonych przez ludzi, a rynek generatywnej AI może jednocześnie osłabiać ekonomiczne warunki ich powstawania.
Nie jest to wyłącznie konflikt technologii z kulturą. Pochodzenie danych treningowych wpływa równocześnie na legalność modelu, jego jakość, możliwość wejścia na rynek oraz zaufanie klientów. Dlatego AI governance zaczyna się wcześniej niż ocena obowiązków wynikających z AI Act. Zaczyna się od data governance: wiedzy o tym, jakie treści wykorzystuje organizacja, skąd one pochodzą i na jakich zasadach mogą być przetwarzane.
Najważniejsze informacje
- Ugoda w sprawie Bartz przeciwko Anthropic nie oznacza, że amerykański sąd uznał samo trenowanie modelu na książkach za naruszenie prawa. Sąd odróżnił sposób wykorzystania utworów od sposobu pozyskania i przechowywania ich kopii.
- Model collapse opisuje pogarszanie się modeli trenowanych rekurencyjnie na treściach wytworzonych przez wcześniejsze modele. Nie oznacza to, że każda domieszka danych syntetycznych prowadzi do załamania jakości.
- W Unii Europejskiej nie można mechanicznie przenosić amerykańskiej koncepcji fair use. Znaczenie mają m.in. przepisy o eksploracji tekstów i danych oraz zastrzeżenia składane przez uprawnionych.
- Dostawcy modeli AI ogólnego przeznaczenia muszą posiadać politykę zgodności z unijnym prawem autorskim i publikować odpowiednio szczegółowe podsumowanie treści wykorzystanych do trenowania modelu.
- Firma korzystająca z gotowego narzędzia nie odpowiada automatycznie za cały proces jego pretreningu, ale powinna oceniać dostawcę, zasady wykorzystywania własnych danych oraz ryzyko związane z wygenerowanymi rezultatami.
Sprawa Anthropic dotyczyła nie tylko trenowania AI
Punktem wyjścia do dyskusji jest tekst Charlesa Graebera opublikowany 24 sierpnia 2026 r. w „The New York Times”. Graeber, pisarz i jeden z powodów w pozwie zbiorowym przeciwko Anthropic, opisuje wykorzystanie książek do rozwoju modelu Claude oraz ugodę o wartości 1,5 mld dolarów, zatwierdzoną w lipcu 2026 r. i obejmującą prawa do blisko pół miliona tytułów.
Perspektywa autora jest zrozumiała, ale dla prawidłowej oceny prawnej konieczne jest rozdzielenie dwóch kwestii. W czerwcu 2025 r. sąd uznał, że wykorzystanie książek do trenowania modeli Anthropic mogło mieścić się w amerykańskiej konstrukcji fair use. Za dozwoloną uznał również digitalizację legalnie kupionych egzemplarzy, jeżeli cyfrowa kopia zastępowała zniszczony egzemplarz papierowy i pozostawała w wewnętrznej bibliotece.
Zapraszamy do współpracy
Szczegółowe informacje o ofercie i warunkach współpracy można uzyskać telefonicznie lub wysyłając zapytanie za pomocą formularza kontaktowego.
Inaczej oceniono pobranie milionów książek z pirackich bibliotek i zachowanie ich w centralnym repozytorium. Perspektywa przyszłego wykorzystania zbioru do trenowania modeli nie legalizowała sposobu pozyskania kopii. Ugoda zakończyła roszczenia dotyczące pirackiej biblioteki, a nie ustanowiła ogólnej zasady, zgodnie z którą trenowanie AI na utworach jest zawsze bezprawne.
To rozróżnienie ma znaczenie również dla biznesu. Zgodny z prawem cel projektu nie naprawia wadliwego źródła danych. Z kolei posiadanie dostępu do treści nie przesądza jeszcze, że każda forma jej dalszego wykorzystania jest dozwolona. Ocena musi obejmować cały cykl życia danych: pozyskanie, kopiowanie, przygotowanie zbioru, trenowanie, przechowywanie oraz rezultat działania modelu.
Czym jest model collapse?
Graeber łączy problem praw autorskich z ryzykiem „głodu AI”. Jeżeli internet będzie stopniowo wypełniał się treściami generowanymi automatycznie, kolejne modele mogą być trenowane coraz częściej na rezultatach swoich poprzedników. Powstaje wówczas pętla, w której system nie uczy się bezpośrednio z różnorodności świata, lecz z jego statystycznego przybliżenia wytworzonego przez inny model.
Badacze opisali ten mechanizm jako model collapse. W pracy opublikowanej w 2024 r. w „Nature” wykazano, że rekurencyjne trenowanie modeli na danych generowanych przez wcześniejsze modele może prowadzić do utraty informacji o rzadszych przypadkach, zmniejszenia różnorodności oraz kumulowania błędów. Z czasem reprezentacja rzeczywistości staje się coraz uboższa – jak w kolejnych kopiach wykonanych z kopii.
Nie należy jednak przedstawiać model collapse jako nieuchronnego i natychmiastowego końca generatywnej AI. Dane syntetyczne są użytecznym narzędziem, jeżeli ich pochodzenie jest znane, jakość kontrolowana, a zbiór zachowuje odpowiedni udział wiarygodnych danych pochodzących ze świata rzeczywistego. Problemem jest nie samo wykorzystanie treści syntetycznych, lecz ich niekontrolowane nagromadzenie oraz brak możliwości odróżnienia ich od materiałów oryginalnych.

Dlaczego prawa autorskie stają się elementem jakości AI?
Prawo autorskie jest zwykle przedstawiane jako ograniczenie dostępu do danych. Z perspektywy rozwoju AI pełni jednak również funkcję infrastrukturalną. Tworzy warunki ekonomiczne, w których powstają nowe książki, artykuły, fotografie, nagrania i inne treści odzwierciedlające ludzkie doświadczenie.
Jeżeli generatywna AI obniża wynagrodzenia twórców, wypiera oryginalne treści z rynku i jednocześnie wykorzystuje je bez licencji do budowy produktów konkurujących z autorami, może osłabić własne przyszłe źródło danych. Nie jest to prosty związek przyczynowy ani przesądzona prognoza. Pokazuje jednak, że licencjonowanie treści może być nie tylko kosztem zgodności, lecz także sposobem zapewnienia dostępu do wiarygodnych i różnorodnych zbiorów.
W tym ujęciu pochodzenie danych staje się parametrem jakości. Organizacja, która potrafi udokumentować źródło materiałów, warunki licencji, dokonane zastrzeżenia oraz udział danych syntetycznych, lepiej kontroluje ryzyko prawne i techniczne. Ta sama dokumentacja może być potrzebna w postępowaniu, badaniu due diligence, negocjacjach inwestycyjnych, audycie dostawcy i ocenie niezawodności modelu.
AI a prawa autorskie w Unii Europejskiej
Amerykańskie orzeczenie w sprawie Anthropic nie przesądza, jak podobny projekt należałoby ocenić w Polsce lub w innym państwie Unii Europejskiej. System unijny nie zna ogólnej konstrukcji fair use odpowiadającej rozwiązaniu amerykańskiemu. Posługuje się określonymi wyjątkami i ograniczeniami praw wyłącznych.
Dla trenowania modeli szczególne znaczenie ma eksploracja tekstów i danych, czyli TDM. W polskim prawie art. 26³ ustawy o prawie autorskim i prawach pokrewnych pozwala zwielokrotniać rozpowszechnione utwory w celu eksploracji tekstów i danych, chyba że uprawniony zastrzegł inaczej. W przypadku treści publicznie udostępnionych online zastrzeżenie powinno zostać wyrażone w formacie przeznaczonym do odczytu maszynowego.
Nie jest to jednak uniwersalna licencja na pobieranie każdej treści z internetu. Analiza wymaga uwzględnienia m.in. legalności dostępu, skutecznego zastrzeżenia praw, zakresu niezbędnych kopii, okresu ich przechowywania, ochrony baz danych, warunków umownych oraz innych praw związanych z materiałem. Sam fakt technicznej dostępności pliku nie przesądza o legalności jego wykorzystania.
AI Act dodaje do tego obowiązki organizacyjne i informacyjne po stronie dostawców modeli AI ogólnego przeznaczenia. Zgodnie z art. 53 dostawca powinien wdrożyć politykę zapewniającą zgodność z unijnym prawem autorskim, w szczególności identyfikować i respektować zastrzeżenia praw do TDM. Musi również sporządzić i publicznie udostępnić odpowiednio szczegółowe podsumowanie treści użytych do trenowania modelu według wzoru przygotowanego przez Komisję Europejską.
Podsumowanie danych treningowych zwiększa przejrzystość, ale nie zastępuje licencji ani nie rozstrzyga automatycznie sporu z uprawnionym. Nie musi też zawierać katalogu każdego pojedynczego utworu. Jego rolą jest przedstawienie rodzajów i źródeł treści na poziomie pozwalającym lepiej zrozumieć proces trenowania i dochodzić praw.
Co to oznacza dla firm korzystających z generatywnej AI?
Zakres odpowiedzialności zależy od roli organizacji. Większość firm kupujących dostęp do ChatGPT, Microsoft Copilot lub podobnej usługi będzie podmiotem stosującym system AI, a nie dostawcą bazowego modelu ogólnego przeznaczenia. Nie oznacza to jednak, że kwestie praw autorskich można pozostawić wyłącznie dostawcy technologii.
| Model wykorzystania AI | Najważniejsze ryzyko | Co powinna zweryfikować organizacja |
|---|---|---|
| Gotowe narzędzie SaaS | Niejasne zasady dotyczące promptów, plików i rezultatów | Warunki usługi, wykorzystywanie danych do trenowania, poufność, retencję, uprawnienia do komercyjnego użycia wyników i zasady odpowiedzialności dostawcy |
| RAG na dokumentach organizacji | Wprowadzenie do systemu materiałów bez odpowiednich praw albo informacji poufnych | Tytuł prawny do dokumentów, zakres licencji, dane osobowe, tajemnicę przedsiębiorstwa, kontrolę dostępu i usuwanie materiałów |
| Fine-tuning modelu | Nieudokumentowane źródła zbioru i możliwość zmiany roli organizacji | Pochodzenie danych, zastrzeżenia TDM, licencje, dokumentację zbioru, skalę modyfikacji oraz obowiązki wynikające z AI Act |
| Własny model wprowadzany na rynek | Odpowiedzialność za proces rozwoju i obowiązki dostawcy | Politykę prawa autorskiego, podsumowanie danych treningowych, dokumentację techniczną, zarządzanie ryzykiem oraz obowiązki wobec podmiotów integrujących model |
W praktyce podstawowy test powinien zaczynać się od ustalenia, czy firma tylko korzysta z wyniku zewnętrznego modelu, czy zasila go własnymi treściami, buduje warstwę RAG, przeprowadza fine-tuning albo oferuje zmodyfikowane rozwiązanie klientom. Im dalej organizacja odchodzi od standardowego użycia gotowej usługi, tym większe znaczenie mają pochodzenie danych, umowy licencyjne i możliwość wejścia w rolę dostawcy.
Pochodzenie danych powinno wejść do AI governance
Dojrzały model AI governance nie może ograniczać się do rejestru narzędzi, klasyfikacji ryzyka i ogólnej polityki korzystania z ChatGPT. Musi łączyć odpowiedzialność za system z odpowiedzialnością za dane i treści.
Inwentaryzacja systemów i zbiorów
Rejestr zastosowań AI powinien wskazywać nie tylko nazwę narzędzia i właściciela biznesowego, ale również źródła danych wykorzystywanych w RAG, fine-tuningu i testach. Bez tej informacji organizacja nie potrafi odtworzyć, na jakim materiale oparto działanie systemu.
Ocena dostawcy i umowy
Due diligence dostawcy powinno objąć warunki korzystania z danych klienta, deklaracje dotyczące trenowania, ochronę poufności, zasady retencji, mechanizmy opt-out oraz odpowiedzialność za roszczenia dotyczące własności intelektualnej. Ogólne zapewnienie, że usługa jest „zgodna z AI Act”, nie zastępuje analizy umowy i dokumentacji technicznej.
Zasady dotyczące treści wejściowych
Pracownicy powinni wiedzieć, jakie utwory, dokumenty i bazy danych mogą wprowadzać do systemu. Dostęp do pliku wewnątrz organizacji nie zawsze oznacza prawo do wykorzystania go w procesie trenowania lub tworzenia zewnętrznej usługi. Zasady powinny obejmować również dane osobowe, tajemnicę przedsiębiorstwa i zobowiązania poufności.
Kontrola rezultatów i pochodzenia treści
Rezultat wygenerowany przez AI może zawierać fragmenty podobne do cudzych utworów, błędy, nieprawdziwe przypisania albo treści o niejasnym statusie. W obszarach publikacyjnych, marketingowych i produktowych potrzebna jest kontrola człowieka oraz procedura reagowania na wątpliwości dotyczące źródła materiału.
Nadzór nad jakością danych
Jeżeli organizacja rozwija własne rozwiązanie, powinna oznaczać dane syntetyczne, badać ich udział w zbiorze i monitorować wpływ na wyniki. Kontrola jakości danych ogranicza ryzyko model collapse, ale również pozwala wykazać, że testy i walidacja opierały się na adekwatnym materiale.
Udokumentowana decyzja przed wdrożeniem
Nowy przypadek użycia powinien przejść prosty proces akceptacji łączący perspektywę biznesu, IT, privacy, bezpieczeństwa i własności intelektualnej. Taki mechanizm jest rdzeniem skutecznego AI Governance: pozwala szybciej wdrażać bezpieczne zastosowania i zatrzymywać projekty, w których organizacja nie potrafi wyjaśnić pochodzenia danych lub podziału odpowiedzialności.
AI governance zaczyna się od data governance
Spór opisany przez „The New York Times” nie daje jednej odpowiedzi na pytanie, gdzie przebiega granica między innowacją a prawami twórców. Pokazuje natomiast, że dane nie są neutralnym paliwem, które można oceniać wyłącznie według objętości i kosztu pozyskania.
Ich źródło wpływa na zgodność z prawem. Ich różnorodność wpływa na jakość modelu. Sposób ich wytwarzania wpływa na przyszłą dostępność ludzkich treści. Wreszcie dokumentacja ich pochodzenia wpływa na zdolność organizacji do obrony projektu przed klientem, inwestorem lub organem nadzoru.
Dlatego firma nie powinna czekać, aż prawa autorskie staną się problemem po otrzymaniu roszczenia. W ramach wdrożenia AI Governance i AI Compliance BPPZ pomaga zinwentaryzować zastosowania AI, określić role organizacji, ocenić dostawców i umowy, uporządkować źródła danych oraz zaprojektować proces akceptacji nowych narzędzi. Celem jest stworzenie modelu, w którym rozwój AI opiera się na kontrolowanych danych, jasno przypisanej odpowiedzialności i decyzjach, które można później wykazać.
FAQ
Czy firma korzystająca z ChatGPT odpowiada za dane treningowe modelu?
Nie odpowiada automatycznie za cały proces pretreningu prowadzony przez dostawcę. Powinna jednak zweryfikować warunki usługi, sposób wykorzystywania własnych promptów i plików, zakres gwarancji dotyczących rezultatów oraz własne obowiązki jako podmiotu stosującego AI. Sytuacja zmienia się, gdy firma przeprowadza fine-tuning, buduje własny model albo wprowadza zmodyfikowane rozwiązanie na rynek.
Czy AI Act rozstrzyga, czy wolno trenować AI na książkach i artykułach?
Nie. AI Act nakłada na dostawców modeli AI ogólnego przeznaczenia obowiązek posiadania polityki zgodności z prawem autorskim i publikowania podsumowania danych treningowych. Sama legalność wykorzystania konkretnego utworu nadal wymaga oceny na podstawie prawa autorskiego, w tym przepisów o TDM, licencji i zastrzeżeń uprawnionego.
Czy dostępność treści w internecie oznacza, że można użyć jej do trenowania AI?
Nie. Techniczna dostępność nie jest równoznaczna z nieograniczonym prawem do kopiowania i wykorzystania treści. Należy ocenić legalność dostępu, ewentualne zastrzeżenie TDM, warunki korzystania z serwisu, zakres dozwolonego użytku oraz inne prawa związane z materiałem.
Czy model collapse oznacza, że dane syntetyczne są bezużyteczne?
Nie. Dane syntetyczne mogą uzupełniać zbiory, wspierać testy i ograniczać niektóre problemy z dostępnością danych. Ryzyko powstaje przede wszystkim wtedy, gdy treści generowane przez modele zastępują dane pochodzące ze świata rzeczywistego, nie są odpowiednio oznaczane, a ich jakość i udział w zbiorze pozostają poza kontrolą.
Źródła
- Charles Graeber, The Original Sin of Anthropic’s Claude, „The New York Times”, 24 sierpnia 2026 r.
- U.S. District Court for the Northern District of California, Bartz v. Anthropic – Order on Fair Use, 23 czerwca 2025 r.
- Reuters, US judge approves Anthropic’s $1.5 billion settlement of copyright lawsuit, 20 lipca 2026 r.
- Ilia Shumailov i in., AI models collapse when trained on recursively generated data, „Nature” 631, 755–759 (2024).
- Komisja Europejska, General-Purpose AI Models in the AI Act – Questions & Answers.
- Rozporządzenie Parlamentu Europejskiego i Rady (UE) 2024/1689 (AI Act), EUR-Lex.
- Ustawa o prawie autorskim i prawach pokrewnych – tekst jednolity, Dz.U. z 2025 r. poz. 24.







