Znak ChatGPTSystemy i czaty·10 października 2026·4 min

ChatGPT przyjmie nagranie do 512 MB. Zapisu całości nie obiecuje

Limit 512 MB to prawie dziewięć godzin nagrania w MP3, ale tylko 48 minut w nieskompresowanym WAV. Przetworzenia długich plików OpenAI nie gwarantuje, a w jednej z pierwszych prób z zapisu 15-minutowego wywiadu najpierw zginęła jedna z dwóch części.

Część sprawy w toku:Co wklejasz do AI
Dłonie na klawiaturze laptopa, widok z góry
Zdjęcie ilustracyjne

Na skróty

  • Od 6 października płatni użytkownicy ChatGPT mogą wgrać plik dźwiękowy i dostać jego zapis, streszczenie albo szkic maila; na planie darmowym tej funkcji nie ma.
  • Limit 512 MB mieści prawie dziewięć godzin MP3 w zwykłej jakości, ale tylko około 48 minut nieskompresowanego WAV.
  • Pliki MP4 i WebM rozpoznane jako wideo nie przechodzą, więc nagranie z wideorozmowy trzeba najpierw zamienić na sam dźwięk.
  • OpenAI nie gwarantuje przetworzenia długich nagrań, a w próbie opisanej przez włoski serwis technologiczny Punto Informatico z zapisu 15-minutowego wywiadu najpierw zginęła jedna z dwóch części.
  • Usunięcie rozmowy nie kasuje pliku z biblioteki, a na kontach prywatnych treść może służyć do trenowania modeli, zależnie od ustawień.
  • Głos uczestników zebrania to w Polsce dane osobowe, więc uczestnicy powinni wiedzieć, że nagranie trafi do ChatGPT.

Od 6 października płatni użytkownicy ChatGPT mogą przepisać nagranie na tekst: wystarczy dołączyć plik dźwiękowy do rozmowy i poprosić o zapis, streszczenie albo szkic maila po spotkaniu. OpenAI podało to w notatce o wydaniu (release notes) z tego dnia. Limit to 512 MB na plik. Na planie darmowym funkcji nie ma.

ChatGPT przyjmuje popularne formaty dźwięku: MP3, M4A, WAV, FLAC, AAC i OGG, a także pliki MP4 i WebM z samym dźwiękiem. Plik MP4 albo WebM rozpoznany jako wideo nie przechodzi, nawet gdy ścieżka dźwięku jest wyraźna. Wideo trzeba najpierw zamienić na dźwięk. Według OpenAI dostępność zależy też od ustawień firmowej przestrzeni roboczej, regionu, wersji aplikacji i wybranego modelu.

512 MB to prawie dziewięć godzin albo 48 minut

OpenAI podaje limit w megabajtach, a ile to czasu, zależy od formatu pliku. Nagranie w MP3 zajmuje około jedenaście razy mniej miejsca niż WAV, czyli format bez kompresji. Granica wypada więc gdzie indziej.

Ile nagrania mieści limit 512 MB, rachunek na rozmiarach formatów

ok. 9 godz.

MP3 w zwykłej jakości, 128 kilobitów na sekundę, czyli 0,96 MB na minutę

ok. 48 min

WAV bez kompresji w jakości płyty CD, czyli 10,6 MB na minutę

Limit podzielony przez rozmiar minuty nagrania. Włoski serwis technologiczny Punto Informatico podał 7 października zbliżony wynik: około dziewięciu godzin MP3 i około pięćdziesięciu minut WAV.

Nagranie zebrania z telefonu w MP3 albo M4A limitu praktycznie nie dosięgnie. Kłopot zaczyna się przy plikach WAV. Godzinne spotkanie w takim formacie waży około 635 MB i przed wgraniem trzeba je przekonwertować do MP3.

Starsze poradniki, także polskie, podają limit 25 MB. Według serwisu poradnikowego FindSkill ta liczba dotyczy interfejsu dla programistów (API), osobnej usługi OpenAI do wbudowywania jej modeli we własne programy. Aplikacji ChatGPT ta granica nie obejmuje.

Godzina zebrania: co z niej wychodzi i co trzeba sprawdzić

OpenAI w notatce o wydaniu podaje, że z nagrania spotkania, wywiadu albo wykładu powstają uporządkowane notatki albo szkic maila do uczestników. O wyniku decyduje polecenie.

  1. Przygotuj plik

    Zapisz nagranie w MP3 albo M4A. Nagranie wideorozmowy najpierw zamień na sam dźwięk.

  2. Dołącz nagranie

    W nowej rozmowie dołącz plik tak samo jak dokument PDF. Osobna rozmowa na każde nagranie nie miesza ustaleń z różnych spotkań.

  3. Napisz, czego potrzeba

    Na przykład: streszczenie w pięciu zdaniach, lista decyzji, sprawy otwarte z osobą odpowiedzialną, zadania z terminami i szkic maila do uczestników. Dopisz: nie zgaduj nazwisk ani liczb, zaznacz miejsca niepewne.

  4. Sprawdź z nagraniem

    Odsłuchaj fragmenty z liczbami, datami, nazwiskami i zgodami. Tak zaleca też OpenAI.

  5. Usuń plik

    Po pracy usuń nagranie z biblioteki plików.

OpenAI ostrzega, że zapis może zawierać błędy, a rozpoznawanie, kto mówi, bywa zawodne. Jakość zależy też od języka. Osobnych wyników dla polskiego notatka o wydaniu nie podaje.

Pierwsze próby opisał włoski serwis technologiczny Punto Informatico. Nagranie MP3 trwające około półtorej godziny ChatGPT rozpoznał, podał jego długość i nie dokończył przetwarzania. Przy 15-minutowym wywiadzie z kilkoma rozmówcami poprosił o podział na dwa pliki, a potem oddał zapis opisany jako pełny. Brakowało jednej z dwóch części. Pełny zapis powstał dopiero po kolejnych poprawkach. OpenAI nazywa przetwarzanie długich nagrań staraniem bez gwarancji (w oryginale best-effort) i uprzedza, że bardzo długie pliki mogą przekroczyć limit czasu.

Skasowanie rozmowy nie usuwa pliku z biblioteki

Dwie wcześniejsze funkcje OpenAI do notatek ze spotkań, Record i Meetings, kasują dźwięk po przygotowaniu notatek. Strona pomocy o wgrywaniu plików takiej obietnicy nie składa, na co 7 października zwrócił uwagę FindSkill. Pakistański serwis TechJuice napisał, że pliki znikają same. Dokumentacja OpenAI tego nie potwierdza. Według tej samej strony pomocy, cytowanej przez FindSkill, skasowanie rozmowy nie usuwa pliku zapisanego w bibliotece.

Na kontach prywatnych, w tym płatnych, OpenAI może używać przesłanych treści do ulepszania modeli, zależnie od ustawień. Decyduje przełącznik ulepszania modelu dla wszystkich. Jest w kontroli danych. Na treściach z planów Business, Enterprise i Edu OpenAI domyślnie nie trenuje.

Na nagraniu zebrania jest głos innych osób. W Polsce taki głos to dane osobowe: Urząd Ochrony Danych Osobowych (UODO) w 2022 roku ukarał stołeczny ośrodek dla osób nietrzeźwych za nagrywanie dźwięku bez podstawy prawnej. Wgranie zebrania do ChatGPT przekazuje głosy wszystkich uczestników amerykańskiej firmie. OpenAI w pomocy funkcji Record zaleca sprawdzenie lokalnego prawa i zdobycie zgody przed nagrywaniem innych.

Czytaj też

Rozmowy z czatem czyta człowiek. Wyłączenie trenowania nie zamyka wszystkich drzwi

OpenAI potwierdza we własnym dokumencie, że pracownicy i podwykonawcy sięgają do treści użytkowników. Przełącznik, który to ogranicza, jest w każdym z czterech największych czatów, tylko w żadnym nie wyłącza wszystkiego.

Źródła

  1. OpenAI Help Center, „ChatGPT release notes”, wpis „Audio uploads in ChatGPT”, 06.10.2026 (źródło pierwotne)
  2. OpenAI Help Center, „How OpenAI handles data in consumer services”, kopia z 01.10.2026 (źródło pierwotne)
  3. Punto Informatico, „ChatGPT accetta i file audio: come funziona”, 07.10.2026 (po włosku)
  4. FindSkill, „ChatGPT Audio Uploads: Turn a Recording Into Notes (2026)”, 07.10.2026
  5. TechJuice, „ChatGPT Can Now Transcribe Meetings and Draft the Follow-Up”, 07.10.2026
  6. ITmedia AI+, „ChatGPT、ついに音声ファイルに対応 文字起こしや要約などが可能に 有料ユーザー向け”, 09.10.2026 (po japońsku)
  7. Transkriptor, „Czy ChatGPT może transkrybować dźwięk?”, 03.04.2026
  8. Gazeta Prawna, „Kara UDOO dla SODON za niezgodne z prawem nagrywanie i utrwalanie dźwięku w ośrodku”, 23.06.2022

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.