Otwarte dane, bez ukrytego trainsetu.
Tu zbieramy publiczne artefakty SlayerLab i zasady, według których powstają. Każdy dataset prowadzi do swojej karty na Hugging Face — razem z licencją, wersją i ograniczeniami.
Co dziś publikuje SlayerLab.
Lista pochodzi z oficjalnego API organizacji. Każda karta poniżej otwiera dokładne repozytorium — nie stronę wyszukiwania ani kopię opisu.
Polish DynaWord
Otwarty, wieloźródłowy korpus polskiego tekstu pisanego przez ludzi, rozwijany w rodzinie DynaWord.
v0.2.5: 4 319 200 dokumentów · 9,64 mld tokenów (proxy tiktoken) · 18 źródeł
GoLLeM Corpus 2B PL
Dokładny tekst korpusu użytego do treningu modeli GoLLeM-110M-PL v2 i v3, opublikowany dla reprodukcji treningu od zera.
około 2,0 mld tokenów · Parquet · pretraining
DynaWord Mix Extended
Kurowany miks pretreningowy z rozszerzeniami zgodnymi licencyjnie oraz opisanym czyszczeniem i usuwaniem PII.
około 500 mln tokenów w tokenizerze 32k BPE
HPLT v3 PL Cleaned
Oczyszczony polski podzbiór HPLT v3 z wieloetapową bramką PII i redukcją boilerplate'u.
korpus web · PII-gated · licencja wymaga kontroli źródeł
Slayer PL 8×3B
Osiem rozłącznych shardów do wieloprzebiegowego treningu z polskim rdzeniem i warstwą prawno-urzędową.
8 × około 3 mld tokenów · około 24 mld łącznie (cl100k)
Minimal EN Corpus 2.5B
Anglojęzyczny miks pretreningowy i gotowe binaria nanoGPT do kontrolowanych eksperymentów z modelami około 125M.
2 689 323 439 tokenów treningowych przy BPE 12 288
Minimal EN Corpus 5B
Większy wariant anglojęzycznego korpusu do porównywalnych eksperymentów nanoGPT.
5 396 605 407 tokenów treningowych przy BPE 12 288
SlayerLab Tokenizers
Znormalizowane artefakty tokenizerów z warsztatu Slayer, zebrane w jednym przeglądalnym zbiorze.
38 zgłoszeń warsztatowych + kanoniczny tokenizer SlayerLab 32k
Lojban Master Corpus
Połączony korpus języka Lojban. Mapa praw dla poszczególnych źródeł pozostaje w przeglądzie.
15 źródeł · rights review in progress · bez zgody na użycie komercyjne
Jedna organizacja, różne warunki. Dataset oznaczony jako other albo „warunki źródeł” wymaga przeczytania karty i licencji składników przed treningiem, redystrybucją lub użyciem komercyjnym. Sam dostęp na Hugging Face nie jest zgodą na dowolne użycie.
Dane mają swój rezultat.
Publiczne modele pokazują, do czego użyliśmy korpusów: od polskich baz GoLLeM, przez badania tokenizerów, po serię BDH i edukacyjny Pollock.
Polski model bazowy GPT-2-class trenowany od zera; druga epoka na tym samym korpusie około 2B.
PLtransformersCC BY-SA 4.002GoLLeM 110M PL v2SlayerLab/GoLLeM-110M-PL-v2Polski model bazowy GPT-2-class po jednej epoce na czystym, wieloźródłowym korpusie około 2B.
PLtransformersCC BY-SA 4.003GoLLeM 45M PLSlayerLab/GoLLeM-45M-PLModel badawczy do ablacji polskiego tokenizera: 42,5M parametrów, GPT-2 i BPE 32 768.
PLtransformersMIT04GoLLeM 110M PL SFTSlayerLab/goLLeM-110M-PL-SFT-mergedEksperymentalna wersja instruction-tuned scalona do standardowego formatu Transformers.
PLtransformersCC BY-SA 4.005Pollock 1.4SlayerLab/pollock-mini-lm-125mEdukacyjny model bazowy nanoGPT poniżej 128M, udostępniony także w formacie Transformers.
ENtransformersInne / sprawdź kartę06BDH 25M PLSlayerLab/bdh-25m-plPolski, bajtowy baseline Fast Weight Layers: 25,3M parametrów i 100M tokenów treningowych.
PLcustomCC BY 4.007BDH 150M SlayerSlayerLab/bdh-150m-slayerBajtowy checkpoint BDH około 151M po 30 tys. kroków na miksie 970M tokenów.
EN + PLcustomCC BY 4.008BDH ScalingSlayerLab/bdh-scalingArtefakty replikacji BDH i porównania ze zbliżonymi rozmiarem baseline'ami 25M, 50M i 100M.
EN + PL + CSpytorchApache 2.009Slayer ScratchSlayerLab/slayer-scratchArchiwum dydaktyczne własnego checkpointu PyTorch, tokenizera, logów i instrukcji reprodukcji.
PLpytorchInne / sprawdź kartę10Lojban GPT-2 RSI-1SlayerLab/lojban-gpt2-rsi1Model GPT-2 97,7M trenowany dla Lojbanu w pętli recursive self-improvement.
JBOpytorchInne / sprawdź kartęBenchmark jest termometrem, nie paliwem.
Wynik ma znaczenie tylko wtedy, gdy test nie został pokazany modelowi. Dlatego dane treningowe i ewaluacyjne prowadzimy jako dwa rozłączne tory.
Najpierw rozdzielamy
Zbiory ewaluacyjne i prywatny held-out są ustalone przed treningiem. Nie trafiają do miksu ani do generowania przykładów treningowych.
Sprawdzamy pochodzenie
Dla każdego źródła zapisujemy autora, licencję, zakres dozwolonego użycia i obowiązki atrybucji. „Publiczny” nie znaczy „dowolny”.
Czyścimy przecięcie
Przed treningiem szukamy duplikatów i bliskich dopasowań do testów. Oficjalne splity benchmarków pozostają poza treningiem.
Publikujemy ślad
Dataset card, manifest, wersja i ograniczenia muszą pozwolić odtworzyć decyzję — również wtedy, gdy artefaktu nie należy używać komercyjnie.
Najpierw zamrażamy test. Potem trenujemy.
Publiczne benchmarki, ich oficjalne splity oraz prywatny held-out nie zasilają treningu. Poprawę mierzymy stałym protokołem, a do publikacji dołączamy wersję danych i ograniczenia wyniku.
Zbiory, które służą wyłącznie do pomiaru.
To zewnętrzne repozytoria, nie publikacje SlayerLab. Linkujemy je bezpośrednio, żeby można było sprawdzić kartę, konfiguracje i licencję u źródła.
Zamknięte benchmarki pozostają zamknięte. Polish EQ-Bench, CPTUB i PLCC nie są prezentowane jako dostępne datasety, jeśli publiczne są tylko wyniki albo przykłady. Szczegóły opisujemy na stronie zamkniętych benchmarków.
Masz czysty korpus albo potrafisz znaleźć jego słabe miejsce?
Najbardziej potrzebujemy pracy nad pochodzeniem, jakością, deduplikacją i pomiarem — nie kolejnego pliku bez licencji i manifestu.