Fabryka.AI

FABRYKA AI / HISTORICAL RESEARCH RECORD

Dane i modele na Hugging Face

Dane · modele · pochodzenie

Otwarte dane, bez ukrytego trainsetu.

Tu zbieramy publiczne artefakty SlayerLab i zasady, według których powstają. Każdy dataset prowadzi do swojej karty na Hugging Face — razem z licencją, wersją i ograniczeniami.

§ 01 · Hugging Face

Co dziś publikuje SlayerLab.

Lista pochodzi z oficjalnego API organizacji. Każda karta poniżej otwiera dokładne repozytorium — nie stronę wyszukiwania ani kopię opisu.

Stan na · 9 publicznych datasetówźródło: HF datasets API ↗
01 · datasetPL

Polish DynaWord

Otwarty, wieloźródłowy korpus polskiego tekstu pisanego przez ludzi, rozwijany w rodzinie DynaWord.

v0.2.5: 4 319 200 dokumentów · 9,64 mld tokenów (proxy tiktoken) · 18 źródeł

CC BY-SA 4.01M<n<10Makt. 28.08.2026
Karta datasetu ↗
02 · datasetPL

GoLLeM Corpus 2B PL

Dokładny tekst korpusu użytego do treningu modeli GoLLeM-110M-PL v2 i v3, opublikowany dla reprodukcji treningu od zera.

około 2,0 mld tokenów · Parquet · pretraining

CC BY-SA 4.01M<n<10Makt. 31.08.2026
Karta datasetu ↗
03 · datasetPL

DynaWord Mix Extended

Kurowany miks pretreningowy z rozszerzeniami zgodnymi licencyjnie oraz opisanym czyszczeniem i usuwaniem PII.

około 500 mln tokenów w tokenizerze 32k BPE

CC BY-SA 4.010M<n<100Makt. 19.08.2026
Karta datasetu ↗
04 · datasetPL

HPLT v3 PL Cleaned

Oczyszczony polski podzbiór HPLT v3 z wieloetapową bramką PII i redukcją boilerplate'u.

korpus web · PII-gated · licencja wymaga kontroli źródeł

Inne / sprawdź kartę10M<n<100Makt. 18.08.2026
Karta datasetu ↗
05 · datasetPL + EN

Slayer PL 8×3B

Osiem rozłącznych shardów do wieloprzebiegowego treningu z polskim rdzeniem i warstwą prawno-urzędową.

8 × około 3 mld tokenów · około 24 mld łącznie (cl100k)

Inne / sprawdź kartę10M<n<100Makt. 28.08.2026
Karta datasetu ↗
06 · datasetEN

Minimal EN Corpus 2.5B

Anglojęzyczny miks pretreningowy i gotowe binaria nanoGPT do kontrolowanych eksperymentów z modelami około 125M.

2 689 323 439 tokenów treningowych przy BPE 12 288

Warunki źródeł1M<n<10Makt. 29.08.2026
Karta datasetu ↗
07 · datasetEN

Minimal EN Corpus 5B

Większy wariant anglojęzycznego korpusu do porównywalnych eksperymentów nanoGPT.

5 396 605 407 tokenów treningowych przy BPE 12 288

Warunki źródeł1M<n<10Makt. 31.08.2026
Karta datasetu ↗
08 · datasetPL

SlayerLab Tokenizers

Znormalizowane artefakty tokenizerów z warsztatu Slayer, zebrane w jednym przeglądalnym zbiorze.

38 zgłoszeń warsztatowych + kanoniczny tokenizer SlayerLab 32k

MITn<1Kakt. 26.08.2026
Karta datasetu ↗
09 · datasetJBO

Lojban Master Corpus

Połączony korpus języka Lojban. Mapa praw dla poszczególnych źródeł pozostaje w przeglądzie.

15 źródeł · rights review in progress · bez zgody na użycie komercyjne

Inne / sprawdź kartę100K<n<1Makt. 26.07.2026
Karta datasetu ↗
!

Jedna organizacja, różne warunki. Dataset oznaczony jako other albo „warunki źródeł” wymaga przeczytania karty i licencji składników przed treningiem, redystrybucją lub użyciem komercyjnym. Sam dostęp na Hugging Face nie jest zgodą na dowolne użycie.

§ 02 · Modele

Dane mają swój rezultat.

Publiczne modele pokazują, do czego użyliśmy korpusów: od polskich baz GoLLeM, przez badania tokenizerów, po serię BDH i edukacyjny Pollock.

10 publicznych repozytoriów modeli · stan na 04.09.2026źródło: HF models API ↗
01GoLLeM 110M PL v3SlayerLab/GoLLeM-110M-PL-v3

Polski model bazowy GPT-2-class trenowany od zera; druga epoka na tym samym korpusie około 2B.

PLtransformersCC BY-SA 4.0
02GoLLeM 110M PL v2SlayerLab/GoLLeM-110M-PL-v2

Polski model bazowy GPT-2-class po jednej epoce na czystym, wieloźródłowym korpusie około 2B.

PLtransformersCC BY-SA 4.0
03GoLLeM 45M PLSlayerLab/GoLLeM-45M-PL

Model badawczy do ablacji polskiego tokenizera: 42,5M parametrów, GPT-2 i BPE 32 768.

PLtransformersMIT
04GoLLeM 110M PL SFTSlayerLab/goLLeM-110M-PL-SFT-merged

Eksperymentalna wersja instruction-tuned scalona do standardowego formatu Transformers.

PLtransformersCC BY-SA 4.0
05Pollock 1.4SlayerLab/pollock-mini-lm-125m

Edukacyjny model bazowy nanoGPT poniżej 128M, udostępniony także w formacie Transformers.

ENtransformersInne / sprawdź kartę
06BDH 25M PLSlayerLab/bdh-25m-pl

Polski, bajtowy baseline Fast Weight Layers: 25,3M parametrów i 100M tokenów treningowych.

PLcustomCC BY 4.0
07BDH 150M SlayerSlayerLab/bdh-150m-slayer

Bajtowy checkpoint BDH około 151M po 30 tys. kroków na miksie 970M tokenów.

EN + PLcustomCC BY 4.0
08BDH ScalingSlayerLab/bdh-scaling

Artefakty replikacji BDH i porównania ze zbliżonymi rozmiarem baseline'ami 25M, 50M i 100M.

EN + PL + CSpytorchApache 2.0
09Slayer ScratchSlayerLab/slayer-scratch

Archiwum dydaktyczne własnego checkpointu PyTorch, tokenizera, logów i instrukcji reprodukcji.

PLpytorchInne / sprawdź kartę
10Lojban GPT-2 RSI-1SlayerLab/lojban-gpt2-rsi1

Model GPT-2 97,7M trenowany dla Lojbanu w pętli recursive self-improvement.

JBOpytorchInne / sprawdź kartę
§ 03 · Metoda

Benchmark jest termometrem, nie paliwem.

Wynik ma znaczenie tylko wtedy, gdy test nie został pokazany modelowi. Dlatego dane treningowe i ewaluacyjne prowadzimy jako dwa rozłączne tory.

01

Najpierw rozdzielamy

Zbiory ewaluacyjne i prywatny held-out są ustalone przed treningiem. Nie trafiają do miksu ani do generowania przykładów treningowych.

02

Sprawdzamy pochodzenie

Dla każdego źródła zapisujemy autora, licencję, zakres dozwolonego użycia i obowiązki atrybucji. „Publiczny” nie znaczy „dowolny”.

03

Czyścimy przecięcie

Przed treningiem szukamy duplikatów i bliskich dopasowań do testów. Oficjalne splity benchmarków pozostają poza treningiem.

04

Publikujemy ślad

Dataset card, manifest, wersja i ograniczenia muszą pozwolić odtworzyć decyzję — również wtedy, gdy artefaktu nie należy używać komercyjnie.

Zasada release gate

Najpierw zamrażamy test. Potem trenujemy.

Publiczne benchmarki, ich oficjalne splity oraz prywatny held-out nie zasilają treningu. Poprawę mierzymy stałym protokołem, a do publikacji dołączamy wersję danych i ograniczenia wyniku.

§ 04 · Ewaluacja

Zbiory, które służą wyłącznie do pomiaru.

To zewnętrzne repozytoria, nie publikacje SlayerLab. Linkujemy je bezpośrednio, żeby można było sprawdzić kartę, konfiguracje i licencję u źródła.

01LLMzSzŁPolskie egzaminy państwowe i zawodowe · MCQHF ↗02PES 2018–2022Egzaminy specjalizacyjne z medycyny · MCQHF ↗03PoQuADPolskie pytania i odpowiedzi z kontekstuHF ↗04Belebele · PL / ENRozumienie tekstu i kontrola regresji między językamiHF ↗05INCLUDE-44 · PLWiedza kulturowa i regionalnaHF ↗06ARC-ChallengeAngielska kontrola regresji rozumowania naukowegoHF ↗07MMLUAngielska kontrola regresji wiedzy przekrojowejHF ↗08GSM8KAngielska kontrola regresji rozumowania matematycznegoHF ↗
Ø

Zamknięte benchmarki pozostają zamknięte. Polish EQ-Bench, CPTUB i PLCC nie są prezentowane jako dostępne datasety, jeśli publiczne są tylko wyniki albo przykłady. Szczegóły opisujemy na stronie zamkniętych benchmarków.

§ 05 · Wkład

Masz czysty korpus albo potrafisz znaleźć jego słabe miejsce?

Najbardziej potrzebujemy pracy nad pochodzeniem, jakością, deduplikacją i pomiarem — nie kolejnego pliku bez licencji i manifestu.

Dołącz do pracy →Hugging Face