ARTFEED — Contemporary Art Intelligence

Tiny_Schiller: Un corpus letterario tedesco per piccoli modelli linguistici

publication · 2026-07-24

Tiny_schiller è un corpus in un unico file di 2,07 megabyte, contenente undici drammi di Schiller di pubblico dominio. Funge da alternativa diretta a tiny_shakespeare di Karpathy, con l'obiettivo di facilitare la prototipazione, il fine-tuning, l'educazione e la ricerca di piccoli modelli linguistici nell'ambito della letteratura tedesca. Il corpus deriva dall'esportazione GerDraCor di DraCor (CC0) ed è stato elaborato utilizzando un'ingegneria deterministica del parser, eliminando la necessità di regolazioni del parser pre-addestramento. Presenta suddivisioni a livello di carattere, codifica byte-pair GPT-2, tokenizzazione cl100k_base, una suddivisione dialogo-completamento in formato istruzione e 89 suddivisioni per personaggio a livello di carattere, tutte accessibili tramite un singolo comando HuggingFace. Ciò fornisce un modo semplificato per utilizzare testi letterari tedeschi, colmando una lacuna nei corpus letterari tedeschi esistenti, più estesi, che richiedono un'ampia pre-elaborazione.

Fatti principali

  • tiny_schiller è un singolo file di 2,07 MB contenente undici drammi di Schiller di pubblico dominio.
  • È un equivalente diretto di tiny_shakespeare di Karpathy per testi letterari tedeschi.
  • Proviene dall'esportazione GerDraCor di DraCor con licenza CC0.
  • Elaborato tramite ingegneria deterministica del parser.
  • Include suddivisioni a livello di carattere, GPT-2 BPE e tokenizzazione cl100k_base.
  • Include una suddivisione dialogo-completamento in formato istruzione.
  • Include 89 suddivisioni per personaggio.
  • Caricabile con una singola chiamata HuggingFace.

Entità

Artisti

Istituzioni

  • DraCor
  • GerDraCor
  • HuggingFace

Fonti