Cosa succede se addestri un LLM rumeno su dati pubblici grezzi — un esperimento onesto

Cosa succede se addestri un LLM rumeno su dati pubblici grezzi — un esperimento onesto

Avevo delle GPU ferme, inutilizzate. In questo periodo stiamo organizzando i dati per un modello interno — un lavoro di curazione lento e attento, che non tiene occupato l’hardware. Così ho pensato: nel frattempo, facciamo un test.

Non un modello serio. Un esperimento. Volevo rispondere a una domanda che mi ponevo da tempo:

Cosa viene fuori se addestri un modello linguistico rumeno da zero, usando solo dati pubblici, raccolti da internet esattamente così come sono — senza un filtraggio accurato, senza curazione, senza dati sintetici, senza annotazione umana?

Il risultato si chiama Beatrice v0.1. Puoi provarlo subito.

Cos’è, in realtà

Un modello da 896 milioni di parametri, addestrato da zero, quasi interamente in rumeno (il resto un po’ di inglese e codice, per la struttura di ragionamento).

E, per essere chiari fin dall’inizio: Beatrice non pretende di essere intelligente. Non è un modello di produzione, non compete con niente. È un test del nostro processo di addestramento — il pipeline dai dati grezzi fino a un modello che parla. Volevo vederlo funzionare end-to-end prima di investire nel modello vero.

Ho costruito l’intera catena: filtraggio, deduplicazione, un tokenizzatore addestrato da zero sul rumeno (due volte più efficiente di quello di GPT-2 sul testo rumeno), la miscela di dati, l’addestramento, il fine-tuning conversazionale. Ogni pezzo ha funzionato. Questo era il vero obiettivo.

Cosa ho imparato, ed è la parte interessante

Ho valutato il modello su oltre mille domande. Ne è emerso un profilo che dice tutto su cosa sia un modello di queste dimensioni:

  • Scrive un rumeno corretto e naturale. Grammatica, diacritici, ordine delle parole naturale, espressioni idiomatiche. Qui il corpus filtrato ha mostrato il suo valore.
  • Eccelle nella comprensione del testo. Dagli un contesto e una domanda su di esso, ed estrae la risposta giusta. Nei miei test: 100%.
  • Inventa i fatti. Interrogato “a memoria” su popolazioni, anni, nomi — risponde con sicurezza cose false. Sui quiz di conoscenza generale ottiene un punteggio casuale.

In altre parole: un ottimo lettore, non un’enciclopedia.

E questo non è un difetto da correggere — è il profilo di un modello da 896M di parametri. Non ha dove immagazzinare conoscenza sul mondo. Ciò che sa fare, e fa bene, è leggere un testo e riformularlo in rumeno pulito. Da qui la conclusione pratica: un modello piccolo come questo funziona meglio abbinato a una fonte di informazioni — gli dai il testo, lui fa la formulazione. Lasciato solo, allucina.

È una lezione che conoscevo in teoria. Ora ce l’ho misurata, in rumeno.

L’onestà conta più dell’hype

Avrei potuto scrivere “ho addestrato un LLM rumeno” e fermarmi lì. Ma Beatrice ha limiti reali, e li dichiaro tutti: inventa, non ammette quando non sa, non ha filtri di sicurezza. Li ho scritti anche nella model card, nero su bianco.

Non per modestia. Perché un modello presentato come più di quello che è invecchia male — le persone ne scoprono i limiti comunque, da sole. Meglio conoscerli dall’inizio e concentrarsi su ciò che fa davvero bene.

E ciò che Beatrice fa bene — leggere e scrivere in rumeno — non è poco per un esperimento uscito da GPU che altrimenti sarebbero rimaste ferme.

Cosa viene dopo

Beatrice v0.1 è il passo zero. Tra 1–2 mesi addestreremo il modello vero, su dati filtrati e di qualità — sintetici più scritti da persone, non testo pubblico grezzo. Sarà più coerente, meno incline ad allucinare, e probabilmente più facile da eseguire.

La differenza tra i due non sarà la dimensione del modello. Sarà la qualità dei dati. Beatrice ne è la prova, per controesempio: dati grezzi → un lettore competente ma che confabula. Voglio vedere quanto si alza l’asticella quando i dati sono organizzati con cura.

Provalo tu stesso

Il modello è pubblico. Chi è curioso può provarlo:

🔗 huggingface.co/krakiun/ro-nanochat-d20-chat

Gira in locale, con un solo comando — le istruzioni sono nella pagina del modello. Nessun account, nessun cloud, niente lascia il tuo computer.

Digli “ciao”, fagli una domanda, dagli un testo e chiedigli di rispondere basandosi su di esso. Vedrai presto sia cosa sa fare sia dove inciampa. Entrambi sono interessanti.

Feedback e critiche sono benvenuti. Beatrice non è stata costruita per impressionare — è stata costruita per imparare da lei. E la critica onesta ne fa parte.

PII Offline Remover — anonimizzazione dei dati personali, 100 % sul tuo Mac

Offri consulenza o servizi personalizzati?

No. La mia filosofia è costruire asset, non vendere ore. Dedico il mio tempo esclusivamente allo sviluppo di prodotti e sistemi automatizzati. Credo che il vero valore a lungo termine stia nel creare soluzioni scalabili, non nell'offrire servizi 1-a-1.

Lavori da solo sui progetti?

No. La maggior parte dei progetti viene sviluppata insieme a un piccolo team di collaboratori. Negli ultimi anni ho lavorato costantemente con 1-7 persone, a seconda del progetto. Il mio ruolo principale è definire strategia, architettura tecnica e direzione del prodotto.

Posso collaborare con te su un progetto? Se sì, come?

Sono sempre alla ricerca di partner eccezionali, non solo collaboratori. Cerco persone che portino competenze di alto livello e un allineamento totale con la visione. Le partnership strategiche sono strutturate su performance e impegno a lungo termine.

Come posso contattarti per discutere?

Il modo più efficiente è attraverso la pagina di contatto. Prioritizzo conversazioni strategiche e proposte ben articolate. Non ho tempo per discussioni superficiali, ma rispondo sempre con interesse ai messaggi che dimostrano sostanza e potenziale reale.

Come posso supportare i tuoi progetti?

Il supporto più prezioso è quello strategico. Un'introduzione a un partner rilevante, un feedback pertinente basato su competenze profonde o un'opportunità di mercato che non ho visto sono molto più preziosi di qualsiasi altra cosa.