APandrea.
Torna al Blog
AI LocalePrivacyRizzo PGDPROpen SourceAutomazione

Rizzo P: il modello AI italiano per proteggere i tuoi dati sensibili

Scopri Rizzo P, il modello AI locale che anonimizza dati sensibili italiani in 500 MB. Usa ChatGPT e Claude senza regalare informazioni riservate.

6 min di lettura
Rizzo P: il modello AI italiano per proteggere i tuoi dati sensibili

Ogni giorno migliaia di professionisti italiani caricano dati sensibili su ChatGPT, Claude o Gemini senza chiedersi dove finiscano davvero. Cartelle cliniche, contratti, bilanci aziendali, atti legali: tutto passa per server americani o cinesi. E se ti dicessi che esiste un modo per usare l'AI più potente senza regalare i tuoi dati a nessuno?

Quando ho iniziato a esplorare soluzioni per proteggere la privacy dei dati italiani nell'era dell'AI, mi sono reso conto di un paradosso: vogliamo l'intelligenza dei modelli di frontiera, ma non possiamo permetterci di perdere il controllo su informazioni riservate. In questo articolo ti mostro come un modello AI locale, pensato per l'italiano, può risolvere questo problema senza costringerti a spendere migliaia di euro in hardware.

Perché caricare dati sensibili su AI esterne è un rischio reale

Il problema non è teorico. Ho visto personalmente un video diventato virale di un medico che caricava cartelle cliniche complete su ChatGPT per analizzarle. Nome, cognome, codice fiscale, diagnosi: tutto esposto a un servizio terzo di cui non conosciamo le policy di archiviazione o utilizzo dati.

Non succede solo in ambito sanitario. Avvocati che caricano atti e sentenze complete. Commercialisti che analizzano bilanci con partite IVA e IBAN. Notai che processano rogiti con dati catastali. Startup che fanno passare contratti riservati attraverso assistenti AI per velocizzare il lavoro.

Il rischio non è solo etico: dal 2 agosto 2026, l'AI Act europeo entra pienamente in vigore. Studi professionali e aziende che trasferiscono dati sensibili senza controllo rischiano sanzioni pesanti, sia per violazioni GDPR che per non conformità alla nuova normativa europea.

L'illusione dei modelli AI locali (e perché costano troppo)

La soluzione più ovvia sembrerebbe far girare un modello open source in locale. Scarichi Llama, Qwen o DeepSeek tramite Ollama o LM Studio, e i tuoi dati non escono mai dal dispositivo. Problema risolto, giusto?

Non proprio. Per eseguire un modello decente come DeepSeek V3 (284 miliardi di parametri) ti servono almeno 128 GB di RAM. Stiamo parlando di un MacBook Pro da 9.000 euro o di una workstation Nvidia da 6.000 euro in su. E anche investendo quella cifra, le performance non sono minimamente paragonabili a Claude 3.5 Sonnet o GPT-4.

Quindi ti ritrovi in un vicolo cieco: o usi l'AI migliore perdendo il controllo sui dati, oppure investi una fortuna per un'alternativa locale mediocre. Deve esistere una terza via.

Come funziona Rizzo P: anonimizzazione locale + AI di frontiera

L'idea che ho sviluppato si posiziona esattamente nel mezzo. Rizzo P è un modello AI di 300 milioni di parametri, specializzato nell'anonimizzare documenti italiani. Pesa solo 500 MB, gira sul processore di qualsiasi computer moderno e riconosce 22 categorie di dati personali: nomi, codici fiscali, partite IVA, IBAN, targhe, dati catastali e altro ancora.

Il flusso di lavoro è semplice:

  • Carichi il tuo documento (contratto, cartella clinica, bilancio) su Rizzo P in locale
  • Il modello sostituisce tutti i dati sensibili con placeholder anonimi (es. "Mario Rossi" diventa "FULLNAME_1", "RSSMRA80A01H501Z" diventa "CF_1")
  • Solo ora carichi il documento anonimizzato su ChatGPT, Claude o qualsiasi altro servizio
  • Ottieni l'analisi dal modello di frontiera
  • Rizzo P può de-anonimizzare la risposta in locale, ripristinando i dati originali solo sul tuo dispositivo

In questo modo sfrutti l'intelligenza dei migliori modelli disponibili senza mai esporre informazioni riservate. Il dizionario che mappa i placeholder ai dati reali esiste solo nella memoria del tuo PC durante la sessione attiva.

Test sul campo: medici, avvocati e commercialisti

Ho testato Rizzo P su casi d'uso concreti. Primo esempio: una cartella clinica con dati anagrafici completi. Il modello ha identificato e sostituito nome, cognome, codice fiscale, residenza e tessera sanitaria in meno di due secondi. Ho poi caricato il documento anonimizzato su ChatGPT chiedendo un riassunto clinico: la risposta è stata precisa, ma nessun dato personale era visibile.

Secondo test: un contratto di riservatezza (NDA) con ragioni sociali, partite IVA e clausole. Anonimizzato in locale, poi verificato da Claude per controllo di completezza degli articoli. Il modello ha analizzato penali, foro competente e clausole senza mai vedere i nomi delle parti coinvolte.

Questa prima versione non è perfetta: alcuni tag vengono identificati parzialmente, altri sfuggono in contesti sintattici complessi. Ma ho progettato il modello per essere migliorato progressivamente con l'aiuto della community italiana.

Dataset sintetico e contributo collettivo: il futuro è open source

Un modello verticale come Rizzo P vive dei suoi dati di addestramento. Per questo ho lanciato un progetto di dataset collaborativo su Hugging Face: chiunque può contribuire generando esempi sintetici di testo italiano con entità da anonimizzare, usando i propri modelli AI (ChatGPT, Claude, Gemini o API cinesi).

In poche settimane abbiamo superato i 100 GB di dati, con oltre 41 milioni di righe nel dataset grezzo. Dopo pulizia e validazione, circa 1,4 milioni di esempi sono pronti per il training della versione 1.2. La community ha bilanciato le categorie meno rappresentate: ad esempio, abbiamo generato migliaia di frasi con targhe e dati catastali, che nella versione iniziale erano sottorappresentati.

Il training della nuova versione è già partito su GPU Blackwell affittate, con l'obiettivo di migliorare la precisione soprattutto su documenti legali e sanitari. L'idea non è competere con GPT-4, ma costruire strumenti specifici per esigenze italiane che i modelli generalisti non coprono bene.

Potremmo estendere questo approccio ad altri modelli verticali: embedding semantici ottimizzati per documenti italiani, OCR per fatture e contratti, speech-to-text specializzato su dialetti regionali. Esattamente la strategia che Mistral AI sta seguendo in Europa: non cercare di battere OpenAI sul large language model generico, ma vincere su modelli piccoli, specifici e open source.

Installazione e utilizzo: nessuna competenza tecnica richiesta

Rizzo P è disponibile come applicazione standalone per Windows, macOS e Linux. Su macOS, l'app è stata notarizzata da Apple (verifica anti-malware ufficiale). Dopo l'installazione, l'interfaccia è minimale: carichi un PDF o scrivi testo manualmente, clicchi "Anonimizza" e in un secondo ottieni il risultato.

Puoi copiare l'output direttamente in ChatGPT o Claude. Se vuoi ripristinare i dati originali, incolli la risposta del modello nella sezione "Restore the answer" e Rizzo P sostituisce i placeholder con i valori reali usando il dizionario locale. Volendo, puoi scaricare il dizionario per sessioni future o cancellarlo immediatamente per azzerare la memoria.

Il codice è completamente open source su GitHub. Trovi gli script di training, pulizia dataset e contribuzione. Se vuoi aiutare a migliorare il modello, basta clonare la repository, eseguire contribute_dataset.py e generare nuovi esempi sintetici con il tuo modello AI preferito. Una volta pronti, fai push su Hugging Face e io mi occupo di validarli e integrarli nella versione successiva.

Questa è solo la prima tappa di un progetto più ampio. Rizzo P dimostra che un singolo professionista, con gli strumenti giusti e una community motivata, può costruire soluzioni AI utili senza aspettare iniziative miliardarie. La domanda vera è: quanto tempo abbiamo prima che questi strumenti diventino indispensabili, e chi controllerà i dati quando succederà? Se stai lavorando con informazioni sensibili, il mio consiglio è di iniziare a testare soluzioni locali adesso, prima che diventi un obbligo normativo.