La maggior parte delle discussioni sulle prestazioni linguistiche dell'IA si concentra ancora sull'inglese. Un modello ottiene un buon punteggio in un benchmark standard, viene elogiato come all'avanguardia e viene implementato a livello globale. Ma un numero crescente di prove, tra cui il nuovo dataset EU MMLU della Commissione Europea, dimostra che un'ottima performance in inglese dice ben poco su come un modello gestisce il francese, l'ungherese o il maltese. Per chiunque si affidi alla traduzione automatica in tempo reale tramite IA durante eventi internazionali, questa lacuna non è una nota a piè di pagina accademica. È la differenza tra un partecipante che comprende un discorso e non lo capisce affatto.
Questo è importante perché i parametri di riferimento utilizzati per valutare i modelli linguistici di grandi dimensioni (LLM) determinano quali sistemi vengono implementati e considerati affidabili. Se questi parametri di riferimento sono costruiti quasi interamente in inglese, non possono dirci come un modello si comporta in tutte le altre lingue, comprese quelle parlate dal pubblico a cui la traduzione automatica in tempo reale basata sull'IA dovrebbe rivolgersi.
Cos'è il benchmark EU MMLU?
EU MMLU è un nuovo dataset di benchmarking multilingue pubblicato dalla Direzione generale per la traduzione (DG Traduzione) della Commissione europea. Si basa su Massive Multitask Language Understanding (MMLU), uno dei framework più utilizzati per la valutazione dei modelli linguistici multilingue, che testa i modelli attraverso migliaia di domande a risposta multipla che coprono 57 materie, dalla scienza e dal diritto all'etica e agli affari pubblici.
EU MMLU adatta questo quadro di riferimento specificamente al contesto dell'UE. Si concentra su 7 aree tematiche scelte per la loro rilevanza per le istituzioni europee e attualmente copre 16 lingue ufficiali dell'UE, tra cui croato, ceco, olandese, francese, tedesco, greco, ungherese, irlandese, italiano, lituano, polacco, portoghese, rumeno, slovacco e sloveno, con l'intenzione di aggiungerne altre. Piuttosto che limitarsi a tradurre le domande esistenti in inglese, il progetto si è proposto di preservare lo stesso significato, la stessa difficoltà e lo stesso valore di valutazione in ogni versione linguistica, in modo che un punteggio in polacco abbia lo stesso significato di un punteggio in francese.
Perché una modella può eccellere in inglese e inciampare altrove
La maggior parte dei set di dati per la valutazione dell'IA sono stati creati in inglese e riflettono contesti educativi, culturali e sociali anglofoni. Un modello addestrato e testato prevalentemente su dati in inglese può apparire molto performante, mentre le sue effettive prestazioni in altre lingue rimangono in gran parte non misurate.
È proprio questo il divario che la DG Traduzione si è prefissata di colmare. Come affermato nell'annuncio dell'UE relativo al MMLU, un modello può ottenere un buon punteggio in inglese, ma avere prestazioni significativamente inferiori in francese, ungherese o maltese. Il problema di fondo non è che i modelli non siano in grado di elaborare altre lingue. Il problema è che i benchmark standard raramente li testano in modo sufficientemente rigoroso da rivelare le loro lacune, quindi le debolezze nella grammatica, nelle sfumature o nella terminologia specifica di un settore passano inosservate finché un pubblico reale non si trova a dover utilizzare il risultato.
Nello specifico, per la traduzione automatica basata sull'IA, queste prestazioni disomogenee hanno conseguenze dirette. Un sistema potrebbe gestire bene un testo di partenza in inglese semplice, per poi introdurre errori, frasi goffe o perdite di significato una volta che lo stesso contenuto viene tradotto in una lingua di destinazione meno testata, proprio nel momento in cui la precisione è più importante per un ascoltatore che segue la traduzione in tempo reale.
Come i pregiudizi linguistici e culturali si manifestano nella traduzione simultanea
Le lacune nelle prestazioni linguistiche sono solo una parte del quadro. La DG Traduzione ha anche pubblicato criteri di qualità per il benchmarking multilingue che vanno oltre l'accuratezza della traduzione per valutare quanto bene un modello di intelligenza artificiale rifletta i valori dell'UE e gestisca contenuti culturalmente specifici, inclusi modi di dire, umorismo, riferimenti, formati di date e numeri e differenze nel tono o nel livello di cortesia attesi.
Questi sono proprio gli elementi che rendono la traduzione simultanea davvero difficile. Un relatore che a una conferenza utilizza un'espressione regionale, un riferimento culturalmente specifico o un livello di formalità legato alle convenzioni locali si affida a qualcosa di più di una semplice traduzione parola per parola. Un sistema di intelligenza artificiale che non ha familiarità con questo tipo di sfumature in una determinata lingua potrebbe tradurre le parole letteralmente in modo corretto, perdendo però completamente il significato o il tono desiderato. In un evento multilingue, questo tipo di discrepanza può influenzare la percezione di un messaggio da parte del pubblico, anche quando nessuno si accorge di un errore tecnico.
Perché i dati multilingue sottoposti a revisione umana sono ancora importanti
Uno degli aspetti più notevoli dell'EU MMLU è la sua metodologia. A differenza della maggior parte dei benchmark multilingue, che si basano principalmente sulla traduzione automatica per generare domande di prova in lingue diverse dall'inglese, l'EU MMLU ha utilizzato un approccio incentrato sulla persona. La DG Traduzione ha collaborato con quasi 250 studenti traduttori e project manager della rete European Master's in Translation (EMT), provenienti da 21 università di tutta Europa, per tradurre e rivedere oltre 1.000 domande del benchmark.
Questa distinzione è più importante di quanto possa sembrare a prima vista. Un parametro di riferimento creato tramite traduzione automatica rischia di ereditare le stesse debolezze che dovrebbe evidenziare, confrontando l'output di un modello con quello di un altro modello anziché con un autentico standard umano. La revisione umana ancora la valutazione al modo in cui le persone usano effettivamente il linguaggio, che è anche lo standard più importante per la traduzione simultanea in eventi reali, dove il pubblico è umano e la tolleranza per lievi errori di traduzione è bassa.
Cosa potrebbe significare una valutazione più equa dell'IA per gli eventi multilingue
La DG Traduzione definisce chiaramente il suo obiettivo a lungo termine: stabilire un nuovo standard per la valutazione multilingue dell'IA in Europa, in modo che i sistemi di IA offrano prestazioni coerenti in diverse lingue e culture, anziché principalmente in ambienti anglofoni. Se tale obiettivo verrà raggiunto, i benefici pratici si estenderanno ben oltre i laboratori di ricerca.
Per le organizzazioni che gestiscono conferenze internazionali, riunioni istituzionali o eventi aziendali globali, un benchmarking multilingue più accurato significa una maggiore visibilità su quali sistemi di intelligenza artificiale siano affidabili per quali lingue, anziché scoprire a metà evento che un particolare strumento non offre prestazioni ottimali al di fuori dell'inglese. Ciò consente di prendere decisioni più consapevoli su dove la traduzione simultanea basata esclusivamente sull'IA sia affidabile e dove un approccio ibrido, che combini l'IA con l'interpretazione umana, tuteli meglio il significato e le sfumature per una lingua o un pubblico specifici.
Benchmark come EU MMLU non risolveranno da un giorno all'altro tutte le lacune nell'IA multilingue, ma rappresentano un cambiamento significativo nel modo in cui le prestazioni vengono misurate e comunicate. Man mano che questi standard di valutazione maturano, offrono a organizzatori di eventi, istituzioni e team di comunicazione una base più chiara per scegliere soluzioni di traduzione simultanea basate sull'IA adatte a un pubblico realmente multilingue. Per scoprire come Interprefy affronta la traduzione simultanea basata sull'IA in diverse lingue, esplora la nostra piattaforma di traduzione vocale basata sull'IA.


Altri link per il download



