ARTFEED — Contemporary Art Intelligence

Le chiamate API LLM falliscono in contesti multilingue: uno studio propone correzioni post-addestramento

ai-technology · 2026-08-13

Una recente indagine pubblicata su arXiv (2608.11715) esplora l'affidabilità dei modelli linguistici di grandi dimensioni (LLM) nell'effettuare chiamate API in più lingue. I ricercatori evidenziano un problema frequente noto come 'Mancata corrispondenza della lingua degli argomenti' (ALM), in cui un modello identifica correttamente lo strumento ma produce valori degli argomenti in una lingua diversa. Sebbene questi output siano semanticamente validi, sono funzionalmente errati e non vengono misurati dalle metriche tradizionali di chiamata API. Lo studio rivaluta le tecniche post-addestramento per alleviare l'ALM, rivelando che il fine-tuning supervisionato (SFT) stabilisce una solida base di riferimento, migliorando notevolmente l'uniformità della lingua degli argomenti e la precisione complessiva delle chiamate di funzione. Quando i modelli vengono selezionati in modo coerente, le prestazioni di SFT rivaleggiano o addirittura superano quelle di metodi di apprendimento per rinforzo (RL) più complessi. La ricerca considera anche se RL con ricompense strutturate e sensibili agli argomenti offra vantaggi aggiuntivi, osservando che tecniche come l'ottimizzazione delle politiche relative al gruppo (GRPO) possono migliorare elementi specifici. Questi risultati implicano che approcci post-addestramento più semplici potrebbero affrontare efficacemente l'uso di strumenti multilingue, mettendo in discussione la necessità di complessi framework RL.

Fatti principali

  • Studio su arXiv:2608.11715
  • Identifica la mancata corrispondenza della lingua degli argomenti (ALM) nelle chiamate API LLM
  • ALM si verifica quando il modello seleziona lo strumento corretto ma genera valori degli argomenti in una lingua incoerente
  • SFT fornisce una solida base di riferimento, migliorando la coerenza della lingua degli argomenti e l'accuratezza delle chiamate di funzione end-to-end
  • SFT raggiunge prestazioni paragonabili o superiori agli approcci RL con selezione coerente del modello
  • RL con ricompense strutturate e sensibili agli argomenti (es. GRPO) può offrire vantaggi aggiuntivi
  • Le metriche standard di chiamata API non catturano ALM
  • Lo studio rivaluta le strategie post-addestramento per l'uso di strumenti multilingue

Entità

Istituzioni

  • arXiv

Fonti