industry · product
Come mantenere accurato un agente AI dopo il lancio
Uno studio sottoposto a revisione paritaria ha rilevato un calo di qualità nel 91% dei 128 abbinamenti modello-dataset testati nel tempo. Non serve che cambi nulla nella tua configurazione perché un agente in produzione peggiori: ecco il ciclo di manutenzione che se ne accorge.

La manutenzione di un agente AI non è lavoro di rifinitura. È il lavoro. Un agente che al lancio ha superato ogni test può peggiorare in modo misurabile in produzione senza che nessuno tocchi un prompt, una regola di sicurezza o una riga di codice. Uno studio sottoposto a revisione paritaria, pubblicato su Scientific Reports di Nature, ha abbinato quattro modelli di machine learning a 32 dataset reali presi da sanità, finanza, trasporti e meteorologia, per poi osservare come ogni abbinamento reggeva col passare del tempo dall'ultimo addestramento. La qualità è calata nel 91% dei 128 abbinamenti, uno schema che gli autori hanno chiamato invecchiamento dell'AI. La soluzione non è un modello migliore. È un ciclo di revisione con un responsabile.
Abbiamo già scritto di come portare un agente al lancio in sicurezza, in quattro fasi. Questa è la parte successiva, quella di cui si parla molto meno e che fa più danni silenziosi: cosa fai nella sesta settimana, e nella ventesima.
Perché un agente AI peggiora dopo il lancio?
Quattro cose si deteriorano, e lo fanno in modo indipendente. Quasi tutti i team ne sorvegliano una sola.
| Cosa si deteriora | Come si manifesta | Come te ne accorgi |
|---|---|---|
| Il comportamento del modello | Stessa domanda, stesso prompt, una risposta peggiore ma sicura di sé quanto quella giusta | Riesegui un set di test fisso a cadenza regolare e confronta i punteggi |
| Le tue informazioni | L'agente cita correttamente una regola, un prezzo o un orario di apertura che hai cambiato il mese scorso | Metti una data su ogni voce della knowledge base e rivedila a cadenza fissa |
| La tua attività | Un nuovo servizio, una nuova sede, gli orari stagionali, una promozione finita | Lega gli aggiornamenti delle informazioni al cambiamento operativo che li ha resi necessari |
| Il perimetro | All'agente vengono chiesti compiti più lunghi e complessi di quelli per cui era stato pensato | Tieni d'occhio il tasso di passaggio a un operatore e il tipo di richieste che arrivano |
La prima riga coglie di sorpresa. Nella sua rubrica su HousingWire, Anwar Ali la chiama deriva comportamentale e la distingue dalla deriva dei dati, di cui quasi tutti i team hanno sentito parlare. È la più difficile delle due da individuare, perché in una risposta peggiore non c'è niente che sembri peggiore.
Come si presenta davvero la deriva in un progetto reale?
Anwar Ali, SVP e Head of Product Management di BSI Financial Services, ha raccontato esattamente questo a settembre 2026. Il suo team gestiva un agente vocale e di chat che rispondeva alle domande dei mutuatari sui dati reali dei conti, dietro regole di compliance messe a punto in parecchio tempo. Funzionava. Il containment, cioè la quota di clienti il cui problema si risolveva senza arrivare a una persona, è rimasto sopra la media di settore per mesi.
Poi è sceso di circa otto punti. Per settimane non se ne è accorto nessuno.
L'analisi ha scagionato le regole di sicurezza, il flusso di conversazione e i cambiamenti nel comportamento dei clienti. La causa era il modello stesso, un modello consolidato di un laboratorio di primo piano, che senza far rumore dava risposte peggiori alle stesse categorie di domande. La sua conclusione è la parte da rubare: è stato un fallimento della misurazione, non della tecnologia. Il containment veniva rivisto ogni settimana, e un indicatore settimanale che arriva in ritardo non riesce a intercettare uno scivolamento lento finché non ci sono già passati parecchi clienti.
Quali numeri tenere d'occhio, e ogni quanto?
Scegli un gruppo ristretto di metriche, assegna a ciascuna una cadenza, e fai in modo che quella cadenza sia più breve della finestra in cui si fanno i danni. Una metrica rivista una volta al mese ti regala un mese storto prima di darti un segnale. Queste sono metriche operative, non metriche di ritorno economico; per il lato finanziario vedi come misurare il ROI dell'AI quando quasi nessun progetto ne mostra.
| Metrica | Cadenza | Cosa significa se peggiora |
|---|---|---|
| Tasso di passaggio a un operatore | Ogni giorno | L'agente rifiuta o sbaglia più spesso, oppure sono cambiate le domande |
| Tempo di prima risposta | Ogni giorno | Un problema di consegna o di coda, non di qualità |
| Risoluzione senza passaggio a un operatore | Ogni giorno | L'indicatore classico della deriva. Guarda l'andamento, non il singolo giorno |
| Percentuale di pollici verso sulle risposte AI | Ogni settimana | Il tuo team vede qualcosa che i numeri aggregati nascondono |
| Tasso di prenotazione o conversione dalle conversazioni | Ogni settimana | L'agente risponde ma non chiude più |
| Punteggio del set di test di regressione | Ogni mese, e a ogni cambio di modello | Il modello o la configurazione si sono mossi sotto i tuoi piedi |
Il tempo di prima risposta merita un posto in quella lista anche se raramente va alla deriva. Il nostro studio su 32,581 conversazioni ha rilevato che le risposte entro 60 secondi convertivano al 35.1%, contro il 7.1% di quelle arrivate tra una e ventiquattro ore. La velocità è la metrica per cui un agente viene comprato, quindi è quella che vale la pena dimostrare ancora vera.
Ogni quanto va rifatto il test di un agente AI?
Tieni un set fisso di test di regressione fatto di conversazioni reali con esiti corretti noti, e rieseguilo in tre occasioni:
- A cadenza fissa, almeno una volta al mese. È questo che trasforma la deriva in un numero invece che in un sospetto.
- Prima e dopo ogni cambio di modello, compresi quelli che non hai deciso tu. Se la tua piattaforma passa a un modello più recente, per il tuo sistema è un cambiamento.
- Dopo ogni modifica rilevante alle informazioni o alle istruzioni. Una correzione fatta per un reclamo spesso rompe una risposta che andava benissimo.
Costruiscilo con le conversazioni che hai già. Dai venti ai cinquanta casi: le domande più frequenti, i casi limite scomodi, e quella manciata di richieste a cui l'agente non deve mai rispondere da solo. Abbastanza grande da intercettare una regressione vera, abbastanza piccolo da rieseguirlo davvero.
Rivalutare su quale modello far girare tutto è un ciclo a parte, più lento. Ogni trimestre è un buon punto di partenza, ed è molto più semplice se la tua configurazione non è mai stata saldata a un solo laboratorio, come sostenevamo in perché non conviene costruire la tua attività su un solo modello AI.
Com'è fatto un ciclo di manutenzione settimanale?
Da trenta a sessanta minuti, sempre nello stesso momento della settimana:
- Leggi dieci conversazioni reali dall'inizio alla fine. Non i riassunti. Prendine qualcuna segnalata e qualcuna a caso, perché sono quelle a caso a mostrarti com'è fatta la normalità.
- Smista ogni pollice verso registrato dal tuo team. Assegna ciascuno a una di tre categorie: l'informazione era sbagliata o mancava, le istruzioni erano sbagliate, oppure l'agente avrebbe dovuto passare la conversazione a una persona.
- Correggi la categoria, non la conversazione. Una correzione una tantum dentro una singola chat non insegna niente al sistema. Aggiorna la voce della knowledge base, l'istruzione o la regola di passaggio.
- Riesegui il set di regressione se hai toccato qualcosa di portante.
- Scrivi cosa hai cambiato e perché. Un registro delle modifiche con le date è ciò che ti permette di rispondere a "quando è cominciato?" sei settimane dopo.
Perché i compiti più lunghi falliscono anche quando il modello sta bene?
Questo è un vincolo di progettazione più che un'attività di manutenzione, ma si presenta con l'aspetto di un deterioramento.
Un preprint su arXiv dell'agosto 2026, How Fast Do Agents Rot?, ha misurato l'affidabilità degli agenti su nove modelli e 10,664 traiettorie analizzate. Il successo di un compito segue una legge geometrica governata dall'affidabilità per singolo passaggio, che cresce con la scala del modello ma si satura ben al di sotto di 1 anche nei sistemi più potenti. Nel compito davvero agentico di uso degli strumenti, ogni modello testato, compresi quelli proprietari diffusissimi, è passato da un successo quasi perfetto a quasi zero nel giro di sedici passaggi dipendenti l'uno dall'altro. Il deterioramento seguiva il numero di passaggi, non la lunghezza del contesto.
È un preprint, e i suoi compiti non sono conversazioni di assistenza clienti. La lettura pratica regge lo stesso: l'affidabilità si erode in modo composto a ogni passaggio dipendente, quindi un agente il cui perimetro è rispondere, qualificare e prenotare poggia su basi molto più solide di uno che manda avanti senza supervisione un processo da quindici passaggi. Se il lavoro del tuo agente è cresciuto in silenzio dal lancio, hai un problema di perimetro travestito da problema di qualità.
Chi se ne occupa davvero?
Di solito nessuno, ed è questa la vera scoperta nell'articolo di Ali. Il product rilascia, l'engineering tiene in piedi l'infrastruttura, le operations mandano avanti l'attività, e nessuno ha il compito di accorgersi che le risposte sono peggiorate.
Nomina una persona, e non affidare il lavoro a un comitato. Guarda i numeri quotidiani, manda avanti il ciclo settimanale, e ha l'autorità per dire che l'agente sta sbagliando e ridurne il perimetro. È quest'ultima parte a rendere reale il ruolo. Ali è netto sull'alternativa: "un revisore che può solo mettere un timbro non sta facendo supervisione, ne sta solo dando l'apparenza".
Dove si inserisce Entagl
Chiunque nel tuo team può segnalare una risposta AI sbagliata direttamente dalla casella unificata, aggiungendo una nota su cosa non andava. Le risposte segnalate finiscono in una coda di revisione con uno stato, così lo smistamento settimanale ha una lista di lavoro invece di un esercizio di memoria. Le informazioni stanno in un unico posto, quindi correggere una FAQ, un servizio o i tuoi orari di apertura le corregge in un colpo solo per WhatsApp, Instagram, Messenger, Telegram, chat sul sito, email e API. Dato che i quattro agenti condividono un solo cervello, una correzione fatta per la chat vale anche alla telefonata successiva.
Due elementi strutturali contano più di qualsiasi singola funzione. L'instradamento dei modelli non è legato a un unico laboratorio: il modello dietro a ogni fase è un'impostazione, e dietro si possono configurare modelli di riserva, quindi un cambio di comportamento da parte di un fornitore diventa una scelta di instradamento e non una ricostruzione. E il passaggio a una persona è un percorso di prima classe, non uno stato di errore, quindi il numero che ti dice che qualcosa sta andando alla deriva è un numero che stai già raccogliendo.
Ancorare bene l'agente fin dall'inizio rende tutto questo meno costoso, come spieghiamo in come addestrare un agente AI sulle informazioni della tua attività.
Cosa la manutenzione non risolve
Non rende accurato un agente che non è mai stato ancorato come si deve. Monitorare un agente con un perimetro sbagliato ti dà una misurazione precisa della cosa sbagliata.
Non elimina le allucinazioni. I controlli che le riducono sono un insieme a parte, di cui parliamo in come impedire al tuo agente AI di avere allucinazioni.
E un numero che si muove non è una diagnosi. Il tasso di passaggio a un operatore può salire perché l'agente è peggiorato, oppure perché hai lanciato una campagna pubblicitaria che ha portato domande di tipo diverso. Leggi le conversazioni prima di cambiare qualcosa. È per questo che il primo passo del ciclo settimanale è leggere, non misurare.
FAQ
Ogni quanto va controllata la performance di un agente AI?
Guarda ogni giorno il tasso di passaggio a un operatore, il tempo di prima risposta e il tasso di risoluzione, perché sono gli indicatori anticipatori di uno scivolamento. Rivedi ogni settimana le risposte segnalate e la conversione. Riesegui un set di test di regressione ogni mese e a ogni cambio di modello. È proprio la revisione solo settimanale ad aver lasciato passare inosservato per settimane un calo di otto punti in un progetto del settore finanziario.
Un agente AI può peggiorare se non è cambiato niente?
Sì, per due motivi distinti, e conviene tenerli separati. La deriva comportamentale è quella che sfugge a quasi tutti i team: un modello ospitato può iniziare a dare risposte peggiori alle stesse domande senza che i tuoi prompt o la tua configurazione siano cambiati, ed è quello che Anwar Ali ha documentato in BSI Financial Services quando il containment è sceso di circa otto punti. L'altro è l'invecchiamento dell'AI: un modello fermo diventa meno accurato solo perché è passato più tempo dal suo addestramento, cosa che Scientific Reports di Nature ha osservato nel 91% dei 128 abbinamenti modello-dataset testati. Meccanismi diversi, stesso sintomo. Un set fisso di test di regressione li intercetta entrambi.
Come capisci se il problema è il modello o la tua knowledge base?
Riesegui il tuo set fisso di test di regressione. Se casi che prima passavano ora falliscono mentre le informazioni di base non sono cambiate, si è mosso il modello. Se l'agente risponde con sicurezza partendo da informazioni semplicemente superate, si sono mosse le tue informazioni. È il set di test a separare le due cose, ed è per questo che va tenuto fisso e riutilizzato, non riscritto ogni volta.
Chi dovrebbe occuparsi della manutenzione dell'agente AI in una piccola impresa?
Una persona con nome e cognome, di solito chi si occupa dell'esperienza cliente più che chi è più tecnico. Il lavoro consiste nel leggere conversazioni, smistare le risposte segnalate e aggiornare le informazioni sull'attività. Niente di tutto questo richiede competenze di sviluppo, e tutto richiede qualcuno che abbia l'autorità per ridurre il perimetro dell'agente quando i numeri lo dicono.
Un modello migliore elimina la necessità di monitorare?
No. L'affidabilità per singolo passaggio migliora con la scala del modello ma non arriva a 1, quindi le catene di compiti più lunghe si degradano comunque, e un modello più potente può lo stesso cambiare comportamento sotto i tuoi piedi. I modelli migliori alzano il pavimento. Non tolgono la necessità di tenere d'occhio il pavimento.
Comincia dal numero che non stai raccogliendo
Quasi sicuramente fai già una revisione settimanale dei numeri da qualche altra parte in questa attività, tieni un registro delle modifiche per qualche altro sistema, e sai come fare un controllo a campione sulla qualità del lavoro. Ali arriva alla stessa conclusione in fondo alla sua rubrica: la capacità di solito c'è già, e quasi nessuno l'ha puntata sull'AI che parla con i suoi clienti.
Scegli un indicatore anticipatore che non stai guardando ogni giorno, assegnagli un responsabile e metti trenta minuti in calendario per la lettura settimanale. Solo questo sarebbe bastato a intercettare la deriva descritta qui.
Per vedere come funzionano su uno spazio di lavoro reale la coda delle risposte segnalate, le informazioni condivise e i controlli di passaggio a una persona, prenota una demo di 30 minuti e ci passeremo insieme le tue conversazioni.
Fonti: Nature Scientific Reports, "Temporal quality degradation in AI models" (2022); HousingWire, Anwar Ali, "The silent failure mode: what happens when your AI model quietly gets worse" (settembre 2026); arXiv:2609.01660, "How Fast Do Agents Rot?" (agosto 2026); Entagl Response Velocity Study (2026). Dati verificati a settembre 2026.