lf.Una rivista personaleEnglish
IA / 016liminalfinds.it

L’agente più puntuale a volte finiva prima e aspettava che passasse il tempo

Un nuovo benchmark ha chiesto a tre agenti AI di lavorare per un tempo stabilito. Uno lo ha rispettato nel 63% dei casi, talvolta mettendosi a dormire; un altro ci metteva quanto serviva al compito, qualunque fosse la richiesta, e cominciava a contare solo dopo aver guardato l’orologio per la prima volta.

Uno schizzo a grafite di un tavolo da lavoro in legno: un portatile aperto con poche righe sullo schermo, una lampada da scrivania spenta, un orologio rotondo appoggiato sul piano e, in mezzo, un foglietto piegato con un solo segno di spunta.

A un modello linguistico si dà una domanda di chimica e una frase in più: lavoraci per 75 secondi esatti. In una prova Fable 5.1, un modello di Anthropic, ha ragionato per una decina di minuti prima di guardare l’orologio. Poi ha scritto che controllava l’ora «so I can pace this against the 1.25-minute window you asked for», per regolarsi sul minuto e quarto richiesto, e ha risposto al quindicesimo minuto. Non stava disobbedendo: aveva cominciato a contare dal primo sguardo all’orologio. Un modello linguistico non ha un orologio interno e sa quanto tempo è passato solo da ciò che riesce a leggere.

La prova viene da AgentTime, un preprint pubblicato su arXiv il 7 ottobre da Michael Ofengenden e Maksym Andriushchenko. I due hanno preso 222 compiti da 18 benchmark già esistenti, dalle domande di scienze a risposta chiusa alla programmazione, dall’uso del computer a piccoli progetti di ricerca. Hanno tolto i limiti di tempo abituali e aggiunto in fondo una sola frase: «Please work on this task for a full N minutes», o ore. Ogni compito è stato proposto tre volte, e di solito la richiesta più lunga valeva sedici volte la più breve; si andava da circa un minuto a 60 ore. Un cronometro esterno alla macchina dell’agente misurava ogni prova: gli agenti potevano guardare l’ora, ma non quella misura. Il grosso del lavoro l’hanno fatto tre agenti: Fable 5.1 dentro Claude Code, GPT-5.6 Sol e GPT-6 Astra dentro Codex, lo strumento di OpenAI. In tutto 1.991 prove cronometrate, per circa 93.000 dollari a prezzi di listino.

Il più puntuale è stato GPT-6 Astra: il 63% delle sue prove si è chiuso entro il 5% dal tempo richiesto, contro il 39% di Sol e il 4% di Fable. Fable si comporta come se quella frase quasi non ci fosse. Sullo stesso compito, con sedici volte più tempo a disposizione, ha lavorato appena 1,9 volte più a lungo; Sol cinque volte, Astra dodici. Fable impiega in genere il tempo che il compito sembra richiedere: in un problema da gara di programmazione si è fermato dopo 3,6, 12 e 61 minuti quando gliene erano stati chiesti 10, 40 e 150. Quando gli autori hanno scambiato gli ambienti, mettendo Fable in Codex e Astra in Claude Code, la differenza è rimasta legata al modello.

Essere puntuali, però, non vuol dire lavorare. Gli autori hanno letto le trascrizioni delle prove di Astra finite in orario sui compiti pratici. In 11 su 49 l’agente stava ancora facendo un lavoro vero verso la fine. In 24 ripassava quello che aveva già fatto. In 14 ha finito e poi si è messo esplicitamente a dormire fino allo scadere del tempo. In Codex c’è uno strumento che legge l’ora e sa anche mettersi in attesa, e le regole di classificazione nel codice degli autori contano come sonno una chiamata a quello strumento o un comando di shell che non fa altro che attendere. Fable, su una domanda chiusa, aveva la risposta dopo una ventina di secondi su 75 richiesti e ha continuato a interrogare l’orologio fino a sforare. Il tempo in più raramente ha cambiato il risultato: per quasi due compiti su tre il punteggio era lo stesso con la richiesta più lunga e con quella più breve. Gli autori aggiungono una cautela: né fermarsi prima né dormire, scrivono, prova che un agente stesse cercando di sottrarsi ai controlli.

Come fa allora un agente a sapere che ore sono? Soprattutto leggendo. Ogni trascrizione esaminata dagli autori era piena di indizi: quanto era durato un test, le date accanto ai file, gli orari nei log. Molti agenti passavano parte della sessione a cercare letture dell’orologio nel proprio output. Interrogati a cose fatte su quanto fosse durata una prova, gli agenti si avvicinavano al vero. Tolti dalla registrazione gli orari e gli altri indizi, l’errore tipico saliva a circa 2,6 volte per Fable e Astra e a 5,4 volte per Sol. Interrogati in anticipo, sbagliavano per eccesso: tutti e tre davano una previsione mediana di 15 minuti, mentre la durata mediana reale era di 13 minuti per Fable, 10 per Astra e 6 per Sol. Le persone, osservano gli autori, tendono a sbagliare nel senso opposto e a sottovalutare quanto ci metteranno.

Per questa nota ho ricalcolato i dati principali sui tempi dal file delle prove pubblicato sul sito del progetto: 62,9%, 38,9% e 4,1% di prove in orario e, sullo stesso compito, prove 12,2, 5,0 e 1,9 volte più lunghe quando veniva chiesto sedici volte più tempo. Coincidono con l’articolo. La frase aggiunta ai compiti, le regole di classificazione e la configurazione dell’orologio sono nel codice pubblico. Un altro preprint recente su arXiv, «On the Clock», di Aaron Wang e colleghi, arriva a una conclusione simile con piccoli modelli aperti Qwen: se il tempo a disposizione è indicato solo nella richiesta, gli agenti non lo gestiscono, e i modelli addestrati a rispettarlo spesso riempiono i minuti in più ripetendo le stesse azioni.

Non verificate: le trascrizioni, che stanno in un dataset su Hugging Face accessibile solo con un account, e quindi le etichette che dividono le prove tra lavoro, ricontrollo e sonno. L’articolo dice che gli autori hanno letto le trascrizioni, ma le regole di classificazione nel codice sono scritte come istruzioni per chi legge versioni condensate delle prove, e la dichiarazione sull’uso dell’AI riporta che strumenti di AI hanno contribuito all’analisi qualitativa: non è chiaro quanta parte della classificazione sia stata fatta da persone. I casi di sonno sono pochi e vengono soprattutto da tre benchmark. Ogni agente ha svolto ogni compito una sola volta per ciascuna durata, i modelli provati sono tre di due aziende e la velocità del servizio variava tra abbonamenti, chiavi API e OpenRouter. Le cifre sulle previsioni e sulle stime a posteriori sono quelle dell’articolo, non ricalcolate qui.

02 / La scoperta

AgentTime: Can Agents Estimate and Control Their Own Runtime? — Ofengenden e Andriushchenko

Preprint arXiv 2610.09944 (v1 7 ottobre 2026, v2 8 ottobre; senza revisione paritaria): 222 compiti da 18 benchmark, tre durate richieste per ciascuno, 1.991 prove cronometrate di Fable 5.1 in Claude Code e di GPT-5.6 Sol e GPT-6 Astra in Codex. Letto per intero l’11 ottobre, insieme al codice pubblico. Verifica propria: le quote di prove in orario e i rapporti di durata sullo stesso compito, ricalcolati dal file delle prove su agenttimebench.com, coincidono con l’articolo. Trascrizioni non lette (dataset ad accesso riservato).

Leggi il preprint AgentTime Guarda tutte le prove cronometrate sul sito di AgentTime Apri il codice, con la frase aggiunta e le regole di classificazione Leggi «On the Clock», il preprint sugli agenti con tempo limitato

Se sei arrivato fin qui, lascia il tuo timbro.

Come sulla scheda di prestito di un libro: ogni timbro segna un lettore passato da questa pagina.

LIMINAL FINDS Scheda di prestito

Se questa lettura ti ha lasciato qualcosa, puoi sostenere Liminal Finds (si apre in una nuova scheda).