Il selettore di modelli sta diventando un selettore di orchestrazione

Il 30 settembre GitHub ha spostato HydraFusion dalla riga di comando all'editor.
L'anteprima di ricerca ora funziona in VS Code 1.140 e versioni successive, e nell'app GitHub Copilot, il che mette davanti agli sviluppatori comuni un'idea piuttosto inusuale: smetti di scegliere un modello, scegli un flusso di lavoro.
HydraFusion non è un modello. È uno strato che decide, per ogni turno, quanti ruoli modello richiede l'attività.
Tre forme per una richiesta
Single è il caso familiare. Un modello gestisce la richiesta, come già funziona Copilot Auto.
Cascade inizia a basso costo. Un modello efficiente scrive una prima bozza, e un controllo di qualità la accetta oppure escala il lavoro a un modello più potente. Lo scopo è mantenere le modifiche di routine su modelli economici e riservare quelli costosi ai problemi che ne hanno davvero bisogno.
Critique spende di più per essere più sicuro. Un modello redige, un secondo modello di una famiglia diversa agisce come critico in sola lettura, e il modello che redige rivede una volta in base a quel feedback. Il critico non tocca mai il codice, il che evita che il ciclo si trasformi in due modelli che discutono.
La differenza rispetto ad Auto è architetturale. Auto decide quale singolo modello deve ricevere il tuo prompt. HydraFusion decide quanti ruoli richiede il turno e come interagiscono. È un cambiamento significativo in dove risiede il controllo dell'intelligenza. Storicamente sceglievi un modello perché era migliore per il tuo tipo di lavoro. Qui scegli una politica di ottimizzazione e lasci che la piattaforma componga i modelli sottostanti.

L'economia è reale e anche autodichiarata
Il problema è la fatturazione. GitHub addebita in base ai token alla tariffa standard di ciascun modello selezionato. Un'esecuzione Critique chiama almeno due modelli, quindi può costare più per richiesta di una singola chiamata. Cascade è progettato per costare meno spingendo il lavoro facile verso il basso. Il risparmio non è uno sconto su alcun modello. È una scommessa sul fatto che la maggior parte dei turni non ha bisogno del migliore.
Le valutazioni controllate di GitHub hanno riportato riduzioni del costo del flusso di lavoro dal 36 al 67 percento rispetto alla sua baseline Claude Opus 5 su tre benchmark di agenti di coding, con una qualità superiore di 4,9 punti percentuali su TerminalBench 2.1, inferiore di 1,5 punti su DeepSWE e inferiore di 0,1 punti su CheckpointBench. Sono numeri prodotti dal fornitore sul proprio setup di test. Sono un'ipotesi sul tuo repository, non una garanzia, e il pool di modelli che partecipa a HydraFusion non è stato pubblicato completamente. Qualsiasi cosa costruita sull'anteprima dovrebbe trattare il comportamento di routing come qualcosa che può cambiare senza preavviso.
C'è anche un chiaro costo di latenza. Una bozza più una revisione richiede più tempo di una singola risposta. I team con piani Business ed Enterprise devono monitorare attentamente le dashboard di utilizzo, perché il sistema decide quando escalare e quella decisione non è gratuita.
Un'ottimizzazione che non puoi ispezionare è difficile da considerare affidabile
La parte scomoda del routing è che la cosa che prende la decisione è la piattaforma, non lo sviluppatore. Puoi vedere quale modello ha risposto a posteriori, ma non puoi facilmente vedere perché il sistema ha scelto un flusso di lavoro, cosa ha misurato il controllo di qualità, o quanto un'esecuzione Cascade sia stata vicina a escalare. Le affermazioni sui benchmark di GitHub descrivono una media sul proprio set di test, e le medie nascondono i casi che contano.
Quel divario trasforma l'orchestrazione in un problema di governance più che puramente tecnico. Un team di ingegneria che deve spiegare perché una particolare pull request è stata revisionata da due famiglie di modelli e addebitata di conseguenza ha bisogno di telemetria di routing, e l'anteprima non la espone ancora. Il rimedio non è evitare la funzionalità. È testarla come testeresti qualsiasi dipendenza i cui interni sono nascosti: su un set fisso e noioso di attività del repository, misurando il costo delle attività completate rispetto a un singolo modello di frontiera, e osservando tentativi e sforzo di revisione invece del prezzo di listino di una selezione.
Vale la pena conservare il confronto con Auto. Auto risponde a una domanda su quale modello sia più adatto a un prompt. HydraFusion risponde a una domanda su quanto processo meriti un turno, e il processo è sempre stata la parte costosa del lavoro software.
L'effetto collaterale curioso è che rende la scelta del modello meno emotiva. Gli sviluppatori sviluppano attaccamenti a modelli particolari, e quegli attaccamenti sono di solito costruiti su una manciata di successi memorabili. Un sistema che instrada per tipo di attività e escala in caso di fallimento riconosce silenziosamente che nessun singolo modello vince in ogni categoria, cosa che è vera da un po' e raramente viene messa in pratica.
La prossima area dell'editor viene costruita per questo
La build Insiders mostra già dove andrà dopo. Una funzionalità chiamata Compare Agents, etichettata Run Multiple Agents, invia un prompt a diversi agenti in parallelo, ciascuno nel proprio worktree git, poi fa scegliere a un agente arbitro un vincitore o passa la rosa ristretta a una persona.
Il dettaglio interessante è ciò che l'arbitro esamina. Confronta file modificati e statistiche delle diff, risultati dei test, stato della build, diagnostica, tempi e differenze architetturali. Esegue la suite di test. Non chiede a un altro modello linguistico di leggere il codice e indovinare. È una piccola decisione con grandi conseguenze, perché significa che il confronto è basato sullo stato effettivo del progetto piuttosto che sull'opinione che un modello ne ha.
Il resto della stessa release è infrastruttura più silenziosa che conta solo una volta che gli agenti vengono eseguiti in parallelo. Le sessioni multi-cartella consentono a ogni conversazione in una sessione di usare la propria cartella o worktree, così le modifiche smettono di entrare in collisione. La delega remota affida un'attività a un host agente remoto connesso. Le cartelle worktree condivise riutilizzano directory ignorate per evitare di reinstallare le dipendenze su ogni branch. I Dev Containers ora si fermano dopo cinque minuti di inattività e si riavviano su richiesta.
La governance continua ad arrivare negli stessi commit delle funzionalità
La metà della release rivolta all'IT non è un ripensamento. Quando le funzionalità AI non sono disponibili, l'editor ora indica la versione minima richiesta invece di un generico invito ad aggiornare. Gli amministratori possono impostare un livello predefinito per il modello Auto. Una nuova impostazione OpenTelemetry mappa l'utilizzo di Copilot ai singoli sviluppatori.
Leggi quei tre insieme e la forma è chiara. Una piattaforma che coordina diversi modelli su più turni genera costi, telemetria e domande sui permessi che un autocomplete a modello singolo non ha mai fatto. L'attribuzione dei costi smette di essere una curiosità finanziaria e diventa un prerequisito per avvicinare la funzionalità alla produzione.
La revisione multi-modello è pratica standard tra i team di ingegneria attenti da un po'. Chiedi a un modello di scrivere e a un altro di cercare errori, oppure provi prima un modello veloce e scali quando l'output delude. HydraFusion prende quell'abitudine e la rende automatica, il che è comodo e rimuove anche una decisione che alcuni team amavano prendere manualmente.
Quanto a lungo una funzionalità in anteprima debba rimanere un'anteprima è una domanda giusta. Il tooling sta arrivando più velocemente della policy che lo circonda, e la prevedibilità dei prezzi è la prima vittima. Un'esecuzione Critique che chiama silenziosamente due modelli di frontiera su un grande repository può spendere soldi veri prima che qualcuno se ne accorga. Che HydraFusion passi a essere predefinita dipende meno dal fatto che il routing funzioni e più dal fatto che GitHub riesca a rendere la fattura abbastanza leggibile perché qualcuno la firmi.
Articoli correlati
Le immagini di prodotto AI stanno colpendo un muro di conformità che nessuno aveva messo in conto
Il costo è sempre stato indicato per generazione. Il costo reale è prezzato per asset che sopravvive alla revisione.
I robot possono svolgere il 74 per cento del lavoro fisico, ma quasi nulla di tutto ciò è economicamente conveniente
La capacità c'è in larga misura. L'economia no. Quarant'anni per arrivare al dieci per cento non è una previsione che giustifica il panico.
Un modello agentico open-weight da 744 miliardi di parametri arriva con licenza MIT
La licenza è il marketing. Un modello da 744B che chiunque può scaricare rimette in discussione il calcolo comprare-o-costruire.
I modelli video AI cinesi entrano a Hollywood: 73 inquadrature negli effetti visivi della serie Amazon
A espatriare non sono le serie, ma gli strumenti con cui si fanno.