Gemini Omni 1.1 Flash ha concatenato quattro richieste in un'inquadratura da 40 secondi. Il flusso di lavoro è il prodotto.

Gemini Omni 1.1 Flash di Google è un prodotto strano da valutare, perché il modello in sé non è nuovo. È diventato disponibile a livello generale il 27 agosto 2026 con l'id gemini-omni-1.1-flash, e il vecchio endpoint di anteprima è stato ritirato il 30 settembre. Tutto ciò che circonda la generazione è cambiato; la qualità della generazione è in gran parte rimasta dov'era.
L'elenco delle capacità si legge come una checklist di produzione. L'estensione della scena ora analizza fino a dieci secondi di contesto precedente, che Google descrive come un salto rispetto ai modelli precedenti che facevano riferimento solo all'ultimo secondo. I video si estendono a incrementi di dieci secondi fino a un tetto cumulativo di quaranta secondi. Il controllo del primo e dell'ultimo fotogramma consente agli sviluppatori di specificare entrambe le estremità di un'inquadratura e generare il movimento tra di esse, pensato per orbite di camera, transizioni zoom e loop senza cuciture visibili. Una modalità bozza a 360p genera fino al 60% più velocemente a un terzo del costo dello standard 720p. L'output finale viene upscalato a 1080p o 4K. Fino a tre secondi di video possono essere forniti come materiale di riferimento per la coerenza di personaggi e scene.
Leggi con attenzione la funzione di estensione, perché il marketing la arrotonda. Una clip Omni da quaranta secondi è composta da quattro richieste concatenate, ognuna delle quali usa gli ultimi dieci secondi come contesto, non da un'unica generazione da quaranta secondi. Le singole generazioni restano comunque tra i tre e i dieci secondi. Questa distinzione conta per chi pianifica latenza e costo di inferenza rispetto a un deliverable, ed è il tipo di dettaglio che decide se un'inquadratura da quaranta secondi è pratica o semplicemente possibile.

Il prezzo è progettato per farti iterare
La struttura dei prezzi di Google premia la bozza. Il prezzo API è di $1,50 per milione di token di input e $17,50 per milione di token di output video, fatturati a 5.792 token per secondo di video 720p, che corrisponde a circa $0,10 al secondo o $6 al minuto. Per clip da dieci secondi, la scala dei livelli va da circa $0,30 a 360p, a $1,00 a 720p, a $1,50 a 1080p, a $3,00 a 4K.
Quel gradiente non è casuale. Il divario tra una bozza a 360p e un master a 4K è di un ordine di grandezza, il che spinge i team verso un metodo di lavoro in cui si itera a basso costo in un livello a bassa risoluzione e si paga solo per il take finale. Confrontalo con l'abitudine che la maggior parte delle persone ha portato nella generazione video, cioè scrivere un prompt, aspettare, guardare il risultato, riscrivere il prompt e pagare il prezzo pieno per ogni tiro di dado. Google sta spingendo il secondo comportamento fuori dal flusso di lavoro.
Confronta anche le superfici, perché la distribuzione è disomogenea. Google presenta l'intero set di capacità come rivolto agli sviluppatori e disponibile via API: cinque capacità arrivano agli sviluppatori tramite AI Studio, l'API Gemini e la Gemini Enterprise Agent Platform, mentre il rollout per i consumatori nell'app Gemini è limitato alla sola estensione della scena. Lo stesso modello è presente in Google Flow per gli abbonati AI Plus, Pro e Ultra, ed è gratuito in YouTube Shorts Remix e nell'app YouTube Create. Un modello, cinque livelli di accesso, quattro dei quali non ottengono le funzionalità interessanti.
L'aritmetica di un'inquadratura da quaranta secondi
L'estensione concatenata cambia quanto costa un'inquadratura, e il cambiamento non è lineare.
Una singola generazione da tre a dieci secondi è economica e veloce. Una sequenza da quaranta secondi è composta da quattro richieste in serie, e ciascuna può fallire in modo indipendente. Se la terza richiesta produce un take che rompe la continuità, non rigeneri quaranta secondi. Rigeneri dal primo fotogramma del segmento rotto, poi riconcateni tutto ciò che segue, e il costo di un errore si moltiplica con la posizione nella sequenza. I primi dieci secondi sono economici da rifare. Gli ultimi dieci secondi sono costosi, perché rifarli significa rifare tutto ciò che viene dopo.
Questo è l'argomento pratico a favore del controllo dei keyframe. Poter specificare un fotogramma iniziale e finale trasforma ogni segmento in un problema delimitato con un passaggio di verifica a entrambe le estremità. Invece di giudicare un'intera sequenza guardandola e sperando che la continuità abbia tenuto, un team può verificare se il segmento è atterrato sul fotogramma su cui doveva atterrare. Per un'orbita di camera o una transizione zoom, è un'unità di lavoro molto più testabile di un prompt libero.
Il livello bozza a 360p segue la stessa logica. Prototipare una sequenza da quaranta secondi a circa un dollaro invece di sei dollari rende l'iterazione accessibile, e l'upscale a 1080p o 4K diventa un passaggio separato e deliberato. Ciò che Google ha effettivamente rilasciato è una pipeline di produzione con un gate di revisione integrato nel prezzo.
Cosa dicono ora i benchmark
Gemini Omni 1.1 Flash guida la classifica text-to-video di Arena con 1516, appena davanti al suo predecessore Gemini Omni Flash a 1513, e la fascia di posizionamento di Arena per il modello più recente va da uno a quattro, che è un modo gentile per dire che i due sono in parità all'interno dell'intervallo di confidenza.
Il quadro delle classifiche altrove è meno lusinghiero di quanto lasciasse intendere la copertura del lancio. Il modello ha conquistato tutte e quattro le board di Artificial Analysis entro la metà di luglio 2026. Quel dominio è finito. Sulla board text-to-video ricostruita, all'inizio di ottobre, Gemini Omni Flash 1.1 si trova all'ottavo posto con audio e all'ottavo senza audio, e sulla board image-to-video di Arena è secondo dietro MiniMax H3. Artificial Analysis non ha valutato direttamente 1.1 Flash sulla sua board text-to-video, dove il modello Flash più vecchio è in testa e Wan 3.0 di Alibaba e MiniMax H3 seguono da vicino.
Due cose che il rilascio non risolve
L'audio sincronizzato nativo non è confermato. I materiali di lancio di Google non dettagliano la generazione di colonne sonore insieme al video, e l'output audio è indicato come in arrivo in release successive. L'audio in input è limitato a riferimenti vocali al lancio. Per una famiglia di modelli any-to-any con quel nome, l'output audio mancante è la lacuna che salta all'occhio, in particolare per i team che producono contenuti short-form dove il suono è metà del deliverable.
La seconda è la durata. Quaranta secondi assemblati da quattro richieste concatenate sono una capacità reale, ed è anche un tetto che un formato video narrativo raggiunge rapidamente. Google ha lasciato intravedere un Gemini Omni Pro di fascia più alta senza data di rilascio, e la meccanica dell'estensione suggerisce che il percorso verso inquadrature più lunghe passi attraverso una migliore gestione del contesto piuttosto che attraverso un'unica generazione più lunga.
Ogni output porta per impostazione predefinita watermarking SynthID e C2PA Content Credentials, e l'endpoint di anteprima ritirato non compare più nell'elenco dei modelli di Google. Google ora consiglia Omni 1.1 rispetto agli endpoint di anteprima di Veo 3.1, il che è un passaggio di consegne interno notevole. Veo 3.1 resta l'attuale flagship di Veo, e nessun Veo 4 è stato annunciato.
Con cosa costruire davvero
Il modo utile di leggere questo rilascio è come un cambiamento in ciò che il prodotto è. Un modello video che produce una clip da dieci secondi è un generatore di novità. Un modello che analizza dieci secondi di contesto precedente, accetta un fotogramma iniziale e finale, crea bozze a 360p a un terzo del prezzo e fa upscale a 4K è un componente che puoi inserire in una timeline.
Questa è la versione del video generativo su cui i team di produzione possono pianificare, ed è la versione in cui l'ingegneria interessante si sposta dalla scrittura dei prompt alla progettazione della pipeline. In questo rilascio, l'assemblaggio conta più della clip.
Articoli correlati
Step 5 ha saltato quattro numeri di versione, è arrivato secondo tra i modelli aperti e nessuno lo sta chiamando
La posizione nel benchmark è un segnale che i produttori usano per giudicare un modello. Il volume di chiamate è un segnale che i consumatori producono usandolo.
Microsoft riduce la latenza delle trascrizioni parziali a 100 millisecondi. Questo cambia lo scopo della trascrizione.
Al di sotto dei 100 millisecondi, un prodotto di trascrizione può rispondere mentre qualcuno sta ancora parlando.
Synthesia ha passato un decennio a registrare avatar. Ora vuole che rispondano.
Uno strumento di formazione che le persone ripetono volontariamente è un prodotto diverso da uno che completano perché qualcuno gliel'ha assegnato.
Un modello che si rifiuta di scrivere frasi ora gestisce mille miliardi di token al giorno
Un classificatore con un'interfaccia molto migliore, rivolto al lavoro che il software voleva già strutturato.