Torna al Blog
AI & Insights
28 luglio 2026
22 min di lettura

Kimi K3 vs Claude Opus 5: l'Open Source ha Recuperato, Poi si è Mosso il Prezzo

Rendici una fonte preferita
Grafico che ordina sette modelli AI per Elo su GDPval-AA v2, il lavoro intellettuale di valore economico, con Kimi K3 e Claude Opus 5 evidenziati

Il 17 luglio 2026 Moonshot AI ha pubblicato i pesi di un modello da 2,8 trilioni di parametri e ha detto a chiunque li volesse di scaricarselo pure.

Sette giorni dopo Anthropic ha rilasciato Claude Opus 5 senza mai nominare Kimi. Non ne aveva bisogno. Ogni grafico dell'annuncio aveva la stessa cosa sull'asse orizzontale, e non era un punteggio di benchmark. Erano dollari.

È questa la vera storia dell'estate. I modelli aperti si sono avvicinati abbastanza da rendere il confronto sensato, e nel momento in cui è successo i laboratori di frontiera hanno smesso di competere su chi fa il punteggio più alto e hanno iniziato a competere su quanto costa un lavoro finito.

In breve

  • Kimi K3 è il primo modello a pesi aperti da 2,8 trilioni di parametri, e batte Claude Opus 4.8 sulla maggior parte della suite di benchmark di Moonshot.
  • È anche, per ammissione della sua stessa relazione tecnica, ancora dietro a Claude Fable 5 e GPT-5.6 Sol nel complesso.
  • Sui quattro benchmark che entrambi i fornitori pubblicano, Claude Opus 5 ne prende tre e Kimi K3 uno.
  • K3 costa $15 per milione di token in uscita. Opus 5 ne costa $25. Fable 5 ne costa $50.
  • La sorpresa più grande è interna ad Anthropic: Opus 5 supera Fable 5 su gran parte della tabella di Anthropic stessa, a metà prezzo.

Cosa è uscito, e quando

Quattro rilasci in sette settimane, ed è per questo che si è fatta confusione.

I quattro rilasci

ModelloRilascioPesiIngresso / uscita per milione di token
Claude Fable 59 giugno 2026Chiusi$10 / $50
GPT-5.6 Sol9 luglio 2026Chiusi$5 / $30
Kimi K317 luglio 2026Aperti$0,30–$3 / $15
Claude Opus 524 luglio 2026Chiusi$5 / $25
Grafico a barre che confronta i prezzi pubblicati per milione di token in uscita: Kimi K3 a $15, Claude Opus 5 a $25, GPT-5.6 Sol a $30 e Claude Fable 5 a $50
Quanto costa un milione di token in uscita sui quattro modelli

I token in uscita sono quelli che pesano. L'ingresso costa poco su tutti i modelli qui elencati, e Kimi K3 lo rende ancora più economico chiedendo $0,30 per milione con cache hit contro $3,00 con cache miss. Se il vostro carico di lavoro ripete lo stesso prompt lungo, come fa quasi ogni carico in produzione, è lì che stanno davvero i risparmi.

Perché l'ordine conta

La relazione tecnica di Moonshot confronta Kimi K3 con Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 e GLM-5.2. Opus 5 non c'è, perché Opus 5 ancora non esisteva.

Quindi non esiste una sola tabella con dentro entrambi i modelli protagonisti. Si possono comunque confrontare, ma solo affiancando i numeri di un fornitore a quelli dell'altro, e ciascuno usa i propri mezzi di misura. Tenetelo presente ovunque questo articolo metta un dato di K3 accanto a uno di Opus 5.

Cosa ha costruito Moonshot

L'architettura

Kimi K3 è un modello mixture-of-experts con 2,8 trilioni di parametri totali, di cui 104 miliardi attivi per ogni token. Instrada verso 16 esperti su 896 e ha 93 livelli, 69 dei quali usano Kimi Delta Attention e 24 usano attenzione latente multi-testa con gate. La finestra di contesto è di 1.048.576 token. La visione è nativa, tramite un encoder da 401 milioni di parametri che Moonshot chiama MoonViT-V2.

Due scelte architetturali fanno il lavoro pesante, e Moonshot le nomina entrambe: Kimi Delta Attention e Attention Residuals, che insieme spingono l'informazione più avanti lungo la sequenza e più in profondità nello stack. Insieme a uno schema di instradamento che la relazione chiama Stable LatentMoE, Moonshot dichiara circa 2,5 volte l'efficienza di scala di Kimi K2.

La lettura pratica di quei numeri è il rapporto. Solo 104 miliardi dei 2,8 trilioni di parametri si attivano per un dato token, ed è questo a rendere sostenibile servire un modello così grande.

Una quantizzazione arrivata prima, non dopo

I pesi escono quantizzati, non quantizzati dopo. K3 è stato addestrato con pesi MXFP4 e attivazioni MXFP8, quindi quello che scarichi è quello che è stato addestrato, non una sua compressione con perdita.

Conta se pensate di ospitarlo voi. Con quasi tutti i modelli aperti scegliete una quantizzazione dopo il rilascio e accettate qualunque perdita di accuratezza comporti. Qui il formato a bassa precisione faceva parte dell'addestramento, quindi non c'è nessun compromesso di qualità da andare a cercare.

Le demo erano videogiochi

Una città voxel costruita da Kimi K3, con un colosseo romano pieno di spettatori renderizzato a 120 fotogrammi al secondo

Le demo con cui Moonshot ha aperto erano videogiochi. Non trascrizioni di chatbot, non frammenti di codice, ma cose giocabili costruite in un colpo solo: un open world, una città voxel, un picchiaduro, un motore fisico nel browser. È una scelta deliberata, perché un gioco che gira è difficile da falsificare e facile da verificare.

Kimi K3 contro Claude Opus 5, testa a testa

I quattro benchmark in comune

Quattro benchmark compaiono sia nella relazione di Moonshot sia nell'annuncio di Opus 5. Sono l'unico punto in cui i due modelli si incontrano davvero.

Grafico a quattro riquadri che confronta Kimi K3, Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Claude Opus 4.8 su BrowseComp, DeepSWE, Humanity's Last Exam e GDPval-AA v2
I quattro benchmark che entrambi i fornitori pubblicano. Dati di Kimi K3 da Moonshot; gli altri da Anthropic

Opus 5 ne prende tre su quattro. K3 vince la ricerca agentica su BrowseComp per quattro decimi di punto, che rientra nel rumore di misura, e perde tutto ciò che richiede di tenere a mente un problema a lungo.

Dove si apre il divario

Il risultato di Humanity's Last Exam è quello da guardare. K3 raggiunge 56,0% con strumenti contro il 64,7% di Opus 5. Non è un arrotondamento, è una classe di risposta diversa su domande di livello di ricerca, ed è coerente con quello che Moonshot dice del proprio modello altrove nella relazione.

Sulla programmazione agentica il quadro è molto più stretto. Su DeepSWE v1.1 i due stanno a un punto e mezzo di distanza, 67,5% contro 68,8%, e GPT-5.6 Sol li batte entrambi con 72,7%. Se il vostro lavoro è scrivere e correggere codice, la scelta fra questi modelli non la deciderà DeepSWE.

Il divario sul lavoro intellettuale

Su GDPval-AA v2, che valuta come i modelli affrontano il lavoro professionale di valore economico, Opus 5 segna 1.861 Elo contro i 1.668 di K3. È all'incirca la distanza fra K3 e Claude Opus 4.8, un modello di due generazioni fa.

È anche il divario più ampio dei quattro, e quello che più probabilmente si farà sentire nell'uso aziendale ordinario. GDPval è costruito sul tipo di compiti per cui le persone vengono davvero pagate.

Un avvertimento sul leggere insieme le tabelle di due fornitori

Ogni numero di questa sezione viene dall'azienda che produce il modello. Moonshot ha misurato K3 con i propri mezzi; Anthropic ha misurato Opus 5 con i suoi. I due non concordano del tutto nemmeno dove misurano la stessa cosa: Anthropic dà Fable 5 a 1.747 su GDPval dove Moonshot lo dà a 1.760, e le rispettive cifre su AutomationBench divergono molto di più, perché hanno usato sottoinsiemi di compiti diversi.

Niente di tutto ciò rende inutile il confronto. Significa però che una differenza di un punto fra un numero di Moonshot e uno di Anthropic non dice nulla, e che solo i divari ampi sono sicuri su cui ragionare.

Dove Kimi K3 vince davvero

Un modello a pesi aperti al primo posto su un qualsiasi benchmark di frontiera sarebbe stato impensabile un anno fa, e K3 ne tiene diversi.

Primo posto su WebDev Arena

WebDev Arena — Elo, preferenza umana sui compiti di sviluppo web

Kimi K31678
Claude Fable 51634
GPT-5.6 Sol1630
GLM-5.21592
Claude Opus 4.81565
GPT-5.51507

K3 è primo su 99 modelli in WebDev Arena, dove sono le persone a votare quale modello ha costruito la pagina web migliore. È un punteggio di preferenza più che un test di capacità, ed è il benchmark che qui corrisponde più da vicino a quello che un'agenzia web fa tutti i giorni.

Vale la pena notare cosa misura: non se il codice è corretto, ma se una persona che guarda due risultati ne preferisce uno. Per il lavoro front-end è spesso la domanda che conta.

Risultati su programmazione e lavoro agentico

Prende anche il miglior punteggio della suite di Moonshot su ProgramBench con 77,8%, su OmniDocBench con 91,1%, su AutomationBench con 30,8%, su DeepSearchQA con 95,0% F1 e su SpreadsheetBench 2 con 34,8%.

Su SWE-Marathon, una suite costruita attorno al lavoro sui kernel GPU, segna 42,0% e batte Claude Fable 5 di sette punti. Su Terminal-Bench 2.1 arriva a 88,3% contro l'88,8% di GPT-5.6 Sol, abbastanza vicino da essere rumore. Su FrontierSWE, un benchmark a lungo orizzonte, è secondo con 81,2% dietro al solo Fable 5 con 86,6%, e dieci punti davanti a GPT-5.6 Sol.

Il risultato su BrowseComp riguarda il prezzo

Moonshot ha misurato K3 al 91,2% su BrowseComp per $2,03 a compito. La relazione nota che è metà di quanto costa GPT-5.6 Sol per il suo 90,4%, e un ordine di grandezza in meno dei modelli Claude al massimo sforzo.

È l'esempio più chiaro del cambiamento di cui parla tutto questo articolo. Stesso punteggio, un decimo della bolletta.

Cosa dicono le classifiche indipendenti

Artificial Analysis mette K3 a 57,1 sul suo Intelligence Index v4.1, quarto su 580 modelli, dietro Fable 5 a 59,9 e GPT-5.6 Sol a 58,9 ma davanti a Claude Opus 4.8 a 55,7. Vals AI lo mette secondo su 39. Entrambe le letture sono del 23 luglio 2026, prima che uscisse Opus 5.

Dove invece no

Il verdetto di Moonshot stessa

La relazione di Moonshot è insolitamente schietta su questo punto, e proprio la schiettezza è la cosa più credibile che contiene. Le prestazioni di K3 "restano dietro ai modelli proprietari più potenti, ovvero Claude Fable 5 e GPT-5.6 Sol". Altrove la relazione ammette un "divario evidente nell'esperienza d'uso".

Di solito i fornitori non scrivono questo del proprio lancio. Prendetelo per quello che è.

I punteggi dietro all'ammissione

Ovunque il ragionamento prolungato conti più del recupero rapido, K3 scivola. Su Humanity's Last Exam raggiunge 43,5% da solo e 56,0% con strumenti, dietro a entrambi i modelli di frontiera in un caso e nell'altro. Su GDPval-AA v2 è terzo con 1.668 Elo dietro a Fable 5 con 1.760 e GPT-5.6 Sol con 1.748. Su JobBench resta indietro di quattro punti e mezzo rispetto a Fable 5, e su Kimi Code Bench 2.0, la suite interna di programmazione di Moonshot, perde contro Fable 5 di quattro.

Cosa significa in pratica "eccessiva proattività"

La relazione descrive il modello come incline a un'eccessiva proattività durante i compiti lunghi. In parole povere, fa cose che non gli avete chiesto: riscrive codice che volevate solo far leggere, allarga un brief a cui volevate una risposta stretta, va avanti quando dovrebbe fermarsi e chiedere.

È un problema gestibile se una persona rivede l'output. Diventa un costo vero se contavate di lasciare il modello a lavorare da solo per un'ora, che è esattamente il compito per cui vengono venduti i modelli chiusi di frontiera.

La tabella completa dei benchmark

Come leggerla

Il confronto completo di Moonshot, fra programmazione, lavoro agentico, ragionamento e visione, con Claude Opus 5 aggiunto dove Anthropic riporta lo stesso benchmark. Un trattino significa che quel fornitore non pubblica una cifra per quella riga, non che il modello abbia preso zero.

BenchmarkKimi K3Opus 5Fable 5GPT-5.6 SolOpus 4.8GPT-5.5GLM-5.2
DeepSWE67,568,870,073,059,067,046,2
ProgramBench77,876,877,671,970,863,7
Terminal-Bench 2.188,384,688,884,683,482,7
FrontierSWE81,286,671,366,764,967,3
SWE-Marathon42,035,039,040,014,013,0
PostTrainBench36,641,434,634,128,434,3
MLS-Bench48,349,946,242,835,540,4
Kimi Code Bench 2.072,976,964,871,769,064,2
GDPval-AA v2 (Elo)1.6681.8611.7601.7481.6001.4941.514
BrowseComp91,290,888,090,484,384,4
DeepSearchQA (F1)95,094,293,1
Toolathlon-Verified73,277,974,976,273,559,9
MCP-Atlas84,284,783,683,682,882,6
AutomationBench30,829,129,727,222,712,9
JobBench52,957,446,548,438,343,4
AA-Briefcase (Elo)1.5481.5831.4951.3541.1581.260
APEX-Agents41,043,339,939,438,535,6
OfficeQA Pro63,369,963,263,960,941,4
SpreadsheetBench 234,834,732,431,629,128,1
DECK-Bench73,573,074,766,968,268,6
GPQA Diamond93,592,694,191,093,591,2
HLE-Full43,556,353,344,549,841,4
HLE-Full, strumenti56,064,763,058,057,952,2
MMMU-Pro81,681,283,078,981,2
CharXiv (RQ)84,888,984,680,584,1
MathVision94,394,895,886,792,2
ZeroBench (pass@5)23,023,017,017,022,0
WorldVQA ForceAnswer51,056,741,839,138,5
OmniDocBench91,189,885,887,989,4
PerceptionBench58,557,259,747,255,8

Dalla relazione tecnica di Kimi K3, con la colonna di Opus 5 dall'annuncio di Anthropic. Tutti i modelli al massimo sforzo di ragionamento, GPT-5.5 a xhigh. I risultati di Claude Fable 5 includono i suoi fallback di sicurezza; quelli di GPT-5.6 Sol includono i cyberguard.

Cosa ha fatto Anthropic

L'immagine di lancio di Claude Opus 5 di Anthropic, un numero cinque composto da uova di uccello illustrate

Il prezzo è rimasto, tutto il resto si è mosso

Claude Opus 5 è arrivato il 24 luglio a $5 per milione di token in ingresso e $25 in uscita, esattamente quanto costava Claude Opus 4.8. Il prezzo non si è mosso. Tutto il resto sì.

I numeri di Anthropic stessa

La tabella di benchmark di Anthropic che confronta Claude Opus 5 con Fable 5, Opus 4.8 e GPT-5.6 Sol su programmazione, lavoro intellettuale, ragionamento, uso del computer, ambito legale, salute e biologia
La tabella di confronto pubblicata da Anthropic per Claude Opus 5. Fonte: Anthropic
BenchmarkOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Frontier-Bench v0.143,3%33,7%21,1%34,4%
GDPval-AA v2 (Elo)1.8611.7471.5931.736
ARC-AGI-330,2%1,5%7,8%
BrowseComp90,8%87,4%84,3%90,4%
HLE, senza strumenti56,3%56,5%49,8%
HLE, con strumenti64,7%63,9%57,9%
OSWorld 2.070,6%66,1%55,7%62,6%
DeepSWE v1.168,8%69,7%59,0%72,7%
FrontierCode v1.153,4%53,5%46,5%47,5%
AutomationBench26,0%17,4%17,0%18,1%
Legal Agent Benchmark11,7%13,3%10,4%2,5%
HealthBench Professional59,8%66,0% (Mythos 5)57,4%60,5%
BioMysteryBench, difficile49,4%46,5%42,4%

Dall'annuncio di Claude Opus 5 di Anthropic.

Frontier-Bench e ARC-AGI-3

Il numero che salta all'occhio è Frontier-Bench v0.1, dove Opus 5 segna 43,3% contro il 21,1% di Opus 4.8. Il doppio del punteggio allo stesso prezzo, a un rilascio di distanza.

Su ARC-AGI-3, una prova di risoluzione di problemi inediti, arriva a 30,2% dove GPT-5.6 Sol si ferma a 7,8% e Opus 4.8 a 1,5%. Sono numeri assoluti bassi su un test volutamente difficile, e il punto è il rapporto più che il punteggio.

La parte scomoda: Opus 5 ha superato Fable 5

Il risultato davvero scomodo per Anthropic è la colonna di Fable 5. Opus 5 la batte su Frontier-Bench, GDPval, BrowseComp, OSWorld 2.0, AutomationBench e Humanity's Last Exam con strumenti.

Fable 5 si aggrappa a DeepSWE v1.1, FrontierCode e al benchmark legale per frazioni di punto, e Mythos 5 guida ancora su salute e biologia. Ma Fable 5 era stato lanciato a giugno come modello di classe Mythos, un livello esplicitamente sopra Opus, al doppio del prezzo. Sette settimane dopo il livello Opus lo ha superato.

Se oggi pagate $10 e $50 per milione di token per Fable 5, quella tabella merita dieci minuti del vostro tempo.

Le curve di costo

Grafico che mette in relazione il punteggio di coding agentico e il costo per tentativo su Frontier-Bench v0.1, con Opus 5 sopra Fable 5 a ogni livello di prezzo
Frontier-Bench v0.1, punteggio in relazione al costo per tentativo. Fonte: Anthropic
Grafico CursorBench che mostra Claude Opus 5 raggiungere il punteggio massimo di Fable 5 a circa metà del costo per compito
CursorBench. La linea arancione sta sopra quella gialla a ogni prezzo, ed è tutto lì il ragionamento. Fonte: Anthropic

Leggete i due grafici allo stesso modo. L'asse orizzontale sono i soldi, quello verticale il punteggio, e Opus 5 sta sopra Fable 5 in ogni punto della curva. Una linea più alta ovunque significa che non esiste un budget al quale il modello più vecchio e più caro sia l'acquisto migliore.

Dove stanno ora Fable 5 e Mythos 5

Fable 5 è uscito il 9 giugno come primo modello pubblicamente disponibile di quella che Anthropic chiama classe Mythos. Esce con protezioni che rimandano le richieste di cybersecurity e biologia a Claude Opus 4.8, cosa che secondo Anthropic accade in meno del 5% delle sessioni.

Mythos 5 è lo stesso modello con le restrizioni cyber rimosse. Non è disponibile al pubblico, va solo ai partner del Project Glasswing e a ricercatori di biologia selezionati, e guida ancora su Opus 5 nel lavoro su salute e biologia.

E GPT-5.6 Sol

GPT-5.6 Sol è il livello alto di una famiglia di tre modelli OpenAI insieme a Terra e Luna, a $5 e $30. Artificial Analysis lo dà un punto dietro Fable 5 sull'intelligenza e primo sul Coding Agent Index. Tiene anche il miglior punteggio DeepSWE di questo articolo con 72,7%, quindi per la pura programmazione agentica resta quello da battere.

L'unità di misura che è cambiata

Costo per compito finito, non per token

Ecco cosa accomuna tutti e quattro i rilasci, e non è l'architettura.

Ogni confronto serio pubblicato quest'estate misura il costo per compito completato invece del punteggio per benchmark. I grafici di Anthropic mettono i dollari su scala logaritmica. La relazione di Moonshot argomenta in dollari: $2,03 per compito su BrowseComp, entro 50 Elo da GPT-5.6 Sol su GDPval con un costo inferiore del 13%, 2,6 volte più economico di Fable 5.

Grafico OSWorld 2.0 che mostra Opus 5 superare Fable 5, Opus 4.8 e GPT-5.6 Sol a ogni livello di costo
OSWorld 2.0, uso agentico del computer, in relazione al costo per compito. Fonte: Anthropic
Grafico di Humanity's Last Exam con il tasso di successo in relazione al costo per compito su scala logaritmica
Humanity's Last Exam con strumenti. Opus 5 supera il miglior risultato di Fable 5 a circa un terzo del costo. Fonte: Anthropic

Perché tutti sono passati a quell'unità

La capacità grezza ha smesso di essere il vincolo. Quando quattro modelli superano tutti l'88% sullo stesso benchmark di coding, la domanda interessante non è più quale sia il più intelligente. È quale finisce il lavoro al primo tentativo, perché un modello che ne richiede tre a $5 costa più di uno che ne richiede uno solo a $10.

Anche il prezzo per token ha smesso di prevedere la bolletta. Un modello più economico che ragiona più a lungo, o che riprova più spesso, può costare più per lavoro finito di uno più caro che ci arriva diretto.

Il numero da chiedere a un fornitore

Se state valutando l'AI per la vostra azienda, chiedete il costo per compito completato su lavoro che assomigli al vostro. Non il punteggio del benchmark, e non la tariffa per token.

La versione che potete misurare da soli è ancora più semplice: la bolletta di fine mese, divisa per il numero di cose che sono state effettivamente fatte.

Quale conviene a un'azienda?

Scegliete per lavoro, non per classifica

Dipende interamente dal lavoro, e per la maggior parte delle aziende la risposta è più di uno.

Cosa state facendoScelta sensataPerché
Lavoro ripetitivo ad alto volumeKimi K3$15 per milione di token in uscita contro $25 o $50
Compiti autonomi lunghiClaude Opus 5La relazione di K3 segnala un'eccessiva proattività sui tempi lunghi
Costruire e iterare pagine webKimi K3Primo su 99 in WebDev Arena, dove a scegliere sono le persone
Ragionamento a livello di ricercaClaude Opus 564,7% su HLE con strumenti contro il 56,0% di K3
Lavoro intellettuale professionaleClaude Opus 51.861 Elo su GDPval-AA v2, davanti a ogni modello testato
Pura programmazione agenticaGPT-5.6 Sol72,7% su DeepSWE v1.1, il miglior punteggio qui
Dati che non possono uscire dai vostri serverKimi K3I pesi aperti sono l'unica opzione ospitabile in proprio
Ricerca approfondita e navigazione webKimi K391,2% su BrowseComp a $2,03 a compito
Automazione di desktop e computerClaude Opus 570,6% su OSWorld 2.0, ben davanti al resto
Vi serve che funzioni ancora nel 2029Kimi K3I pesi che possedete non possono essere dismessi da altri

L'argomento a favore dei pesi che possedete

L'ultima riga è quella che si sottovaluta di più. Ogni modello chiuso di questa pagina prima o poi sarà ritirato, e la versione attorno a cui avete costruito il vostro flusso di lavoro smetterà di rispondere. Un set di pesi scaricato no.

Per un'azienda che automatizza qualcosa destinato a durare anni, è una considerazione concreta e non ideologica. È anche l'unica ragione dell'elenco che non ha niente a che vedere con i benchmark.

Un ambiente di gioco open world costruito da Kimi K3 in un solo passaggio, con un cavaliere che si avvicina a un insediamento di case di tronchi

Cosa significa se non costruite prodotti AI

La maggior parte di chi legge non deve scegliere fra architetture mixture-of-experts. Si chiede se qualcosa di tutto questo cambi cosa fare adesso. Due cose lo cambiano.

Modelli più economici cambiano cosa vale la pena automatizzare

Il lavoro che non aveva senso economico a $50 per milione di token in uscita ne ha a $15. Questo copre gran parte della produzione poco appariscente del marketing: descrizioni prodotto su larga scala, tradurre un sito in tre lingue, testi alternativi per mille immagini, prime bozze di brief editoriali.

Se avete fatto i conti un anno fa e avete rinunciato, l'aritmetica adesso è diversa. Il nostro lavoro di scrittura di contenuti SEO poggia esattamente su questo cambiamento.

Finestre di contesto più grandi cambiano la qualità dei consigli

Kimi K3 e i recenti modelli Claude accettano tutti un milione di token, abbastanza da contenere tutto il vostro sito, i tre concorrenti più vicini e un anno di dati di ricerca in un colpo solo.

Un modello che ragiona su tutto insieme dà risposte migliori di uno che legge a frammenti. È la ragione pratica per cui la SEO guidata dall'AI è passata da novità a routine, più che qualsiasi cosa legata a modelli più intelligenti.

Cosa non è cambiato

Tutto questo ha bisogno di qualcosa a cui puntare. Un modello che sa leggere tutto il vostro sito serve solo se il sito dice qualcosa che valga la pena leggere, e un assistente AI citerà solo una pagina che riesce a raggiungere.

Quella parte resta ordinario sviluppo web e ordinaria ottimizzazione per i motori di ricerca. I modelli sono diventati più economici. L'obbligo di avere qualcosa che valga la pena indicizzare non è sparito.

La cosa da ricordare

Un anno fa la distanza fra il miglior modello aperto e il miglior modello chiuso era così ampia che il confronto sembrava ridicolo. Quest'estate un modello a pesi aperti ha preso il primo posto su WebDev Arena, ha eguagliato la frontiera sul ragionamento di livello universitario avanzato e lo ha fatto a un quinto del prezzo, poi ha pubblicato una relazione in cui ammette di perdere ancora sul lavoro più difficile.

La risposta di Anthropic non è stata un punteggio più alto a un prezzo più alto. È stato un modello che batte il suo stesso livello premium costando la metà.

Entrambi i fatti puntano nella stessa direzione. La capacità sta diventando una merce e il prezzo sta diventando il campo di battaglia, il che è una buona notizia se state comprando invece di vendere. Se volete capire quale modello sta in quale parte della vostra azienda, parlate con il nostro team o partite da un preventivo gratuito. I modelli cambieranno di nuovo entro l'autunno. Il modo in cui li scegliete non dovrebbe doverlo fare.

Ti è piaciuto questo articolo? Condividilo!