Kthehu te Blogu
AI & Insights
28 korrik 2026
23 min lexim

Kimi K3 vs Claude Opus 5: Burimi i Hapur e Arriti Frontin, Pastaj Lëvizi Çmimi

Na bëni një burim të preferuar
Grafik që rendit shtatë modele AI sipas Elo-s në GDPval-AA v2, puna intelektuale me vlerë ekonomike, me Kimi K3 dhe Claude Opus 5 të theksuar

Më 17 korrik 2026 Moonshot AI publikoi peshat e një modeli me 2,8 trilionë parametra dhe i tha kujtdo që i donte se mund ta shkarkonte lirisht.

Shtatë ditë më vonë Anthropic nxori Claude Opus 5 pa e përmendur fare Kimin. Nuk kishte nevojë. Çdo grafik i njoftimit kishte të njëjtën gjë në boshtin horizontal, dhe nuk ishte pikë testi. Ishin dollarë.

Kjo është historia e vërtetë e kësaj vere. Modelet e hapura u afruan aq sa krahasimi ia vlen të bëhet, dhe në çastin që ndodhi kjo, laboratorët e frontit pushuan së garuari se kush merr pikët më të larta dhe nisën të garojnë se sa kushton një punë e kryer.

Shkurtimisht

  • Kimi K3 është modeli i parë me pesha të hapura në 2,8 trilionë parametra dhe e mund Claude Opus 4.8 në pjesën më të madhe të testeve të Moonshot.
  • Është gjithashtu, sipas raportit të vet teknik, ende pas Claude Fable 5 dhe GPT-5.6 Sol në tërësi.
  • Në katër testet që publikojnë të dy prodhuesit, Claude Opus 5 merr tri dhe Kimi K3 merr një.
  • K3 kushton 15 dollarë për milion tokenë dalës. Opus 5 kushton 25. Fable 5 kushton 50.
  • Befasia më e madhe është e brendshme për Anthropic-un: Opus 5 e kalon Fable 5 në pjesën më të madhe të tabelës së vetë Anthropic-ut, me gjysmën e çmimit.

Çfarë doli dhe kur

Katër nxjerrje në shtatë javë, dhe pikërisht prandaj u ngatërruan gjërat.

Të katër nxjerrjet

ModeliDoliPeshatHyrje / dalje për milion tokenë
Claude Fable 59 qershor 2026Të mbyllura$10 / $50
GPT-5.6 Sol9 korrik 2026Të mbyllura$5 / $30
Kimi K317 korrik 2026Të hapura$0,30–$3 / $15
Claude Opus 524 korrik 2026Të mbyllura$5 / $25
Grafik me shtylla që krahason çmimet e publikuara për milion tokenë dalës: Kimi K3 me 15 dollarë, Claude Opus 5 me 25, GPT-5.6 Sol me 30 dhe Claude Fable 5 me 50
Sa kushton një milion tokenë dalës te të katër modelet

Tokenët dalës janë ata që rëndojnë. Hyrja kushton pak te të gjitha modelet e përmendura këtu, dhe Kimi K3 e bën edhe më lirë duke kërkuar 0,30 dollarë për milion kur ka cache hit kundrejt 3,00 dollarëve kur ka cache miss. Nëse ngarkesa juaj e punës e përsërit të njëjtin prompt të gjatë, siç bën thuajse çdo ngarkesë në prodhim, kursimi i vërtetë qëndron pikërisht aty.

Pse ka rëndësi radha

Raporti teknik i Moonshot e krahason Kimi K3 me Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 dhe GLM-5.2. Opus 5 nuk gjendet aty, sepse Opus 5 ende nuk ekzistonte.

Pra nuk ka një tabelë të vetme me të dy modelet kryesore brenda. Ato mund të krahasohen prapëseprapë, por vetëm duke vënë numrat e njërit prodhues pranë atyre të tjetrit, dhe secili përdor mjetet e veta të matjes. Mbajeni parasysh kudo ku ky artikull vendos një shifër të K3-shit pranë një shifre të Opus 5.

Çfarë ndërtoi Moonshot

Arkitektura

Kimi K3 është një model mixture-of-experts me 2,8 trilionë parametra gjithsej, prej të cilëve 104 miliardë janë aktivë për çdo token. Drejton punën te 16 ekspertë nga 896 dhe ka 93 shtresa, 69 prej të cilave përdorin Kimi Delta Attention dhe 24 përdorin vëmendje latente me shumë koka me porta. Dritarja e kontekstit është 1.048.576 tokenë. Shikimi është i brendshëm, përmes një enkoduesi me 401 milionë parametra që Moonshot e quan MoonViT-V2.

Dy zgjedhje arkitekture e bëjnë punën e rëndë, dhe Moonshot i emërton të dyja: Kimi Delta Attention dhe Attention Residuals, që së bashku e çojnë informacionin më larg përgjatë sekuencës dhe më thellë nëpër shtresa. Bashkë me një skemë drejtimi që raporti e quan Stable LatentMoE, Moonshot pretendon rreth 2,5 herë efikasitet më të mirë shkallëzimi sesa Kimi K2.

Leximi praktik i atyre numrave është raporti mes tyre. Vetëm 104 miliardë nga 2,8 trilionët e parametrave ndizen për një token të dhënë, dhe pikërisht kjo e bën të përballueshme shërbimin e një modeli kaq të madh.

Një kuantizim që erdhi në fillim, jo në fund

Peshat dalin të kuantizuara, jo të kuantizuara më pas. K3 u stërvit me pesha MXFP4 dhe aktivizime MXFP8, prandaj ajo që shkarkon është ajo që u stërvit, jo një ngjeshje e saj me humbje.

Kjo ka rëndësi nëse mendoni ta strehoni vetë. Te shumica e modeleve të hapura zgjidhni një kuantizim pas nxjerrjes dhe pranoni çfarëdo saktësie që ju kushton. Këtu formati me saktësi të ulët ishte pjesë e stërvitjes, prandaj nuk ka ndonjë humbje cilësie të veçantë që duhet kërkuar.

Demot ishin lojëra

Një qytet voksel i ndërtuar nga Kimi K3, me një koloseum romak plot spektatorë të vizatuar në 120 korniza për sekondë

Demot me të cilat Moonshot doli përpara ishin lojëra. Jo transkripte chatbot-ësh, jo copa kodi, por gjëra të luajtshme të ndërtuara me një herë: një botë e hapur, një qytet voksel, një lojë me përleshje, një motor fizik në shfletues. Është zgjedhje e qëllimshme, sepse një lojë që punon është e vështirë të falsifikohet dhe e lehtë të kontrollohet.

Kimi K3 përballë Claude Opus 5, ballë për ballë

Katër testet e përbashkëta

Katër teste gjenden si te raporti i Moonshot ashtu edhe te njoftimi i Opus 5. Janë i vetmi vend ku të dy modelet takohen drejtpërdrejt.

Grafik me katër panele që krahason Kimi K3, Claude Opus 5, Claude Fable 5, GPT-5.6 Sol dhe Claude Opus 4.8 në BrowseComp, DeepSWE, Humanity's Last Exam dhe GDPval-AA v2
Katër testet që publikojnë të dy prodhuesit. Shifrat e Kimi K3 nga Moonshot; të tjerat nga Anthropic

Opus 5 merr tri nga katër. K3 fiton kërkimin agjent në BrowseComp me katër të dhjetat e një pike, që hyn brenda zhurmës së matjes, dhe humbet gjithçka që kërkon ta mbash një problem në mendje për një kohë të gjatë.

Ku hapet hendeku

Rezultati i Humanity's Last Exam është ai që duhet parë. K3 arrin 56,0% me mjete kundrejt 64,7% të Opus 5. Nuk është rrumbullakim, është klasë tjetër përgjigjeje në pyetje të nivelit kërkimor, dhe përputhet me atë që Moonshot thotë për modelin e vet gjetkë në raport.

Te programimi agjent tabloja është shumë më e ngushtë. Në DeepSWE v1.1 të dy rrinë brenda një pike e gjysmë nga njëri-tjetri, 67,5% kundrejt 68,8%, dhe GPT-5.6 Sol i kalon të dy me 72,7%. Nëse puna juaj është të shkruani e të ndreqni kod, zgjedhja mes këtyre modeleve nuk do të vendoset nga DeepSWE.

Hendeku te puna intelektuale

Në GDPval-AA v2, që vlerëson si i dalin modelet punës profesionale me vlerë ekonomike, Opus 5 shënon 1.861 Elo kundrejt 1.668 të K3-shit. Kjo është afërsisht distanca mes K3-shit dhe Claude Opus 4.8, një model dy brezni më parë.

Është gjithashtu hendeku më i gjerë nga të katërt, dhe ai që ka më shumë gjasa të ndihet në përdorimin e zakonshëm në biznes. GDPval është ndërtuar mbi llojin e detyrave për të cilat njerëzit paguhen vërtet.

Një paralajmërim për leximin e dy tabelave bashkë

Çdo numër i kësaj pjese vjen nga kompania që prodhon modelin. Moonshot e mati K3 me mjetet e veta; Anthropic e mati Opus 5 me të tijat. Të dy nuk pajtohen plotësisht as aty ku matin të njëjtën gjë: Anthropic e jep Fable 5 me 1.747 në GDPval aty ku Moonshot e jep me 1.760, dhe shifrat e tyre për AutomationBench ndryshojnë shumë më tepër, sepse përdorën nënbashkësi të ndryshme detyrash.

Asgjë nga këto nuk e bën krahasimin të padobishëm. Do të thotë veç se një ndryshim prej një pike mes një numri të Moonshot dhe një numri të Anthropic-ut nuk tregon asgjë, dhe se vetëm hendeqet e mëdha janë të sigurta për të arsyetuar mbi to.

Ku fiton vërtet Kimi K3

Një model me pesha të hapura që mban vendin e parë në ndonjë test fronti do të ishte i paimagjinueshëm një vit më parë, dhe K3 mban disa.

Vendi i parë në WebDev Arena

WebDev Arena — Elo, preferenca e njerëzve për punët e zhvillimit web

Kimi K31678
Claude Fable 51634
GPT-5.6 Sol1630
GLM-5.21592
Claude Opus 4.81565
GPT-5.51507

K3 rri i pari nga 99 modele në WebDev Arena, ku janë njerëzit ata që votojnë se cili model e ndërtoi faqen më të mirë. Është më shumë rezultat preference sesa provë aftësie, dhe është testi që këtu i përgjigjet më drejtpërdrejt asaj që bën përditë një agjenci web.

Ia vlen të vihet re çfarë mat: jo nëse kodi është i saktë, por nëse një njeri që shikon dy rezultate parapëlqen njërin. Për punën front-end shpesh është pikërisht kjo pyetja që ka rëndësi.

Rezultatet te programimi dhe puna agjente

Merr gjithashtu rezultatin më të mirë të grupit të testeve të Moonshot në ProgramBench me 77,8%, në OmniDocBench me 91,1%, në AutomationBench me 30,8%, në DeepSearchQA me 95,0% F1 dhe në SpreadsheetBench 2 me 34,8%.

Në SWE-Marathon, një grup provash i ndërtuar rreth punës me kernele GPU, shënon 42,0% dhe e mund Claude Fable 5 me shtatë pikë. Në Terminal-Bench 2.1 arrin 88,3% kundrejt 88,8% të GPT-5.6 Sol, aq afër sa mund të quhet zhurmë matjeje. Në FrontierSWE, një test me horizont të gjatë, del i dyti me 81,2% pas vetëm Fable 5 me 86,6%, dhe dhjetë pikë përpara GPT-5.6 Sol.

Rezultati i BrowseComp ka të bëjë me çmimin

Moonshot e mati K3 me 91,2% në BrowseComp për 2,03 dollarë detyra. Raporti vëren se kjo është gjysma e asaj që kushton GPT-5.6 Sol për 90,4% të vetat, dhe një rend madhësie më lirë se modelet Claude kur punojnë me përpjekje maksimale.

Është shembulli më i qartë i ndryshimit për të cilin flet i tërë ky artikull. I njëjti rezultat, një e dhjeta e faturës.

Çfarë thonë renditjet e pavarura

Artificial Analysis e vendos K3 me 57,1 në Intelligence Index v4.1, të katërtin nga 580 modele, pas Fable 5 me 59,9 dhe GPT-5.6 Sol me 58,9 por para Claude Opus 4.8 me 55,7. Vals AI e nxjerr të dytin nga 39. Të dyja leximet janë të 23 korrikut 2026, para se të dilte Opus 5.

Ku nuk fiton

Vlerësimi i vetë Moonshot

Raporti i Moonshot është pazakonisht i drejtpërdrejtë për këtë, dhe pikërisht drejtpërdrejtësia është gjëja më e besueshme brenda tij. Performanca e K3 "mbetet ende pas modeleve pronësore më të fuqishme, pikërisht Claude Fable 5 dhe GPT-5.6 Sol". Diku tjetër raporti pranon një "hendek të dukshëm në përvojën e përdoruesit".

Zakonisht prodhuesit nuk e shkruajnë këtë për lançimin e vet. Merreni ashtu siç është.

Pikët pas kësaj pranimi

Kudo ku arsyetimi i qëndrueshëm ka më shumë rëndësi se nxjerrja e shpejtë e informacionit, K3 rrëshqet. Në Humanity's Last Exam arrin 43,5% vetëm dhe 56,0% me mjete, pas të dy modeleve të frontit në të dyja rastet. Në GDPval-AA v2 del i treti me 1.668 Elo pas Fable 5 me 1.760 dhe GPT-5.6 Sol me 1.748. Në JobBench mbetet katër pikë e gjysmë pas Fable 5, dhe në Kimi Code Bench 2.0, grupi i brendshëm i testeve të programimit i vetë Moonshot, humbet nga Fable 5 me katër pikë.

Çfarë do të thotë në praktikë "nismë e tepruar"

Raporti e përshkruan modelin si të prirur ndaj nismës së tepruar gjatë detyrave të gjata. Thënë thjesht, bën gjëra që nuk ia keni kërkuar: rishkruan kod që donit vetëm ta lexonte, e zgjeron një detyrë për të cilën donit përgjigje të ngushtë, vazhdon kur duhej të ndalej e të pyeste.

Është problem i menaxhueshëm nëse një njeri e rishikon rezultatin. Bëhet kosto e vërtetë nëse kishit ndër mend ta linit modelin të punonte vetëm për një orë, që është pikërisht puna për të cilën shiten modelet e mbyllura të frontit.

Tabela e plotë e testeve

Si të lexohet

Krahasimi i plotë i Moonshot, ndër programim, punë agjente, arsyetim dhe shikim, me Claude Opus 5 shtuar aty ku Anthropic raporton të njëjtin test. Një vijë ndarëse do të thotë se ai prodhues nuk publikon shifër për atë rresht, jo se modeli mori zero.

TestiKimi K3Opus 5Fable 5GPT-5.6 SolOpus 4.8GPT-5.5GLM-5.2
DeepSWE67,568,870,073,059,067,046,2
ProgramBench77,876,877,671,970,863,7
Terminal-Bench 2.188,384,688,884,683,482,7
FrontierSWE81,286,671,366,764,967,3
SWE-Marathon42,035,039,040,014,013,0
PostTrainBench36,641,434,634,128,434,3
MLS-Bench48,349,946,242,835,540,4
Kimi Code Bench 2.072,976,964,871,769,064,2
GDPval-AA v2 (Elo)1.6681.8611.7601.7481.6001.4941.514
BrowseComp91,290,888,090,484,384,4
DeepSearchQA (F1)95,094,293,1
Toolathlon-Verified73,277,974,976,273,559,9
MCP-Atlas84,284,783,683,682,882,6
AutomationBench30,829,129,727,222,712,9
JobBench52,957,446,548,438,343,4
AA-Briefcase (Elo)1.5481.5831.4951.3541.1581.260
APEX-Agents41,043,339,939,438,535,6
OfficeQA Pro63,369,963,263,960,941,4
SpreadsheetBench 234,834,732,431,629,128,1
DECK-Bench73,573,074,766,968,268,6
GPQA Diamond93,592,694,191,093,591,2
HLE-Full43,556,353,344,549,841,4
HLE-Full, me mjete56,064,763,058,057,952,2
MMMU-Pro81,681,283,078,981,2
CharXiv (RQ)84,888,984,680,584,1
MathVision94,394,895,886,792,2
ZeroBench (pass@5)23,023,017,017,022,0
WorldVQA ForceAnswer51,056,741,839,138,5
OmniDocBench91,189,885,887,989,4
PerceptionBench58,557,259,747,255,8

Nga raporti teknik i Kimi K3, me kolonën e Opus 5 nga njoftimi i Anthropic-ut. Të gjitha modelet me përpjekje maksimale arsyetimi, GPT-5.5 me xhigh. Rezultatet e Claude Fable 5 përfshijnë tërheqjet e tij të sigurisë; ato të GPT-5.6 Sol përfshijnë cyberguard-et.

Çfarë bëri Anthropic

Pamja e lançimit të Claude Opus 5 nga Anthropic, një numër pesë i ndërtuar me vezë zogjsh të ilustruara

Çmimi mbeti, gjithçka nën të lëvizi

Claude Opus 5 erdhi më 24 korrik me 5 dollarë për milion tokenë hyrës dhe 25 dollarë për milion tokenë dalës, pikërisht sa kushtonte Claude Opus 4.8. Çmimi nuk lëvizi. Gjithçka nën të po.

Numrat e vetë Anthropic-ut

Tabela e testeve e Anthropic-ut që krahason Claude Opus 5 me Fable 5, Opus 4.8 dhe GPT-5.6 Sol në programim, punë intelektuale, arsyetim, përdorim kompjuteri, fushën juridike, shëndetin dhe biologjinë
Tabela krahasuese e publikuar nga Anthropic për Claude Opus 5. Burimi: Anthropic
TestiOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Frontier-Bench v0.143,3%33,7%21,1%34,4%
GDPval-AA v2 (Elo)1.8611.7471.5931.736
ARC-AGI-330,2%1,5%7,8%
BrowseComp90,8%87,4%84,3%90,4%
HLE, pa mjete56,3%56,5%49,8%
HLE, me mjete64,7%63,9%57,9%
OSWorld 2.070,6%66,1%55,7%62,6%
DeepSWE v1.168,8%69,7%59,0%72,7%
FrontierCode v1.153,4%53,5%46,5%47,5%
AutomationBench26,0%17,4%17,0%18,1%
Legal Agent Benchmark11,7%13,3%10,4%2,5%
HealthBench Professional59,8%66,0% (Mythos 5)57,4%60,5%
BioMysteryBench, i vështirë49,4%46,5%42,4%

Nga njoftimi i Claude Opus 5 nga Anthropic.

Frontier-Bench dhe ARC-AGI-3

Numri që bie në sy është Frontier-Bench v0.1, ku Opus 5 shënon 43,3% kundrejt 21,1% të Opus 4.8. Dyfishi i rezultatit me të njëjtin çmim, një nxjerrje më vonë.

Në ARC-AGI-3, një provë e zgjidhjes së problemeve të panjohura, arrin 30,2% aty ku GPT-5.6 Sol ndalet në 7,8% dhe Opus 4.8 në 1,5%. Janë numra absolutë të ulët në një test qëllimisht të vështirë, dhe pika është raporti më shumë se rezultati.

Pjesa e sikletshme: Opus 5 e kaloi Fable 5

Rezultati vërtet i pakëndshëm për Anthropic-un është kolona e Fable 5. Opus 5 e kalon në Frontier-Bench, GDPval, BrowseComp, OSWorld 2.0, AutomationBench dhe Humanity's Last Exam me mjete.

Fable 5 kapet pas DeepSWE v1.1, FrontierCode dhe testit juridik me thyesa pike, dhe Mythos 5 kryeson ende te shëndeti e biologjia. Por Fable 5 u lançua në qershor si model i klasës Mythos, një shkallë shprehimisht mbi Opus, me dyfishin e çmimit. Shtatë javë më vonë shkalla Opus e kaloi.

Nëse sot paguani 10 e 50 dollarë për milion tokenë për Fable 5, ajo tabelë i meriton dhjetë minuta të kohës suaj.

Kurbat e kostos

Grafik që lidh rezultatin e programimit agjent me koston për përpjekje në Frontier-Bench v0.1, ku Opus 5 qëndron mbi Fable 5 në çdo nivel çmimi
Frontier-Bench v0.1, rezultati përballë kostos për përpjekje. Burimi: Anthropic
Grafik CursorBench që tregon Claude Opus 5 duke arritur rezultatin maksimal të Fable 5 me rreth gjysmën e kostos për detyrë
CursorBench. Vija portokalli rri mbi atë të verdhën në çdo çmim, dhe këtu qëndron i tërë argumenti. Burimi: Anthropic

Lexojini të dy grafikët njësoj. Boshti horizontal janë paratë, ai vertikal rezultati, dhe Opus 5 rri mbi Fable 5 në çdo pikë të kurbës. Një vijë më e lartë kudo do të thotë se nuk ka asnjë buxhet në të cilin modeli më i vjetër e më i shtrenjtë të jetë blerja më e mirë.

Ku ndodhen tani Fable 5 dhe Mythos 5

Fable 5 doli më 9 qershor si modeli i parë publikisht i disponueshëm i asaj që Anthropic e quan klasa Mythos. Del me mbrojtje që ia kalojnë kërkesat e sigurisë kibernetike dhe të biologjisë Claude Opus 4.8, gjë që sipas Anthropic-ut ndodh në më pak se 5% të seancave.

Mythos 5 është i njëjti model me kufizimet kibernetike të hequra. Nuk është i disponueshëm publikisht, u shkon vetëm partnerëve të Project Glasswing dhe studiuesve të përzgjedhur të biologjisë, dhe kryeson ende mbi Opus 5 në punën për shëndetin e biologjinë.

Dhe GPT-5.6 Sol

GPT-5.6 Sol është shkalla e lartë e një familjeje me tre modele të OpenAI-t bashkë me Terra e Luna, me 5 e 30 dollarë. Artificial Analysis e rendit një pikë pas Fable 5 për inteligjencë dhe të parin në Coding Agent Index. Mban gjithashtu rezultatin më të mirë të DeepSWE në këtë artikull me 72,7%, prandaj për programimin agjent të pastër mbetet ai që duhet mundur.

Njësia që ndryshoi

Kosto për detyrë të kryer, jo për token

Ja çfarë kanë të përbashkët të katër nxjerrjet, dhe nuk është arkitektura.

Çdo krahasim serioz i publikuar këtë verë mat koston për detyrë të përfunduar në vend të pikëve për test. Grafikët e Anthropic-ut i vendosin dollarët në shkallë logaritmike. Raporti i Moonshot argumenton me dollarë: 2,03 dollarë për detyrë në BrowseComp, brenda 50 Elo nga GPT-5.6 Sol në GDPval me 13% kosto më të ulët, 2,6 herë më lirë se Fable 5.

Grafik OSWorld 2.0 që tregon Opus 5 duke kaluar Fable 5, Opus 4.8 dhe GPT-5.6 Sol në çdo nivel kostoje
OSWorld 2.0, përdorimi agjent i kompjuterit, përballë kostos për detyrë. Burimi: Anthropic
Grafik i Humanity's Last Exam me shkallën e suksesit përballë kostos për detyrë në shkallë logaritmike
Humanity's Last Exam me mjete. Opus 5 e kalon rezultatin më të mirë të Fable 5 me rreth një të tretën e kostos. Burimi: Anthropic

Pse kaluan të gjithë te ajo njësi

Aftësia e papërpunuar pushoi së qeni kufizimi. Kur katër modele e kalojnë të gjitha 88% në të njëjtin test programimi, pyetja interesante nuk është më se cili është më i zgjuari. Është se cili e kryen punën që në përpjekjen e parë, sepse një model që kërkon tri përpjekje me nga 5 dollarë është më i shtrenjtë se një që kërkon vetëm një me 10 dollarë.

Edhe çmimi për token pushoi së parashikuari faturën. Një model më i lirë që arsyeton më gjatë, ose që riprovon më shpesh, mund të kushtojë më shumë për punë të kryer sesa një më i shtrenjtë që arrin drejt e te përgjigjja.

Numri që duhet kërkuar nga një prodhues

Nëse po vlerësoni AI-në për biznesin tuaj, kërkoni koston për detyrë të përfunduar mbi punë që i ngjan tuajës. Jo pikën e testit, dhe jo tarifën për token.

Versioni që mund ta matni vetë është edhe më i thjeshtë: fatura në fund të muajit, pjesëtuar me numrin e gjërave që u kryen vërtet.

Cilin duhet të përdorë një biznes?

Zgjidhni sipas punës, jo sipas renditjes

Varet plotësisht nga puna, dhe për shumicën e kompanive përgjigjja është më shumë se një.

Çfarë po bëniZgjedhje e arsyeshmePse
Punë e përsëritur me vëllim të lartëKimi K315 dollarë për milion tokenë dalës kundrejt 25 ose 50
Detyra të gjata të pavaruraClaude Opus 5Vetë raporti i K3 përmend nismën e tepruar në afate të gjata
Ndërtim dhe përmirësim faqesh webKimi K3I pari nga 99 në WebDev Arena, ku zgjedhin njerëzit
Arsyetim në nivel kërkimorClaude Opus 564,7% në HLE me mjete kundrejt 56,0% të K3-shit
Punë intelektuale profesionaleClaude Opus 51.861 Elo në GDPval-AA v2, para çdo modeli të testuar
Programim agjent i pastërGPT-5.6 Sol72,7% në DeepSWE v1.1, rezultati më i mirë këtu
Të dhëna që nuk dalin dot nga serverët tuajKimi K3Peshat e hapura janë e vetmja mundësi që strehohet vetë
Kërkim i thelluar dhe shfletim në internetKimi K391,2% në BrowseComp me 2,03 dollarë detyra
Automatizim i desktopit dhe i kompjuteritClaude Opus 570,6% në OSWorld 2.0, mirë përpara të tjerëve
Ju duhet të punojë ende në 2029Kimi K3Peshat që i mbani ju nuk mund t'ju hiqen nga dora

Argumenti për peshat që i mbani vetë

Rreshti i fundit është ai që nënvlerësohet më shumë. Çdo model i mbyllur në këtë faqe do të tërhiqet herët a vonë, dhe versioni rreth të cilit ndërtuat punën tuaj do të pushojë së përgjigjuri. Një grup peshash i shkarkuar jo.

Për një biznes që automatizon diçka të menduar të punojë me vite, kjo është arsye e prekshme dhe jo ideologjike. Është gjithashtu e vetmja arsye e listës që nuk ka të bëjë fare me testet.

Një mjedis loje me botë të hapur i ndërtuar nga Kimi K3 me një herë, me një kalorës që i afrohet një vendbanimi me shtëpi trarësh

Çfarë do të thotë kjo nëse nuk ndërtoni produkte AI

Shumica e atyre që lexojnë këtu nuk kanë për të zgjedhur mes arkitekturash mixture-of-experts. Pyesin nëse diçka nga e gjitha kjo ndryshon atë që duhet bërë tani. Dy gjëra e ndryshojnë.

Modelet më të lira ndryshojnë çfarë ia vlen të automatizohet

Puna që nuk kishte kuptim ekonomik me 50 dollarë për milion tokenë dalës e ka me 15. Kjo mbulon pjesën më të madhe të prodhimit pa shkëlqim në marketing: përshkrime produktesh në shkallë të gjerë, përkthimi i një faqeje në tri gjuhë, tekst alternativ për një mijë imazhe, drafte të para briefash.

Nëse i bëtë llogaritë një vit më parë dhe hoqët dorë, aritmetika tani është tjetër. Puna jonë me shkrimin e përmbajtjes SEO mbështetet pikërisht në këtë ndryshim.

Dritaret më të mëdha të kontekstit ndryshojnë cilësinë e këshillës

Kimi K3 dhe modelet e fundit Claude pranojnë të gjitha një milion tokenë, sa mjafton për të mbajtur tërë faqen tuaj, tre konkurrentët më të afërt dhe një vit të dhëna kërkimi me një lexim të vetëm.

Një model që arsyeton mbi të gjitha njëherësh jep përgjigje më të mira se një që lexon copa-copa. Kjo është arsyeja praktike pse SEO-ja e drejtuar nga AI kaloi nga risi në rutinë, më shumë se çdo gjë që lidhet me modele më të zgjuara.

Çfarë nuk ka ndryshuar

E gjithë kjo ka nevojë për diçka ku të drejtohet. Një model që di ta lexojë tërë faqen tuaj vlen vetëm nëse faqja thotë diçka që ia vlen të lexohet, dhe një asistent AI do të citojë vetëm një faqe që arrin ta hapë.

Ajo pjesë mbetet zhvillim web i zakonshëm dhe optimizim për motorët e kërkimit i zakonshëm. Modelet u lirësuan. Detyrimi për të pasur diçka që ia vlen të indeksohet nuk u zhduk.

Gjëja që ia vlen të mbahet mend

Një vit më parë hendeku mes modelit më të mirë të hapur dhe atij më të mirë të mbyllur ishte aq i gjerë sa krahasimi dukej qesharak. Këtë verë një model me pesha të hapura zuri vendin e parë në WebDev Arena, barazoi frontin në arsyetimin e nivelit universitar të lartë dhe e bëri me një të pestën e çmimit, pastaj publikoi një raport ku pranon se ende humbet në punët më të vështira.

Përgjigjja e Anthropic-ut nuk ishte një rezultat më i lartë me çmim më të lartë. Ishte një model që e mund shkallën e vet premium duke kushtuar gjysmën.

Të dyja këto fakte tregojnë të njëjtin drejtim. Aftësia po bëhet mall dhe çmimi po bëhet fusha e betejës, gjë që është lajm i mirë nëse jeni duke blerë e jo duke shitur. Nëse doni të kuptoni cili model i takon cilës pjesë të biznesit tuaj, flisni me ekipin tonë ose nisni me një preventiv falas. Modelet do të ndryshojnë sërish deri në vjeshtë. Mënyra si zgjidhni mes tyre nuk duhet të ketë nevojë të ndryshojë.

Ju pëlqeu ky artikull? Ndajeni!