Google en Meta hebben woensdag allebei hun nieuwste frontier AI-modellen uitgebracht, met slechts enkele uren ertussen. Google lanceerde Gemini 3.8 Flash samen met een cybersecurity-variant, terwijl Meta Muse Spark 1.3 presenteerde.
Door deze dubbele release worden de modellen direct met elkaar vergeleken. Onafhankelijke tests van Artificial Analysis laten een verdeeld beeld zien. Meta scoort beter op agentisch kenniswerk en wetenschappelijk redeneren, terwijl Google uitblinkt in feitenkennis en terminal coderen.
Twee frontier-releases op dezelfde dag
Gemini 3.8 Flash is de derde Flash-release van Google in zes weken. Het model kost $0,75 per 1 miljoen input tokens en $3,75 per 1 miljoen output tokens.
Volg ons op X voor het laatste nieuws terwijl het gebeurt
Dat introductietarief geldt tot en met 31 december 2026. Daarna worden de prijzen verdubbeld naar $1,50 en $7,50 per 1 miljoen tokens.
Google heeft het algemene model gecombineerd met Gemini 3.8 Flash Cyber. Dit model is beschikbaar voor een selecte groep vertrouwde verdedigers. Op CyberGym, een benchmark voor het vinden van kwetsbaarheden, scoorde het model 86,2%.
De cyber-variant behaalde ook 47,2% op CWE-Bench, een benchmark voor patching. Volgens Google maakte dit model 2,6 keer meer juiste patches voor Chrome-kwetsbaarheden dan grotere commerciële modellen.
Toegang tot het model wordt beperkt via het Fairwind Program, waardoor het alleen toegankelijk is voor overheden en operators van kritieke infrastructuur. OpenAI trok een dag eerder een vergelijkbare grens rond Astra, het eerste model dat zij markeerden op een kritieke cybersecurity-drempel.
Tegelijkertijd bracht Meta Muse Spark 1.3 uit via Muse Code en de Meta Model API. Ingenieurs van het bedrijf maten ongeveer 20% minder tool-aanroepen dan bij versie 1.2.
Gemini 3.8 Flash vs Muse Spark 1.3: Onafhankelijke benchmarks verdelen het resultaat
Artificial Analysis heeft de modellen getest, en de resultaten tonen hoe ze scoren. Muse Spark 1.3 in max-modus behaalde 1.754 Elo op GDPval-AA v2. Gemini 3.8 Flash (high) haalde 1.545.
Meta was ook de nummer één bij de Sierra Research banking agent-test (52,4% tegen 44,9%) en bij CritPt-physica-redenering. Gemini 3.8 Flash stond bovenaan op Terminal-Bench 2.1 met 87,6%, AA-LCR long context met 81%, en AA-Omniscience nauwkeurigheid met 55%.
Gemini 3.8 Flash behaalde de hoogste GPQA Diamond-score van alle geteste modellen, namelijk 95%. Op Humanity’s Last Exam zaten beide modellen binnen één punt van elkaar.
Het best scorende model van Meta is vandaag nog niet beschikbaar. Volgens het bedrijf komt max reasoning pas uit na extra veiligheidstests. Tot die tijd is alleen xhigh beschikbaar.
Die variant scoorde 61 op de Artificial Analysis Intelligence Index, vier punten hoger dan Muse Spark 1.2. Het model blijft wel achter op Claude Fable 5.1 met 66 en Claude Opus 5 met 63.
Er staan nog meer releases gepland. Elon Musk heeft aangekondigd dat Grok 4.7 snel verschijnt, waardoor er binnen twee weken vier frontier-releases op de markt zijn.
Abonneer je op ons YouTube-kanaal om inzichten van experts te zien van leiders en journalisten









