AMD har visat att Kimi K2.5, en språkmodell med en biljon parametrar, går att köra lokalt på fyra Ryzen AI Max+-datorer till en totalkostnad på cirka 88 000 kronor. Modellen kvantiseras ner till 2-bitars precision och fördelas över maskinerna via vanlig Ethernet, med en hastighet på ungefär åtta tokens per sekund.

Resultatet är mer imponerande som demo än som praktiskt verktyg. Åtta tokens per sekund med kraftigt komprimerad modell är långt ifrån molnprestanda, och oberoende tester visar att nätverket fortfarande är en flaskhals. Mer intressant är vad en enskild Ryzen AI Max+-maskin klarar på egen hand med mindre modeller, där 120 GB delat GPU-minne ger prestanda som tidigare krävde dedikerade GPU-kort.

I dagens nyhetsbrev:

  • AMD pressar biljonmodell genom fyra datorer för 88 000 kronor

  • NVIDIA ger bort AI-mjukvara till telekomjättar och hoppas sälja hårdvaran

  • Karpathy visar att GPT egentligen bara är matematik i stor skala

  • Google vill att webben ska prata direkt med AI-agenter, men inte alla håller med

AMD pressar biljonmodell genom fyra minidatorer

AMD har visat hur Moonshot AI:s Kimi K2.5-modell med en biljon parametrar kan köras lokalt på ett kluster av fyra Framework Desktop-datorer med Ryzen AI Max+ 395-processorer. Den kvantiserade modellen på 375 GB fördelas över de fyra maskinerna med hjälp av llama.cpp:s RPC-funktion, där varje nod bidrar med GPU-minne och beräkningskraft via vanligt Ethernet. Resultatet är en lokal AI-inferens som producerar runt 8 tokens per sekund utan molntjänster.

Quick points:

  • Varje Framework Desktop kostar från cirka 22 000 kronor i toppkonfiguration med 128 GB minne, vilket ger en totalkostnad på runt 88 000 kronor för hela klustret. Det är en bråkdel av vad traditionella GPU-servrar kostar, men långt ifrån gratis och kräver Linux-konfiguration med AMD:s ROCm-stack.

  • Kimi K2.5 är en MoE-modell (Mixture of Experts) som aktiverar bara 32 miljarder av sin biljon parametrar per fråga. Modellen körs i kraftigt kvantiserad 2-bit-version, vilket minskar storleken men också påverkar svarskvaliteten.

  • Oberoende tester av Jeff Geerling visar att nätverkskluster med llama.cpp RPC fortfarande är experimentellt och att prestandan begränsas av att nätverket är långsammare än internminnet. Åtta tokens per sekund räcker för enklare uppgifter, men är långt från molntjänsternas hastighet.

Quick take: Åtta tokens per sekund med en kraftigt komprimerad modell är mer marknadsföring än genombrott. Verkliga värdet med Ryzen AI Max+ ligger i att köra medelstora modeller snabbt och lokalt på en enda maskin, inte i att pressa biljonmodeller genom fyra nätverkade datorer.

Quick number | Youtube Short går från 30 till 200 miljarer visningar/dag

2021  ▓░░░░░░░░░  30 miljarder/dag
2022  ▓▓░░░░░░░░  50 miljarder/dag
2023  ▓▓▓░░░░░░░  70 miljarder/dag
2024  ▓▓▓▓░░░░░░  90 miljarder/dag
2025  ▓▓▓▓▓▓▓▓▓▓ 200 miljarder/dag

Visningar per sekund:
- 2021: 347 000 visningar/sekund
- 2025: 2,3 miljoner visningar/sekund

Jämför omfattning:
- 200 miljarder = fler än antalet stjärnor i Vintergatan
- 2,3 miljoner visningar/sekund = hela Stockholms befolkning tittar samtidigt
- Högst engagement av alla kortformat (5,91%)

Shorts driver nu 10% av YouTubes totala visningstid och passerade TikTok i engagement-rate 2024

NVIDIA bygger AI-modell för att styra telekomnät

(Källa: NVIDIA)

NVIDIA släppte inför mobilkonferensen MWC i Barcelona en specialbyggd språkmodell med 30 miljarder parametrar för telekombranschen. Modellen, som bygger på Nemotron 3-arkitekturen och tagits fram tillsammans med AdaptKey AI, ska hjälpa operatörer att gå från manuell felsökning till AI-agenter som hanterar nätverksfel på egen hand. Lanseringen är en del av ett bredare initiativ där NVIDIA tillsammans med BT, Deutsche Telekom, T-Mobile och Nokia vill bygga framtidens 6G-nät på öppna AI-plattformar.

Quick points:

    • NVIDIA och VIAVI har tagit fram en energisparplan som använder syntetisk data och AI-agenter för att minska 5G-nätens energiförbrukning utan att försämra täckning eller hastighet för användare.

    • Tillsammans med Tech Mahindra har NVIDIA publicerat en öppen guide för hur operatörer kan träna AI-modeller att felsöka nätverksproblem steg för steg, ungefär som en erfaren nätverksingenjör.

    • Enligt NVIDIA:s egen branschundersökning är nätverksautomation den AI-investering som ger bäst avkastning bland telekomoperatörer, men analytiker på Bain varnar att teknisk skuld, kompetensbrister och organisatorisk tröghet bromsar omställningen.

Quick take: Strategin är densamma som i datacenter: ge bort mjukvaran, sälj hårdvaran. Om tillräckligt många operatörer bygger sin nätverksautomation på NVIDIA:s verktyg sitter de snart fast i samma GPU-beroende som resten av AI-branschen. Ericsson och Nokia borde vara oroliga.

Quick click | Seedance 2/Kling 3.0

Quick prompt | Nano Banana 2

REFERENCE: [uploaded image of person]

1990s German minimal techno 12" single cover featuring the person from the reference image.

CRITICAL LIKENESS: The person recognizable in stark high-contrast black and white photograph.

Extreme close-up of face, harsh direct flash, clinical and confrontational. Or distant figure in brutalist architecture, anonymous yet identifiable. Grainy, slightly out of focus, photocopied texture.

Design: vast white or grey space, tiny text in Helvetica or DIN, catalog number prominent, minimal information. Tresor, Basic Channel, Chain Reaction aesthetic.

No album title visible, just artist name in lowercase, catalog number like "TR-47" or "BC-12." Stark, anti-commercial, functional.

Plain white sleeve, center label visible through die-cut hole, utilitarian beauty.

Format: 1:1 square, minimal elements

Karpathy kokar ner GPT till 200 rader Python

(Källa: Karpathys blogb)

Andrej Karpathy, tidigare AI-chef på Tesla och en av grundarna till OpenAI, har publicerat microgpt, en komplett GPT-modell i 200 rader ren Python utan ett enda externt bibliotek. Modellen har 4 192 parametrar, tränas på 32 000 babynamn och genererar nya namn som låter trovärdiga men aldrig existerat. Poängen är pedagogisk: koden visar exakt samma algoritm som driver ChatGPT och Claude, bara utan den skala och optimering som gör dem snabba.

Quick points:

  • Skriptet kräver inga externa bibliotek och innehåller allt från tokenizer till träningsloop, inklusive en egen autograd-motor som beräknar gradienter utan PyTorch. Karpathy förklarade samma koncept tidigare i sin populära micrograd-video om backpropagation.

  • En separat steg-för-steg-version bygger upp modellen gradvis, från enkla bokstavsräkningar till fullständig uppmärksamhetsmekanism och GPT-arkitektur. Hela koden går att köra direkt i en Google Colab-miljö.

  • Gisten fick över 5 000 stjärnor på GitHub och skapade en våg av varianter i C++ och Rust, där en C++-version kör 300–400 gånger snabbare.

Quick take: Värdet med microgpt är inte koden i sig utan insikten att språkmodeller inte är magi, bara matematik i stor skala. För den som dagligen fattar beslut om AI-verktyg är det ovärderligt att förstå att skillnaden mellan en leksaksmodell och ChatGPT i princip bara handlar om mer data, fler parametrar och dyrare hårdvara.

Google vill att webben ska prata direkt med AI-agenter

(Källa: Google Chrome blog)

Google har lanserat WebMCP i en tidig förhandsversion av Chrome, ett protokoll som låter webbplatser erbjuda färdiga verktyg direkt till AI-agenter. I stället för att en agent tar skärmbilder och gissar var köp-knappen sitter kan en e-handelssajt berätta exakt vilka funktioner som finns tillgängliga, som att söka produkter eller lägga en beställning. Protokollet är ett samarbete mellan Google och Microsoft som nu standardiseras inom W3C, och siktar på att bli webbens gemensamma gränssnitt för AI-agenter.

Quick points:

  • WebMCP erbjuder två vägar in: en deklarativ API som bygger på vanliga HTML-formulär, och en imperativ JavaScript-API för mer komplexa arbetsflöden som bokningar eller kundvagnar. Enligt MarkTechPost minskar det beräkningskostnaderna med runt 67 % jämfört med skärmbildsbaserade metoder.

  • WebMCP är inte samma sak som Anthropics MCP (Model Context Protocol). VentureBeat förklarar att WebMCP fungerar helt i webbläsaren på klientsidan, medan Anthropics MCP är ett backend-protokoll. En resebyrå kan använda båda parallellt utan konflikter.

  • Parallellt med WebMCP pågår en het debatt bland utvecklare om att befintliga kommandoradsverktyg redan räcker för de flesta AI-agenter. Andrej Karpathy kallade CLI-verktyg för det mest spännande gränssnittet för agenter just för att de redan finns, fungerar och går att kombinera fritt.

Quick take: WebMCP löser ett verkligt problem för konsumentwebben, där AI-agenter i dag slösar pengar och tid på att gissa sig fram genom gränssnitt byggda för människor. Om WebMCP slår igenom kan "agentoptimering" bli lika viktigt som sökmotoroptimering är i dag. Men det kräver att sajter frivilligt ger AI-agenter genvägar förbi sina gränssnitt, och det är långt ifrån självklart att e-handlare vill göra det.

A quick tool | Vimcal

Vimcal är en kalenderapp som marknadsför sig som världens snabbaste kalender för personer med många möten. Verktyget kombinerar tangentbordsgenvägar med AI-schemaläggning och låter användare dela tillgänglighet genom att dra för att markera tider. Plattformen visar överlappande arbetstid mellan tidszoner, synkroniserar Google Calendar och Outlook i en vy samt visar sociala profiler för deltagare. Svarstider ligger under 100 millisekunder.

Vimcal kostar 187 kronor per månad eller 1870 kronor per år. Gratis provperiod finns utan kreditkort. Verktyget fungerar i webbläsare, dator och iOS-app. Företaget uppfyller ISO 27001, SOC 2 Type II och HIPAA för säkerhet.

Behöver du hjälp att navigera ett ständigt skiftande AI-landskap?
Micke Quick är konsult med särskilt fokus på AI och arbetsflöden inom reklam- och marknadsföring. Han hjälper dig med insikter, utbildning, och strategi för implementering av AI.

Läs mer på mickequick.se

Quick links

Cluesmith har öppnat källkoden till Codev, en uppsättning infrastrukturverktyg som samordnar flera AI-modeller för att automatisera hela mjukvaruutvecklingscykeln från specifikation till pull request.

T-Mobile och SoftBank har visat att programvarudefinierad AI-RAN fungerar i fält, med samtidig AI- och 16-lagers massive MIMO-behandling i aktiva 5G-nät inför Mobile World Congress i Barcelona.

USA:s utrikesdepartement granskar (archive.ph) tiotusentals studentvisum med AI-verktyg som söker igenom sociala medier efter stöd för Hamas, inom ramen för programmet "Catch and Revoke" som hittills lett till över 300 indragna visum.

U.S. Immigration and Customs Enforcement har börjat använda ELITE, ett Palantir-byggt AI-verktyg som kartlägger personer för utvisning på en digital karta, skapar dossierer och ger varje adress en sannolikhetspoäng baserat på bland annat Medicaid-data.