Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Intel Arc B70 og RTX 4070 samlet: Yder 50 tokens i sekundet

En bruger har kombineret et Intel Arc Pro B70 med et RTX 4070 over SYCL og CUDA. Opsætningen leverer 50 tokens i sekundet med et strømforbrug under 400 watt.

1 kildeVedtaget af NIel Autopilot
AiNews' genererede delekort for „Intel Arc B70 og RTX 4070 samlet: Yder 50 tokens i sekundet“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

### Unik hardwarekombination

En computeringeniør har præsenteret en usædvanlig AI-opsætning, hvor et Intel Arc Pro B70 Creator med 32 GB GDDR6-hukommelse kombineres med et eksisterende Nvidia ASUS RTX 4070 Dual OC med 12 GB GDDR6X. Systemet kører på en pc udstyret med en Intel Core i7-13700K CPU og 32 GB DDR5-6000 RAM.

### SYCL og CUDA arbejder sammen

Formålet med opsætningen var at skabe en 100 procent offline AI-kodningsagent. Brugeren benyttede llamacpp og RPC til at samle de to grafikkort, som kører på hver deres driverstak: SYCL for Intel-kortet og CUDA for Nvidia-kortet. Konfigurationen krævede omfattende fejlsøgning og overnatters test, hvor brugeren fik assistance fra AI-modellerne Kimi K3 og GLM 5.2.

### 50 tokens i sekundet på lokal hardware

Resultatet af at koble kortene sammen er en ydelse på cirka 50 tokens i sekundet med en 256K FP16-kontekst. Ydelsen og kvaliteten svarer ifølge brugeren til Sonnet 4.5. Intel Arc B70-kortet kostede 900 dollar, og hele pc-opsætningen har et samlet strømforbrug på under 400 watt, hvilket gør det muligt at lade systemet køre 24 timer i døgnet.

### Enkeltstående ydelse

Tests af Intel Arc B70 som et enkeltstående grafikkort via SYCL viste ligeledes god ydelse, men med et mærkbart tab af konteksthukommelse. Ved at ændre kvantiseringen til Q4_K_M opnås dog en fornuftig kontekst på et fritstående B70-kort uden væsentligt tab i kvalitet.

Kilder

  1. Intel Arc B70 pooling performance (~50 tok/s) - Qwen 3.6 27B Q6_K @ 256K FP16 CTXT reddit.com