Brugere oplever fejl i ræsonnering med sprogmodellen Laguna S 2.1
Sprogmodellen Laguna S 2.1 hitter med over 160.000 downloads, men brugere melder om fejl i ræsonnering og pludselige afbrydelser under afvikling i vLLM og llama.cpp.

Brugere i AI-fællesskabet oplever tekniske udfordringer med sprogmodellen Laguna S 2.1 fra Poolside. Modellen har ellers opnået stor opmærksomhed i Unsloths GGUF-udgave med 93 trendpoint, 266 likes og 164.322 downloads.
På Reddit beretter brugeren Oatilis om tilbagevendende problemer ved afvikling af modellen i både vLLM og Poolsides forgrening af llama.cpp. Uanset hvilken kvantisering der anvendes – herunder NVFP4 og Q8_0 – udskriver modellen øjeblikkeligt strengen `</think>`. Dette forhindrer modellen i at udføre sin ræsonneringsproces.
### Midlertidige nødløsninger og fejl i afvikling
For at omgå problemet har brugere forsøgt at fremtvinge en tvingende `think`-streng i prompten. Selvom det forhindrer modellen i straks at afslutte ræsonneringen, medfører det, at modellen altid ræsonnerer – selv ved helt enkle prompts som »Hello«.
Udfordringerne fortsætter dog ved praktisk brug. Ved anvendelse i udviklingsværktøjet OpenCode stopper modellerne ofte midt i genereringen af kode, selvom der stadig er rigeligt med kontekstplads tilbage. Problemerne optræder på tværs af opsætninger, herunder med modelvarianter som `Laguna-S-2.1-NVFP4` med draft-modellen `Laguna-S-2.1-DFlash-NVFP4` i vLLM samt `Q8_0` fra `Laguna-S-2.1-GGUF` med `laguna-s-2.1-DFlash-BF16.gguf` i llama.cpp.
### Efterspørgsel på nye modeller
Laguna S 2.1 tilhører en bølge af nye mellemstore modeller sammen med navne som DSV4 Flash 0731, Inkling Small og Step 3.7 Flash.
Sideløbende udtrykker brugere som `_TheWolfOfWalmart_` et ønske om nye konkurrenter i klassen for 70-80B MoE-modeller, der kan levere hurtigere afvikling end ældre modeller som Qwen 27B/35B og Qwen 3.6-familien på hardware baseret på V620 GPU'er og ROCm. Indtil videre må lokalt drevne udviklere dog kæmpe med tekniske fejl i de nyeste udgivelser.