Öppna vikter på egen hårdvara
LLM:er med öppna vikter körs på kundens GPU-servrar. Inference stannar i installationen, och promptar eller resultat behöver inte lämna nätverket.
Katalogen visar den information organisationen behöver för att välja vilka modeller som får användas: modellidentitet, licens och EU-ursprung.
Lanes och routing
Lanes skiljer arbetslaster åt efter beslutad policy. Routingkedjan visar vilken väg ett modellanrop tog, vilken modell som svarade och om en nedgradering skedde.
Varje route-kvitto sparar lane, modell, tokens och kostnad. Det ger både driftdata och underlag för revision utan att göra tekniska mått till ledningens gränssnitt.
Budget med hårda stopp
Admin-konsolen fördelar budget per avdelning. När gränsen nås stoppar policyn vidare kostnad i stället för att bara skicka en varning.
Kostnaden normaliseras till kronor i verksamhetsvyn, medan tokens och modellanrop finns kvar för den tekniska granskaren.