Hoppa till innehåll
Logotyp: WECORE
Skapa konto / logga in
LLMaaS
Tillgänglig på begäran

Starta öppna LLM:er på GPU:er du kontrollerar.

Ett självhostat startverktyg för LLM:er i ditt WECORE-moln. Välj en öppen modell från Hugging Face, driftsätt den på GPU-noder i ett steg och få ett färdigt chattgränssnitt plus ett OpenAI-kompatibelt API – serverat av vLLM, med prompter och data som aldrig lämnar din infrastruktur.
vLLM-inferensmotor
OpenAI-kompatibelt API
Öppna Hugging Face-modeller
Privat i grunden
Modul i tidig åtkomst: LLMaaS – byggd på WECORE:s GPU- och Cloud Server-byggstenar.

Illustrativt gränssnitt – din modell, din endpoint, din data.

vLLM
Serveringsmotor med hög genomströmning
OpenAI-kompatibelt
Drop-in /v1-API för chatt och completions
Öppna modeller
Llama, Qwen, Mistral, DeepSeek med flera
Självhostad
Körs på dina GPU:er, data stannar kvar
Arbetsflöde

Från modell till endpoint, utan att lämna ditt moln.

Inspirerat av startverktyget Azimuth LLM förvandlar WECORE en vald öppen modell till en körande chattapp och ett API på dina egna GPU-noder – ingen inferensinfrastruktur att bygga själv.
01

Välj en modell

Välj bland utvalda öppna modeller eller peka på valfritt repository på Hugging Face som vLLM stöder – instruct, chatt, kod, embedding eller vision-språk.

02

Dimensionera GPU:erna

Välj en GPU-flavor och en startstorlek från din GPU-kapacitet hos WECORE. Preflight-kontroller bekräftar att VRAM och kvot passar modellen innan den startar.

03

Starta i ett steg

WECORE driftsätter vLLM och en webbaserad chattapp åt dig – modellvikterna hämtas, serveras och hälsokontrolleras, och exponeras bakom din egen API-nyckel per tjänst.

04

Chatta och integrera

Använd den inbyggda webbchatten, eller peka dina appar mot den OpenAI-kompatibla endpointen. Följ token/s, latens och GPU-användning i de inbyggda instrumentpanelerna.

Användningsfall

Ett startverktyg, många AI-arbetsbelastningar.

Varje spår levereras med utvalda modellförval, rätt GPU-dimensionering och ett chatt- eller API-gränssnitt anpassat för uppgiften.
Chatt + retrieval

Chatt- och RAG-assistenter

Sätt upp en intern assistent eller en RAG-chattbot som svarar utifrån dina egna dokument – ett privat alternativ till publika chattjänster, med källor som stannar i ditt nätverk.

Llama 3.1 Qwen2.5 Mistral Embeddings
Utvecklarverktyg

Kod och agenter

Servera en kodmodell bakom det OpenAI-kompatibla API:et för att driva IDE-assistenter, kodgranskningsbottar och verktygsanvändande agenter – fakturerat som GPU-tid, inte per token till en leverantör.

Qwen2.5-Coder DeepSeek-Coder Devstral
Multimodalt

Vision- och dokument-AI

Driftsätt en vision-språkmodell för bildförståelse, frågor och svar om skärmdumpar och dokumentextraktion med bildanalysgränssnittet, allt på accelererade noder.

Llama 3.2 Vision Qwen2-VL Pixtral
Plattform

Ett tunt kontrollplan över beprövad öppen inferens.

LLMaaS är inte ännu en modell. Det är det styrda produktlagret som sätter samman vLLM, öppna vikter och ett webbgränssnitt på GPU-kapacitet du redan äger.
llm-launch självhostad
model:   meta-llama/Llama-3.1-8B-Instruct
backend: vllm (openai-compatible)
gpu:     1 × A100-80GB
ui:      web chat + image analysis
expose:  https + per-service API key
status:  SERVING  ·  142 tok/s

Utvald modellkatalog

Utgå från granskade öppna modeller med rimliga standardinställningar, eller ta med valfritt repository på Hugging Face som vLLM stöder – vikter bakom åtkomstkontroll hämtas med din egen token.

OpenAI-kompatibel endpoint

Ett stabilt /v1-API för chatt och completions gör att befintliga SDK:er, agenter och verktyg pekar mot WECORE genom att byta en enda bas-URL.

Passformen kontrolleras innan du betalar

Varje modell körs som en hanterad tjänst på en dedikerad server, och passformen – GPU-minne, kontextgränser, planbehörighet – kontrolleras innan något skapas.

Inbyggd observerbarhet

Färdiga instrumentpaneler visar genomströmning, latens, ködjup och GPU-utnyttjande från dag ett.

Privat i grunden

Prompter, svar och vikter stannar på operatörslagring i ditt moln – inga API-anrop till tredje part, ingen dataexport till en modelleverantör.

Förhandskoll av kvot och kostnad

Uppskatta VRAM, GPU-timmar och kostnad innan en modell startar, och sluta betala i samma stund som du stoppar en inaktiv modell.

Öppen stack

Den bästa öppna inferensen, sammansatt och styrd.

LLMaaS paketerar samma komponenter som forsknings- och plattformsteam redan litar på, bakom ett enda startflöde med självbetjäning.

Inferens

vLLM OpenAI-kompatibel server Vikter från Hugging Face GPU-acceleration

Gränssnitt

Webbchatt Bildanalysgränssnitt REST + SDK:er Strömmande svar

Modeller

Llama Qwen Mistral DeepSeek Gemma Embeddings

Plattform

Din egen GPU-kapacitet Dedikerad server per tjänst API-nycklar per tjänst Mätvärden och instrumentpaneler
Därför WECORE Cloud

API-liknande upplevelse, självhostad körning.

Dimension
Hostade LLM-API:er
WECORE LLMaaS
Var det körs
Leverantörens SaaS, delad miljö
GPU-kapacitet du äger, i ditt moln
Datahemvist
Prompter och data lämnar ditt nätverk
Prompter, vikter och loggar stannar i ditt moln
Modellkontroll
Leverantörens modeller och versioner
Valfri öppen modell som vLLM stöder, pinnad av dig
Integration
Proprietära endpoints
OpenAI-kompatibelt API – byt en enda bas-URL
Kostnadsmodell
Per token, mätt per anrop
GPU-tid du äger; stoppa en inaktiv modell och sluta betala
Vanliga frågor

Frågor och svar om LLM-as-a-Service

Vad startverktyget är, vad det serverar och hur det passar in i din WECORE-infrastruktur

Det är ett självhostat startverktyg för LLM:er: du väljer en öppen modell och WECORE driftsätter den på dina GPU-noder med ett webbaserat chattgränssnitt och ett OpenAI-kompatibelt API. Mönstret är inspirerat av StackHPC:s Azimuth LLM-appar, anpassat för att köras på WECORE:s GPU-infrastruktur.

Alla modeller som vLLM stöder och som serveras från Hugging Face – inklusive Llama, Qwen, Mistral, DeepSeek, Gemma och vision-språkmodeller. Vi levererar utvalda förval med rimliga standardinställningar, och du kan peka på ditt eget repository; vikter bakom åtkomstkontroll hämtas med din egen åtkomsttoken.

Genom ett OpenAI-kompatibelt /v1-API för chatt och completions. Befintliga SDK:er, agentramverk och verktyg fungerar genom att bara byta bas-URL – ingen omskrivning. En inbyggd webbchatt (och ett bildanalysgränssnitt för visionmodeller) ingår för den som inte vill skriva kod.

Ingenstans utanför ditt moln. Prompter, svar, modellvikter och loggar stannar på operatörslagring i din WECORE-infrastruktur. Det görs inga API-anrop till tredje part och ingen data lämnar molnet till en modelleverantör, vilket gör tjänsten till en stark kandidat för känsliga och reglerade arbetsbelastningar.

GPU-kapacitet i ditt eget WECORE-moln – aldrig på delad leverantörshårdvara. Varje modell körs som en hanterad tjänst på en dedikerad server, och endpointen skyddas av en API-nyckel per tjänst. Du äger GPU:erna; WECORE kör serveringslagret på dem.

Ja. Färdiga instrumentpaneler visar token/s, latens, ködjup och GPU-utnyttjande. Eftersom du kör på GPU:er du redan betalar för är kostnaden GPU-tid – och stoppar du en inaktiv modell stoppar du kostnaden med den.

De är generella plattformar som du bygger på: KaaS för containerbaserade applikationer och HPC-plattformen för Slurm-baserad batchberäkning. LLMaaS är en färdig produkt snarare än en plattform – den serverar öppna modeller bakom ett chattgränssnitt och ett OpenAI-kompatibelt API i ett steg, så att du aldrig behöver sätta ihop inferensstacken själv. Du behöver ingen av de andra produkterna för att använda den.

Tidig åtkomst

Förvandla dina GPU:er till en privat AI-endpoint.

WECORE LLMaaS är för team som vill ha bekvämligheten hos ett hostat LLM-API utan att skicka prompter och data till en publik leverantör – öppna modeller, en OpenAI-kompatibel endpoint och ett chattgränssnitt, allt på infrastruktur du kontrollerar.