پرش به محتوا
Logo: WECORE
ثبت‌نام / ورود
LLMaaS
در دسترس بنا به درخواست

مدل‌های زبانی متن‌باز را روی GPUهای خودتان راه‌اندازی کنید.

یک راه‌انداز خودمیزبان LLM برای ابر WECORE شما. یک مدل متن‌باز از Hugging Face انتخاب کنید، آن را در یک گام روی نودهای GPU مستقر کنید و یک رابط گفت‌وگوی آماده به‌همراه یک API سازگار با OpenAI بگیرید؛ سرویس‌دهی با vLLM، با پرامپت‌ها و داده‌هایی که هرگز از زیرساخت شما خارج نمی‌شوند.
موتور استنتاج vLLM
API سازگار با OpenAI
مدل‌های متن‌باز Hugging Face
خصوصی به‌صورت ذاتی
ماژول دسترسی زودهنگام: LLMaaS؛ ساخته‌شده روی بنیان‌های GPU و سرور ابری WECORE.

رابط نمادین: مدل شما، endpoint شما، دادهٔ شما.

vLLM
موتور سرویس‌دهی با توان عملیاتی بالا
سازگار با OpenAI
API گفت‌وگو و تکمیل /v1 به‌صورت drop-in
مدل‌های متن‌باز
Llama،‏ Qwen،‏ Mistral،‏ DeepSeek و بیشتر
خودمیزبان
روی GPUهای شما اجرا می‌شود، داده سرجا می‌ماند
جریان کار

از مدل تا endpoint، بدون خروج از ابر شما.

با الهام از راه‌انداز Azimuth LLM،‏ WECORE یک مدل متن‌باز انتخاب‌شده را روی نودهای GPU خودتان به یک اپ گفت‌وگو و API در حال اجرا تبدیل می‌کند، بدون نیاز به ساخت زیرساخت استنتاج.
۰۱

یک مدل انتخاب کنید

از میان مدل‌های متن‌باز منتخب انتخاب کنید یا به هر مخزن پشتیبانی‌شده توسط vLLM روی Hugging Face اشاره کنید؛ instruct، چت، کد، embedding یا زبانی‑تصویری.

۰۲

اندازهٔ GPU را تعیین کنید

یک فلیور GPU و اندازهٔ آغازین را از ظرفیت GPU WECORE خود انتخاب کنید. بررسی‌های پیش‌پرواز پیش از اجرا تأیید می‌کنند که VRAM و سهمیه با مدل می‌خوانند.

۰۳

در یک گام راه‌اندازی کنید

WECORE vLLM و یک اپ وب گفت‌وگو را برای شما مستقر می‌کند؛ وزن‌های مدل دریافت، سرویس‌دهی و سلامت‌سنجی می‌شوند و پشت کلید API اختصاصی خودتان عرضه می‌گردند.

۰۴

گفت‌وگو و یکپارچه‌سازی کنید

از گفت‌وگوی وب داخلی استفاده کنید یا اپ‌هایتان را به endpoint سازگار با OpenAI وصل کنید. توکن بر ثانیه، تأخیر و مصرف GPU را در داشبوردهای داخلی ببینید.

کاربردها

یک راه‌انداز، چندین بار کاری هوش مصنوعی.

هر مسیر با مدل‌های پیش‌تنظیم‌شدهٔ منتخب، اندازه‌گیری درست GPU و یک سطح گفت‌وگو یا API متناسب با کار عرضه می‌شود.
گفت‌وگو + بازیابی

دستیارهای گفت‌وگو و RAG

یک دستیار داخلی یا یک چت‌بات تقویت‌شده با بازیابی روی اسناد خودتان راه بیندازید؛ جایگزینی خصوصی برای سرویس‌های گفت‌وگوی عمومی، با منابعی که درون شبکهٔ شما می‌مانند.

Llama 3.1 Qwen2.5 Mistral Embeddings
ابزار توسعه‌دهنده

کد و عامل‌ها

یک مدل کد را پشت API سازگار با OpenAI سرویس‌دهی کنید تا دستیارهای IDE، بات‌های بازبینی کد و عامل‌های ابزارمند را نیرو دهد؛ با هزینهٔ زمان GPU، نه پرداخت به‌ازای هر توکن به یک فروشنده.

Qwen2.5-Coder DeepSeek-Coder Devstral
چندوجهی

بینایی و هوش اسناد

یک مدل زبانی‑تصویری را برای درک تصویر، پرسش‌وپاسخ روی اسکرین‌شات و استخراج اسناد با رابط تحلیل تصویر مستقر کنید، همه روی نودهای شتاب‌دهنده.

Llama 3.2 Vision Qwen2-VL Pixtral
پلتفرم

یک لایهٔ کنترل نازک روی استنتاج متن‌باز اثبات‌شده.

LLMaaS یک مدل دیگر نیست. این لایهٔ محصول حاکمیت‌شده است که vLLM، وزن‌های متن‌باز و یک رابط وب را روی ظرفیت GPU که از پیش در اختیار دارید گرد هم می‌آورد.
llm-launch خودمیزبان
model:   meta-llama/Llama-3.1-8B-Instruct
backend: vllm (openai-compatible)
gpu:     1 × A100-80GB
ui:      web chat + image analysis
expose:  https + per-service API key
status:  SERVING  ·  142 tok/s

کاتالوگ مدل منتخب

از مدل‌های متن‌باز بررسی‌شده با پیش‌فرض‌های منطقی آغاز کنید، یا هر مخزن Hugging Face پشتیبانی‌شده توسط vLLM را بیاورید، وزن‌های دارای دروازه با توکن خودتان دریافت می‌شوند.

endpoint سازگار با OpenAI

یک API گفت‌وگو و تکمیل پایدار /v1 یعنی SDKها، عامل‌ها و ابزارهای موجود تنها با تغییر یک base URL به WECORE اشاره می‌کنند.

بررسی تناسب پیش از هزینه

هر مدل به‌صورت یک سرویس مدیریت‌شده روی یک سرور اختصاصی اجرا می‌شود و تناسب (حافظهٔ GPU، کران‌های context و صلاحیت پلن) پیش از ساخت هر چیزی بررسی می‌شود.

رصدپذیری داخلی

داشبوردهای آماده از همان روز اول توان عملیاتی، تأخیر، عمق صف و بهره‌وری GPU را نمایان می‌کنند.

خصوصی به‌صورت ذاتی

پرامپت‌ها، پاسخ‌ها و وزن‌ها روی فضای ذخیره‌سازی اپراتور درون ابر شما می‌مانند، بدون فراخوانی API شخص ثالث و بدون خروج داده به فروشندهٔ مدل.

پیش‌بینی سهمیه و هزینه

پیش از راه‌اندازی یک مدل، VRAM، ساعت‌های GPU و اثر کیف‌پول را برآورد کنید و لحظه‌ای که مدل بیکار را متوقف می‌کنید دیگر هزینه‌ای ندهید.

پشتهٔ متن‌باز

بهترین استنتاج متن‌باز، گردآوری‌شده و حاکمیت‌شده.

LLMaaS همان اجزایی را که تیم‌های پژوهش و پلتفرم پیش‌تر به آن اعتماد دارند، پشت یک جریان راه‌اندازی خودگردان بسته‌بندی می‌کند.

استنتاج

vLLM سرور سازگار با OpenAI وزن‌های Hugging Face شتاب‌دهی GPU

رابط‌ها

رابط گفت‌وگوی وب رابط تحلیل تصویر REST + SDK پاسخ‌های جریانی

مدل‌ها

Llama Qwen Mistral DeepSeek Gemma Embeddings

پلتفرم

ظرفیت GPU خودتان سرور اختصاصی برای هر سرویس کلیدهای API اختصاصی هر سرویس سنجه‌ها و داشبوردها
چرا WECORE Cloud

تجربه‌ای شبیه API، اجرای خودمیزبان.

بُعد
APIهای میزبانی‌شدهٔ LLM
LLMaaS WECORE
جای اجرا
SaaS فروشنده، اجارهٔ مشترک
ظرفیت GPU خودتان، درون ابر شما
اقامت داده
پرامپت‌ها و داده از شبکهٔ شما خارج می‌شوند
پرامپت‌ها، وزن‌ها و لاگ‌ها روی ابر شما می‌مانند
کنترل مدل
مدل‌ها و نسخه‌های فروشنده
هر مدل متن‌باز پشتیبانی‌شده توسط vLLM، پین‌شده توسط شما
یکپارچه‌سازی
endpointهای اختصاصی
API سازگار با OpenAI: تغییر یک base URL
مدل هزینه
به‌ازای توکن، به‌ازای هر درخواست
زمان GPU که مال شماست؛ مدل بیکار را متوقف کنید، هزینه هم متوقف می‌شود
پرسش‌های متداول

پرسش‌های سرویس مدل زبانی، پاسخ داده شد

راه‌انداز چیست، چه چیزی سرویس‌دهی می‌کند و چطور با زیرساخت WECORE جور می‌شود

این یک سرویس LLM خودمیزبان است: شما یک مدل متن‌باز انتخاب می‌کنید و WECORE آن را روی نودهای GPU شما به‌همراه یک رابط گفت‌وگوی وب و یک API سازگار با OpenAI مستقر می‌کند. این الگو از اپ‌های Azimuth LLM شرکت StackHPC الهام گرفته و برای اجرا روی زیرساخت GPU WECORE سازگار شده است.

هر مدلی که vLLM پشتیبانی می‌کند و از Hugging Face سرویس‌دهی می‌شود؛ از جمله Llama،‏ Qwen،‏ Mistral،‏ DeepSeek،‏ Gemma و مدل‌های زبانی‑تصویری. ما پیش‌تنظیم‌های منتخب با پیش‌فرض‌های منطقی عرضه می‌کنیم و شما می‌توانید به مخزن خودتان اشاره کنید؛ وزن‌های دارای دروازه با توکن دسترسی خودتان دریافت می‌شوند.

از طریق یک API گفت‌وگو و تکمیل /v1 سازگار با OpenAI. SDKها، چارچوب‌های عامل و ابزارهای موجود تنها با تغییر base URL کار می‌کنند، بدون بازنویسی. یک گفت‌وگوی وب داخلی (و یک رابط تحلیل تصویر برای مدل‌های بینایی) هم برای کسانی که نمی‌خواهند کد بنویسند گنجانده شده است.

هیچ‌جای بیرون از ابر شما. پرامپت‌ها، پاسخ‌ها، وزن‌های مدل و لاگ‌ها روی فضای ذخیره‌سازی اپراتور درون زیرساخت WECORE شما می‌مانند. هیچ فراخوانی API شخص ثالث و هیچ خروج داده‌ای به فروشندهٔ مدل وجود ندارد، که آن را برای بارهای کاری حساس و تحت‌مقررات بسیار مناسب می‌کند.

روی ظرفیت GPU درون ابر WECORE خودتان، و هرگز روی سخت‌افزار مشترک فروشنده. هر مدل به‌صورت یک سرویس مدیریت‌شده روی یک سرور اختصاصی اجرا می‌شود و endpoint با کلید API اختصاصی هر سرویس محافظت می‌شود. GPUها مال شماست و WECORE لایهٔ سرویس‌دهی را روی آن‌ها اجرا می‌کند.

بله. داشبوردهای آماده توکن بر ثانیه، تأخیر، عمق صف و بهره‌وری GPU را نمایان می‌کنند. چون روی GPUهایی اجرا می‌کنید که از پیش بابتشان هزینه می‌دهید، هزینه همان زمان GPU است؛ و با متوقف کردن مدل بیکار، هزینه هم متوقف می‌شود.

آن‌ها پلتفرم‌های همه‌منظوره‌ای‌اند که روی‌شان می‌سازید: KaaS برای اپلیکیشن‌های کانتینری و پلتفرم HPC برای محاسبهٔ دسته‌ای مبتنی بر Slurm. LLMaaS یک محصول آماده است، نه یک پلتفرم؛ مدل‌های متن‌باز را در یک گام پشت رابط گفت‌وگو و API سازگار با OpenAI سرویس‌دهی می‌کند تا هرگز خودتان پشتهٔ استنتاج را سرهم نکنید. برای استفاده از آن به هیچ‌کدام از آن دو محصول نیاز ندارید.

دسترسی زودهنگام

GPUهای خود را به یک endpoint خصوصی هوش مصنوعی تبدیل کنید.

LLMaaS WECORE برای تیم‌هایی است که راحتی یک API میزبانی‌شدهٔ LLM را می‌خواهند بدون فرستادن پرامپت‌ها و داده به یک فروشندهٔ عمومی؛ مدل‌های متن‌باز، یک endpoint سازگار با OpenAI و یک رابط گفت‌وگو، همه روی زیرساختی که خودتان کنترل می‌کنید.