دستیارهای گفتوگو و RAG
یک دستیار داخلی یا یک چتبات تقویتشده با بازیابی روی اسناد خودتان راه بیندازید؛ جایگزینی خصوصی برای سرویسهای گفتوگوی عمومی، با منابعی که درون شبکهٔ شما میمانند.
POST /v1/chat/completions
۱۴۲ توکن بر ثانیه
رابط نمادین: مدل شما، endpoint شما، دادهٔ شما.
از میان مدلهای متنباز منتخب انتخاب کنید یا به هر مخزن پشتیبانیشده توسط vLLM روی Hugging Face اشاره کنید؛ instruct، چت، کد، embedding یا زبانی‑تصویری.
یک فلیور GPU و اندازهٔ آغازین را از ظرفیت GPU WECORE خود انتخاب کنید. بررسیهای پیشپرواز پیش از اجرا تأیید میکنند که VRAM و سهمیه با مدل میخوانند.
WECORE vLLM و یک اپ وب گفتوگو را برای شما مستقر میکند؛ وزنهای مدل دریافت، سرویسدهی و سلامتسنجی میشوند و پشت کلید API اختصاصی خودتان عرضه میگردند.
از گفتوگوی وب داخلی استفاده کنید یا اپهایتان را به endpoint سازگار با OpenAI وصل کنید. توکن بر ثانیه، تأخیر و مصرف GPU را در داشبوردهای داخلی ببینید.
یک دستیار داخلی یا یک چتبات تقویتشده با بازیابی روی اسناد خودتان راه بیندازید؛ جایگزینی خصوصی برای سرویسهای گفتوگوی عمومی، با منابعی که درون شبکهٔ شما میمانند.
یک مدل کد را پشت API سازگار با OpenAI سرویسدهی کنید تا دستیارهای IDE، باتهای بازبینی کد و عاملهای ابزارمند را نیرو دهد؛ با هزینهٔ زمان GPU، نه پرداخت بهازای هر توکن به یک فروشنده.
یک مدل زبانی‑تصویری را برای درک تصویر، پرسشوپاسخ روی اسکرینشات و استخراج اسناد با رابط تحلیل تصویر مستقر کنید، همه روی نودهای شتابدهنده.
model: meta-llama/Llama-3.1-8B-Instruct
backend: vllm (openai-compatible)
gpu: 1 × A100-80GB
ui: web chat + image analysis
expose: https + per-service API key
status: SERVING · 142 tok/s
از مدلهای متنباز بررسیشده با پیشفرضهای منطقی آغاز کنید، یا هر مخزن Hugging Face پشتیبانیشده توسط vLLM را بیاورید، وزنهای دارای دروازه با توکن خودتان دریافت میشوند.
یک API گفتوگو و تکمیل پایدار /v1 یعنی SDKها، عاملها و ابزارهای موجود تنها با تغییر یک base URL به WECORE اشاره میکنند.
هر مدل بهصورت یک سرویس مدیریتشده روی یک سرور اختصاصی اجرا میشود و تناسب (حافظهٔ GPU، کرانهای context و صلاحیت پلن) پیش از ساخت هر چیزی بررسی میشود.
داشبوردهای آماده از همان روز اول توان عملیاتی، تأخیر، عمق صف و بهرهوری GPU را نمایان میکنند.
پرامپتها، پاسخها و وزنها روی فضای ذخیرهسازی اپراتور درون ابر شما میمانند، بدون فراخوانی API شخص ثالث و بدون خروج داده به فروشندهٔ مدل.
پیش از راهاندازی یک مدل، VRAM، ساعتهای GPU و اثر کیفپول را برآورد کنید و لحظهای که مدل بیکار را متوقف میکنید دیگر هزینهای ندهید.
این یک سرویس LLM خودمیزبان است: شما یک مدل متنباز انتخاب میکنید و WECORE آن را روی نودهای GPU شما بههمراه یک رابط گفتوگوی وب و یک API سازگار با OpenAI مستقر میکند. این الگو از اپهای Azimuth LLM شرکت StackHPC الهام گرفته و برای اجرا روی زیرساخت GPU WECORE سازگار شده است.
هر مدلی که vLLM پشتیبانی میکند و از Hugging Face سرویسدهی میشود؛ از جمله Llama، Qwen، Mistral، DeepSeek، Gemma و مدلهای زبانی‑تصویری. ما پیشتنظیمهای منتخب با پیشفرضهای منطقی عرضه میکنیم و شما میتوانید به مخزن خودتان اشاره کنید؛ وزنهای دارای دروازه با توکن دسترسی خودتان دریافت میشوند.
از طریق یک API گفتوگو و تکمیل /v1 سازگار با OpenAI. SDKها، چارچوبهای عامل و ابزارهای موجود تنها با تغییر base URL کار میکنند، بدون بازنویسی. یک گفتوگوی وب داخلی (و یک رابط تحلیل تصویر برای مدلهای بینایی) هم برای کسانی که نمیخواهند کد بنویسند گنجانده شده است.
هیچجای بیرون از ابر شما. پرامپتها، پاسخها، وزنهای مدل و لاگها روی فضای ذخیرهسازی اپراتور درون زیرساخت WECORE شما میمانند. هیچ فراخوانی API شخص ثالث و هیچ خروج دادهای به فروشندهٔ مدل وجود ندارد، که آن را برای بارهای کاری حساس و تحتمقررات بسیار مناسب میکند.
روی ظرفیت GPU درون ابر WECORE خودتان، و هرگز روی سختافزار مشترک فروشنده. هر مدل بهصورت یک سرویس مدیریتشده روی یک سرور اختصاصی اجرا میشود و endpoint با کلید API اختصاصی هر سرویس محافظت میشود. GPUها مال شماست و WECORE لایهٔ سرویسدهی را روی آنها اجرا میکند.
بله. داشبوردهای آماده توکن بر ثانیه، تأخیر، عمق صف و بهرهوری GPU را نمایان میکنند. چون روی GPUهایی اجرا میکنید که از پیش بابتشان هزینه میدهید، هزینه همان زمان GPU است؛ و با متوقف کردن مدل بیکار، هزینه هم متوقف میشود.
آنها پلتفرمهای همهمنظورهایاند که رویشان میسازید: KaaS برای اپلیکیشنهای کانتینری و پلتفرم HPC برای محاسبهٔ دستهای مبتنی بر Slurm. LLMaaS یک محصول آماده است، نه یک پلتفرم؛ مدلهای متنباز را در یک گام پشت رابط گفتوگو و API سازگار با OpenAI سرویسدهی میکند تا هرگز خودتان پشتهٔ استنتاج را سرهم نکنید. برای استفاده از آن به هیچکدام از آن دو محصول نیاز ندارید.