نسخه آنلاین در حال بارگذاری زمان... تهران: ۲۶°C
۲۸ کاربر آنلاین

PNo.30Light

نشریه تخصصی هوش مصنوعی، سیستم‌های سرور و مهندسی داده

تازه ترین‌ها
هوش مصنوعی
زمان مطالعه: ۴ دقیقه ۴۵۰ بازدید

راهنمای جامع راه‌اندازی و اجرای مدل‌های سبک هوش مصنوعی در سرورهای لینوکس

نویسنده: تحریریه فنی P30Light
راهنمای جامع راه‌اندازی و اجرای مدل‌های سبک هوش مصنوعی در سرورهای لینوکس
✦ خلاصه نکات کلیدی مقاله
  • کاهش ۶۰ درصدی مصرف حافظه رم با استفاده از فرمت فشرده‌سازی GGUF و کوانتیزاسیون ۴ بیتی.
  • راه‌اندازی سرویس Uvicorn در پس‌زمینه با مدیریت خودکار Systemd و مانیتورینگ سلامت سرویس.
  • اتصال امن Nginx به عنوان Reverse Proxy با فعال‌سازی بافر استریمینگ و هدرهای امنیتی.

این یک نمونه مقاله است که می‌توانید آن را ویرایش کرده یا به عنوان الگو برای مقالات جدید کپی نمایید. متن‌ها به صورت راست‌چین (RTL) با فونت بهینه وزیرمتن نمایش داده می‌شوند.

۱. مقدمه و نیازمندی‌های اولیه

برای شروع کار در سرورهای لینوکس (Ubuntu 24.04)، ابتدا بسته‌های پایه و محیط پایتون را به‌روزرسانی می‌کنیم:

# به‌روزرسانی مخازن لینوکس و نصب پایتون
sudo apt update && sudo apt upgrade -y
sudo apt install -y python3-pip python3-venv uvicorn nginx

نکته فنی: همیشه توصیه می‌شود کتابخانه‌های پایتون را در یک محیط مجازی (Virtualenv) مجزا نصب نمایید تا با وابستگی‌های سیستم‌عامل تداخل نداشته باشد.


۲. راه‌اندازی سرور استنتاج محلی

قطعه‌کد زیر نمونه‌ای از اجرای یک API سبک جهت دریافت درخواست‌ها و پاسخ‌دهی به کلاینت‌ها است:

import time
from fastapi import FastAPI, HTTPException
from pydantic import BaseModel

app = FastAPI(title="P30Light Edge Inference Engine")

class InferenceRequest(BaseModel):
    prompt: str
    max_tokens: int = 128

@app.post("/v1/generate")
async def generate_response(req: InferenceRequest):
    start_time = time.time()
    
    # پردازش متن توسط مدل محلی
    output_text = f"پاسخ پردازش شده به درخواست: {req.prompt}"
    duration = round(time.time() - start_time, 3)
    
    return {
        "status": "success",
        "result": output_text,
        "latency_sec": duration
    }

۳. پیکربندی وب‌سرور Nginx

برای ایجاد یک لایه معکوس امن (Reverse Proxy) و هدایت ترافیک به سمت اپلیکیشن پایتون:

server {
    listen 80;
    server_name api.p30light.ir;

    location / {
        proxy_pass http://127.0.0.1:8000;
        proxy_http_version 1.1;
        proxy_set_header Host $host;
        proxy_set_header X-Real-IP $remote_addr;
        proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for;
        proxy_read_timeout 60s;
    }
}

۴. جمع‌بندی و نتیجه‌گیری

با پیاده‌سازی این معماری، سرعت پاسخ‌دهی به کاربران به میزان قابل توجهی ارتقا یافته و هزینه‌های ابری به صفر نزدیک می‌شود.

لینک گزارش با موفقیت کپی گردید!