سالها، application delivery در سازمانها بر سه اصل ثابت بنا شده بود:
- کارایی (Performance): پاسخ سریع و بدون تأخیر
- دسترسپذیری (Availability): سرویس همیشه در دسترس باشد.
- پایداری (Reliability): رفتار سرویس قابل پیشبینی باشد.
این سه گانه که با عنوان PAR شناخته میشود، برای نسلهای مختلف معماری نرمافزار مانند کلاینت–سرور و وب و cloud مناسب بود. اما استنتاج هوش مصنوعی (AI Inference) این قواعد را تغییر داده است؛ زیرا رفتار مدلهای AI ثابت نیستند، هزینه اجرایشان پایدار نیست و خروجی قابل پیشبینی ندارند.
همچنین از آنجایی که امروزه استنتاج به بار کاری اصلی (Mainstream Workload) سازمانها تبدیل شده و طبق گزارشF5، بیش از ۸۰٪ سازمانها سرورهای استنتاج اختصاصی خود را دارند، بزرگترین ریسک زمانی رخ میدهد که بسیاری از مدیران فناوری، Inference Endpoints را «فقط یک API معمولی دیگر» میدانند. در این مقاله بررسی میکنیم چرا این فرض اشتباه است و چرا سازمانها باید نگاه خود را به AI Endpoint تغییر دهند.
سه گانه PAR؛ بنیاد سنتی تحویل برنامه (application delivery)
در سیستمهای سنتی و Deterministic، پاسخها کاملاً قابل پیشبینی هستند و نیازی به شک و تردید در مورد صحت خروجی نیست. PAR در این محیط یعنی:
- عملکرد (Performance): آیا پاسخ با سرعت کافی (مثلاً در زیر ۱۰۰ میلیثانیه) به کاربر میرسد؟
- در دسترس بودن (Availability): آیا سیستم آنلاین است و تحت فشار هم میتواند نتایج معتبر برگرداند؟
- قابلیت اطمینان (Reliability): آیا میتوان به برنامه اعتماد کرد که در طول زمان رفتار ثابتی داشته باشد؟
استنتاج هوش مصنوعی تمام این فرضیات را زیر و رو میکند. به جای اینکه خروجیها قطعی و هزینهها ثابت باشند، حجم کار استنتاج احتمالی و محاسباتی فشرده است.
کارایی (Performance)؛ از سرعت ثابت به سرعت متغیر
در سیستمهای سنتی، کارایی فقط با تأخیر (Latency) یا زمان پاسخ کوتاه سنجیده میشد و دو درخواست مشابه، تقریباً زمان پاسخ یکسانی داشتند.
اما در مدلهای هوش مصنوعی، قضیه متفاوت است. حتی دو Prompt کاملاً یکسان میتوانند به دلیل ساختار درونی مدل، زمان پاسخ متفاوتی داشته باشند.
زمان تأخیر (Latency) در مدل Inference هوش مصنوعی، بسته به اندازه مدل، پیچیدگی ورودی و استراتژیهای دستهبندی (Batching) متفاوت است. همچنین برای سازمانها، عملکرد باید فراتر از Latency متوسط تعریف شود و موارد زیر اهمیت زیادی دارند:
- توان عملیاتی (Throughput): چند درخواست را میتوانیم در یک ثانیه مدیریت کنیم؟
- نرخ تولید توکنها (Token Throughput): نرخ توکن سازی معیار مهمتری از «latency» کلاسیک است و باید بدانیم توکنها (واحدهای سازنده متن یا پاسخ) با چه سرعتی تولید میشوند؟
- واریانس: نوسانات سرعت چقدر است؟ نوسان زیاد باعث تجربه کاربری بد میشود.
به عبارت ساده دیگر میانگین سرعت مهم نیست، قابل پیشبینی بودن سرعت مهم است.
در دسترس بودن (Availability)؛ فقط بالا بودن کافی نیست
در مدل سنتی، در دسترس بودن یک وضعیت سیاه و سفید (binary) داشت و سرور بالا (Up) یا پایین (Down) بود و صحت (Correctness) این وضعیت به دلیل منطق قطعی نرم افزار تضمین شده بود. اما در مدل استنتاج AI، یک مدل میتواند آنلاین اما عملاً غیر قابل استفاده باشد، یعنی:
- سرعت پایین، کندتر از حد انتظار پاسخ دریافت شود.
- Context Saturation، xt مدل پر شده باشد و خروجی بی ربط یا غلط ممکن است conteتولید کند.
- Confidently Wrong، با اطمینان کامل، جوابی اشتباه تولید کند.
در دسترس بودن در دنیای AI فراتر از صرفاً «قابل دسترسی بودن» (Reachability) است. سیستمها باید براساس اینکه آیا پاسخ به موقع و معتبر برمیگردانند یا خیر، اندازهگیری شوند. یک پاسخ نادرست، حتی اگر سریع باشد، به معنی عدم در دسترس بودن واقعی برای کاربر است. بنابراین دسترسی پذیری امروز یعنی:
- سرویس در دسترس باشد.
- بهموقع پاسخ دهد.
- خروجی درست و معتبر باشد.
قابلیت اطمینان (Reliability)؛ از خروجی ثابت تا ثبات معنایی
در سیستمهای قدیمی اگر ورودی ثابت بود، خروجی نیز همیشه یکسان بود. اما در مدل استنتاج، تغییر پذیری (Variability) و نداشتن خروجی ثابت جزو ذات این مدلهاست. از منابع عدم قطعیت (Nondeterminism) این مدلها باید به موارد زیر اشاره کنیم:
- تولید تصادفی (Stochastic Generation): مدلها برای خلاقیت، عامدانه هر بار خروجی متفاوتی میدهند.
- بروزرسانی مدل: با هر بار بروزرسانی (Retraining)، رفتار مدل تغییر میکند.
- مدلهای صورتحساب توکن محور: پیچیدگی محاسباتی و هزینههای مصرف منابع را غیر قابل پیشبینیتر میکند.
ثبات معنایی (Semantic Consistency) دیگر با خروجی کلمهبهکلمه یکسان سنجیده نمیشود، بلکه با کیفیت خروجی سنجیده میشود.
و هدفشان این است که آیا سیستم میتواند خروجیهایی با دقت و کیفیت قابل قبول در طول زمان ارائه دهد، با وجود اینکه هر بار پاسخ متفاوتی تولید میکند؟ این امر نیازمند نظارت بر انحراف داده (Data Drift) و معیارهای کیفیت است.
پیامدهای عملیاتی و امنیتی مدلهای استنتاج هوش مصنوعی
با ورود مدل های زبانی هوش مصنوعی به جریان اصلی کسبوکارها، زیرساختهای Application Delivery دیگر نمیتوانند با الگوهای قدیمی کار کنند. Ai Inference هم پردازش سنگینتری دارند و هم رفتارشان قابل پیشبینی نیست، بنابراین سیستمها باید برای مدیریت بار، کیفیت خروجی و ریسکهای امنیتی رویکرد متفاوتی اتخاذ کنند.
براساس گزارشهای F5، امروز وضعیت امنیتی سازمانها به صورت زیر است:
- ۸۴٪ سازمانها ورودیها را برای حملههایی مثل Prompt Injection، Jailbreak یا دستکاری خروجی بررسی میکنند.
- ۵۶٪ سازمانها ورودی و خروجی مدل را از طریق گیتویها یا میانافزارها فیلتر میکنند.
- اما ۲۰٪ سازمانها هنوز اجازه میدهند ورودی خام (Raw Prompt) بدون هیچ بررسی مستقیم وارد مدل شود، بهعنوان مثال اگر یک وب اپ را بدون فایروال اجرا کنیم.
آمارهای این گزارش پیام روشنی دارد، اگر با استنتاج مثل یک API معمولی رفتار کنیم، سیستم در برابر حملهها، خروجی غلط و رفتار غیرقابل پیشبینی بیدفاع میماند. در چنین شرایطی، دسترسپذیری و پایداری سرویس از بین میرود زیرا درست بودن و سلامت معنایی خروجی نادیده گرفته میشود. در چنین شرایطی سازمانها باید اقداماتی که رد ادامه بیان میکنیم را در برنامه داشته باشند.
سازمانها باید چه اقدامی انجام دهند؟
- Load Balancing باید متناسب با الگوهای جدید اجرای مدل و نیازهای GPU باز طراحی شوند.
- Batching ترتیب پردازش درخواستها را تغییر میدهد و میتواند روی تأخیر و تجربه کاربر تأثیر بگذارد.
- کنترلهای امنیتی باید قادر به شناسایی تهدیدهای نوظهوری مثل Prompt Injection و دستکاری خروجی باشند.
- مانیتورینگ علاوه بر سلامت سرورها، باید کیفیت و اعتبار خروجی مدل را هم ارزیابی کند، چون «در دسترس بودن» بهتنهایی کافی نیست.
نتیجهگیری؛ لزوم سازگاری با عصر استنتاج
مدل استنتاج هوش مصنوعی، قوانین اساسی تحویل اپلیکیشن (application delivery) را برای همیشه تغییر داده است. سازمانی که AI Inference را «فقط یک API» میداند، ناخواسته خود را در معرض ریسکهای عملیاتی جدید، هزینههای غیر قابل کنترل و کاهش اعتماد کاربران قرار میدهد.
برای موفقیت باید سازمانها سیستمهای تحویل برنامه (از توزیع بار تا مانیتورینگ سلامت) را هوشمندتر کنند تا:
- ماهیت احتمالی (Probabilistic) خروجیها را درک کنند.
- از نیاز شدید به محاسبات فشرده (GPU/TPU) پشتیبانی کنند.
- صحت، کیفیت و بافتار (Context) مدل را در کنار دسترسی، مانیتور کنند.
- رویکرد عملکردی مبتنی بر نوسان و throughput داشته باشند.
- سیاستهای امنیتی و مسیریابی را برای استنتاج بازطراحی کنند.
تنها با باز تعریف سهگانه PAR در راستای واقعیتهای جدید AI میتوانیم زیرساختهایی را ایجاد کنیم که برای آیندهای مبتنی بر هوش مصنوعی آماده و قابل اعتماد باشند. در حقیقت تحویل اپلیکیشن در عصر AI منسوخ نشده بلکه فقط باید باز تعریف شود.
منبع مقاله : https://www.f5.com/company/blog/how-ai-inference-changes-application-delivery







