استارتاپ تازهکار Kog ۲۹ می ۲۰۲۶ با انتشار یک پیشنمایش فنی، رکوردی شگفتانگیز در سرعت استنتاج (Inference) مدلهای زبانی بزرگ ثبت کرد. این شرکت اعلام کرد که سرویس جدید آن قادر است پاسخ را با سرعت ۳,۰۰۰ توکن در ثانیه (به ازای هر کاربر) بر روی ۸ کارت گرافیک AMD MI300X و ۲,۱۰۰ توکن بر روی ۸ کارت NVIDIA H200 تولید کند. این رقم در مقایسه با سرعت معمول (۱۰۰ تا ۳۰۰ توکن) برای یک کاربر، یک جهش ۱۰ تا ۳۰ برابری محسوب میشود.
به گزارش آی سی تی نیوز، عملکرد خیرهکننده Kog تنها به لطف یک ایده ساده اما انقلابی به دست آمده است: تغییر دیدگاه به فرآیند تولید توکن (Token Generation) از یک مشکل محاسباتی (Compute-bound) به یک مشکل پخش حافظه (Memory-bandwidth-bound) . Rohan Paul، محقق مشهور هوش مصنوعی، این دستاورد را غیرقابل باور توصیف کرده و در شبکه اجتماعی X به تحلیل فنی آن پرداخته است.
مشکل همیشگی: چرا مدلهای زبانی بزرگ تا امروز کند بودند؟
در یک تراشه گرافیکی معمولی، زمانی که یک مدل زبانی بزرگ را برای یک کاربر اجرا میکنید، تراشه نمیتواند از تمام قدرت محاسباتی خام خود استفاده کند. این فرآیند شبیه تلاش برای خالی کردن یک اقیانوس با یک سطل است: شما قدرت بینهایتی برای پمپاژ آب دارید، اما پهنای باند دهانه سطل (حافظه) بسیار محدود است.
برای تولید هر توکن جدید، تراشه باید وزنهای عظیم مدل (که در حافظه پرسرعت HBM ذخیره شدهاند) را ورق بزند. به دلیل اینکه در حالت تک کاربری (Batch Size = 1)، تراشه نمیتواند محاسبات ریاضی ماتریسی عظیم و موازی انجام دهد، سرعت نهایی کاملاً به میزان پهنای باند حافظه وابسته است و این پهنای باند معمولاً عامل محدودکننده بوده است.
راهحل انقلابی Kog سه تغییر اساسی در هسته
Kog با جسارت تمام، سه لایه را که قبلاً به صورت جداگانه تنظیم میشدند، بازطراحی کرده است: معماری مدل، نرمافزار زمان اجرا (Runtime) و کد سطح پایین GPU. مهمترین نوآوری آنها مونوکرنل (Monokernel) نام دارد.
مونوکرنل (مغز متفکر واحد): به طور معمول، برای اجرای یک مدل، سیستم عامل هزاران بار برنامه کوچک روی GPU لود میکند، منتظر میماند تا پردازش تمام شود، نتایج را به CPU پس میدهد، تصمیم میگیرد توکن بعدی چیست و دوباره یک برنامه جدید لود میکند. این رفت و برگشتها ۳۵ درصد از زمان پردازش را تلف میکرد. Kog کل فرآیند تولید توکن (شامل بارگذاری وزنها، محاسبات، و حتی بخش نمونهبرداری) را در یک برنامه واحد و عظیم به نام «مونوکرنل» پیادهسازی کرده است که به صورت مداوم روی GPU resident میماند و هرگز خارج نمیشود.
هماهنگسازی مبتنی بر وابستگی: Kog با ابزار دقیق خود متوجه شد که سازوکارهای سنتی هماهنگسازی (Synchronization) حدود ۳۵ درصد از زمان تولید توکن را هدر میدهند. در روش سنتی، هزاران هسته پردازشی باید پشت یک نرده باریکه (Barrier) بایستند و منتظر بمانند تا همه به نقطه خاصی برسند. Kog به جای این روش، هر هسته را مستقل کرده و فقط زمانی صبر میکند که دادهای که به آن نیاز دارد واقعاً آماده باشد.
هماهنگسازی و ارتباطات (برای AMD MI300X): در تراشههای MI300X، Kog برای بهینهسازی مصرف انرژی، الگوی دسترسی به حافظه را متناسب با معماری چیپلت (Chiplet) نقشهبرداری کرده است، زیرا تأخیر حافظه بسته به این که کدام بخش از تراشه درخواست داده را ارسال میکند، متفاوت است.
مقایسه سرعتها و تأثیر بر بازار
برای مقایسه بهتر، باید توجه داشت که سرعت معمول استنتاج مدلهای زبانی بزرگ برای یک کاربر، حدود ۱۰۰ تا ۳۰۰ توکن در ثانیه است. سرعت ثبت شده توسط Kog روی ۸ کارت NVIDIA H200 معادل ۲,۱۰۰ توکن در ثانیه است که حدود ۱۰ تا ۲۰ برابر سریعتر از استاندارد فعلی میباشد. سرعت ثبت شده روی ۸ کارت AMD MI300X نیز معادل ۳,۰۰۰ توکن در ثانیه است که حدود ۱۰ تا ۳۰ برابر سریعتر از استاندارد فعلی است.
Kog تأکید کرده است که این تکنیکها به راحتی روی مدلهای بسیار بزرگتر و حجیمتر مانند مدلهای ترکیبی از متخصصان (Mixture of Experts) نیز مقیاسپذیر خواهد بود و در آینده کاربران شاهد سرعتهای مشابه حتی برای غولهایی مانند GPT-5 یا مدلهای نسل بعدی خواهند بود.
واکنش صنعت و چشمانداز آینده
کاهش هزینه و زمان پاسخگویی در این مقیاس، تحول عظیمی را در نحوه ساخت اپلیکیشنهای هوش مصنوعی ایجاد خواهد کرد. اپلیکیشنهایی که امروز با تأخیر ۲ تا ۳ ثانیه پاسخ میدهند (مانند جستجوی حین تایپ یا تولید محتوای لحظهای)، با این سرعت میتوانند به صورت بلادرنگ عمل ک نند. این خبر داغترین بحث روز جامعه مهندسی هوش مصنوعی است و نشان میدهد که مقیاسپذیری عمودی (افزایش سرعت یک کاربر) به جای مقیاسپذیری افقی (اضافه کردن سختافزار بیشتر) در کانون توجه قرار گرفته است.
هم اکنون پیشنمایش فنی این سرویس (Tech Preview) برای آزمایش عموم فعالان صنعت در دسترس قرار گرفته است.