لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

متن تیتر خود را وارد کنید

پایگاه خبری CIT رسانه‌ای تخصصی در حوزه فناوری اطلاعات و ارتباطات ایران است که اخبار و تحولات اکوسیستم ICT را پوشش می‌دهد. تمرکز آن بر اطلاع‌رسانی تحلیلی درباره فناوری، اقتصاد دیجیتال، استارتاپ‌ها و امنیت سایبری است.این رسانه با پوشش فعالیت فعالان صنعت ICT، نقش پل ارتباطی میان صنعت، سیاست‌گذاران و مخاطبان را ایفا می‌کند.

پست های مرتبط

استارتاپ تازه‌کار Kog ۲۹ می ۲۰۲۶ با انتشار یک پیش‌نمایش فنی، رکوردی شگفت‌انگیز در سرعت استنتاج (Inference) مدل‌های زبانی بزرگ ثبت کرد. این شرکت اعلام کرد که سرویس جدید آن قادر است پاسخ را با سرعت ۳,۰۰۰ توکن در ثانیه (به ازای هر کاربر) بر روی ۸ کارت گرافیک AMD MI300X و ۲,۱۰۰ توکن بر روی ۸ کارت NVIDIA H200 تولید کند. این رقم در مقایسه با سرعت معمول (۱۰۰ تا ۳۰۰ توکن) برای یک کاربر، یک جهش ۱۰ تا ۳۰ برابری محسوب می‌شود.

به گزارش  آی سی تی نیوز، عملکرد خیره‌کننده Kog تنها به لطف یک ایده ساده اما انقلابی به دست آمده است: تغییر دیدگاه به فرآیند تولید توکن (Token Generation) از یک مشکل محاسباتی (Compute-bound) به یک مشکل پخش حافظه (Memory-bandwidth-bound) . Rohan Paul، محقق مشهور هوش مصنوعی، این دستاورد را غیرقابل باور توصیف کرده و در شبکه اجتماعی X به تحلیل فنی آن پرداخته است.

 

مشکل همیشگی: چرا مدل‌های زبانی بزرگ تا امروز کند بودند؟

در یک تراشه گرافیکی معمولی، زمانی که یک مدل زبانی بزرگ را برای یک کاربر اجرا می‌کنید، تراشه نمی‌تواند از تمام قدرت محاسباتی خام خود استفاده کند. این فرآیند شبیه تلاش برای خالی کردن یک اقیانوس با یک سطل است: شما قدرت بی‌نهایتی برای پمپاژ آب دارید، اما پهنای باند دهانه سطل (حافظه) بسیار محدود است.

برای تولید هر توکن جدید، تراشه باید وزن‌های عظیم مدل (که در حافظه پرسرعت HBM ذخیره شده‌اند) را ورق بزند. به دلیل اینکه در حالت تک کاربری (Batch Size = 1)، تراشه نمی‌تواند محاسبات ریاضی ماتریسی عظیم و موازی انجام دهد، سرعت نهایی کاملاً به میزان پهنای باند حافظه وابسته است و این پهنای باند معمولاً عامل محدودکننده بوده است.

 

راه‌حل انقلابی Kog سه تغییر اساسی در هسته

Kog  با جسارت تمام، سه لایه را که قبلاً به صورت جداگانه تنظیم می‌شدند، بازطراحی کرده است: معماری مدل، نرم‌افزار زمان اجرا (Runtime) و کد سطح پایین GPU. مهم‌ترین نوآوری آنها مونوکرنل (Monokernel) نام دارد.

مونوکرنل (مغز متفکر واحد): به طور معمول، برای اجرای یک مدل، سیستم عامل هزاران بار برنامه کوچک روی GPU لود می‌کند، منتظر می‌ماند تا پردازش تمام شود، نتایج را به CPU پس می‌دهد، تصمیم می‌گیرد توکن بعدی چیست و دوباره یک برنامه جدید لود می‌کند. این رفت و برگشت‌ها ۳۵ درصد از زمان پردازش را تلف می‌کرد. Kog کل فرآیند تولید توکن (شامل بارگذاری وزن‌ها، محاسبات، و حتی بخش نمونه‌برداری) را در یک برنامه واحد و عظیم به نام «مونوکرنل» پیاده‌سازی کرده است که به صورت مداوم روی GPU resident می‌ماند و هرگز خارج نمی‌شود.

هماهنگ‌سازی مبتنی بر وابستگی: Kog با ابزار دقیق خود متوجه شد که سازوکارهای سنتی هماهنگ‌سازی (Synchronization) حدود ۳۵ درصد از زمان تولید توکن را هدر می‌دهند. در روش سنتی، هزاران هسته پردازشی باید پشت یک نرده باریکه (Barrier) بایستند و منتظر بمانند تا همه به نقطه خاصی برسند. Kog به جای این روش، هر هسته را مستقل کرده و فقط زمانی صبر می‌کند که داده‌ای که به آن نیاز دارد واقعاً آماده باشد.

هماهنگ‌سازی و ارتباطات (برای AMD MI300X): در تراشه‌های MI300X، Kog برای بهینه‌سازی مصرف انرژی، الگوی دسترسی به حافظه را متناسب با معماری چیپلت (Chiplet) نقشه‌برداری کرده است، زیرا تأخیر حافظه بسته به این که کدام بخش از تراشه درخواست داده را ارسال می‌کند، متفاوت است.

 

مقایسه سرعت‌ها و تأثیر بر بازار

برای مقایسه بهتر، باید توجه داشت که سرعت معمول استنتاج مدل‌های زبانی بزرگ برای یک کاربر، حدود ۱۰۰ تا ۳۰۰ توکن در ثانیه است. سرعت ثبت شده توسط Kog روی ۸ کارت NVIDIA H200 معادل ۲,۱۰۰ توکن در ثانیه است که حدود ۱۰ تا ۲۰ برابر سریع‌تر از استاندارد فعلی می‌باشد. سرعت ثبت شده روی ۸ کارت AMD MI300X نیز معادل ۳,۰۰۰ توکن در ثانیه است که حدود ۱۰ تا ۳۰ برابر سریع‌تر از استاندارد فعلی است.

Kog تأکید کرده است که این تکنیک‌ها به راحتی روی مدل‌های بسیار بزرگتر و حجیم‌تر مانند مدل‌های ترکیبی از متخصصان (Mixture of Experts) نیز مقیاس‌پذیر خواهد بود و در آینده کاربران شاهد سرعت‌های مشابه حتی برای غول‌هایی مانند GPT-5 یا مدل‌های نسل بعدی خواهند بود.

 

واکنش صنعت و چشم‌انداز آینده

کاهش هزینه و زمان پاسخگویی در این مقیاس، تحول عظیمی را در نحوه ساخت اپلیکیشن‌های هوش مصنوعی ایجاد خواهد کرد. اپلیکیشن‌هایی که امروز با تأخیر ۲ تا ۳ ثانیه پاسخ می‌دهند (مانند جستجوی حین تایپ یا تولید محتوای لحظه‌ای)، با این سرعت می‌توانند به صورت بلادرنگ عمل ک نند. این خبر داغ‌ترین بحث روز جامعه مهندسی هوش مصنوعی است و نشان می‌دهد که مقیاس‌پذیری عمودی (افزایش سرعت یک کاربر) به جای مقیاس‌پذیری افقی (اضافه کردن سخت‌افزار بیشتر) در کانون توجه قرار گرفته است.

هم اکنون پیش‌نمایش فنی این سرویس (Tech Preview) برای آزمایش عموم فعالان صنعت در دسترس قرار گرفته است.

آخرین اخبار کسب و کار

برچسب ها