به گزارش آی سی تی نیوز؛ شرکتهای چینی در اقدامی همزمان، دو مدل هوش مصنوعی متنباز جدید را منتشر کردند که هر کدام در حوزه خود، مدلهای بسته غربی را به چالش میکشند. علیبابا مدل تصویرساز Qwen-Image-2.1 را با ۷ میلیارد پارامتر عرضه کرده و شیائومی مدل چندوجهی MiMo-V2.6-Pro را با یک تریلیون پارامتر کل و قیمتی بسیار پایینتر از رقبا منتشر کرده است.
Qwen-Image-2.1؛ مدل تصویرساز ۷ میلیاردی علیبابا
علیبابا در تاریخ ۲۰ سپتامبر ۲۰۲۶ (۲۹ شهریور ۱۴۰۵) مدل Qwen-Image-2.1 را با معماری ۷ میلیارد پارامتری و وزنهای متنباز منتشر کرد. این مدل از کدگذار متن Qwen3-VL 8B و VAE با ۶۴ کانال RGBA بهره میبرد و قابلیت تولید تصاویر با لایههای شفاف را بهصورت بومی دارد؛ به این معنا که کاربران بدون نیاز به حذف پسزمینه، میتوانند تصاویری با پسزمینه شفاف تولید کنند.
Qwen-Image-2.1 میتواند حداکثر ۱۰ تصویر مرجع دریافت کند و قابلیتهایی مانند ویرایش متن درون تصویر، ترکیب تصاویر، استخراج سوژه از عکس واقعی و تولید پانوراما و اینفوگرافیک را ارائه میدهد. در بنچمارک Qwen-Image-Bench، این مدل امتیاز ۶۰.۲۸ را کسب کرده که بالاتر از Nano Banana 2.0 با ۵۹.۸۲ و GPT Image 1.5 با ۵۹.۶۵ قرار میگیرد.
نکته مهم درباره Qwen-Image-2.1 این است که برخلاف نسخههای قبلی که با مجوز Apache 2.0 منتشر میشدند، این مدل تحت مجوز Qwen Research License و صرفاً برای مصارف غیرتجاری و پژوهشی عرضه شده است. استفاده تجاری از آن نیازمند مجوز جداگانه از علیبابا است. با این حال، در روز انتشار، از سوی ComfyUI، Diffusers، vLLM-Omni و SGLang پشتیبانی شد.
MiMo-V2.6-Pro؛ مدل یک تریلیون پارامتری شیائومی با قیمت ۲۰ برابر کمتر
شیائومی نیز در تاریخ ۲۱ سپتامبر ۲۰۲۶ (۳۰ شهریور ۱۴۰۵) مدل متنباز MiMo-V2.6-Pro را منتشر کرد. این مدل یک MoE با ۱.۰۲ تریلیون پارامتر کل و ۴۲ میلیارد پارامتر فعال در هر توکن است که از ورودی متن، تصویر، صدا و ویدیو پشتیبانی میکند و پنجره کانتکست آن به ۱ میلیون توکن میرسد.
بر اساس دادههای منتشرشده، امتیاز MiMo-V2.6-Pro در شاخص هوش Artificial Analysis حدود ۴۶ است که بالاترین امتیاز در میان مدلهای متنباز محسوب میشود و از Kimi K3 و Qwen3.8 Max نیز پیشی گرفته است. این مدل در بنچمارک Terminal Bench 2.1 امتیاز ۸۹.۹ کسب کرده که بالاتر از Claude Opus 5 قرار میگیرد.
مهمترین مزیت MiMo-V2.6-Pro، قیمت بسیار پایین آن است. هزینه هر میلیون توکن ورودی این مدل ۰.۴۳۵ دلار و خروجی ۰.۸۷ دلار اعلام شده که در مقایسه با رقبای مطرح، حدود ۹ برابر ارزانتر در ورودی و ۲۳ برابر ارزانتر در خروجی است. در مقایسه با Claude Opus 5، این قیمت نزدیک به ۲۰ برابر کمتر برآورد میشود. نسخه ارزانتر این مدل با نام Flash نیز با قیمت ۰.۱۴ دلار ورودی و ۰.۲۸ دلار خروجی در دسترس است.
شیائومی هزینه آموزش این مدل را حدود ۲.۶۲ میلیون دلار در کمتر از ۶ روز اعلام کرده و کد آموزش RL و حدود ۷,۰۰۰ محیط وظیفه را نیز متنباز کرده است. وزنهای این مدل با مجوز MIT و اجازه استفاده تجاری روی Hugging Face در دسترس قرار دارد.
تفاوت رویکرد دو شرکت
نکته قابل توجه در این دو انتشار، تفاوت رویکرد علیبابا و شیائومی در مجوزدهی است. علیبابا Qwen-Image-2.1 را با مجوز پژوهشمحور منتشر کرده و استفاده تجاری از آن را محدود کرده است، در حالی که شیائومی MiMo-V2.6-Pro را با مجوز MIT و اجازه استفاده تجاری آزاد عرضه کرده است.
همچنین این دو مدل در حوزههای متفاوتی فعالیت میکنند. Qwen-Image-2.1 یک مدل تصویرساز است، در حالی که MiMo-V2.6-Pro یک مدل زبانی چندوجهی محسوب میشود.
تحلیل ICTNews
انتشار همزمان این دو مدل متنباز از سوی علیبابا و شیائومی، نشاندهنده یک تغییر استراتژیک در صنعت هوش مصنوعی چین است. شرکتهای چینی بهجای رقابت صرف بر سر قدرت مدلها، اکنون بر باز بودن، کارایی هزینه و دسترسیپذیری تمرکز کردهاند.
MiMo-V2.6-Pro با قیمت ۲۰ برابر کمتر از Claude Opus 5 و عملکردی همسطح GPT-5.6-Sol، میتواند معادلات بازار API را بهطور جدی تغییر دهد. اگر این مدل بتواند وعدههای عملکردی خود را در عمل نیز محقق کند، بسیاری از استارتاپها و توسعهدهندگان ممکن است به سمت آن جذب شوند.
در سمت تصویر، Qwen-Image-2.1 با قابلیت خروجی RGBA و پشتی بانی از ۱۰ تصویر مرجع، ابزاری قدرتمند برای طراحان و تولیدکنندگان محتوا محسوب میشود. محدودیت مجوز پژوهشمحور، هرچند استفاده تجاری را محدود میکند، اما نشان میدهد علیبابا هنوز در حال ارزیابی پتانسیل تجاری این مدل است.
در مجموع، به نظر میرسد چین با استراتژی «متنباز و ارزان»، در حال ایجاد یک جبهه جدید در رقابت جهانی هوش مصنوعی است؛ جبههای که در آن، قیمت و دسترسیپذیری بهاندازه قدرت خام مدلها اهمیت دارد.