Gemini 4 Argon (جمنای 4 آرگون) مدل جدید و پیشرو گوگل است که با هدف استدلال عمیق در جریانهای کاری پیچیده و طولانیمدت توسعه یافته است. این مدل پس از لغو Gemini 3.5 Pro و تمرکز گوگل روی Gemini 3.8 Flash معرفی شده است. همچنین در یک اتفاقی جالب، هوش مصنوعی بدون سانسور Qwen 3.8 توانسته لایسنس اینترنت دانلود منیجر را دور بزند.
عملکرد جمنای 4 Argon در بنچمارکها
گوگل با این مدل جدید که از الگوی نامگذاری تازهای استفاده میکند قصد دارد قابلیتهایی در سطح مدلهای پیشرفته را در زمینههایی مانند برنامهنویسی، فعالیتهای دانشمحور، دفاع سایبری و نویسندگی خلاق ارائه دهد. سقف تولید توکن در Gemini 4 Argon به 1 میلیون توکن افزایش یافته است؛ در حالی که این مقدار پیشتر 64 هزار توکن بود. این افزایش امکان پردازش کاربردهای طولانیتر و پیچیدهتر را فراهم میکند. این قابلیت در کنار پیشرفتهایی در زمینه برنامهنویسی، استدلال و قابلیتهای چندوجهی ارائه شده است.
وقتی مدل فضای کافی برای تفکر عمیق و تولید صدها هزار توکن در یک مسیر واحد داشته باشد، سطح جدیدی از عمق استدلال را برای حل یکباره مسائل دشوار فراهم میکند. در زمینه بنچمارکها، گوگل به امتیاز 77.9 درصدی Gemini 4 Argon در DeepSWE v1.1 اشاره کرده است. Claude Opus 5.5 با امتیاز 74.2 درصد در رتبه بعدی قرار دارد و GPT-6 Astra نیز امتیاز 74.1 درصد را به دست آورده است.
گوگل Gemini 4 Argon را بهگونهای آموزش داده که توانایی بسیار بالایی در دفاع سایبری داشته باشد و در مقایسه با Gemini 3.8 Flash Cyber پیشرفت قابلتوجهی ارائه دهد. این مدل برای مدافعان مورد اعتماد حوزه امنیت سایبری و تیمهای داخلی گوگل بدون محدودیتهای امنیتی سایبری در دسترس قرار میگیرد تا بتوانند از تمام قابلیتهای دفاع سایبری آن در سطح مدلهای پیشرفته استفاده کنند. در CWE-bench v1 که توانایی مدل برای برطرف کردن آسیبپذیریهای امنیتی را ارزیابی میکند، Argon با کسب امتیاز 68 درصد به صورت مشترک در جایگاه اول قرار گرفته است.

خارج از حوزه برنامهنویسی، Gemini 4 Argon در ارزیابیهای تخصصی حوزههای مختلف نیز عملکرد پیشرو دارد. از جمله این ارزیابیها میتوان به Vals Finance Agent v2 برای تحقیقات مالی چندمرحلهای و Harvey’s Legal Agent Benchmark برای تحقیقات حقوقی و نگارش متون حقوقی اشاره کرد. در AutomationBench که بنچمارک شرکت Zapier برای سنجش اجرای سرتاسری وظایف در عملکردهای اصلی کسبوکار است، Argon با امتیاز 51.3 درصد در جایگاه اول قرار گرفته است.
در LVBench که درک ویدیوهای طولانی را ارزیابی میکند، Argon با کسب امتیاز 91.7 درصد به عملکردی در سطح پیشرفته دست یافته است. Gemini 4 Argon بهزودی عرضه خواهد شد و انتشار آن ابتدا برای مشترکان Google AI Ultra و مشتریان پولی API آغاز میشود.
Argon در دوره معرفی با قیمت 2 دلار به ازای هر 1 میلیون توکن ورودی و 10 دلار به ازای هر 1 میلیون توکن خروجی عرضه خواهد شد. قیمت توکنهای ورودی ذخیرهشده نیز 95 درصد کمتر از قیمت معمول توکنهای ورودی خواهد بود. پس از پایان دوره معرفی، قیمت 4 دلار به ازای هر 1 میلیون توکن ورودی و 20 دلار به ازای هر 1 میلیون توکن خروجی اعمال خواهد شد.
این مدل تاکنون از طریق برنامه Fairwind در اختیار آزمایشکنندگان مورد اعتماد و مدافعان حوزه امنیت سایبری قرار گرفته است. گوگل پیش از عرضه گستردهتر، روی چند زمینه اصلی تمرکز دارد:
- دفاع در برابر سوءاستفاده: گوگل برای مقابله با سوءاستفادههای مرتبط با حملات سایبری یا حملات شیمیایی، زیستی، پرتوزا و هستهای (CBRN)، روشهای نظارت بر فعالسازیهای داخلی مدل برای شناسایی سوءاستفاده را بهبود داده است.
- مقابله با حملات تزریق پرامپت: گوگل میگوید Argon مقاومترین مدل این شرکت در برابر تزریق غیرمستقیم پرامپت محسوب میشود و در بنچمارک Indirect Prompt Injection (IPI) شرکت Gray Swan عملکرد پیشرو دارد.
- تقویت سیستمها: گوگل اعلام کرده است که محیطهای سندباکسشده خود را با جداسازی و ایزولهکردن آنها پیش از آغاز آموزشها یا ارزیابیهای پرخطر، تقویت میکند.
- نظارت بر ناهماهنگی: گوگل در حال استقرار سازوکارهای کاهش ناهماهنگی است که زنجیره استدلال و اقدامات Argon را زیر نظر میگیرند و در صورت نیاز اجرای آن را متوقف میکنند.
- گوگل میگوید از سیستمی مشابه برای نظارت بر فرایندهای آموزشی خود و ارسال هشدار به یک تیم اختصاصی واکنش به رخدادها استفاده کرده است. این شرکت همچنین برای جلوگیری از تاثیرگذاری یافتههای این سیستم بر آموزش مدل، اقدامات احتیاطی ویژهای در نظر گرفته تا استدلال Argon به شکلی تغییر نکند که بتواند از نظارت فرار کند.
Gemini 4 Argon در داخل گوگل نیز در حال استفاده است و جریانهای کاری مختلفی را با کمک هزاران کارمند گوگل پیش میبرد. این کارکنان از تواناییهای مدل در وظایف تخصصی برنامهنویسی، انجام تحقیقات عمیقتر و نگارش باکیفیت استفاده میکنند. گوگل امروز چند نمونه از این کاربردها را منتشر کرده است.
گروهی از ایجنتهای Argon دادههای تلهمتری مربوط به پروفایلسازی در سراسر زیرساخت گوگل را تحلیل کردند تا به صورت مستقل بهینهسازیهای حافظه را در دیتاسنترهای این شرکت شناسایی و اعمال کنند. پس از پیادهسازی این بهینهسازیها، بیش از 300 TiB (تبیبایت) حافظه آزاد شد. گوگل برآورد میکند مجموع صرفهجویی در حافظه به حدود 500 TiB تا 1 PiB برسد.
ایجنتهای Argon در حال کمک به انتقال کدبیسهای C و C++ به Rust در سراسر گوگل هستند. مقیاس این پروژهها از دهها هزار خط کد در کتابخانههای اصلی مانند re2 و libgav1 آغاز میشود و تا بیش از 800 هزار خط کد در کرنل Zircon سیستمعامل Fuchsia ادامه دارد. با توجه به اهمیت حیاتی بسیاری از این سیستمها، چنین بازنویسیهای گستردهای پیش از عرضه در محیط عملیاتی، تحت حسابرسیهای خودکار و دستی، آزمایشهای شبیهسازی و بررسیهای دقیق قرار میگیرند.
در مورد libgav1 که نرمافزار متنباز گوگل برای رمزگشایی ویدیو است، ایجنتهای Argon یک پورت Rust موجود را دریافت کردند و با اجرای دورهای متعدد آزمایش مبتنی بر پروفایل، 32 هزار خط کد SIMD را جایگزین کردند. آنها خروجی کامپایلر را بررسی کردند و کد Rust ایمنی تولید کردند تا کامپایلر بتواند عملیات برداریسازی را به صورت خودکار انجام دهد. نتیجه نهایی یک رمزگشای ویدیویی با ایمنی حافظه است که با خروجی ویدیویی کاملاً یکسان، 2.7 برابر سریعتر از نسخه Rust اجرا میشود و به عملکرد نسخه بهینهشده C++ نزدیکتر است.








دیدگاهتان را بنویسید