گوگل جمینای ۳.۸ فلش و نسخه امنیتی آن را برای ایجنت‌های هوش مصنوعی معرفی کرد

گوگل جمینای ۳.۸ فلش و نسخه امنیتی آن را برای ایجنت‌های هوش مصنوعی معرفی کرد

به گزارش خبرگزاری آنا جمینای ۳.۸ سومین مدل از خانواده فلش است که گوگل تنها در شش هفته معرفی کرده و سه هفته پس از عرضه جمینای ۳.۷ فلش از راه می‌رسد. گوگل این نسل را بهترین مدل خود تا امروز در زمینه استدلال و کدنویسی می‌داند و می‌گوید هسته مشترک دو نسخه جدید با حلقه‌های ایجنت‌محور طولانی‌مدت آموزش دیده تا بتواند خروجی‌های خود را بار‌ها ارزیابی و اصلاح کند. بخش مهمی از پیشرفت این هسته نیز حاصل آموزش در حوزه دشوار امنیت سایبری بوده است.

جمینای ۳.۸ فلش برای کدنویسی طولانی و ایجنت‌های خودکار جمینای ۳.۸ فلش به‌طور ویژه برای وظایفی طراحی شده که انجام آن‌ها به چندین مرحله استدلال، استفاده مکرر از ابزار‌ها و ادامه کار در بازه زمانی طولانی نیاز دارد. گوگل می‌گوید این مدل در بنچمارک DeepSWE v۱.۱ که روی حل مستقل مسائل پیچیده مهندسی نرم‌افزار تمرکز دارد، از بسیاری از مدل‌های مرزی بزرگ‌تر بهتر عمل کرده و در عین حال هزینه اجرای پایین‌تری دارد.

پیشرفت مدل تنها به برنامه‌نویسی محدود نیست و گوگل از بهبود عملکرد آن در حوزه‌های تخصصی مانند امور مالی، حقوق، علوم، علوم انسانی و وظایف حرفه‌ای نیز خبر داده است. جمینای ۳.۸ فلش در آزمون HLE-Verified امتیاز ۵۴.۹ درصد کسب کرده و در ارزیابی‌هایی مانند Vals Finance Agent V۲ و Harvey's Legal Agent Benchmark نیز از نسل قبلی و برخی مدل‌های مرزی دیگر جلو افتاده است.

مدل برای عملکرد بهتر، بیشتر فکر می‌کند یکی از تغییرات مهم جمینای ۳.۸ فلش به نحوه مصرف منابع مربوط می‌شود. گوگل می‌گوید این مدل در وظایف پیچیده مراحل استدلال بیشتری انجام می‌دهد و در صورت نیاز چند بار ابزار‌های مختلف را فراخوانی می‌کند تا پاسخ نهایی را اصلاح کند. همین رویکرد می‌تواند باعث افزایش مصرف توکن شود، به‌خصوص زمانی که سطح تلاش مدل روی مقادیر بالاتر تنظیم شده باشد. برای کاربرد‌هایی که هزینه پردازش اهمیت بیشتری دارد، توسعه‌دهندگان می‌توانند سطح تلاش مدل را کاهش دهند یا همچنان از جمینای ۳.۷ فلش استفاده کنند.

گوگل قیمت اولیه جمینای ۳.۸ فلش را مانند نسل قبلی ۰.۷۵ دلار برای هر یک میلیون توکن ورودی و ۳.۷۵ دلار برای هر یک میلیون توکن خروجی تعیین کرده است. ساخت بازی و برنامه‌های تعاملی با یک دستور گوگل برای نمایش قابلیت‌های ایجنت‌محور مدل، چند نمونه از استفاده جمینای ۳.۸ فلش در آنتی‌گرویتی و AI استودیو ارائه کرده است. یکی از نمونه‌ها یک بازی سه‌بعدی درباره جادوگری در قلعه است که با یک دستور ساده ساخته شده و شامل معماها، روایت محیطی و بافت‌هایی است که با نانو بنانا تولید شده‌اند.

در نمونه‌ای دیگر، مدل یک نسخه قابل استفاده از گوگل مپس با ظاهر سیستم‌عامل DOS ساخته که شامل مکان‌ها، مسیریابی و حتی نمای خیابان است. گوگل همچنین نمایشگر‌های تعاملی سه‌بعدی برای کالبدشکافی تجهیزات سخت‌افزاری و نقشه‌های علمی مبتنی بر داده‌های واقعی زمین‌شناسی را به‌عنوان نمونه‌هایی از توان مدل برای ساخت رابط‌ها و برنامه‌های پیچیده معرفی کرده است. نسخه سایبر برای کشف خودکار آسیب‌پذیری‌ها جمینای ۳.۸ فلش سایبر نسخه تخصصی امنیت سایبری این خانواده است و گوگل آن را قدرتمندترین مدل امنیتی خود تا امروز معرفی کرده است.

این مدل در بنچمارک CyberGym که توانایی کشف خودکار آسیب‌پذیری‌های نرم‌افزاری را می‌سنجد، عملکردی در سطح مدل‌های مرزی داشته و از جمینای ۳.۵ فلش سایبر و چند مدل بسیار بزرگ‌تر پیشی گرفته است. گوگل برای سنجش عملکرد در شرایط واقعی‌تر، یک آزمون داخلی نیز طراحی کرده که شامل یافتن انواع مختلف آسیب‌پذیری در کدبیس‌های پیچیده و ۲۰ زبان برنامه‌نویسی است. جمینای ۳.۸ فلش سایبر در این ارزیابی به نرخ موفقیت بیش از ۷۰ درصد رسیده و گوگل می‌گوید فاصله محسوسی با مدل‌های قبلی این شرکت ایجاد کرده است.

تمرکز بر اصلاح آسیب‌پذیری به‌جای حمله گوگل تأکید دارد نسخه سایبر را از ابتدا بیشتر برای توانمندسازی مدافعان طراحی کرده و اصلاح آسیب‌پذیری‌ها را بر قابلیت‌های تهاجمی مانند بهره‌برداری از ضعف‌ها مقدم دانسته است. در بنچمارک خارجی CWE-Bench، این مدل نرخ موفقیت ۴۷.۲ درصدی در اولین تلاش ثبت کرده که بسیار نزدیک به نتیجه ۴۷.۸ درصدی یکی از مدل‌های مرزی پیشرو است، اما با هزینه اجرای به‌مراتب پایین‌تر. این مدل در حال حاضر داخل خود گوگل نیز مورد استفاده قرار می‌گیرد.

تیم امنیت کروم اعلام کرده جمینای ۳.۸ فلش سایبر ۲.۶ برابر بیشتر از بهترین مدل‌های تجاری بزرگ‌تر، اصلاحیه درست برای آسیب‌پذیری‌های کروم تولید کرده است. تیم پژوهش آسیب‌پذیری گوگل کلاود نیز با کمک همین مدل توانسته یک ضعف بنیادی و بحرانی را در کمتر از دو ساعت پیدا کند؛ فرایندی که به گفته گوگل در حالت معمول ممکن است ماه‌ها تحقیق نیاز داشته باشد. دسترسی محدود برای مدافعان مورد اعتماد به‌دلیل توانایی‌های گسترده امنیتی، جمینای ۳.۸ فلش سایبر مانند نسخه عادی به‌صورت عمومی عرضه نمی‌شود.

گوگل دسترسی به آن را از طریق برنامه جدید Fairwind در اختیار گروهی از نهاد‌های دولتی مورد اعتماد، اپراتور‌های زیرساخت‌های حیاتی، نگه‌دارندگان نرم‌افزار و متخصصان امنیتی قرار می‌دهد تا بتوانند از قابلیت‌های گسترده‌تر مدل برای شناسایی، تحلیل و اصلاح تهدید‌ها استفاده کنند. گوگل برای نسخه عمومی جمینای ۳.۸ فلش نیز محدودیت‌هایی در زمینه سوءاستفاده سایبری و حوزه‌های شیمیایی، زیستی، پرتوزا و هسته‌ای در نظر گرفته است. نسخه سایبر سیاست‌های انعطاف‌پذیرتری برای کار‌های امنیتی دارد و همین موضوع یکی از دلایل اصلی محدود بودن دسترسی به آن محسوب می‌شود.

مقاومت بیشتر در برابر تزریق پرامپت مدل‌های جمینای ۳.۸ علاوه بر افزایش توانایی در استدلال و کدنویسی، از نظر مقابله با حملات تزریق پرامپت نیز بهبود پیدا کرده‌اند. این نوع حمله تلاش می‌کند از طریق متن یا داده‌های مخرب، دستور‌های اصلی مدل را دور بزند یا رفتار ایجنت هوش مصنوعی را به سمت انجام اقدام ناخواسته هدایت کند. گوگل می‌گوید نتایج جمینای ۳.۸ در ارزیابی‌های Gray Swan جهش محسوسی را در مقاومت مقابل چنین حملاتی نشان داده است.

این ویژگی به‌ویژه برای مدل‌هایی اهمیت دارد که به ابزار‌های خارجی، مرورگر، کد یا سامانه‌های سازمانی دسترسی دارند و ممکن است هنگام انجام وظایف چندمرحله‌ای با محتوای مخرب روبه‌رو شوند. عرضه از API تا برنامه جمینای جمینای ۳.۸ فلش اکنون از طریق Gemini API، گوگل AI استودیو، اندروید استودیو، آنتی‌گرویتی و ابزار Stitch در اختیار توسعه‌دهندگان قرار گرفته است.

مشتریان سازمانی نیز می‌توانند از طریق Gemini Enterprise به آن دسترسی داشته باشند و کاربران عادی مشترک گوگل AI Pro و Ultra نیز این مدل را در برنامه جمینای، AI Mode جست‌وجوی گوگل و جمینای در Google Sheets دریافت می‌کنند. گوگل با فاصله بسیار کوتاهی میان نسل‌های اخیر فلش، سرعت توسعه این خانواده را افزایش داده و جمینای ۳.۸ را هم‌زمان در دو مسیر متفاوت پیش برده است. نسخه عمومی روی ایجنت‌های خودکار، کدنویسی و استدلال پیچیده تمرکز دارد و نسخه سایبر همان هسته را برای کشف و اصلاح آسیب‌پذیری‌ها تخصصی‌تر می‌کند؛

ترکیبی که نشان می‌دهد رقابت نسل جدید مدل‌ها بیش از گذشته از پاسخ‌گویی در چت به سمت انجام مستقل کار‌های طولانی و تخصصی حرکت کرده است.

منبع: آنا