به گزارش خبرگزاری آنا جمینای ۳.۸ سومین مدل از خانواده فلش است که گوگل تنها در شش هفته معرفی کرده و سه هفته پس از عرضه جمینای ۳.۷ فلش از راه میرسد. گوگل این نسل را بهترین مدل خود تا امروز در زمینه استدلال و کدنویسی میداند و میگوید هسته مشترک دو نسخه جدید با حلقههای ایجنتمحور طولانیمدت آموزش دیده تا بتواند خروجیهای خود را بارها ارزیابی و اصلاح کند. بخش مهمی از پیشرفت این هسته نیز حاصل آموزش در حوزه دشوار امنیت سایبری بوده است.
جمینای ۳.۸ فلش برای کدنویسی طولانی و ایجنتهای خودکار جمینای ۳.۸ فلش بهطور ویژه برای وظایفی طراحی شده که انجام آنها به چندین مرحله استدلال، استفاده مکرر از ابزارها و ادامه کار در بازه زمانی طولانی نیاز دارد. گوگل میگوید این مدل در بنچمارک DeepSWE v۱.۱ که روی حل مستقل مسائل پیچیده مهندسی نرمافزار تمرکز دارد، از بسیاری از مدلهای مرزی بزرگتر بهتر عمل کرده و در عین حال هزینه اجرای پایینتری دارد.
پیشرفت مدل تنها به برنامهنویسی محدود نیست و گوگل از بهبود عملکرد آن در حوزههای تخصصی مانند امور مالی، حقوق، علوم، علوم انسانی و وظایف حرفهای نیز خبر داده است. جمینای ۳.۸ فلش در آزمون HLE-Verified امتیاز ۵۴.۹ درصد کسب کرده و در ارزیابیهایی مانند Vals Finance Agent V۲ و Harvey's Legal Agent Benchmark نیز از نسل قبلی و برخی مدلهای مرزی دیگر جلو افتاده است.
مدل برای عملکرد بهتر، بیشتر فکر میکند یکی از تغییرات مهم جمینای ۳.۸ فلش به نحوه مصرف منابع مربوط میشود. گوگل میگوید این مدل در وظایف پیچیده مراحل استدلال بیشتری انجام میدهد و در صورت نیاز چند بار ابزارهای مختلف را فراخوانی میکند تا پاسخ نهایی را اصلاح کند. همین رویکرد میتواند باعث افزایش مصرف توکن شود، بهخصوص زمانی که سطح تلاش مدل روی مقادیر بالاتر تنظیم شده باشد. برای کاربردهایی که هزینه پردازش اهمیت بیشتری دارد، توسعهدهندگان میتوانند سطح تلاش مدل را کاهش دهند یا همچنان از جمینای ۳.۷ فلش استفاده کنند.
گوگل قیمت اولیه جمینای ۳.۸ فلش را مانند نسل قبلی ۰.۷۵ دلار برای هر یک میلیون توکن ورودی و ۳.۷۵ دلار برای هر یک میلیون توکن خروجی تعیین کرده است. ساخت بازی و برنامههای تعاملی با یک دستور گوگل برای نمایش قابلیتهای ایجنتمحور مدل، چند نمونه از استفاده جمینای ۳.۸ فلش در آنتیگرویتی و AI استودیو ارائه کرده است. یکی از نمونهها یک بازی سهبعدی درباره جادوگری در قلعه است که با یک دستور ساده ساخته شده و شامل معماها، روایت محیطی و بافتهایی است که با نانو بنانا تولید شدهاند.
در نمونهای دیگر، مدل یک نسخه قابل استفاده از گوگل مپس با ظاهر سیستمعامل DOS ساخته که شامل مکانها، مسیریابی و حتی نمای خیابان است. گوگل همچنین نمایشگرهای تعاملی سهبعدی برای کالبدشکافی تجهیزات سختافزاری و نقشههای علمی مبتنی بر دادههای واقعی زمینشناسی را بهعنوان نمونههایی از توان مدل برای ساخت رابطها و برنامههای پیچیده معرفی کرده است. نسخه سایبر برای کشف خودکار آسیبپذیریها جمینای ۳.۸ فلش سایبر نسخه تخصصی امنیت سایبری این خانواده است و گوگل آن را قدرتمندترین مدل امنیتی خود تا امروز معرفی کرده است.
این مدل در بنچمارک CyberGym که توانایی کشف خودکار آسیبپذیریهای نرمافزاری را میسنجد، عملکردی در سطح مدلهای مرزی داشته و از جمینای ۳.۵ فلش سایبر و چند مدل بسیار بزرگتر پیشی گرفته است. گوگل برای سنجش عملکرد در شرایط واقعیتر، یک آزمون داخلی نیز طراحی کرده که شامل یافتن انواع مختلف آسیبپذیری در کدبیسهای پیچیده و ۲۰ زبان برنامهنویسی است. جمینای ۳.۸ فلش سایبر در این ارزیابی به نرخ موفقیت بیش از ۷۰ درصد رسیده و گوگل میگوید فاصله محسوسی با مدلهای قبلی این شرکت ایجاد کرده است.
تمرکز بر اصلاح آسیبپذیری بهجای حمله گوگل تأکید دارد نسخه سایبر را از ابتدا بیشتر برای توانمندسازی مدافعان طراحی کرده و اصلاح آسیبپذیریها را بر قابلیتهای تهاجمی مانند بهرهبرداری از ضعفها مقدم دانسته است. در بنچمارک خارجی CWE-Bench، این مدل نرخ موفقیت ۴۷.۲ درصدی در اولین تلاش ثبت کرده که بسیار نزدیک به نتیجه ۴۷.۸ درصدی یکی از مدلهای مرزی پیشرو است، اما با هزینه اجرای بهمراتب پایینتر. این مدل در حال حاضر داخل خود گوگل نیز مورد استفاده قرار میگیرد.
تیم امنیت کروم اعلام کرده جمینای ۳.۸ فلش سایبر ۲.۶ برابر بیشتر از بهترین مدلهای تجاری بزرگتر، اصلاحیه درست برای آسیبپذیریهای کروم تولید کرده است. تیم پژوهش آسیبپذیری گوگل کلاود نیز با کمک همین مدل توانسته یک ضعف بنیادی و بحرانی را در کمتر از دو ساعت پیدا کند؛ فرایندی که به گفته گوگل در حالت معمول ممکن است ماهها تحقیق نیاز داشته باشد. دسترسی محدود برای مدافعان مورد اعتماد بهدلیل تواناییهای گسترده امنیتی، جمینای ۳.۸ فلش سایبر مانند نسخه عادی بهصورت عمومی عرضه نمیشود.
گوگل دسترسی به آن را از طریق برنامه جدید Fairwind در اختیار گروهی از نهادهای دولتی مورد اعتماد، اپراتورهای زیرساختهای حیاتی، نگهدارندگان نرمافزار و متخصصان امنیتی قرار میدهد تا بتوانند از قابلیتهای گستردهتر مدل برای شناسایی، تحلیل و اصلاح تهدیدها استفاده کنند. گوگل برای نسخه عمومی جمینای ۳.۸ فلش نیز محدودیتهایی در زمینه سوءاستفاده سایبری و حوزههای شیمیایی، زیستی، پرتوزا و هستهای در نظر گرفته است. نسخه سایبر سیاستهای انعطافپذیرتری برای کارهای امنیتی دارد و همین موضوع یکی از دلایل اصلی محدود بودن دسترسی به آن محسوب میشود.
مقاومت بیشتر در برابر تزریق پرامپت مدلهای جمینای ۳.۸ علاوه بر افزایش توانایی در استدلال و کدنویسی، از نظر مقابله با حملات تزریق پرامپت نیز بهبود پیدا کردهاند. این نوع حمله تلاش میکند از طریق متن یا دادههای مخرب، دستورهای اصلی مدل را دور بزند یا رفتار ایجنت هوش مصنوعی را به سمت انجام اقدام ناخواسته هدایت کند. گوگل میگوید نتایج جمینای ۳.۸ در ارزیابیهای Gray Swan جهش محسوسی را در مقاومت مقابل چنین حملاتی نشان داده است.
این ویژگی بهویژه برای مدلهایی اهمیت دارد که به ابزارهای خارجی، مرورگر، کد یا سامانههای سازمانی دسترسی دارند و ممکن است هنگام انجام وظایف چندمرحلهای با محتوای مخرب روبهرو شوند. عرضه از API تا برنامه جمینای جمینای ۳.۸ فلش اکنون از طریق Gemini API، گوگل AI استودیو، اندروید استودیو، آنتیگرویتی و ابزار Stitch در اختیار توسعهدهندگان قرار گرفته است.
مشتریان سازمانی نیز میتوانند از طریق Gemini Enterprise به آن دسترسی داشته باشند و کاربران عادی مشترک گوگل AI Pro و Ultra نیز این مدل را در برنامه جمینای، AI Mode جستوجوی گوگل و جمینای در Google Sheets دریافت میکنند. گوگل با فاصله بسیار کوتاهی میان نسلهای اخیر فلش، سرعت توسعه این خانواده را افزایش داده و جمینای ۳.۸ را همزمان در دو مسیر متفاوت پیش برده است. نسخه عمومی روی ایجنتهای خودکار، کدنویسی و استدلال پیچیده تمرکز دارد و نسخه سایبر همان هسته را برای کشف و اصلاح آسیبپذیریها تخصصیتر میکند؛
ترکیبی که نشان میدهد رقابت نسل جدید مدلها بیش از گذشته از پاسخگویی در چت به سمت انجام مستقل کارهای طولانی و تخصصی حرکت کرده است.
منبع: آنا