انقلاب هوش چندوجهی: ۹ دمو از Gemini Omni و Gemini 3.5 در عمل

گوگل در جریان رویداد سالانه خود از جدیدترین نسل مدل‌های هوش مصنوعی بومی و عامل‌گرا (Agentic AI) رونمایی کرد که توانایی پردازش بی‌وقفه ویدیو، صدا و متن را به صورت همزمان دارند.

معرفی Gemini Omni و Gemini 3.5
شنیدن نسخه صوتی مقاله تولید شده توسط تیم بلاگ
0:00

گوگل با معرفی جدیدترین دستاوردهای خود، یعنی مدل Gemini Omni و خانواده Gemini 3.5، مرزهای جدیدی در هوش مصنوعی تعریف کرده است. این فناوری‌ها فراتر از چت‌بات‌های متنی رایج، ابزارهایی چندوجهی و بومی (Native Multimodal) هستند که بدون تبدیل لایه‌های ورودی به متن واسط، می‌توانند ویدیو، صدا و فایل‌های مختلف را همزمان پردازش و پاسخ‌هایی فوق‌العاده زنده تولید کنند.

در این مقاله نگاهی اختصاصی به ۹ نمایش و دموی عملی می‌اندازیم که قدرت چشمگیر این دو مدل بزرگ را در ویرایش ویدیو، خلق موسیقی و انجام وظایف چندمرحله‌ای (Agentic Tasks) به تصویر می‌کشند.

بخش اول: خلاقیت بومی چندوجهی با Gemini Omni

مدل Omni از همان ابتدا طوری طراحی شده است که می‌تواند ویدیو را به عنوان ورودی زنده دریافت کرده، آن را تحلیل کند و مستقیماً تغییرات ویدیویی باکیفیت بر اساس قوانین فیزیکی دنیای واقعی تحویل دهد. دموی‌های اول تا ششم این قابلیت‌ها را در عمل نشان می‌دهند:

۱. ویرایش مستقیم ویدیو از طریق مکالمه

تصور کنید در حال مکالمه صوتی با هوش مصنوعی هستید و از او می‌خواهید یک ویدیو را ویرایش کند. مدل Omni به دلیل درک پیوسته فیزیک و صحنه‌ها، می‌تواند دستورات شما را گام‌به‌گام پیاده‌سازی کند؛ بدون اینکه انسجام شخصیت‌ها یا اجزای ویدیو از بین برود.

مثال پرومپت عملی: «مجسمه درون ویدیو را به طور کامل از حباب بساز.»
تغییر ساختار فیزیکی اشیاء در ویدیو با درک دقیق عمق و انعکاس نور

۲. بازآفرینی خلاقانه اکشن‌ها

در این دمو، شما می‌توانید رفتار یا اکشن خاصی را درون یک ویدیو تغییر دهید. برای مثال، دویدن یک کاراکتر را به پریدن تبدیل کنید یا یک اکشن کاملاً فانتزی و غیرمنتظره به صحنه واقعی اضافه کنید تا سناریویی خلاقانه و کاملاً طبیعی تولید شود.

تغییر رفتار و خلق حرکات هماهنگ و خلاقانه روی کاراکتر ویدیو

۳. ویرایش گام‌به‌گام صحنه‌ها

یکی از بزرگ‌ترین چالش‌های هوش مصنوعی تولید ویدیو، حفظ پیوستگی فریم‌ها در طول زمان است. Gemini Omni به شما اجازه می‌دهد ویدیو را در چند مرحله متوالی تغییر دهید؛ بدون اینکه عناصر پس‌زمینه و زاویه دوربین به هم بریزند.

۴. نگاشت پس‌زمینه بر اساس تصاویر دلخواه

شما می‌توانید یک تصویر دوبعدی را به عنوان منبع پس‌زمینه به Omni بدهید و از او بخواهید پس‌زمینه ویدیوی شما را با آن جایگزین کند. مدل به قدری هوشمند است که نورپردازی کاراکترهای جلوی تصویر را متناسب با رنگ و نور پس‌زمینه جدید اصلاح می‌کند.

مثال پرومپت عملی: «نور اتاق را کم کن و تصویر یک کره شیشه‌ای شطرنجی معلق را به پس‌زمینه اضافه کن.»
نگاشت شبیه‌سازی شده پس‌زمینه و ایجاد انعکاس نور واقعی روی کاراکترها

۵. تولید و تراز هوشمند صدا با حرکت ویدیو

این مدل می‌تواند ویدیوی بدون صدا را تماشا کرده و بر اساس حرکات فیزیکی داخل آن، موسیقی متن و جلوه‌های صوتی دقیق و همگام تولید کند. برای نمونه، صدای آرشه کشیدن روی ویولن دقیقاً با سرعت و حرکت دست نوازنده هماهنگ می‌شود.

تولید و تراز دقیق موسیقی و صدا با حرکات آرشه ویولن

۶. هدایت و شبیه‌سازی حرکات دوربین

با پرومپت متنی می‌توانید نحوه حرکت دوربین را در ویدیو مشخص کنید. برای مثال، زاویه فیلم‌برداری را از روی شانه کاراکتر به زاویه روبه‌رو تغییر دهید یا افکت‌های زوم و چرخش حرفه‌ای روی صحنه اعمال کنید.

بخش دوم: عامل‌های هوشمند با Gemini 3.5 Flash

مدل ۳.۵ Flash تمرکز ویژه‌ای روی سرعت، کارایی بالا و ظرفیت بالای پنجره متنی دارد که آن را به بهترین گزینه برای توسعه عامل‌های هوشمند (AI Agents) تبدیل می‌کند:

۷. اجرای وظایف عاملانه در مقیاس بزرگ

Gemini 3.5 Flash به دلیل سرعت بالا می‌تواند صدها تسک فرعی را به طور موازی اجرا کند. این مدل برای خودکارسازی فرآیندهای طولانی‌مدت مانند تحقیق در کدهای منبع بزرگ یا تحلیل فایل‌های مالی سنگین کاربرد دارد.

۸. هماهنگی و همکاري عوامل هوشمند

وقتی ۳.۵ Flash با ابزارها و چارچوب‌های هوشمند (مانند Antigravity) ترکیب می‌شود، می‌تواند چندین عامل فرعی را مدیریت کند تا به صورت تیمی روی مسائل مهندسی نرم‌افزار و مدیریت سیستم همکاری کنند.

۹. نسل جدید دستیارهای شخصی در زندگی روزمره

این دمو نشان می‌دهد که چطور مدل در ابزارهایی نظیر جستجوی گوگل، Gmail و تقویم ادغام شده است تا کارهای پیچیده‌ای چون برنامه‌ریزی سفر، خرید آنلاین و خلاصه کردن ایمیل‌های کاری را به صورت خودکار برای کاربر نهایی انجام دهد.

«مدل‌های Gemini Omni و Gemini 3.5 نشان‌دهنده گذار تاریخی از هوش مصنوعی پاسخ‌دهنده به سیستم‌های عامل‌گرا (Agentic AI) هستند که می‌توانند کارهای واقعی را در دنیای دیجیتال به ثمر برسانند.» — گزارش رسمی رویداد سالانه گوگل

برای آشنایی با خدمات ما جهت دسترسی بدون محدودیت به این مدل‌های پیشرفته و اکانت‌های پریمیوم، می‌توانید به بخش اشتراک‌ها در صفحه اصلی مراجعه کنید.

اشتراک‌گذاری مقاله: ارسال به تلگرام اشتراک در X

تمامی حقوق برای خدای هوش مصنوعی محفوظ است © ۱۴۰۵