انقلاب هوش چندوجهی: ۹ دمو از Gemini Omni و Gemini 3.5 در عمل
گوگل در جریان رویداد سالانه خود از جدیدترین نسل مدلهای هوش مصنوعی بومی و عاملگرا (Agentic AI) رونمایی کرد که توانایی پردازش بیوقفه ویدیو، صدا و متن را به صورت همزمان دارند.
گوگل با معرفی جدیدترین دستاوردهای خود، یعنی مدل Gemini Omni و خانواده Gemini 3.5، مرزهای جدیدی در هوش مصنوعی تعریف کرده است. این فناوریها فراتر از چتباتهای متنی رایج، ابزارهایی چندوجهی و بومی (Native Multimodal) هستند که بدون تبدیل لایههای ورودی به متن واسط، میتوانند ویدیو، صدا و فایلهای مختلف را همزمان پردازش و پاسخهایی فوقالعاده زنده تولید کنند.
در این مقاله نگاهی اختصاصی به ۹ نمایش و دموی عملی میاندازیم که قدرت چشمگیر این دو مدل بزرگ را در ویرایش ویدیو، خلق موسیقی و انجام وظایف چندمرحلهای (Agentic Tasks) به تصویر میکشند.
بخش اول: خلاقیت بومی چندوجهی با Gemini Omni
مدل Omni از همان ابتدا طوری طراحی شده است که میتواند ویدیو را به عنوان ورودی زنده دریافت کرده، آن را تحلیل کند و مستقیماً تغییرات ویدیویی باکیفیت بر اساس قوانین فیزیکی دنیای واقعی تحویل دهد. دمویهای اول تا ششم این قابلیتها را در عمل نشان میدهند:
۱. ویرایش مستقیم ویدیو از طریق مکالمه
تصور کنید در حال مکالمه صوتی با هوش مصنوعی هستید و از او میخواهید یک ویدیو را ویرایش کند. مدل Omni به دلیل درک پیوسته فیزیک و صحنهها، میتواند دستورات شما را گامبهگام پیادهسازی کند؛ بدون اینکه انسجام شخصیتها یا اجزای ویدیو از بین برود.
مثال پرومپت عملی: «مجسمه درون ویدیو را به طور کامل از حباب بساز.»۲. بازآفرینی خلاقانه اکشنها
در این دمو، شما میتوانید رفتار یا اکشن خاصی را درون یک ویدیو تغییر دهید. برای مثال، دویدن یک کاراکتر را به پریدن تبدیل کنید یا یک اکشن کاملاً فانتزی و غیرمنتظره به صحنه واقعی اضافه کنید تا سناریویی خلاقانه و کاملاً طبیعی تولید شود.
۳. ویرایش گامبهگام صحنهها
یکی از بزرگترین چالشهای هوش مصنوعی تولید ویدیو، حفظ پیوستگی فریمها در طول زمان است. Gemini Omni به شما اجازه میدهد ویدیو را در چند مرحله متوالی تغییر دهید؛ بدون اینکه عناصر پسزمینه و زاویه دوربین به هم بریزند.
۴. نگاشت پسزمینه بر اساس تصاویر دلخواه
شما میتوانید یک تصویر دوبعدی را به عنوان منبع پسزمینه به Omni بدهید و از او بخواهید پسزمینه ویدیوی شما را با آن جایگزین کند. مدل به قدری هوشمند است که نورپردازی کاراکترهای جلوی تصویر را متناسب با رنگ و نور پسزمینه جدید اصلاح میکند.
مثال پرومپت عملی: «نور اتاق را کم کن و تصویر یک کره شیشهای شطرنجی معلق را به پسزمینه اضافه کن.»۵. تولید و تراز هوشمند صدا با حرکت ویدیو
این مدل میتواند ویدیوی بدون صدا را تماشا کرده و بر اساس حرکات فیزیکی داخل آن، موسیقی متن و جلوههای صوتی دقیق و همگام تولید کند. برای نمونه، صدای آرشه کشیدن روی ویولن دقیقاً با سرعت و حرکت دست نوازنده هماهنگ میشود.
۶. هدایت و شبیهسازی حرکات دوربین
با پرومپت متنی میتوانید نحوه حرکت دوربین را در ویدیو مشخص کنید. برای مثال، زاویه فیلمبرداری را از روی شانه کاراکتر به زاویه روبهرو تغییر دهید یا افکتهای زوم و چرخش حرفهای روی صحنه اعمال کنید.
بخش دوم: عاملهای هوشمند با Gemini 3.5 Flash
مدل ۳.۵ Flash تمرکز ویژهای روی سرعت، کارایی بالا و ظرفیت بالای پنجره متنی دارد که آن را به بهترین گزینه برای توسعه عاملهای هوشمند (AI Agents) تبدیل میکند:
۷. اجرای وظایف عاملانه در مقیاس بزرگ
Gemini 3.5 Flash به دلیل سرعت بالا میتواند صدها تسک فرعی را به طور موازی اجرا کند. این مدل برای خودکارسازی فرآیندهای طولانیمدت مانند تحقیق در کدهای منبع بزرگ یا تحلیل فایلهای مالی سنگین کاربرد دارد.
۸. هماهنگی و همکاري عوامل هوشمند
وقتی ۳.۵ Flash با ابزارها و چارچوبهای هوشمند (مانند Antigravity) ترکیب میشود، میتواند چندین عامل فرعی را مدیریت کند تا به صورت تیمی روی مسائل مهندسی نرمافزار و مدیریت سیستم همکاری کنند.
۹. نسل جدید دستیارهای شخصی در زندگی روزمره
این دمو نشان میدهد که چطور مدل در ابزارهایی نظیر جستجوی گوگل، Gmail و تقویم ادغام شده است تا کارهای پیچیدهای چون برنامهریزی سفر، خرید آنلاین و خلاصه کردن ایمیلهای کاری را به صورت خودکار برای کاربر نهایی انجام دهد.
«مدلهای Gemini Omni و Gemini 3.5 نشاندهنده گذار تاریخی از هوش مصنوعی پاسخدهنده به سیستمهای عاملگرا (Agentic AI) هستند که میتوانند کارهای واقعی را در دنیای دیجیتال به ثمر برسانند.» — گزارش رسمی رویداد سالانه گوگل
برای آشنایی با خدمات ما جهت دسترسی بدون محدودیت به این مدلهای پیشرفته و اکانتهای پریمیوم، میتوانید به بخش اشتراکها در صفحه اصلی مراجعه کنید.