هدر سایت - گارانتی جدید
Gemini Omni چیست؟ گوگل ویرایش ویدئو را شبیه چت کردن کرد

Gemini Omni چیست؟ گوگل ویرایش ویدئو را شبیه چت کردن کرد

Salami

نویسنده

Salami

  • تاریخ انتشار:
  • زمان مطالعه: ۱۰ دقیقه
هشتگ‌ها: تکنولوژی

تصور کنید ویدئویی گرفته‌اید و به‌جای بازکردن یک نرم‌افزار تدوین، انتخاب لایه‌ها و استفاده از ابزارهای پیچیده، فقط بنویسید پس‌زمینه را عوض کن، نور را سینمایی‌تر کن یا این شی را از تصویر حذف کن. ایده اصلی Gemini Omni دقیقاً همین است؛ گوگل می‌خواهد ویرایش ویدئو را به یک مکالمه تبدیل کند.

Gemini Omni خانواده جدیدی از مدل‌های چندوجهی Google DeepMind است که می‌تواند متن، عکس، صدا و ویدئو را به‌عنوان ورودی درک کند و در نخستین مرحله، خروجی ویدئویی تولید کند. اولین مدل این خانواده Gemini Omni Flash نام دارد و علاوه بر ساخت فیلم از متن یا تصویر، امکان ویرایش مرحله‌به‌مرحله ویدئو با زبان طبیعی را فراهم می‌کند.

به زبان ساده، به‌جای اینکه هر بار کل پروژه را دوباره توضیح دهید، می‌توانید با هوش مصنوعی گفت‌وگو کنید و تغییرها را یکی پس از دیگری اعمال کنید.

Gemini Omni چیست؟

گوگل Gemini Omni را مدلی معرفی می‌کند که در آینده قرار است بتواند هر نوع خروجی را از هر نوع ورودی بسازد اما شروع کار آن با ویدئو است. Omni به‌صورت بومی چندوجهی طراحی شده و متن، تصویر، صوت و فیلم را هم‌زمان پردازش می‌کند. این ویژگی به مدل اجازه می‌دهد مثلاً یک تصویر را برای ظاهر شخصیت، یک ویدئو را برای حرکت و یک توضیح متنی را برای فضای صحنه دریافت کند و آن‌ها را در یک خروجی واحد ترکیب کند.

 

Gemini Omni Flash اولین مدل منتشرشده از این خانواده است و Google DeepMind آن را برای تولید سریع ویدئو، ویرایش و کنترل سینمایی توسعه داده است. نسخه توسعه‌دهندگان نیز فعلاً با عنوان Preview عرضه می‌شود.

چرا Gemini Omni متفاوت است؟

بزرگ‌ترین تفاوت این هوش مصنوعی با بسیاری از ابزارهای تولید ویدئو، فقط کیفیت خروجی نیست؛ بلکه روش تعامل با آن است. در یک ویرایشگر سنتی باید بخش موردنظر را انتخاب کنید، ماسک بسازید، نور را تنظیم کنید یا افکت موردنظر را پیدا کنید. در Gemini Omni کافی است خواسته خود را به زبان معمولی توضیح دهید.

برای مثال:

نور صحنه را گرم‌تر کن و بقیه تصویر را تغییر نده.

پس از مشاهده نتیجه می‌توانید ادامه دهید:

حالا پس‌زمینه را به یک خیابان بارانی تبدیل کن.

و در مرحله سوم:

یک کلاه به شخصیت اضافه کن؛ باقی صحنه همان قبلی بماند.

Omni تاریخچه مکالمه را در نظر می‌گیرد و هر ویرایش را روی نتیجه مرحله قبل انجام می‌دهد؛ بنابراین نیازی نیست در هر دستور دوباره تمام اجزای صحنه را توصیف کنید. گوگل می‌گوید این روش برای حفظ انسجام شخصیت و صحنه طراحی شده است.

ویرایش ویدئو با یک جمله

یکی از مهم‌ترین کاربردهای Gemini Omni، ویرایش ویدئوی موجود است.

ویرایش ویدئو با یک جمله

در Google Vids می‌توان حتی کلیپی را که با موبایل ضبط شده است وارد کرد و سپس با دستور متنی تغییراتی مانند موارد زیر را درخواست کرد:

  • تغییر پس‌زمینه
  • اصلاح نور
  • اضافه‌کردن افکت
  • تغییر ظاهر یک عنصر
  • حذف یا جایگزینی اشیا
  • تغییر استایل کلی ویدئو

گوگل در راهنمای رسمی خود نمونه‌هایی مانند «نور را دراماتیک‌تر کن»، «یک کلاه به این فرد اضافه کن» یا «متن روی تابلو را تغییر بده» ارائه کرده است.

نکته مهم این است که گوگل برای ویرایش دقیق‌تر توصیه می‌کند دستورها کوتاه و مشخص باشند. عبارت‌هایی مانند بقیه چیزها را بدون تغییر نگه دار نیز به مدل کمک می‌کنند بخش‌های ناخواسته تصویر تغییر نکنند.

ساخت ویدئو از متن با Gemini Omni

قابلیت Omni فقط به ویرایش محدود نیست. مدل می‌تواند یک ویدئوی جدید را نیز مستقیماً از توضیح متنی بسازد.

برای نتیجه بهتر می‌توان در پرامپت مواردی مانند این‌ها را مشخص کرد:

  • نوع صحنه
  • حرکت دوربین
  • حرکت شخصیت
  • نورپردازی
  • فضای احساسی
  • استایل تصویری
  • صدای محیط

Gemini Omni Flash در API می‌تواند ویدئو را همراه با صدا تولید کند. نسبت تصویر افقی 16:9 و عمودی 9:16 نیز پشتیبانی می‌شود که دومی برای محتوای Reels ،Shorts و TikTok کاربردی است.

تبدیل عکس به ویدئو

تبدیل عکس به ویدئو

یکی دیگر از کاربردهای مهم، Image-to-Video است. می‌توانید یک عکس، طرح اولیه، تصویر محصول یا کاراکتر را به مدل بدهید و توضیح دهید چه حرکتی باید در ویدئو ایجاد شود. مثلاً تصویری از یک محصول را وارد کنید و درخواست دهید:

دوربین آرام از سمت چپ به راست حرکت کند، نور استودیویی روی محصول منعکس شود و پس‌زمینه ثابت بماند.

گوگل می‌گوید استفاده از تصاویر با وضوح مناسب و توضیح دقیق درباره حرکت سوژه و دوربین، نتیجه بهتری نسبت به فرمان‌های مبهمی مانند «این عکس را متحرک کن» ایجاد می‌کند. این قابلیت به‌خصوص برای تبلیغات محصول، شبکه‌های اجتماعی، استوری‌بورد و نمونه‌سازی سریع محتوا اهمیت دارد.

استفاده هم‌زمان از چند نوع ورودی

نقطه قوت اصلی Gemini Omni، مفهوم Native Multimodality ست. مدل می‌تواند از ترکیبی از متن، تصویر، ویدئو و صوت برای فهم بهتر چیزی که کاربر می‌خواهد استفاده کند. Google DeepMind می‌گوید هدف این طراحی، افزایش کنترل و ایجاد خروجی منسجم‌تر است.

برای مثال می‌توان از یک عکس برای ظاهر کاراکتر، از مرجع دیگری برای استایل و از ویدئو برای نوع حرکت استفاده کرد. این ویژگی تفاوت مهمی با سیستم‌هایی دارد که ابتدا هر ورودی را به‌طور مستقل پردازش کرده و سپس نتایج را با یکدیگر ترکیب می‌کنند.

آیا Gemini Omni از صدای ویدئو هم پشتیبانی می‌کند؟

بله؛ خروجی Gemini Omni Flash می‌تواند ویدئو همراه با صدا باشد. مدل کارت رسمی DeepMind نیز خروجی آن را ویدئوی باکیفیت همراه با صوت معرفی می‌کند. اما هنوز محدودیت‌هایی وجود دارد. در نسخه فعلی Gemini API، آپلود فایل صوتی به‌عنوان Reference برای ویرایش پشتیبانی نمی‌شود و ویرایش صدای موجود یا Voice Editing نیز فعلاً در دسترس نیست.

آیا Gemini Omni از صدای ویدئو هم پشتیبانی می‌کند؟

گوگل همچنین اعلام کرده است که در حال بررسی شیوه ارائه مسئولانه قابلیت‌هایی است که بتوانند صدا و گفتار افراد را تغییر دهند.

Gemini Omni با Veo چه تفاوتی دارد؟

ممکن است Gemini Omni با Veo 3.1 اشتباه گرفته شود، اما این دو نام به یک محصول واحد اشاره نمی‌کنند. Veo 3.1 مدل اصلی و پیشرفته Google DeepMind برای تولید ویدئوی سینمایی است و روی کیفیت تصویر، واقع‌گرایی، پیروی از پرامپت، کنترل خلاقانه و تولید صوت تمرکز دارد. در مقابل، نقطه متمایز  Gemini Omni، ترکیب توانایی استدلال چندوجهی Gemini با تولید و به‌ویژه ویرایش مکالمه‌ای ویدئو است.

به شکل ساده:

Veo: یک ویدئوی حرفه‌ای برای من تولید کن.

Gemini Omni: این ویدئو را بساز؛ حالا نورش را تغییر بده؛ شخصیت را همان نگه دار؛ پس‌زمینه را عوض کن؛ این شیء را اضافه کن.

به همین دلیل Omni بیشتر شبیه یک همکار تدوینگر قابل گفت‌وگو عمل می‌کند.

Gemini Omni کجا قابل استفاده است؟

گوگل اولین مدل خانواده Omni را در Gemini App، Google Flow و YouTube Shorts/YouTube Create عرضه کرده است. دسترسی در Gemini و Flow برای مشترکان Google AI Plus، Pro و Ultra ارائه شده است. در  Google Vids نیز Gemini Omni برای مشترکان Google AI Pro و Ultra و برخی مشتریان تجاری Google Workspace در دسترس است. در این سرویس می‌توان کلیپ ساخته‌شده توسط AI یا حتی ویدئوی ضبط‌شده با موبایل را با دستور متنی ویرایش کرد.

Gemini Omni کجا قابل استفاده است؟

محدودیت‌های Gemini Omni چیست؟

Omni هنوز فناوری کاملاً بی‌نقصی نیست. نسخه فعلی API ویدئوهای ۳ تا ۱۰ ثانیه‌ای با وضوح 720p تولید می‌کند. گوگل اعلام کرده مدت زمان طولانی‌تر در آینده اضافه خواهد شد.

محدودیت‌های دیگر عبارت‌اند از:

  • Scene Extension فعلاً در API پشتیبانی نمی‌شود.
  • امکان کار هم‌زمان با چند ویدئوی مرجع وجود ندارد.
  • Voice Editing هنوز فعال نیست.
  • ثبات کاراکتر هنگام تغییر بزرگ صحنه یا حرکت Pan ممکن است دچار مشکل شود.
  • ویرایش ویدئوی آپلودشده در برخی مناطق از جمله EEA، بریتانیا و سوئیس در دسترس نیست.
  • زبان انگلیسی در API به‌طور کامل ارزیابی شده، اما عملکرد سایر زبان‌ها هنوز رسماً ارزیابی نشده است.

بنابراین ممکن است دستور فارسی نیز کار کند، اما گوگل فعلاً کیفیت یکسان آن با انگلیسی را تضمین نکرده است.

آیا ویدئوهای ساخته‌شده قابل تشخیص هستند؟

گوگل روی ویدئوهای تولید یا ویرایش‌شده با Omni از SynthID استفاده می‌کند؛ یک واترمارک دیجیتال نامرئی که برای تشخیص منشأ محتوای تولیدشده با AI طراحی شده است. محتوای ایجادشده در Gemini App ،Google Flow و YouTube همچنین از اطلاعات مرتبط با منشا محتوا مانند Content Credentials استفاده می‌کند. Google Vids نیز برای کلیپ‌های تولیدشده با AI از SynthID بهره می‌برد.

این موضوع در دوره‌ای که تشخیص ویدئوی واقعی از محتوای AI دشوارتر شده، اهمیت زیادی دارد.

آیا Gemini Omni جای نرم‌افزارهای تدوین را می‌گیرد؟

فعلاً نه. ابزارهایی مانند Premiere Pro، DaVinci Resolve یا Final Cut همچنان کنترل دقیق‌تری روی تایم‌لاین، صدا، تصحیح رنگ، تدوین چندلایه و خروجی حرفه‌ای ارائه می‌دهند. اما Gemini Omni می‌تواند بخش متفاوتی از فرایند را بسیار سریع کند؛ مخصوصاً زمانی که نیاز دارید یک شی را تغییر دهید، بک‌گراند را عوض کنید، افکت بسازید یا نسخه‌های متفاوتی از یک کلیپ تولید کنید.

در نتیجه، آینده محتمل‌تر این است که هوش مصنوعی بخشی از فرایند تدوین را مکالمه‌ای کند نه اینکه تمام ابزارهای حرفه‌ای تدوین یک‌شبه حذف شوند.

Gemini Omni برای چه کسانی کاربرد دارد؟

این فناوری به‌خصوص برای گروه‌های زیر جذاب است:

  • تولیدکنندگان محتوای اینستاگرام و YouTube
  • تیم‌های تبلیغات و مارکتینگ
  • فروشگاه‌های اینترنتی
  • طراحان و موشن‌دیزاینرها
  • فیلم‌سازان در مرحله Pre-visualization
  • کسب‌وکارهایی که ویدئوهای آموزشی تولید می‌کنند

یک فروشگاه اینترنتی برای مثال، می‌تواند عکس محصول را به ویدئو تبدیل کند، پس‌زمینه را تغییر دهد و چند نسخه عمودی و افقی برای کمپین‌های مختلف بسازد.

Gemini Omni برای چه کسانی کاربرد دارد؟

سؤالات متداول

Gemini Omni چیست؟

Gemini Omni خانواده جدید مدل‌های چندوجهی Google DeepMind برای تولید محتوا از انواع ورودی است. اولین مدل آن Gemini Omni Flash، روی ساخت و ویرایش مکالمه‌ای ویدئو تمرکز دارد.

آیا Gemini Omni رایگان است؟

دسترسی مستقیم آن در Gemini App و Flow برای طرح‌های Google AI Plus، Pro و Ultra ارائه شده است. گوگل همچنین عرضه آن را بدون هزینه در YouTube Shorts و YouTube Create آغاز کرده است. شرایط و محدودیت استفاده در هر سرویس متفاوت است.

آیا می‌توان ویدئوی خودمان را ویرایش کرد؟

بله. Omniقابلیت ویرایش ویدئوی آپلودشده را دارد و Google Vids نیز ویرایش کلیپ‌های ضبط‌شده توسط کاربر را پشتیبانی می‌کند؛ البته این قابلیت در بعضی مناطق جغرافیایی محدود است.

آیا Gemini Omni فارسی را پشتیبانی می‌کند؟

در مستندات API، انگلیسی تنها زبانی است که گوگل اعلام کرده به‌طور کامل ارزیابی شده است. زبان‌های دیگر ممکن است کار کنند، اما کیفیت نتیجه می‌تواند متفاوت باشد.

تفاوت Gemini Omni و Veo چیست؟

Veo مدل پیشرفته تولید ویدئوی Google DeepMind است درحالی‌که Gemini Omni روی تجربه چندوجهی و ویرایش مرحله‌ای و مکالمه‌ای تمرکز بیشتری دارد.

جمع‌بندی

Gemini Omni یکی از مهم‌ترین تلاش‌های گوگل برای تبدیل ویرایش ویدئو از یک فرایند ابزارمحور به یک فرایند مکالمه‌ای است. به‌جای پیدا کردن افکت، ساخت ماسک یا تنظیم دستی بعضی جزئیات، کاربر می‌تواند تغییر موردنظر را توضیح دهد و سپس نتیجه را مرحله‌به‌مرحله اصلاح کند.

ترکیب ورودی‌های متنی، تصویری، صوتی و ویدئویی، حفظ زمینه مکالمه، ساخت ویدئو از متن یا عکس و امکان تغییر عناصر یک کلیپ، Omni را از یک مولد ساده ویدئو فراتر می‌برد. البته محدودیت‌هایی مانند مدت کوتاه خروجی API، محدودیت ویرایش صدا، مشکلات احتمالی ثبات شخصیت و محدودیت‌های منطقه‌ای نشان می‌دهند این فناوری هنوز در آغاز مسیر قرار دارد.

اما جهت حرکت گوگل مشخص است: در آینده برای بسیاری از ویرایش‌های ویدئویی، شاید لازم نباشد بدانیم ابزار موردنظر کجاست؛ کافی است به هوش مصنوعی بگوییم چه چیزی می‌خواهیم تغییر کند.

نظرات و امتیاز

از ۵

هنوز امتیازی ثبت نشده

هنوز نظری ثبت نشده

اولین نفری باشید که تجربه خود از این مطلب را با دیگران به اشتراک می‌گذارد.

ثبت اولین نظر

ثبت نظر شما