موضوعات داغ
  • گیمزکام ۲۰۲۵
  • گلکسی S25 FE سامسونگ
  • آیفون 17 اپل
  • بازی GTA VI
  • هوش مصنوعی
  • دینو
سخت افزار مگ
  • اخبار و مقالات
    • گوشی موبایل
      • لوازم جانبی موبایل
    • تبلت
    • لپ تاپ
    • دسکتاپ
      • مادربرد
      • پردازنده مرکزی
      • کارت گرافیک
      • تجهیزات ذخیره سازی
      • حافظه
      • صفحه نمایش
      • تجهیزات جانبی
    • تصویرگری دیجیتال
    • صوتی و تصویری
    • شبکه
    • نرم افزار و بازی
    • کالبدشکافی قطعات
    • مطالب گوناگون
  • بررسی
    • بررسی گوشی موبایل
    • بررسی تبلت
    • بررسی لپ تاپ
    • دسکتاپ
      • بررسی کولر و فن
      • بررسی مادربرد
      • بررسی کارت گرافیک
      • بررسی تجهیزات ذخیره سازی
      • بررسی حافظه
      • بررسی منبع تغذیه و کیس
      • بررسی تجهیزات جانبی
      • بررسی صفحه نمایش
    • بررسی تصویرگری دیجیتال
    • بررسی صوتی و تصویری
    • بررسی شبکه
    • بررسی نرم افزار و بازی
    • بررسی گوناگون
  • راهنمای خرید
    • سیستم پیشنهادی
  • لیست قیمت
    • گوشی موبایل
      • لیست قیمت روز گوشی‌های سامسونگ
      • لیست قیمت روز گوشی‌های شیائومی
      • لیست قیمت روز گوشی‌های هواوی
      • لیست قیمت روز گوشی های آنر
    • تبلت
    • لپ‌تاپ
    • قطعات کامپیوتر
      • لیست قیمت پردازنده
    • محصولات اپل
    • تجهیزات شبکه
    • لوازم خانگی
    • صوتی و تصویری
    • دوربین دیجیتال
    • تجهیزات بازی
    • خودرو
  • ویژه
    • مسابقات
    • نمایشگاه
تبلیغات
تبلیغات
تبلیغات

اخبار و مقالات / مطالب گوناگون

مدل جدید اپل ویدئو های طولانی را بهتر از همیشه تحلیل می‌کند!

Avatarتوسط مهرانه راجعی ·1 شهریور 14041 شهریور 1404· 0

پژوهشگران اپل نسخه‌ای بهبودیافته از مدل SlowFast-LLaVA را توسعه داده‌اند که توانسته است در تحلیل و درک ویدئو های طولانی از مدل‌های بزرگ‌تر عملکرد بهتری نشان دهد. این موضوع اهمیت زیادی دارد، زیرا پردازش ویدئوهای طولانی یکی از چالش‌های اصلی مدل‌های زبانی تصویری محسوب می‌شود.

این روزها بیشتر صحبت‌ها درباره ابزارها و مدل‌‌های هوش مصنوعی تولید ویدئو است که در ماه‌های گذشته در مورد برخی آن‌ها مثل Sora، Veo، Flow، Pictory یا Runway AI اطلاعاتی را با شما به اشتراک گذاشتیم. اما کمتر به مدل‌هایی پرداخته می‌شود که هدفشان درک و تحلیل ویدئوهای طولانی است. در این مطلب قرار است به سراغ نوآوری اپل برویم؛ جایی‌که پژوهشگران این شرکت با معرفی مدل جدیدی توانسته‌اند گام مهمی در فهم دقیق ویدئو ها بردارند و حتی در برخی موارد از رقبای بزرگ‌تر هم جلو بزنند.

بخش فنی موضوع

به‌طور ساده، زمانیکه یک مدل زبانی بزرگ (LLM) برای درک ویدئو آموزش داده می‌شود، ویدئو را به فریم‌ها تقسیم کرده و با استفاده از بینایی کامپیوتری ویژگی‌های بصری هر فریم را استخراج می‌کند. سپس دگرگونی این ویژگی‌ها در گذر زمان را ارزیابی کرده و در نهایت همه داده‌ها را با زبان همسو می‌سازد تا بتواند محتوای ویدئو را به شکل متنی توصیف یا تحلیل نماید.

یک روش بسیار ناکارآمد برای این کار تحلیل تک‌تک فریم‌های ویدئو است؛ روشی که حجم عظیمی از اطلاعات تکراری تولید می‌کند، زیرا اغلب فریم‌ها تغییرات معناداری نسبت به فریم قبل ندارند.

وجود این حجم عظیم داده‌های تکراری می‌تواند به‌راحتی باعث شود مدل زبانی از پنجره زمینه (context window) خود فراتر برود. پنجره زمینه حداکثر مقدار اطلاعاتی است که مدل می‌تواند در یک زمان پردازش و نگهداری کند. زمانیکه این ظرفیت پر می‌شود، مدل برای ادامه پردازش، اطلاعات قدیمی‌تر را کنار می‌گذارد تا فضای کافی برای داده‌های جدید داشته باشد.

البته روش‌های کارآمدتری نیز برای آموزش مدل‌های ویدئویی وجود دارد. برای نمونه، شرکت انویدیا به‌تازگی مقاله‌ای در این زمینه منتشر کرده است. اما در مجموع این توضیح، اساس درک پژوهش اپل را شکل می‌دهد.

مطالعه اپل

به گفته پژوهشگران اپل، مدل های زبانی بزرگ ویدئو یی (Video LLMs) ادراک ویدئویی را با مدل‌های زبانی از پیش آموزش‌دیده ترکیب می‌کنند تا بتوانند ویدئوها را پردازش کرده و به دستورات کاربران پاسخ دهند. هرچند پیشرفت‌های چشمگیری حاصل شده، اما همچنان محدودیت‌های قابل‌توجهی در این مدل‌ها وجود دارد.

این محدودیت‌ها به گفته آن‌ها سه دسته‌اند:

  • مدل‌های موجود معمولاً به پنجره‌های زمینه طولانی و تعداد بسیار زیادی فریم وابسته‌اند که ناکارآمد است و قابلیت انتقال به مدل‌های کوچک‌تر را سخت می‌کند.
  • بیشتر آن‌ها به فرآیندهای آموزشی چندمرحله‌ای و پیچیده نیاز دارند که اغلب از داده‌های خصوصی استفاده می‌کنند و بازتولید آن‌ها دشوار است.
  • بسیاری از آن‌ها تنها برای وظایف ویدئویی بهینه شده‌اند و درک تصاویر را به خوبی مدل‌های عمومی ندارند.

اپل برای رفع این محدودیت‌ها ابتدا به مدل SlowFast-LLaVA توجه کرد؛ یک مدل متن‌باز که پیش‌تر نتایج امیدوارکننده‌ای با ترکیب نشانه‌های مکانی و زمانی به دست آورده بود. این مدل از دو جریان استفاده می‌کرد:

  • یک جریان کند (Slow stream) که فریم‌های کمتر اما با جزئیات بالاتر را پردازش می‌کند تا محتوای صحنه را دریابد.
  • یک جریان سریع (Fast stream) که فریم‌های بیشتری با جزئیات کمتر بررسی می‌کند تا حرکت‌ها و تغییرات در طول زمان دنبال شود.

اپل ابتدا این مدل را با تصاویر تنظیم دقیق (fine-tune) کرد تا توانایی استدلال بصری عمومی را تقویت کند. سپس آن را به‌طور همزمان با تصاویر و ویدئوها (از مجموعه‌داده‌های عمومی) آموزش داد تا ساختارهای زمانی را بدون کاهش توانایی درک تصاویر بیاموزد.

اپل یک مدل زبانی بزرگ برای درک کارآمد ویدئو های طولانی آموزش داد

نتیجه این تلاش‌ها به شکل‌گیری SlowFast-LLaVA-1.5 (SF-LLaVA-1.5) انجامید؛ مجموعه‌ای از مدل‌ها در سه اندازه با 1B، 3B و 7B پارامتر. این مدل‌ها توانستند در بسیاری از وظایف ویدئویی عملکردی بهتر از مدل‌های بسیار بزرگ‌تر داشته باشند و حتی در بعضی موارد همان‌طور که پژوهشگران اپل گفته‌اند، با اختلاف قابل‌توجهی از آن‌ها پیشی بگیرند.

در واقع، در معیارهای ویدئو های طولانی مانند LongVideoBench و MLVU، مدل اپل توانسته است در همه اندازه‌ها، حتی در کوچک‌ترین نسخه 1B، رکوردهای جدیدی ثبت کند.

علاوه بر این، مدل توانست یکی از سه محدودیت یادشده را پشت سر بگذارد و در وظایف تصویری نیز نتایج خوبی نشان دهد؛ از جمله در آزمون‌های دانش عمومی، استدلال ریاضی، OCR و سناریوهای متنی-تصویری. تیم پژوهش حتی چندین استراتژی فشرده‌سازی ویدئو را آزمایش کرد، اما دریافت که تنظیمات انتخاب‌شده بهترین تعادل میان سرعت، دقت و تعداد توکن‌ها را ارائه می‌دهد.

محدودیت‌های باقی‌مانده

با وجود این پیشرفت‌ها، پژوهشگران اپل برای مدل SF-LLaVA-1.5 حداکثر طول ورودی 128 فریم را در نظر گرفتند.

این یعنی چه ویدئو تنها چند دقیقه باشد و چه چند ساعت، مدل همیشه حداکثر 128 فریم را پردازش می‌کند: 96 فریم به صورت یکنواخت برای جریان سریع انتخاب می‌شوند و 32 فریم نیز برای جریان کند.

پژوهشگران با توجه به این موضوع می‌گویند: این رویکرد ممکن است برخی فریم‌های کلیدی را در ویدئوهای طولانی از دست بدهد و مدل را در مورد سرعت پخش ویدئو گمراه کند. (…) عملکرد SF-LLaVA-1.5 می‌تواند با تنظیم تمام پارامترها از جمله رمزگذار بصری بهبود یابد. با این حال، این کار برای مدل‌های ویدئوی طولانی ساده نیست، زیرا حافظه GPU بالایی برای ذخیره مقادیر فعال‌سازی نیاز دارد. مطالعات آینده می‌توانند به ادغام تکنیک‌های صرفه‌جویی در حافظه مانند Stochastic BP بپردازند.

با این حال، رویکرد اپل باعث شد این مدل به یک مدل پیشرفته در سطح جهانی تبدیل شود، آن هم با این مزیت که فقط بر اساس مجموعه‌داده‌های عمومی آموزش دیده است. SF-LLaVA-1.5 اکنون به صورت متن‌باز در GitHub و Hugging Face دردسترس است و متن کامل این پژوهش نیز در arXiv منتشر شده است.

برچسب‌ها: اپل, هوش مصنوعی

امتیاز: 5.0 از 5 (2 رای)
کمی صبر کنید...
تبلیغات
تبلیغات
سرخط خبرها:
  1. ورود جدی اپل به دنیای هوش مصنوعی سازمانی با ChatGPT
  2. سقوط آزاد قیمت پردازنده AMD Ryzen 9 9950X3D در آلمان!
  3. اعلام جزئیات دسترسی به نسخه بتای بازی Call of Duty: Black Ops 7
  4. تبلت پیکسل 2 می‌توانست با کنترل‌های جدید شبیه به کامپیوتر در اندروید بسیار جذاب باشد
  5. مشخصات کارت‌ های گرافیک ویژه چهلمین سالگرد PNY با طراحی Chrome و نورپردازی ARGB منتشر شد

مطالب مرتبط ...

  • 9

    آیا با پول اپل می توان بارسلونا و رئال مادرید را خرید؟

    Avatarتوسط محمد یوسفی زاده · 14 آبان 1394 · 22 اسفند 1398

  • 0

    اپل برای استفاده مجدد از پنل اولد آیفون 13 برای آیفون SE 4 برنامه‌ریزی می‌کند

    Avatarتوسط مهرانه راجعی · 9 مرداد 1403 · 9 مرداد 1403

  • 0

    اخراج کارمندان اپل آسیب زیادی به روحیه شرکت و افکار عمومی وارد می کند

    Avatarتوسط بهنام آزادخواه · 29 اسفند 1401 · 29 اسفند 1401

مطالب گوناگون از دینو

کدام داروها می‌توانند تحمل گرما را سخت‌تر کنند؟

10 فیلم فوق‌ العاده که به شما کمک می کند بچه ها را بهتر درک کنید

چگونه از نشخوار افکار منفی و تجربیات گذشته خودداری کنیم؟

دیدگاهتان را بنویسید لغو پاسخ

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

در صورتی که نظر شما حاوی ناسزا، عبارات توهین‌آمیز و تهدید بوده و در تضاد با قوانین فعلی کشور باشد از انتشار آن بدون حذف موارد ذکر شده، معذوریم.
شکلک‌ها (اموجی‌ها) را می‌توانید با کیبرد گوشی یا کیبرد مجازی ویندوز قرار دهید.
تصاویر نویسندگان دیدگاه از Gravatar گرفته می‌شود.

پربحث‌ترین‌ها

  • قطعی‌های اینترنت به‌صورت روزانه 4

    خط‌ونشان ایرانسل: قیمت تعرفه‌ها بالا نرود، قطعی‌های اینترنت روزانه خواهیم داشت!

  • مانیتور گیمینگ جدید AOC 25G4K با نرخ نوسازی 420 هرتز و پنل Fast IPS رونمایی شد 2

    مانیتور گیمینگ جدید AOC 25G4K با نرخ نوسازی 420 هرتز و پنل Fast IPS رونمایی شد

  • تکذیبیه تهدید به قطعی اینترنت 2

    عقب‌نشینی فوری ایرانسل: تهدید قطعی اینترنت برداشت نادرستی است و موضوعیت ندارد

  • آموزش گام به گام نصب شیدر برای ارتقا گرافیک بازی های کامپیوتر 2

    آموزش نصب شیدر برای ارتقا گرافیک بازی های کامپیوتر

آخرین بررسی‌ها

9.1

تماشا کنید: بررسی گوشی گلکسی زد فولد 7 سامسونگ - این لاکچریِ جذاب!

8.4

بررسی ریلمی C75 – این گوشی اقتصادیِ جان سخت

8.6

بررسی مادربرد گیگابایت B860 GAMING X WIFI6E

9

بررسی کیس گیگابایت AORUS C500 GLASS

8.5

بررسی کیس آراد گرین - گیمینگ خوش قیمت و خوش ساخت (اعلام برنده)

آخرین مطالب دینو

5 نکته‌ که باید پیش از خرید مکمل‌ ها بدانید

از پودرهای کلاژن گرفته تا قرص‌های جویدنی تقویت‌کننده سیستم…

  • هوای پاک چین زمین را گرم‌تر می‌کند!

  • نشانه‌های پنهان افسردگی در کودکان که نباید نادیده بگیرید!

  • چرا زوال عقل در افراد جوان نادیده گرفته می‌شود؟

  • خواندن یا گوش دادن؟ کدام یک مغز را بیشتر درگیر می‌کند؟

  • مطلب بعدی چگونه بازی GTA IV را بدون کارت گرافیک روی کامپیوتر اجرا کنیم؟
  • مطلب قبلی فعال‌سازی رومینگ ایرانسل در عراق (تنظیمات + بسته‌ها)
  • آخرین مطالب
  • محبوب‌ترین مطالب
  • ورود جدی اپل به دنیای هوش مصنوعی سازمانی با ChatGPT

  • سقوط آزاد قیمت پردازنده AMD Ryzen 9 9950X3D در آلمان!

  • نسخه بتای بازی Black Ops 7

    اعلام جزئیات دسترسی به نسخه بتای بازی Call of Duty: Black Ops 7

  • تبلت پیکسل 2 می‌توانست با کنترل‌های جدید شبیه به کامپیوتر در اندروید بسیار جذاب باشد

    تبلت پیکسل 2 می‌توانست با کنترل‌های جدید شبیه به کامپیوتر در اندروید بسیار جذاب باشد

  • مشخصات کارت‌ های گرافیک ویژه چهلمین سالگرد PNY با طراحی Chrome و نورپردازی ARGB منتشر شد

    مشخصات کارت‌ های گرافیک ویژه چهلمین سالگرد PNY با طراحی Chrome و نورپردازی ARGB منتشر شد

  • قطعی‌های اینترنت به‌صورت روزانه 4

    خط‌ونشان ایرانسل: قیمت تعرفه‌ها بالا نرود، قطعی‌های اینترنت روزانه خواهیم داشت!

  • تکذیبیه تهدید به قطعی اینترنت 2

    عقب‌نشینی فوری ایرانسل: تهدید قطعی اینترنت برداشت نادرستی است و موضوعیت ندارد

  • اولین تریلر گیم پلی بازی Black Ops 7 2

    گیمزکام 2025: اولین تریلر گیم پلی بازی Call of Duty: Black Ops 7 منتشر شد

  • آموزش گام به گام نصب شیدر برای ارتقا گرافیک بازی های کامپیوتر 2

    آموزش نصب شیدر برای ارتقا گرافیک بازی های کامپیوتر

  • مانیتور گیمینگ جدید AOC 25G4K با نرخ نوسازی 420 هرتز و پنل Fast IPS رونمایی شد 2

    مانیتور گیمینگ جدید AOC 25G4K با نرخ نوسازی 420 هرتز و پنل Fast IPS رونمایی شد

آخرین دیدگاه‌ها

  • Avatar
    علی گفته است:
    بناد مثل خیلی از نهادهای دیگه فقط پول و سرمایه های...
  • Avatar
    حامد آذرشب گفته است:
    خوب بود
  • Avatar
    حامد آذرشب گفته است:
    خوب بود بدک نبود
  • Avatar
    جنگ ایران امریکا گفته است:
    خخخخ وارد کننده گوشی ارزان بیار خوب اگر گوشی ارزان باشه...
  • Avatar
    ستون گفته است:
    اینا هارد دیسک هستن یا همون HDD سرعت ندارن مفت نمی...
  • Avatar
    kambiz گفته است:
    این خطوط قرمز چی هستش؟ مثلا یک انیمیشن بود اسمش جمشید...
  • Avatar
    امیر گفته است:
    بورو بابا با رم 12 هم میاد بعد شم باتریش میشه...
  • Avatar
    امیر گفته است:
    با وان یو آی 6 و 1 میاد بازار
  • Avatar
    رضا گفته است:
    مثل همیشه کامل و جزئی‌نگر بنظرم فولد ۱۰ گوگل خیلیییییی بهتر...
  • Avatar
    حمید رضا غلامی گفته است:
    گیر کلوپ3 نیز در ژاپن بازی میشود
راهنمای خرید ماوس و کیبورد 2
راهنمای خرید و مشاوره
راهنمای خرید موس و کیبورد با بودجه‌های مختلف (مرداد 1404)
16 مرداد 1404
راهنمای خرید لپ تاپ گیمینگ 469
راهنمای خرید و مشاوره
راهنمای خرید لپ تاپ گیمینگ با بودجه های مختلف (مرداد 1404)
13 مرداد 1404
راهنمای خرید مانیتور 68
راهنمای خرید و مشاوره
راهنمای خرید مانیتور با بهترین قیمت در بودجه‌های مختلف (مرداد 1404)
12 مرداد 1404
راهنمای خرید لپ تاپ با بودجه های مختلف 1,300
راهنمای خرید و مشاوره
راهنمای خرید لپ تاپ با بودجه های مختلف (مرداد 1404)
6 مرداد 1404
راهنمای خرید گوشی موبایل 491
راهنمای خرید و مشاوره
راهنمای خرید گوشی موبایل بر اساس بودجه‌های مختلف (مرداد 1404)
5 مرداد 1404
راهنمای خرید تبلت 7
تبلت راهنمای خرید و مشاوره هایلایت
راهنمای خرید تبلت بر اساس بودجه‌های مختلف (تابستان 1404)
25 تیر 1404
  • سخت‌افزارمگ
  • درباره ما
  • تبلیغات
  • استخدام
سخت‌افزارمگ

© 2025 Sakhtafzarmag.Com. All Rights Reserved.

صفحه نخست » اخبار و مقالات » مطالب گوناگون » مدل جدید اپل ویدئو های طولانی را بهتر از همیشه تحلیل می‌کند!

ورود

عضویت

رمزتان را گم کرده‌اید؟

عضویت | رمزتان را گم کرده‌اید؟
| بازگشت به ورود