موضوعات داغ
  • بتلفیلد 6
  • گوشی‌های سری گلکسی S26
  • آیفون 17 اپل
  • بازی GTA VI
  • گلکسی S25 FE
  • دینو
سخت افزار مگ
  • اخبار و مقالات
    • گوشی موبایل
      • لوازم جانبی موبایل
    • تبلت
    • لپ تاپ
    • دسکتاپ
      • مادربرد
      • پردازنده مرکزی
      • کارت گرافیک
      • تجهیزات ذخیره سازی
      • حافظه
      • صفحه نمایش
      • تجهیزات جانبی
    • تصویرگری دیجیتال
    • صوتی و تصویری
    • شبکه
    • نرم افزار و بازی
    • کالبدشکافی قطعات
    • مطالب گوناگون
  • بررسی
    • بررسی گوشی موبایل
    • بررسی تبلت
    • بررسی لپ تاپ
    • دسکتاپ
      • بررسی کولر و فن
      • بررسی مادربرد
      • بررسی کارت گرافیک
      • بررسی تجهیزات ذخیره سازی
      • بررسی حافظه
      • بررسی منبع تغذیه و کیس
      • بررسی تجهیزات جانبی
      • بررسی صفحه نمایش
    • بررسی تصویرگری دیجیتال
    • بررسی صوتی و تصویری
    • بررسی شبکه
    • بررسی نرم افزار و بازی
    • بررسی گوناگون
  • راهنمای خرید
    • سیستم پیشنهادی
  • لیست قیمت
    • گوشی موبایل
      • لیست قیمت روز گوشی‌های سامسونگ
      • لیست قیمت روز گوشی‌های شیائومی
      • لیست قیمت روز گوشی‌های هواوی
      • لیست قیمت روز گوشی های آنر
    • تبلت
    • لپ‌تاپ
    • قطعات کامپیوتر
      • لیست قیمت پردازنده
    • محصولات اپل
    • تجهیزات شبکه
    • لوازم خانگی
    • صوتی و تصویری
    • دوربین دیجیتال
    • تجهیزات بازی
    • خودرو
  • ویژه
    • مسابقات
    • نمایشگاه
تبلیغات
تبلیغات
تبلیغات

اخبار و مقالات / مطالب گوناگون

مدل‌ های استدلالی جدید OpenAI بیشتر دچار توهم می‌شوند

Avatarتوسط مهرانه راجعی ·30 فروردین 140430 فروردین 1404· 0

مدل‌های جدید هوش مصنوعی OpenAI با نام‌های o3 و o4 مینی در بسیاری از جنبه‌ها پیشرفته هستند. مدل‌ های استدلالی جدید OpenAI همچنان دچار توهم می‌شوند؛ به این معنی که اطلاعات نادرست تولید می‌کنند. ظاهراً حتی بیشتر از برخی مدل‌های قدیمی‌تر OpenAI این اتفاق رخ می‌دهد.

توهم یا تولید اطلاعات نادرست یکی از بزرگ‌ترین و پیچیده‌ترین مشکلات در حوزه هوش مصنوعی است که حتی سیستم‌های پیشرفته امروزی را نیز تحت تأثیر قرار می‌دهد. به‌طور تاریخی، هر مدل جدید معمولاً از نظر کاهش توهم کمی بهتر از مدل قبلی خود عمل می‌کند. اما به نظر می‌رسد این موضوع برای o3 و o4 مینی صدق نمی‌کند.

براساس آزمایش‌های داخلی OpenAI، مدل‌های o3 و o4 مینی، که به‌عنوان مدل‌های استدلالی شناخته می‌شوند، بیشتر از مدل‌های استدلالی قبلی این شرکت، یعنی o1، o1 مینی، و o3 مینی و حتی بیشتر از مدل‌های سنتی و غیر استدلالی مانند GPT-4o دچار توهم می‌شوند.

چرا مدل‌ های استدلالی OpenAI دچار توهم می‌شوند؟

نکته نگران‌کننده‌تر این است که سازندگان ChatGPT دقیقاً نمی‌دانند چرا این اتفاق می‌افتد. در گزارش فنی مدل‌های o3 و o4 مینی، OpenAI می‌نویسد که برای درک علت افزایش توهم در مقیاس‌بندی مدل‌های استدلالی نیاز به تحقیقات بیشتری وجود دارد. این مدل‌ها در برخی زمینه‌ها، مانند وظایف مربوط به کدنویسی و ریاضیات، عملکرد بهتری دارند. اما از آنجا که به‌طور کلی اطلاعات بیشتری ارائه می‌دهند، اغلب ادعاهای نادرست/توهمی بیشتر تولید می‌کنند‌.

مدل‌ های استدلالی جدید OpenAI بیشتر دچار توهم می‌شوند

طبق گزارش OpenAI، مدل o3 در 33٪ از پرسش‌ها در PersonQA که یک معیار داخلی برای اندازه‌گیری دقت دانش مدل در مورد انسان‌هاست، دچار توهم شده است. این رقم تقریباً دوبرابر نرخ توهم مدل‌های استدلالی قبلی OpenAI، یعنی o1 و o3 مینی است که به‌ترتیب 16٪ و 14.8٪ بودند. مدل o4 مینی حتی بدتر عمل کرد و در 48٪ از موارد توهم داشت.

آزمایش‌های مستقل توسط آزمایشگاه تحقیقاتی Transluce نیز شواهدی یافت که نشان می‌دهد مدل o3 تمایل به ساختن جزئیات فرآیندهایی دارد که در رسیدن به پاسخ‌ها به‌کار گرفته است. برای مثال، Transluce مشاهده کرد که o3 ادعا می‌کند روی یک MacBook Pro مدل 2021 خارج از ChatGPT کدی اجرا کرده و سپس نتایج را در پاسخ خود کپی کرده است. در حالی که o3 به برخی ابزارها دسترسی دارد، چنین کاری از عهده آن خارج است.

نیل چودری، یکی از پژوهشگران Transluce و کارمند سابق OpenAI گفت: فرضیه ما این است که نوع یادگیری تقویتی مورداستفاده در مدل‌های سری o ممکن است مشکلاتی را تشدید کند که معمولاً با فرآیندهای استاندارد پس از آموزش کاهش می‌یابند، اما به‌طور کامل از بین نمی‌روند.

سارا شوتمان، یکی از بنیان‌گذاران Transluce، اضافه کرد که نرخ توهم بالای o3 ممکن است باعث شود که این مدل کمتر از آنچه که باید مفید باشد.

کیان کاتنفروش، استاد مدعو دانشگاه استنفورد و مدیرعامل شرکت Workera که در زمینه ارتقای مهارت‌ها فعالیت می‌کند، توضیح داد که تیم او در حال آزمایش مدل o3 در فرآیندهای کدنویسی خود بوده و متوجه شده‌اند که این مدل از رقبای خود برتر است. با این حال، کاتنفروش اشاره کرد که o3 تمایل به تولید لینک‌های خراب برای وب‌سایت‌ها دارد. مدل لینک‌هایی ارائه می‌دهد که هنگام کلیک‌کردن، کار نمی‌کنند.

توهم ممکن است به مدل‌ های استدلالی جدید OpenAI کمک کند تا به ایده‌های جالب برسند و در تفکر خلاق باشند، اما این ویژگی باعث می‌شود که برخی مدل‌ها برای کسب‌وکارهایی که دقت اولویت اصلی است، گزینه نامناسبی باشند. برای مثال، یک شرکت حقوقی احتمالاً از مدلی که خطاهای واقعی زیادی در قراردادهای مشتری وارد می‌کند، رضایت نخواهد داشت.

یکی از رویکردهای امیدوارکننده برای افزایش دقت مدل‌ها، ارائه قابلیت‌های جستجوی وب به آن‌هاست. GPT-4o شرکت OpenAI با قابلیت جستجوی وب به دقت 90٪ در معیار SimpleQA، یکی دیگر از معیارهای دقت OpenAI، دست می‌یابد. احتمالاً جستجو می‌تواند نرخ توهم مدل‌های استدلالی را نیز بهبود بخشد؛ حداقل در مواردی که کاربران حاضر باشند درخواست‌های خود را در اختیار یک ارائه‌دهنده جستجوی ثالث قرار دهند.

اگر افزایش مقیاس مدل‌های استدلالی همچنان باعث بدترشدن توهمات شود، یافتن راه‌حل برای این مشکل ضرورت بیشتری پیدا خواهد کرد.

نیکو فلیکس گقت حل مسئله توهم در تمامی مدل‌های ما یک حوزه تحقیقاتی است و ما به‌طور پیوسته درحال تلاش برای بهبود دقت و قابلیت اطمینان آن‌ها هستیم.

در سال گذشته، صنعت هوش مصنوعی به‌طور گسترده‌ای به مدل‌های استدلالی روی آورده است، چرا که تکنیک‌های بهبود مدل‌های سنتی شروع به نشان‌دادن بازده کاهشی کرده‌اند. استدلال باعث بهبود عملکرد مدل‌ها در طیف گسترده‌ای از وظایف می‌شود؛ بدون نیاز به مقادیر عظیمی از محاسبات و داده‌ها در طول آموزش. با این حال، به نظر می‌رسد که استدلال ممکن است باعث افزایش توهم شود که یک چالش جدید را ایجاد می‌کند.

  • استارتاپ هندی سیستمی برای اجرای هوش مصنوعی بدون نیاز به کارت‌های گرافیک پیشرفته معرفی کرد
  • بیل گیتس: هوش مصنوعی به کمبود پزشک و معلم پایان می‌دهد!
  • OpenAI با سرمایه‌گذاری 40 میلیارد دلاری به ارزش 300 میلیارد دلار رسید

برچسب‌ها: هوش مصنوعی

امتیاز: 5.0 از 5 (1 رای)
کمی صبر کنید...
تبلیغات
تبلیغات
سرخط خبرها:
  1. ابهام در دسترسی کاربران ایرانی به اسپاتیفای؛ آیا محدودیت‌ها کاهش پیدا کرده است؟
  2. کارشناس حوزه فناوری: به‌روزرسانی روش‌های فیلترینگ همچنان ادامه دارد
  3. نماینده تندرو مجلس: دولت پزشکیان به اینترنت پرو رأی مثبت داد؛ اما علیه آن مصاحبه کرد
  4. اطلاعیه انجمن فین‌تک درباره تحریم صرافی‌های ایران: دارایی کاربران در امنیت است
  5. از بازار سنتی تا اکوسیستم هوشمند؛ «وس» چشم‌ انداز آینده صنعت کالای ساختمانی را ترسیم کرد

مطالب مرتبط ...

  • تقلید استراتژیک سامسونگ از اپل؛ قدرت‌نمایی بیکسبی با Perplexity AI 0

    تقلید استراتژیک سامسونگ از اپل؛ قدرت‌نمایی بیکسبی با Perplexity AI

    Avatarتوسط نیما خردمند · 3 آذر 1404 · 3 آذر 1404

  • 0

    انقلاب در هوش مصنوعی با مدل‌ های جهانی؛ پروژه xAI برای درک دنیای واقعی

    Avatarتوسط مهرانه راجعی · 21 مهر 1404 · 21 مهر 1404

  • 0

    شرکت AMD درخواست Tiny Corp برای بنچمارک کردن Instinct MI300X AI را رد کرد

    Avatarتوسط سوما سبحانی · 3 تیر 1403 · 3 تیر 1403

مطالب گوناگون از دینو

کدام داروها می‌توانند تحمل گرما را سخت‌تر کنند؟

10 فیلم فوق‌ العاده که به شما کمک می کند بچه ها را بهتر درک کنید

چگونه از نشخوار افکار منفی و تجربیات گذشته خودداری کنیم؟

دیدگاهتان را بنویسید لغو پاسخ

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

در صورتی که نظر شما حاوی ناسزا، عبارات توهین‌آمیز و تهدید بوده و در تضاد با قوانین فعلی کشور باشد از انتشار آن بدون حذف موارد ذکر شده، معذوریم.
شکلک‌ها (اموجی‌ها) را می‌توانید با کیبرد گوشی یا کیبرد مجازی ویندوز قرار دهید.
تصاویر نویسندگان دیدگاه از Gravatar گرفته می‌شود.

پربحث‌ترین‌ها

  • اختلال اینترنت در ایران 6

    بهبود کیفیت اینترنت زمان می‌برد؛ مردم صبور باشند!

  • محدودیت پروتکل IPv6 در ایران 3

    بازگشت به عقب در زیرساخت اینترنت؛ سهم پروتکل IPv6 در ایران به صفر نزدیک شد

  • رفع محدودیت اینترنت؛ کاهش فشار روانی 2

    رفع محدودیت اینترنت منجر به کاهش فشار روانی و رونق کسب‌وکارها می‌شود

  • پول خرید اینترنت پرو 2

    پیگیری یک رسانه خبری: اپراتورها پول خرید اینترنت پرو را پس نمی‌دهند

آخرین بررسی‌ها

9.7

بررسی حافظه اس‌اس‌دی SAMSUNG 9100 PRO 2TB

9.3

بررسی مادربرد X870 AORUS STEALTH ICE گیگابایت

8.8

تماشا کنید: بررسی گوشی گلکسی A17 4G سامسونگ؛ اقتصادی تازه‌نفس

8.8

بررسی لپ تاپ MSI Vector 16 HX - اژدهای همه‌فن‌حریف

9.6

تماشا کنید: بررسی Aorus FO27Q3 گیگابایت | بهترین مانیتور گیمینگ 2025؟

آخرین مطالب دینو

انقلاب‌های جهان: مهم‌ترین انقلاب‌های تاریخ که تاثیرات مهمی بر جهان داشتند!

کتاب‌های درسی تاریخ پر از صفحاتی است که انقلاب‌های…

  • حقایقی درباره پنتاگون که ممکن است شما را شگفت‌زده کند

  • 0 تا 100 اجرای روف گاردن در تهران | از طراحی اصولی تا نگهداری

  • 7 مورد از بهترین حرکات یوگا برای تسکین استرس

  • آزادی بیان چیست و چه اهمیتی در جامعه دارد؟

  • مطلب بعدی آهنگ پیشواز همراه اول چگونه فعال میشود (تنظیمات آوای انتظار)
  • مطلب قبلی چطور سرعت پردازنده را در ویندوز و مک چک کنیم؟ (آموزش مرحله به مرحله)
  • آخرین مطالب
  • محبوب‌ترین مطالب
  • ابهام در دسترسی کاربران ایرانی به اسپاتیفای؛ آیا محدودیت‌ها کاهش پیدا کرده است؟

  • کارشناس حوزه فناوری: به‌روزرسانی روش‌های فیلترینگ همچنان ادامه دارد

  • رآی مثبت دولت به اینترنت پرو

    نماینده تندرو مجلس: دولت پزشکیان به اینترنت پرو رأی مثبت داد؛ اما علیه آن مصاحبه کرد

  • اطلاعیه فین‌تک در راستای تحریم صرافی‌های ایران

    اطلاعیه انجمن فین‌تک درباره تحریم صرافی‌های ایران: دارایی کاربران در امنیت است

  • از بازار سنتی تا اکوسیستم هوشمند؛ «وس» چشم‌ انداز آینده صنعت کالای ساختمانی را ترسیم کرد

  • اختلال اینترنت در ایران 6

    بهبود کیفیت اینترنت زمان می‌برد؛ مردم صبور باشند!

  • محدودیت پروتکل IPv6 در ایران 3

    بازگشت به عقب در زیرساخت اینترنت؛ سهم پروتکل IPv6 در ایران به صفر نزدیک شد

  • رفع محدودیت اینترنت؛ کاهش فشار روانی 2

    رفع محدودیت اینترنت منجر به کاهش فشار روانی و رونق کسب‌وکارها می‌شود

  • پول خرید اینترنت پرو 2

    پیگیری یک رسانه خبری: اپراتورها پول خرید اینترنت پرو را پس نمی‌دهند

  • دسترسی نیم‌بند به اینترنت؛ وایت‌لیست‌ها همچنان تعیین‌کننده‌اند! 1

    دسترسی نیم‌بند به اینترنت؛ وایت‌لیست‌ها همچنان تعیین‌کننده‌اند!

آخرین دیدگاه‌ها

  • Avatar
    حسین گفته است:
    معلوم نیست به این واضحی!!!! ایران آمریکایی که میخواست تمدن ایران...
  • Avatar
    ممد کریمی گفته است:
    حقشونه بزارید پولشون هدر بره. چرا وقتی اونا فکر ما نبودن...
  • Avatar
    سید گفته است:
    سلام روی سیستمCori 7 4600 Ram 4 Intel 4400 اجرا میشه...
  • Avatar
    علی محمدیان گفته است:
    بخدا دیگه زشته تو این دوره زمونه،قطع نت بشه،و یه مملکت...
  • Avatar
    آرش گفته است:
    روی همراه اول برای من رفع فیلتر شده!
  • Avatar
    tohid گفته است:
    چون توانایی حمله رو دارم و چون لایق بدترین برخورد ها...
  • Avatar
    tohid گفته است:
    اختیار مال داخل خونه ست. مثلا طرف بره سرشو بزنه دیوار...
  • Avatar
    Mahan گفته است:
    من اشتراک هم خریدم ولا پینگش ضعیفه و بازی بالا نمیاره
  • Avatar
    🌛حقیقت گفته است:
    منم اگ مث .... و خیلی از کارمندای دولت نون مفت...
  • Avatar
    علی گفته است:
    سلام .همراه اول داخل گوگل پلی می‌ره ولی دانلود نمیکنه برنامه...
راهنمای خرید لپ تاپ گیمینگ 471
راهنمای خرید و مشاوره هایلایت
راهنمای خرید لپ تاپ گیمینگ با بودجه های مختلف (دی 1404)
13 دی 1404
راهنمای خرید لپ تاپ با بودجه های مختلف 1,303
راهنمای خرید و مشاوره هایلایت
راهنمای خرید لپ تاپ با بودجه های مختلف (دی 1404)
10 دی 1404
راهنمای خرید مانیتور آذر 1404 70
راهنمای خرید و مشاوره
راهنمای خرید مانیتور با بهترین قیمت در بودجه‌های مختلف (دی 1404)
6 دی 1404
راهنمای خرید گوشی موبایل آذر 491
راهنمای خرید و مشاوره
راهنمای خرید گوشی موبایل بر اساس بودجه‌های مختلف (دی 1404)
5 دی 1404
7,765
راهنمای خرید و مشاوره سیستم پیشنهادی هایلایت
راهنمای خرید و مشاوره سیستم کامپیوتر با بودجه های مختلف (دی 1404)
3 دی 1404
راهنمای خرید و مشاوره هدفون و هدست با بودجه های مختلف (آبان 1404) 0
اخبار و مقالات راهنمای خرید و مشاوره هایلایت
راهنمای خرید و مشاوره هدفون و هدست با بودجه های مختلف (آبان 1404)
27 آبان 1404
  • سخت‌افزارمگ
  • درباره ما
  • تبلیغات
  • استخدام
سخت‌افزارمگ

© 2026 Sakhtafzarmag.Com. All Rights Reserved.

صفحه نخست » اخبار و مقالات » مدل‌ های استدلالی جدید OpenAI بیشتر دچار توهم می‌شوند

ورود

عضویت

رمزتان را گم کرده‌اید؟

عضویت | رمزتان را گم کرده‌اید؟
| بازگشت به ورود