رتبه‌بندی مدل‌های هوش مصنوعی بر اساس تولید اطلاعات نادرست

۷ دی ۱۴۰۴
مطالعه جدید مجله Columbia Journalism Review در مارس 2025 نشان داد که Grok-3 با 94 درصد نرخ توهم (هالوسینیشن)، بدترین عملکرد را در میان هشت مدل هوش مصنوعی آزمایش‌شده داشته است. در این بررسی که بر روی موتورهای جستجوی مبتنی بر هوش مصنوعی انجام شد، پرپلکسیتی با 37 درصد خطا، دقیق‌ترین پاسخ‌ها را ارائه کرده است.