گوگل با آپدیت اخیر سرویس Gemini Live، نشان داده که رقابت در حوزه دستیارهای صوتی هوش مصنوعی وارد فاز تازهای شده است. این آپدیت که در نوامبر 2024 منتشر شد، قابلیتهای گفتگویی این دستیار هوشمند را به طرز چشمگیری ارتقا داده و تجربهای نزدیک به مکالمه انسانی را برای کاربران فراهم کرده است.
در واقع، جالبترین بخش این آپدیت توانایی Gemini Live در شناسایی و استفاده از عناصر کلیدی گفتار انسانی مانند آهنگ صدا، سرعت مکالمه و لحن است. با این ویژگی، دیگر نیازی نیست کاربران با صداهای یکنواخت و رباتیک روبرو شوند. Gemini Live اکنون میتواند متناسب با موضوع گفتگو واکنش مناسبی نشان دهد؛ برای مثال، اگر درباره موضوعی استرسزا صحبت کنید، دستیار با لحنی آرام و منظم پاسخ میدهد. این همان چیزی است که مجله تخصصی هوش مصنوعی آرتین همواره پیشبینی میکرد: آیندهای که در آن تعامل با هوش مصنوعی از یک فرآیند مکانیکی به یک تجربه انسانی تبدیل شود.
یکی از قابلیتهای جذاب این آپدیت، کنترل کامل کاربر بر سرعت مکالمه است. حالا میتوانید به Gemini بگویید "سریعتر صحبت کن" تا در کمترین زمان اطلاعات مورد نیازتان را دریافت کنید، یا برعکس، از آن بخواهید با سرعت کمتری توضیح دهد تا یادداشتبرداری کنید. این انعطافپذیری به ویژه برای دانشجویان و افرادی که در حال یادگیری موضوعات پیچیده هستند، بسیار ارزشمند است.
علاوه بر این، Gemini Live اکنون میتواند از لهجههای مختلف استفاده کند و حتی داستانها را با صداهای متنوع و کاراکترهای مختلف بازگو کند. به نظر میرسد گوگل میخواهد تجربه تعامل با هوش مصنوعی را از یک فرآیند خشک به یک سرگرمی جذاب تبدیل کند. تصور کنید که از Gemini بخواهید داستان امپراتوری روم را از زاویه دید خود ژولیوس سزار تعریف کند - و او با لحن و لهجهای مناسب، شما را در آن داستان غرق کند!
با این حال، باید به این نکته اشاره کنیم که Gemini Live هنوز در حال تکامل است و برخی محدودیتها مانند دسترسی به اطلاعات ویدیوهای یوتیوب و یکپارچهسازی کامل با سرویسهای گوگل در حال توسعه است. در عین حال، این سرویس در حال حاضر به بیش از 40 زبان از جمله فارسی، آلمانی و فرانسوی پشتیبانی میکند و کاربران میتوانند حتی در میانه مکالمه بین دو زبان جابجا شوند.
رقابت بین گوگل و OpenAI (با قابلیت Advanced Voice Mode در ChatGPT) اکنون داغتر از همیشه است. اما آنچه Gemini Live را متمایز میکند، ادغام عمیق آن با اکوسیستم گوگل و توانایی حفظ حافظه طولانیمدت مکالمات است. شما میتوانید یک مکالمه را متوقف کنید و ساعتها بعد از همان نقطه ادامه دهید، بدون اینکه نیاز باشد اطلاعات قبلی را دوباره توضیح دهید.
🎯 نکات کلیدی:
- ✅ شناسایی دقیق لحن، ریتم و احساسات در گفتار
- ✅ کنترل سرعت مکالمه توسط کاربر
- ✅ پشتیبانی از بیش از 40 زبان و تعویض زبان در میانه مکالمه
- ✅ قابلیت استفاده از لهجههای مختلف و داستانسرایی با کاراکترها
- ✅ حافظه طولانیمدت و ادامه مکالمات متوقف شده
- ✅ در دسترس برای اندروید و iOS
- ⚠️ برخی قابلیتها هنوز در حال توسعه هستند
مجله تخصصی هوش مصنوعی آرتین
🌐 https://artinmag.ir
📌 اگر این مطلب برای شما مفید بود، آن را با دوستان خود به اشتراک بگذارید. نظرات و پیشنهادات خود را در بخش دیدگاهها با ما در میان بگذارید و با لایک کردن از ما حمایت کنید!
🔔 برای دریافت آخرین اخبار و مقالات تخصصی هوش مصنوعی، عضو کانال مجله آرتین در شبکههای اجتماعی شوید:
🔸 تلگرام و اینستاگرام: @ArtinMag


