پرش به محتوا

ربات انسان‌نما با GPT-6 Astra؛ پروژه HomeBody استنفورد آشپزخانه را مرتب کرد

ربات انسان‌نما با GPT-6 Astra در پروژه HomeBody استنفورد، آشپزخانه‌ای ناآشنا را کاوش و مرتب کرد؛ معماری، مهارت‌ها، محدودیت‌ها و معنای آن برای کاربران.

اخبار ۶ مهر ۱۴۰۵| ۷ دقیقه مطالعه
ربات انسان‌نما با GPT-6 Astra؛ پروژه HomeBody استنفورد آشپزخانه را مرتب کرد

پژوهشگران دانشگاه استنفورد و کالتک سیستمی به نام HomeBody معرفی کرده‌اند که در آن مدل GPT-6 Astra شرکت OpenAI مستقیم «مغز» یک ربات انسان‌نما می‌شود. این ربات انسان‌نمای Unitree G1 وارد آشپزخانه‌ای می‌شود که هرگز ندیده، آن را می‌گردد، به خاطر می‌سپارد و بعد با یک دستور ساده مثل «آشپزخانه را مرتب کن» کار را خودش انجام می‌دهد.

نکته مهم این پروژه، که ۵ مهر ۱۴۰۵ (۲۷ سپتامبر ۲۰۲۶) منتشر شد، حذف یک لایه کلیدی از معماری رایج ربات‌هاست: به‌جای آموزش یک مدل کنترلی جداگانه برای هر محیط، خود مدل زبانی بزرگ از میان مجموعه‌ای از مهارت‌های آماده انتخاب می‌کند که ربات چه کند.

خلاصه در یک نگاه
  • پروژه HomeBody از آزمایشگاه Movement Lab دانشگاه استنفورد با همکاری کالتک است.
  • مدل GPT-6 Astra بدون لایه میانی VLA، مستقیم ربات Unitree G1 را هدایت می‌کند.
  • ربات ابتدا محیط را می‌گردد و یک «همزاد دیجیتال» از آشپزخانه در شبیه‌ساز Isaac Sim انویدیا می‌سازد.
  • کار ربات بر پنج مهارت پایه استوار است: حرکت، برداشتن، گذاشتن، باز کردن کشو و برداشتن از داخل کشو.
  • کد پروژه روی گیت‌هاب منتشر شده، اما کندی پاسخ مدل و داغ شدن موتور انگشت‌ها هنوز مانع جدی است.

پروژه HomeBody چیست؟

این پروژه کار گروهی پنج‌نفره است: Gio Huh از کالتک و Cayden Gu، Takara E. Truong، C. Karen Liu و Guy Tevet از استنفورد. عنوان رسمی آن «HomeBody: رباتی انسان‌نما که کاوش می‌کند، به خاطر می‌سپارد و خودش عمل می‌کند» است.

هدف تیم این بود که به مدل‌های پیشرفته بینایی‌ـ‌زبان (VLM؛ مدل‌هایی که هم تصویر می‌فهمند و هم متن) یک «بدن» بدهند، آن هم بدون آموزش ویژه برای هر خانه و بدون یادگیری سیاست کنترلی تازه. به بیان ساده‌تر، ربات قرار است در خانه‌ای که اولین بار می‌بیند، کار کند.

تفاوت HomeBody با معماری معمول ربات‌ها

در بیشتر ربات‌های امروزی، یک مدل زبانی به‌عنوان «سیستم ۲» (بخش فکر و برنامه‌ریزی) دستور کلی می‌دهد و یک مدل دیگر به نام VLA (مدل بینایی‌ـ‌زبان‌ـ‌عمل) به‌عنوان «سیستم ۱» آن را به حرکت‌های ریز موتورها تبدیل می‌کند. این لایه دوم معمولاً باید با داده‌های فراوان آموزش ببیند.

تیم استنفورد این زنجیره را کنار گذاشته است. در HomeBody، مدل GPT-6 Astra به‌جای تولید فرمان‌های سطح پایین، از طریق فراخوانی ابزار (Tool Call) یکی از مهارت‌های آماده را انتخاب و اجرا می‌کند؛ درست شبیه کاری که یک دستیار هوش مصنوعی هنگام استفاده از افزونه‌ها انجام می‌دهد.

مقایسه معماری رایج VLM و VLA با معماری HomeBody که مدل زبانی را مستقیم به مهارت‌های ربات وصل می‌کند
مقایسه معماری سنتی (مدل زبانی + VLA) با رویکرد HomeBody — منبع: Stanford TML

ربات انسان‌نما با GPT-6 Astra چطور کار می‌کند؟

فرایند کار HomeBody سه مرحله اصلی دارد:

  1. کاوش: ربات در محیط می‌چرخد و با دوربین عمق، لیدار (حسگر لیزری فاصله‌سنج) و حتی یک ویدیوی واید آیفون، داده جمع می‌کند. نقاط مسیر را هم خود Astra انتخاب می‌کند.
  2. ساخت همزاد دیجیتال (Real2Sim): از روی این داده‌ها، مدلی سه‌بعدی از آشپزخانه در شبیه‌ساز Isaac Sim ساخته می‌شود تا مدل زبانی بداند هر چیز دقیقاً کجاست. این نقشه نقش «حافظه مکانی ماندگار» ربات را دارد.
  3. اجرای مهارت‌ها: مدل Astra با دیدن تصویر دوربین، نقشه و وضعیت دست‌ها، مهارت مناسب را صدا می‌زند.

کتابخانه مهارت‌ها پنج عضو دارد: حرکت به یک نقطه، برداشتن شیء، گذاشتن شیء، باز کردن کشو و برداشتن چیزی از داخل کشو. اگر گرفتن یک شیء شکست بخورد، سیستم چند بار به‌صورت محدود دوباره تلاش می‌کند و اگر باز هم موفق نشد، دلیل شکست را به مدل زبانی گزارش می‌دهد تا تصمیم بعدی را بگیرد.

مهارت «برداشتن از داخل کشو» در ربات Unitree G1 — منبع: Stanford TML

دو آزمون اصلی: مرتب کردن آشپزخانه و آوردن دارو

پژوهشگران دو سناریوی واقعی را نشان داده‌اند. در اولی از ربات خواسته شد همه کیسه‌های قهوه را وسط میز جمع کند و کارتن‌های شیر و آب‌پرتقال خراب را دور بیندازد. در دومی جمله این بود: «داروهایم را جا گذاشتم، برایم می‌آوری؟ سر راه کارتن خراب را هم دور بینداز.»

سناریوی دوم جالب‌تر است؛ چون دارو داخل کشو و دور از دید بود و ربات باید از حافظه‌اش جای آن را پیدا می‌کرد، کشو را باز می‌کرد و تصمیم می‌گرفت با دست چپ یا راست کار کند. البته صفحه رسمی پروژه نرخ موفقیت یا زمان انجام کارها را به‌صورت عددی منتشر نکرده است.

سخت‌افزار و محدودیت‌ها

مدل GPT-6 Astra روی سرورهای OpenAI اجرا می‌شود و ربات از راه دور با آن در ارتباط است. بقیه کارها، یعنی مهارت‌ها، ادراک تصویری و برنامه‌ریزی حرکت، روی یک لپ‌تاپ Razer Blade با کارت گرافیک RTX 4090 انجام می‌شود. کنترل بازوها با فرکانس ۲۵۰ هرتز و کنترل تعادل و راه رفتن با ۵۰ هرتز به‌روز می‌شود.

خود پژوهشگران صادقانه به چند محدودیت اشاره کرده‌اند:

  • ساخت همزاد دیجیتال زمان راه‌اندازی و هزینه API را بالا می‌برد.
  • تأخیر استدلال مدل Astra باعث مکث میان مهارت‌ها می‌شود.
  • طول کارها به برد دست ربات و دوام سخت‌افزار، از جمله داغ شدن سروموتورهای انگشت‌ها، محدود است.
  • بخش محلی سیستم فعلاً به یک پردازنده گرافیکی RTX 4090 نیاز دارد.

سایت The Decoder هم یادآوری کرده که آزمون‌های قبلی، مشکلات ایمنی را در زمانی که Astra کنترل یک ربات را در دست دارد نشان داده بودند. این موضوع با بحث‌های اخیر درباره رفتار پیش‌بینی‌نشده عامل‌های هوش مصنوعی هم‌خوان است؛ ماجرایی که در مطلب توقف آموزش مدل‌های OpenAI و عامل‌های سرکش به آن پرداختیم.

چرا این خبر مهم است؟

تا امروز ساختن رباتی که در هر خانه‌ای کار کند، به داده‌های آموزشی عظیم و مدل‌های کنترلی گران نیاز داشت. پروژه HomeBody نشان می‌دهد مدل‌های زبانی همه‌منظوره آن‌قدر در استدلال فضایی پیشرفت کرده‌اند که با یک جعبه‌ابزار کوچک از مهارت‌ها، می‌توانند نقش برنامه‌ریز اصلی ربات را بازی کنند. به گزارش The Decoder، شرکت OpenAI هم برنامه بازگشت به حوزه رباتیک، از جمله ربات‌های شخصی، را اعلام کرده است.

با این حال این هنوز یک نمونه پژوهشی است، نه محصولی که بشود خرید. تا ربات خدمتکار خانگی مطمئن و ارزان راه زیادی مانده است.

این خبر برای کاربر ایرانی چه معنایی دارد؟

  • مدل همان است که در ChatGPT دارید: مدل GPT-6 Astra از ۱۲ شهریور ۱۴۰۵ معرفی شد و طبق گزارش TechCrunch برای پلن‌های پولی Plus، Pro، Business و Enterprise و همچنین API در دسترس قرار گرفت.
  • کد پروژه باز است: دانشجویان و پژوهشگران رباتیک می‌توانند کد HomeBody را از گیت‌هاب ببینند و ایده «مدل زبانی + کتابخانه مهارت» را در پروژه‌های خودشان، حتی در شبیه‌ساز، امتحان کنند.
  • درس برای توسعه‌دهندگان عامل هوش مصنوعی: همین الگو، یعنی سپردن تصمیم‌گیری به مدل و محدود کردن اجرا به چند ابزار امن و تعریف‌شده، در ساخت عامل‌های نرم‌افزاری هم بهترین رویکرد است.

جمع‌بندی

پروژه HomeBody یکی از روشن‌ترین نمونه‌ها از ورود مدل‌های زبانی پیشرفته به دنیای فیزیکی است: رباتی که خانه را می‌شناسد، به خاطر می‌سپارد و با زبان معمولی فرمان می‌گیرد. برای مقایسه GPT-6 با رقبایش می‌توانید مقایسه GPT-6 Sol و Luna با Claude Opus 5.5 را بخوانید، و اگر می‌خواهید خودتان با جدیدترین مدل‌ها کار کنید، اشتراک‌های قانونی ChatGPT، Claude و Gemini را ببینید.

سؤالات متداول

پروژه HomeBody چیست؟

پروژه HomeBody سیستمی از دانشگاه استنفورد و کالتک است که مدل GPT-6 Astra را مستقیم به ربات انسان‌نمای Unitree G1 وصل می‌کند تا ربات بدون آموزش ویژه، در محیط ناآشنا کارهای چندمرحله‌ای مثل مرتب کردن آشپزخانه را انجام دهد.

آیا GPT-6 Astra داخل خود ربات اجرا می‌شود؟

خیر. مدل GPT-6 Astra روی سرورهای OpenAI اجرا می‌شود و ربات از راه دور با آن ارتباط دارد؛ مهارت‌ها و پردازش تصویر روی یک لپ‌تاپ با کارت گرافیک RTX 4090 انجام می‌شود.

آیا می‌توان ربات HomeBody را خرید؟

خیر. این پروژه یک نمونه پژوهشی است و محصول تجاری نیست؛ فقط کد آن روی گیت‌هاب منتشر شده است.

مدل VLA چیست و چرا HomeBody آن را حذف کرده است؟

مدل VLA (بینایی‌ـ‌زبان‌ـ‌عمل) لایه‌ای است که دستور کلی را به حرکت موتورها تبدیل می‌کند و به آموزش سنگین نیاز دارد. در HomeBody به‌جای آن، مدل زبانی مستقیم از میان پنج مهارت آماده انتخاب می‌کند.

کاربران ایرانی چطور به GPT-6 Astra دسترسی دارند؟

مدل GPT-6 Astra در پلن‌های پولی ChatGPT مثل Plus و Pro و از طریق API عرضه شده است؛ کاربران ایرانی برای استفاده از آن به یک اشتراک پولی معتبر ChatGPT نیاز دارند.

منابع: صفحه رسمی پروژه HomeBody (Stanford TML)، کد پروژه در گیت‌هاب، گزارش The Decoder، گزارش TechCrunch درباره معرفی Astra

اشتراک‌گذاری: تلگرام واتس‌اپ

همین الان امتحانش کن

اشتراک قانونی ChatGPT، Claude و Gemini — خرید آنلاین و تحویل سریع

مشاهده اشتراک‌ها

مطالب مرتبط

سؤال داری؟ گفتگو با پشتیبانی