تصور کنید رباتی بتواند تنها با چند تصویر، محیطی واقعی را درک کند، بخشهای پنهان آن را حدس بزند و نسخهای قابلکاوش از همان فضا بسازد. شرکت World Labs به رهبری فِیفِی لی (Fei-Fei Li) با معرفی مدل هوش مصنوعی Atlas، در تلاش است چنین قابلیتی را به واقعیت نزدیک کند.
Atlas مدلی چندوجهی است که متن، تصویر، ویدئو و دادههای سهبعدی را در یک زمینه فضایی مشترک پردازش میکند. هدف آن فقط تولید تصاویر واقعگرایانه نیست؛ بلکه بازسازی و شبیهسازی محیطهای سهبعدی و کمک به آموزش و برنامهریزی رباتهاست.
برای فعالیت در دنیای واقعی، ربات باید بداند اشیا کجا قرار دارند، چه شکلی دارند، چقدر با آنها فاصله دارد و تعامل با آنها چه پیامدی خواهد داشت. این توانایی که «هوش فضایی» نامیده میشود، یکی از پایههای مهم Physical AI است.
Atlas چگونه جهان سهبعدی را درک میکند؟
Atlas یک مدل جهان است که از ابتدا برای ترکیب دادههای متنی، تصویری، ویدئویی و سهبعدی آموزش دیده است. برخلاف بسیاری از مدلهای تولید تصویر و ویدئو، ورودیهای آن فقط پیکسل نیستند. Atlas تلاش میکند این دادهها را در ساختاری فضایی و مشترک قرار دهد و محیط را از زاویههای جدید، با حفظ سازگاری سهبعدی، بازسازی کند.
برای نمونه، کاربر میتواند یک یا چند تصویر مرجع و موقعیت دوربین را ارائه دهد تا Atlas همان محیط را از زاویهای دیگر تولید کند. مدل حتی میتواند بخشهای دیدهنشده، مانند پشت یک ربات، را بر اساس اطلاعات موجود استنتاج کند.
البته این خروجی همیشه بازسازی دقیق واقعیت نیست. در نبود داده کافی، Atlas بهترین تخمین ممکن را ارائه میدهد و ممکن است در جزئیات پنهان دچار خطا شود.
Atlas همچنین میتواند با استفاده از چند تصویر، صحنههای واقعی را بازسازی و خروجیهای سهبعدی تولید کند. طبق آزمایشهای World Labs، در برخی موارد دو یا سه تصویر برای بازسازی نسبتاً وفادار کافی است؛ هرچند تصاویر بیشتر، میزان حدسزدن بخشهای پنهان را کاهش میدهد. این مدل میتواند بیش از صد تصویر را نیز در زمینه فضایی خود پردازش کند.
از واقعیت تا شبیهسازی؛ کاربرد Atlas در رباتیک

مهمترین کاربرد Atlas در رباتیک، تبدیل محیط واقعی به شبیهسازی یا Real-to-Sim است.
در روش سنتی، مهندسان محیطها را بهصورت دستی در ابزارهایی مانند Gazebo و Isaac Sim میسازند و سپس ربات را در آنها آموزش میدهند. اما تفاوت میان شبیهساز و دنیای واقعی، از اصطکاک و نور گرفته تا وزن اشیا و تأخیر حسگرها، باعث ایجاد شکاف Sim-to-Real میشود.
World Labs پس از پیوستن شرکت SceniX، چارچوبی به نام Real-to-Sim-to-Real یا R2S2R را تشریح کرد. در این رویکرد، یک وظیفه واقعی ربات به محیطی شبیهسازیشده تبدیل میشود و سپس نسخههای متنوعی از آن برای آموزش و ارزیابی ساخته میشود.
این تغییرات میتواند شامل موارد زیر باشد:
- جابهجایی اشیا
- تغییر نور محیط
- تغییر وضعیت دوربین
- تغییر ظاهر فضا
- تغییر شرایط فیزیکی
به این ترتیب، یک تجربه واقعی میتواند به هزاران تجربه مجازی تبدیل شود و نیاز به آزمایشهای پرهزینه با ربات واقعی کاهش یابد.
بااینحال، Atlas جایگزین کامل شبیهسازهای رباتیک یا سامانههای SLAM نیست. بازسازی ظاهری یک محیط با ساختن جهانی که ربات بتواند از نظر هندسی و فیزیکی به آن اعتماد کند، تفاوت زیادی دارد.
مدل Atlas بیشتر در حوزه تولید، بازسازی و شبیهسازی جهان قرار میگیرد و برای تبدیلشدن به سامانهای کامل، باید در کنار برنامهریز و کنترلکننده ربات به کار رود.
World Labs مدلهای جهان را در سه دسته کلی توضیح میدهد:
- Renderer: تبدیل جهان سهبعدی به تصویر و ویدئو
- Simulator: مدلسازی ساختار، هندسه و رفتار محیط
- Planner: تصمیمگیری بر اساس وضعیت محیط و هدف
مرز میان این دستهها ممکن است در آینده کمرنگ شود، اما Atlas فعلاً بیشتر بر بازسازی و شبیهسازی تمرکز دارد، نه کنترل مستقل ربات.
Atlas در مسیر توسعه World Labs
Atlas ادامه مسیر World Labs پس از Marble است؛ مدلی که میتواند از متن، تصویر، ویدئو یا طرح فضایی، محیطهای سهبعدی قابلکاوش بسازد.
این شرکت اکنون میکوشد تولید محتوای سهبعدی را به شبیهسازی و کاربردهای رباتیک پیوند دهد. جذب یک میلیارد دلار سرمایه در فوریه ۲۰۲۶ و معرفی رباتیک، شبیهسازی علمی و کشف علمی بهعنوان حوزههای هدف نیز نشان میدهد Atlas بخشی از برنامهای گستردهتر است.
اهمیت Atlas فقط در تولید محیطهای سهبعدی از چند تصویر نیست؛ ارزش اصلی آن در اتصال مدل جهان به چرخهی آموزش ربات است. تجربه فیزیکی برای رباتها گران و محدود است و مدلهایی مانند Atlas میتوانند بخشی از این تجربه را در شبیهسازی تولید کنند.
بااینحال، Atlas یکی از قطعات پازل Physical AI است و موفقیت آن به تواناییاش در حفظ دقت هندسی، فیزیکی و رفتاری محیطها بستگی دارد.
رقابت آیندهی رباتیک احتمالاً فقط بر سر ساخت موتور، بازو یا حسگر بهتر نخواهد بود؛ بلکه بر سر ساخت جهانهای مجازیای شکل میگیرد که رباتها بتوانند میلیونها بار در آنها تمرین، اشتباه و یادگیری کنند.
پیشتر در ویکیربات مقالهای در مورد مدل R2S2R منتشر شد که به تفصیل در مورد شبیهسازی جهان واقعی برای پروژه های رباتیک توضیح میدهد.
نظر شما چیست؟ آیا مدلهایی مانند Atlas میتوانند بخش قابلتوجهی از فرایند شبیهسازی و آموزش رباتها را بر عهده بگیرند، یا شکاف میان دنیای مجازی و فیزیکی همچنان مانع اصلی باقی خواهد ماند؟

