هوش مصنوعی در سالهای اخیر عمدتاً در دنیای دیجیتال رشد کرده است؛ جایی که ورودی میتواند متن، تصویر یا صدا باشد و خروجی نیز روی صفحهنمایش ظاهر شود. اما ورود این فناوری به دنیای فیزیکی مسئله را تغییر میدهد. ربات باید محیط را ببیند، موقعیت اشیا را تشخیص دهد، پیامد حرکت را پیشبینی کند و با سرعت و دقت مناسب عملگرهای خود را حرکت دهد.
این حوزه با عنوان Physical AI یا هوش مصنوعی فیزیکی شناخته میشود؛ یعنی هوش مصنوعی بخشی از سامانهای است که با جهان واقعی تعامل دارد.
با وجود پیشرفت مدلهای Vision-Language-Action یا VLA، هرچه مدلها بزرگتر و عمومیتر میشوند، به داده و توان پردازشی بیشتری نیاز دارند. مدلهای کوچکتر را میتوان روی خود ربات اجرا کرد، اما انتقال مهارت میان رباتها، محیطها و وظایف مختلف همچنان دشوار است.
دکتر گرگ اومباخ، مدیر ارشد، عضو هیئتمدیره و معاون ارشد ایرباس، در مقالهای در Forbes Technology Council استدلال میکند که Physical AI به جای تکیه بر یک مدل بزرگ واحد، به معماری ماژولار نیاز دارد؛ معماریای که در آن درک معنایی، فضایی، فیزیکی و کنترل حرکت، نقشهای مشخصی داشته باشند.
مشکل مدلهای بزرگ در دنیای واقعی چیست؟
مدلهای بزرگ در دنیای دیجیتال میتوانند اطلاعات عظیمی را در یک مدل ترکیب کنند، اما ربات با محدودیت پردازنده، حافظه، باتری، خنککننده و وزن روبهرو است.
فرض کنید یک مدل VLA باید از تصویر دوربین تشخیص دهد بطری روی میز است، موقعیت آن را پیدا کند، قصد کاربر را بفهمد و حرکت مناسب برای گرفتن بطری را ایجاد کند. اجرای چنین مدلی روی ربات، بهویژه هنگام پردازش مداوم تصاویر با وضوح بالا، انرژی و حافظه زیادی مصرف میکند. افزایش GPU در مرکز داده ممکن است راهحل باشد، اما برای ربات سیار یا پهپاد عملی نیست.
کوچککردن مدل نیز هزینه دارد. ممکن است توانایی تعمیم آن کاهش یابد و در محیط یا وظیفهای جدید به آموزش مجدد نیاز پیدا کند. بنابراین Physical AI با یک مصالحه روبهرو است؛ مدل بزرگتر، توانایی عمومیتر اما هزینه محاسباتی بالاتر؛ مدل کوچکتر، اجرای محلی آسانتر اما تعمیم دشوارتر.
این مسئله با نیاز به تصمیمگیری در مقیاس میلیثانیه نیز مرتبط است. ارسال داده به فضای ابری میتواند تأخیر و وابستگی به شبکه ایجاد کند؛ بنابراین بخش مهمی از پردازش باید روی ربات یا سختافزار نزدیک به آن انجام شود.
مرز تصویر و هندسهی محیط؛ ربات دقیقاً باید چه چیزی را بفهمد؟
یکی از ایدههای اصلی مقالهی فوربس، جداکردن درک تصویری از درک هندسی و فیزیکی است.
اگر دوربین ربات یک فنجان را ببیند، تشخیص اینکه «این یک فنجان است» کافی نیست. ربات باید موقعیت، جهت، سطح تماس و پیامد نزدیکشدن دست خود را نیز بداند. اینجا درک هندسی یا Geometry Understanding اهمیت پیدا میکند.
اما هندسه بهتنهایی کافی نیست. ربات باید بداند گرفتن لیوان با نیروی زیاد چه پیامدی دارد، کیسه پلاستیکی چگونه تغییر شکل میدهد یا کابل هنگام کشیدهشدن چگونه حرکت میکند. درک فیزیکی یا Physical Understanding رابطه میان حرکت و پیامد آن از جمله نیرو، تماس، اصطکاک، تغییر شکل و دینامیک جسم را مدل میکند.
در نتیجه، معماری پیشنهادی میتواند شامل لایهای معنایی برای فهم شیء و قصد کاربر، مدلی فضایی برای تعیین موقعیت، مدلی فیزیکی برای پیشبینی پیامد حرکت و کنترلکنندهای سریع برای تبدیل این اطلاعات به کنش باشد. در این حالت، حلقهی کنترل مجبور نیست برای هر تصمیم کل تصویر خام را از یک مدل عظیم عبور دهد.
چرا معماری ماژولار برای رباتها مهم است؟
فرض کنید بازوی رباتیک در کارخانه باید پیچ خاصی را باز کند. در معماری یکپارچه، هر تغییر در پیچ، موقعیت قطعه، نور یا نوع بازو ممکن است به داده و اعتبارسنجی جدید نیاز داشته باشد.
در معماری ماژولار، سامانهی معنایی، هدف را تشخیص میدهد، سامانه فضایی موقعیت پیچ و ابزار را تخمین میزند، مدل دینامیکی پیامد نیروی اعمالشده را پیشبینی میکند و کنترلکنندهای کوچک، حرکت موتور را تنظیم میکند.
اگر بازو تغییر کند، لازم نیست همه چیز از ابتدا آموزش داده شود؛ فقط بخشهای وابسته به سختافزار یا شرایط جدید تنظیم میشوند. این موضوع، اهمیت مفهوم انتقال مهارت یا Skill Transfer را مشخص میکند. ارزش واقعی یادگیری زمانی ایجاد میشود که مهارتی مانند برداشتن جسم از روی میز، با کمترین آموزش مجدد روی رباتها و محیطهای دیگر نیز قابل استفاده باشد.
صنعت میتواند زودتر از خانهها از Physical AI استفاده کند
اومباخ با اشاره به تجربهی خود در صنعت خودرو میگوید در برخی خطوط تولید باتری و قوای محرکه، سطح اتوماسیون به حدود ۸۰ تا ۹۰ درصد رسیده است. او در صنعت هوافضا این میزان را حدود ۲۰ تا ۳۰ درصد توصیف میکند؛ تفاوتی که به تنوع قطعات، حجم تولید پایینتر و الزامات سختگیرانهتر آزمون و تأیید مربوط است. این اعداد ارزیابی شخصی نویسندهاند و میانگین کل صنایع محسوب نمیشوند.
این تفاوت نشان میدهد Physical AI احتمالاً ابتدا در محیطی ارزش اقتصادی ایجاد میکند که شامل متغیرهای زیادی مانند مونتاژهای متنوع، جابهجایی قطعات، تولید با تیراژ متوسط و برخی فعالیتهای لجستیکی برای اتوماسیون متداول هستند.
خانه و بیمارستان به دلیل تنوع اشیا، حضور انسان، پیشبینیناپذیری، ایمنی، حریم خصوصی و هزینه، مرحله دشوارتری خواهند بود.
خودروهای خودران یک درس مهم برای رباتیک دارند
خودروهای خودران در محیطی فعالیت میکنند که جاده، علائم، چراغها، قوانین و نقشهها چارچوب مشترکی ایجاد میکنند. با این حال، توسعهی آنها نیز مرحلهبهمرحله و ابتدا در دامنههای عملیاتی محدود انجام شد.
ربات عمومی چنین چارچوبی ندارد؛ ممکن است در مدت کوتاهی با مسائل پیشبینی نشدهی متعددی مواجه شود. بنابراین توسعهی رباتیک احتمالاً نمیتواند بر یک مدل بزرگ برای همهچیز تکیه کند. ابتدا باید دامنه عملیاتی یا Operational Domain مشخص شود، عملکرد در شرایط واقعی سنجیده شود و سپس تنوع وظایف و محیطها افزایش یابد.
دادهی فیزیکی؛ گلوگاه اصلی
مدلهای زبانی از حجم عظیم متنهای اینترنتی و مدلهای تصویری از میلیاردها تصویر و ویدئو استفاده میکنند. اما دادهای که نشان دهد ربات در موقعیتی مشخص چه کرده، چه نیرویی وارد کرده و چه نتیجهای گرفته، کمیاب و گران است.
نمونه آموزشی مناسب میتواند شامل ویدئوی دوربین، وضعیت مفاصل، فرمانهای حرکتی، موقعیت ربات، اطلاعات تماس با جسم و مقدار نیرو باشد. جمعآوری چنین دادهای برای هزاران وظیفه و محیط هزینهی زیادی دارد.
شبیهسازی بخشی از مشکل را کاهش میدهد، اما بازسازی دقیق اصطکاک، جرم، تماس، تغییر شکل و زمانبندی حسگرها دشوار است. بنابراین Physical AI به ترکیب داده واقعی، شبیهسازی و یادگیری انتقالپذیر نیاز خواهد داشت.
چرا پردازش لبه برای ربات حیاتی است؟
گاهی ربات هنگام انجام یک کار باید سریع و با حداقل تاخیر واکنش نشان دهد، بنابراین نباید به اینترنت و پردازش ابری وابسته باشد. به همین دلیل، Edge AI اهمیت دارد، زیرا چابک و قابل اطمینان بودن ربات را افزایش میدهد.
پردازش ابری همچنان برای آموزش مدلهای بزرگ، تحلیل داده و بهروزرسانی اطلاعات ربات مهم است، اما حلقهی کنترل نباید به اتصال دائمی به آن وابسته باشد.
Physical AI فقط مسئلهی مدل نیست؛ بلکه پردازنده، NPU، حافظه، حسگر، سیستمعامل، کنترلکنندهی موتور و ارتباط میان این اجزا نیز بخشی از معماریاند. ازاینرو صنعت تراشهسازی به سمت معماریهای ناهمگون متشکل از CPU، GPU، DSP و NPU برای فرایندهای چندوجهی و حساس به زمان حرکت میکند.
آزمون واقعی Physical AI شاید «یادگیری ۱۵ دقیقهای» باشد
تصور کنید کارگری ماهر وظیفهای را به ربات نشان دهد و ربات طی ۱۵ دقیقه آن را مشاهده، تمرین و اعتبارسنجی کند. این به معنی هوش عمومی کامل نیست، اما میتواند هزینهی ساخت و بهکارگیری مدلهای VLA ربات را به طرز چشمگیری کاهش دهد.
برای رسیدن به این نقطه، ربات باید قصد کاربر را بفهمد، محیط را نمایش دهد، پیامد حرکت را پیشبینی کند، عمل را اجرا کند، بازخورد بگیرد و خطا را اصلاح کند. یادگیری سریع زمانی ارزشمند است که مهارت آموختهشده قابل انتقال باشد.
ایمنی نباید فقط داخل مدل باشد
مدل هوش مصنوعی ممکن است حرکتی را منطقی بداند، اما سامانهی ایمنی باید مستقل بررسی کند که نیرو، سرعت، محدوده حرکت و حضور انسان قابل قبول است یا نه. در صورت خروج از محدوده، سامانه باید حرکت را اصلاح کند، کمک بخواهد یا متوقف شود.
از آنجا که مدلهای یادگیری ماشین با عدمقطعیت همراهاند، معماری Physical AI باید در کنار آنها محدودیتهای مستقل، کنترلکنندههای قطعی، توقف اضطراری و لایههای امنیتی داشته باشد.
امنیت سایبری نیز مستقیماً با ایمنی فیزیکی مرتبط است؛ زیرا دسترسی نرمافزار به موتور و عملگر، حفاظت از مدل، داده، فرمانها، بهروزرسانیها و رابطهای سختافزاری را ضروری میکند.
آیا آینده Physical AI به مدلهای کوچکتر نیاز دارد؟
این بحث به معنی بیاهمیتشدن مدلهای بزرگ نیست. آنها همچنان برای درک زبان، برنامهریزی، یادگیری عمومی، تولید داده و آموزش مدلهای کوچکتر کاربرد دارند.
مسئله اصلی، تقسیم کار میان مدلها است. مدل بزرگ در سطح بالا قصد کاربر را بفهمد، مدل فضایی موقعیت اجسام را تخمین بزند، مدل دینامیکی پیامد حرکت را پیشبینی کند و کنترلکنندهای سریع فرمان موتور را تنظیم کند.
بنابراین بحث «مدل بزرگ یا کوچک» نیست؛ بلکه مدل مناسب برای هر لایه از سامانه است. اگر مدل محلی به جای پردازش دائمی همهی تصاویر ورودی، بازنمایی هندسی فشردهای دریافت کند، اجرای آن با سختافزار کممصرفتر نیز ممکن میشود.
Physical AI از مدل هوش مصنوعی فراتر میرود
Physical AI ترکیبی از حسگرها، بینایی ماشین، مدلهای استدلالی، درک هندسی و فیزیکی، کنترلکنندهها، سختافزار لبه و لایههای ایمنی است. موفقیت آن فقط به دقت مدل بستگی ندارد؛ بلکه میزان تأخیر، انرژی، قابلیت اطمینان، کیفیت حسگر، انتقال مهارت، داده، امنیت و کنترل فیزیکی نیز تعیینکنندهاند.
ممکن است مدلی در آزمایشگاه عملکردی عالی داشته باشد، اما اگر به پردازندهای بزرگ نیاز داشته باشد، برای هر ربات داده اختصاصی بخواهد یا نتواند با تأخیر کم در شرایط واقعی عمل کند، هنوز به فناوری مقیاسپذیر رباتیک تبدیل نشده است.
چالش نسل بعدی رباتیک، تبدیل نمایشهای آزمایشگاهی به سامانههایی است که بتوانند یاد بگیرند، مهارت را منتقل کنند، روی سختافزار واقعی اجرا شوند و در محیطهای متغیر قابل اعتماد بمانند.
معماری ماژولار پیشنهادی اومباخ یکی از رویکردهای قابل بررسی است. در این معماری، مرزهای مشخص میان درک معنایی، فضایی، فیزیکی، برنامهریزی، کنترل و ایمنی و اجرای هر بخش با سختافزار و سطح محاسبات مناسب تعیین میشود.
اگر ربات بتواند با چند دقیقه نمایش، وظیفهای را یاد بگیرد، عملکرد خود را اعتبارسنجی کند و همان مهارت را در ربات یا محیطی دیگر به کار ببرد، رباتیک از پروژههای سفارشی و پرهزینه به سکویی نرمافزاری و مقیاسپذیر تبدیل خواهد شد.
پیشتر در ویکیربات، با مدلی موسوم به Gen-1.5 آشنا شدیم که ربات را قادر می ساخت با یکبار دیدن روش انجام کار، آن را یاد بگیرد و جداگانه تکرار کند.

