چرا هوش مصنوعی فیزیکی به معماری جدیدی برای مقیاس‌پذیری نیاز دارد؟

هوش مصنوعی در سال‌های اخیر عمدتاً در دنیای دیجیتال رشد کرده است؛ جایی که ورودی می‌تواند متن، تصویر یا صدا باشد و خروجی نیز روی صفحه‌نمایش ظاهر شود. اما ورود این فناوری به دنیای فیزیکی مسئله را تغییر می‌دهد. ربات باید محیط را ببیند، موقعیت اشیا را تشخیص دهد، پیامد حرکت را پیش‌بینی کند و با سرعت و دقت مناسب عملگرهای خود را حرکت دهد.

این حوزه با عنوان Physical AI یا هوش مصنوعی فیزیکی شناخته می‌شود؛ یعنی هوش مصنوعی بخشی از سامانه‌ای است که با جهان واقعی تعامل دارد.

با وجود پیشرفت مدل‌های Vision-Language-Action یا VLA، هرچه مدل‌ها بزرگ‌تر و عمومی‌تر می‌شوند، به داده و توان پردازشی بیشتری نیاز دارند. مدل‌های کوچک‌تر را می‌توان روی خود ربات اجرا کرد، اما انتقال مهارت میان ربات‌ها، محیط‌ها و وظایف مختلف همچنان دشوار است.

دکتر گرگ اومباخ، مدیر ارشد، عضو هیئت‌مدیره و معاون ارشد ایرباس، در مقاله‌ای در Forbes Technology Council استدلال می‌کند که Physical AI به جای تکیه بر یک مدل بزرگ واحد، به معماری ماژولار نیاز دارد؛ معماری‌ای که در آن درک معنایی، فضایی، فیزیکی و کنترل حرکت، نقش‌های مشخصی داشته باشند.

مشکل مدل‌های بزرگ در دنیای واقعی چیست؟

مدل‌های بزرگ در دنیای دیجیتال می‌توانند اطلاعات عظیمی را در یک مدل ترکیب کنند، اما ربات با محدودیت پردازنده، حافظه، باتری، خنک‌کننده و وزن روبه‌رو است.

فرض کنید یک مدل VLA باید از تصویر دوربین تشخیص دهد بطری روی میز است، موقعیت آن را پیدا کند، قصد کاربر را بفهمد و حرکت مناسب برای گرفتن بطری را ایجاد کند. اجرای چنین مدلی روی ربات، به‌ویژه هنگام پردازش مداوم تصاویر با وضوح بالا، انرژی و حافظه زیادی مصرف می‌کند. افزایش GPU در مرکز داده ممکن است راه‌حل باشد، اما برای ربات سیار یا پهپاد عملی نیست.

کوچک‌کردن مدل نیز هزینه دارد. ممکن است توانایی تعمیم آن کاهش یابد و در محیط یا وظیفه‌ای جدید به آموزش مجدد نیاز پیدا کند. بنابراین Physical AI با یک مصالحه روبه‌رو است؛ مدل بزرگ‌تر، توانایی عمومی‌تر اما هزینه محاسباتی بالاتر؛ مدل کوچک‌تر، اجرای محلی آسان‌تر اما تعمیم دشوارتر.

این مسئله با نیاز به تصمیم‌گیری در مقیاس میلی‌ثانیه نیز مرتبط است. ارسال داده به فضای ابری می‌تواند تأخیر و وابستگی به شبکه ایجاد کند؛ بنابراین بخش مهمی از پردازش باید روی ربات یا سخت‌افزار نزدیک به آن انجام شود.

مرز تصویر و هندسه‌ی محیط؛ ربات دقیقاً باید چه چیزی را بفهمد؟

یکی از ایده‌های اصلی مقاله‌ی فوربس، جداکردن درک تصویری از درک هندسی و فیزیکی است.

اگر دوربین ربات یک فنجان را ببیند، تشخیص اینکه «این یک فنجان است» کافی نیست. ربات باید موقعیت، جهت، سطح تماس و پیامد نزدیک‌شدن دست خود را نیز بداند. اینجا درک هندسی یا Geometry Understanding اهمیت پیدا می‌کند.

اما هندسه به‌تنهایی کافی نیست. ربات باید بداند گرفتن لیوان با نیروی زیاد چه پیامدی دارد، کیسه پلاستیکی چگونه تغییر شکل می‌دهد یا کابل هنگام کشیده‌شدن چگونه حرکت می‌کند. درک فیزیکی یا Physical Understanding رابطه میان حرکت و پیامد آن از جمله نیرو، تماس، اصطکاک، تغییر شکل و دینامیک جسم را مدل می‌کند.

در نتیجه، معماری پیشنهادی می‌تواند شامل لایه‌ای معنایی برای فهم شیء و قصد کاربر، مدلی فضایی برای تعیین موقعیت، مدلی فیزیکی برای پیش‌بینی پیامد حرکت و کنترل‌کننده‌ای سریع برای تبدیل این اطلاعات به کنش باشد. در این حالت، حلقه‌ی کنترل مجبور نیست برای هر تصمیم کل تصویر خام را از یک مدل عظیم عبور دهد.

چرا معماری ماژولار برای ربات‌ها مهم است؟

فرض کنید بازوی رباتیک در کارخانه باید پیچ خاصی را باز کند. در معماری یکپارچه، هر تغییر در پیچ، موقعیت قطعه، نور یا نوع بازو ممکن است به داده و اعتبارسنجی جدید نیاز داشته باشد.

در معماری ماژولار، سامانه‌ی معنایی، هدف را تشخیص می‌دهد، سامانه فضایی موقعیت پیچ و ابزار را تخمین می‌زند، مدل دینامیکی پیامد نیروی اعمال‌شده را پیش‌بینی می‌کند و کنترل‌کننده‌ای کوچک، حرکت موتور را تنظیم می‌کند.

اگر بازو تغییر کند، لازم نیست همه چیز از ابتدا آموزش داده شود؛ فقط بخش‌های وابسته به سخت‌افزار یا شرایط جدید تنظیم می‌شوند. این موضوع، اهمیت مفهوم انتقال مهارت یا Skill Transfer را مشخص می‌کند. ارزش واقعی یادگیری زمانی ایجاد می‌شود که مهارتی مانند برداشتن جسم از روی میز، با کمترین آموزش مجدد روی ربات‌ها و محیط‌های دیگر نیز قابل استفاده باشد.

صنعت می‌تواند زودتر از خانه‌ها از Physical AI استفاده کند

اومباخ با اشاره به تجربه‌ی خود در صنعت خودرو می‌گوید در برخی خطوط تولید باتری و قوای محرکه، سطح اتوماسیون به حدود ۸۰ تا ۹۰ درصد رسیده است. او در صنعت هوافضا این میزان را حدود ۲۰ تا ۳۰ درصد توصیف می‌کند؛ تفاوتی که به تنوع قطعات، حجم تولید پایین‌تر و الزامات سخت‌گیرانه‌تر آزمون و تأیید مربوط است. این اعداد ارزیابی شخصی نویسنده‌اند و میانگین کل صنایع محسوب نمی‌شوند.

این تفاوت نشان می‌دهد Physical AI احتمالاً ابتدا در محیطی ارزش اقتصادی ایجاد می‌کند که شامل متغیرهای زیادی مانند مونتاژهای متنوع، جابه‌جایی قطعات، تولید با تیراژ متوسط و برخی فعالیت‌های لجستیکی برای اتوماسیون متداول هستند.

خانه و بیمارستان به دلیل تنوع اشیا، حضور انسان، پیش‌بینی‌ناپذیری، ایمنی، حریم خصوصی و هزینه، مرحله دشوارتری خواهند بود.

خودروهای خودران یک درس مهم برای رباتیک دارند

خودروهای خودران در محیطی فعالیت می‌کنند که جاده، علائم، چراغ‌ها، قوانین و نقشه‌ها چارچوب مشترکی ایجاد می‌کنند. با این حال، توسعه‌ی آن‌ها نیز مرحله‌به‌مرحله و ابتدا در دامنه‌های عملیاتی محدود انجام شد.

ربات عمومی چنین چارچوبی ندارد؛ ممکن است در مدت کوتاهی با مسائل پیش‌بینی نشده‌ی متعددی مواجه شود. بنابراین توسعه‌ی رباتیک احتمالاً نمی‌تواند بر یک مدل بزرگ برای همه‌چیز تکیه کند. ابتدا باید دامنه عملیاتی یا Operational Domain مشخص شود، عملکرد در شرایط واقعی سنجیده شود و سپس تنوع وظایف و محیط‌ها افزایش یابد.

داده‌ی فیزیکی؛ گلوگاه اصلی

مدل‌های زبانی از حجم عظیم متن‌های اینترنتی و مدل‌های تصویری از میلیاردها تصویر و ویدئو استفاده می‌کنند. اما داده‌ای که نشان دهد ربات در موقعیتی مشخص چه کرده، چه نیرویی وارد کرده و چه نتیجه‌ای گرفته، کمیاب و گران است.

نمونه آموزشی مناسب می‌تواند شامل ویدئوی دوربین، وضعیت مفاصل، فرمان‌های حرکتی، موقعیت ربات، اطلاعات تماس با جسم و مقدار نیرو باشد. جمع‌آوری چنین داده‌ای برای هزاران وظیفه و محیط هزینه‌ی زیادی دارد.

شبیه‌سازی بخشی از مشکل را کاهش می‌دهد، اما بازسازی دقیق اصطکاک، جرم، تماس، تغییر شکل و زمان‌بندی حسگرها دشوار است. بنابراین Physical AI به ترکیب داده واقعی، شبیه‌سازی و یادگیری انتقال‌پذیر نیاز خواهد داشت.

چرا پردازش لبه برای ربات حیاتی است؟

گاهی ربات هنگام انجام یک کار باید سریع و با حداقل تاخیر واکنش نشان دهد، بنابراین نباید به اینترنت و پردازش ابری وابسته باشد. به همین دلیل، Edge AI اهمیت دارد، زیرا چابک و قابل اطمینان بودن ربات را افزایش می‌دهد.

پردازش ابری همچنان برای آموزش مدل‌های بزرگ، تحلیل داده و به‌روزرسانی اطلاعات ربات مهم است، اما حلقه‌ی کنترل نباید به اتصال دائمی به آن وابسته باشد.

Physical AI فقط مسئله‌ی مدل نیست؛ بلکه پردازنده، NPU، حافظه، حسگر، سیستم‌عامل، کنترل‌کننده‌ی موتور و ارتباط میان این اجزا نیز بخشی از معماری‌اند. ازاین‌رو صنعت تراشه‌سازی به سمت معماری‌های ناهمگون متشکل از CPU، GPU، DSP و NPU برای فرایندهای چندوجهی و حساس به زمان حرکت می‌کند.

آزمون واقعی Physical AI شاید «یادگیری ۱۵ دقیقه‌ای» باشد

تصور کنید کارگری ماهر وظیفه‌ای را به ربات نشان دهد و ربات طی ۱۵ دقیقه آن را مشاهده، تمرین و اعتبارسنجی کند. این به معنی هوش عمومی کامل نیست، اما می‌تواند هزینه‌ی ساخت و به‌کارگیری مدلهای VLA ربات را به طرز چشمگیری کاهش دهد.

برای رسیدن به این نقطه، ربات باید قصد کاربر را بفهمد، محیط را نمایش دهد، پیامد حرکت را پیش‌بینی کند، عمل را اجرا کند، بازخورد بگیرد و خطا را اصلاح کند. یادگیری سریع زمانی ارزشمند است که مهارت آموخته‌شده قابل انتقال باشد.

ایمنی نباید فقط داخل مدل باشد

مدل هوش مصنوعی ممکن است حرکتی را منطقی بداند، اما سامانه‌ی ایمنی باید مستقل بررسی کند که نیرو، سرعت، محدوده حرکت و حضور انسان قابل قبول است یا نه. در صورت خروج از محدوده، سامانه باید حرکت را اصلاح کند، کمک بخواهد یا متوقف شود.

از آنجا که مدل‌های یادگیری ماشین با عدم‌قطعیت همراه‌اند، معماری Physical AI باید در کنار آن‌ها محدودیت‌های مستقل، کنترل‌کننده‌های قطعی، توقف اضطراری و لایه‌های امنیتی داشته باشد.

امنیت سایبری نیز مستقیماً با ایمنی فیزیکی مرتبط است؛ زیرا دسترسی نرم‌افزار به موتور و عملگر، حفاظت از مدل، داده، فرمان‌ها، به‌روزرسانی‌ها و رابط‌های سخت‌افزاری را ضروری می‌کند.

آیا آینده Physical AI به مدل‌های کوچک‌تر نیاز دارد؟

این بحث به معنی بی‌اهمیت‌شدن مدل‌های بزرگ نیست. آن‌ها همچنان برای درک زبان، برنامه‌ریزی، یادگیری عمومی، تولید داده و آموزش مدل‌های کوچک‌تر کاربرد دارند.

مسئله اصلی، تقسیم کار میان مدل‌ها است. مدل بزرگ در سطح بالا قصد کاربر را بفهمد، مدل فضایی موقعیت اجسام را تخمین بزند، مدل دینامیکی پیامد حرکت را پیش‌بینی کند و کنترل‌کننده‌ای سریع فرمان موتور را تنظیم کند.

بنابراین بحث «مدل بزرگ یا کوچک» نیست؛ بلکه مدل مناسب برای هر لایه از سامانه است. اگر مدل محلی به جای پردازش دائمی همه‌ی تصاویر ورودی، بازنمایی هندسی فشرده‌ای دریافت کند، اجرای آن با سخت‌افزار کم‌مصرف‌تر نیز ممکن می‌شود.

Physical AI از مدل هوش مصنوعی فراتر می‌رود

Physical AI ترکیبی از حسگرها، بینایی ماشین، مدل‌های استدلالی، درک هندسی و فیزیکی، کنترل‌کننده‌ها، سخت‌افزار لبه و لایه‌های ایمنی است. موفقیت آن فقط به دقت مدل بستگی ندارد؛ بلکه میزان تأخیر، انرژی، قابلیت اطمینان، کیفیت حسگر، انتقال مهارت، داده، امنیت و کنترل فیزیکی نیز تعیین‌کننده‌اند.

ممکن است مدلی در آزمایشگاه عملکردی عالی داشته باشد، اما اگر به پردازنده‌ای بزرگ نیاز داشته باشد، برای هر ربات داده اختصاصی بخواهد یا نتواند با تأخیر کم در شرایط واقعی عمل کند، هنوز به فناوری مقیاس‌پذیر رباتیک تبدیل نشده است.

چالش نسل بعدی رباتیک، تبدیل نمایش‌های آزمایشگاهی به سامانه‌هایی است که بتوانند یاد بگیرند، مهارت را منتقل کنند، روی سخت‌افزار واقعی اجرا شوند و در محیط‌های متغیر قابل اعتماد بمانند.

معماری ماژولار پیشنهادی اومباخ یکی از رویکردهای قابل بررسی است. در این معماری، مرزهای مشخص میان درک معنایی، فضایی، فیزیکی، برنامه‌ریزی، کنترل و ایمنی و اجرای هر بخش با سخت‌افزار و سطح محاسبات مناسب تعیین می‌شود.

اگر ربات بتواند با چند دقیقه نمایش، وظیفه‌ای را یاد بگیرد، عملکرد خود را اعتبارسنجی کند و همان مهارت را در ربات یا محیطی دیگر به کار ببرد، رباتیک از پروژه‌های سفارشی و پرهزینه به سکویی نرم‌افزاری و مقیاس‌پذیر تبدیل خواهد شد.

پیش‌تر در ویکی‌ربات، با مدلی موسوم به Gen-1.5 آشنا شدیم که ربات را قادر می ساخت با یکبار دیدن روش انجام کار، آن را یاد بگیرد و جداگانه تکرار کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *