本文為繁體中文版。English version: When AI Leaves the Screen: Will We Need a Worker, a Caregiver, or a Companion First?
本站為文字版;含完整圖表的版本請見 Medium 原文。
這個問題對我不是抽象的未來想像。
最近半年,我九十多歲的母親在家中跌倒了幾次。我的姊姊、姊夫一直在照顧她,我們也定期陪她回醫院檢查。家人已經付出很多,但沒有人能一天二十四小時始終站在她身旁。幸好幾次跌倒沒有造成嚴重傷害,卻留下了一個無法迴避的問題:如果當時有一個能持續觀察、及時提醒,並在異常發生後立刻求助的實體AI,結果是否可能不同?
我想到的不是一台取代家人的機器,而是一個補上「人不可能永遠在場」這段空白的系統。
這也是我重新理解Physical AI的起點。它最重要的價值,未必是讓機器像人一樣跳舞、跑步或表演,也不只是下一波資本市場題材。真正值得問的是:當人工智慧離開螢幕、取得身體,它能不能在人類無法持續在場的時刻看見風險、做出回應,並把真正的人帶回現場?
過去幾年,AI的主要成果發生在螢幕裡。它回答問題、寫程式、生成圖像、整理資料。但對一位夜裡起身的老人而言,再聰明的聊天機器人,如果沒有看見她失去平衡,也無法在跌倒後確認是否受傷,那份智慧仍然停留在另一個世界。
現在,AI正開始走出那個世界。
在工廠裡,它被要求搬料、分揀、裝配並連續工作;在家庭市場,它被想像成家務助手;在中國新出現的仿生人產品中,它甚至被包裝成具有表情、記憶與人格的陪伴者。
當AI離開螢幕,人類會先為它的勞動力付費、為家人的安全付費,還是先為它的存在感付費?
一、Physical AI到底多了什麼?
Physical AI、具身智慧與空間智慧經常被混在一起。它們彼此相關,但不完全相同。
李飛飛近年強調的Spatial Intelligence,是AI對三維世界的理解:深度、幾何、物體彼此的位置、運動,以及它們如何在空間中互動。Embodied Intelligence更進一步:智慧不只在模型內推理,而是透過身體與環境互動,在行動和結果之間學習。
Physical AI則是較接近產業化的總稱。它把感知、空間與物理推理、規劃、控制和動作連成閉環,應用可以是人形機器人、自駕車、無人機、工業機械或智慧空間。
生成式AI的循環大致是:
提示 → 模型推理 → 文字、影像或程式碼
Physical AI的循環則是:
感測世界 → 建立物理狀態 → 規劃 → 動作 → 接觸結果 → 發現誤差 → 修正下一步
大型語言模型主要從人類留下的文字、影像、程式碼與數位紀錄中學習。Physical AI面對的則是另一種資料:它不只要知道「杯子」這個詞,也要知道杯子的位置、重量、材質與可抓取部位;手指施力後,杯子會不會滑動、傾倒或破裂;第一次沒抓好,下一步該如何修正。
它的經驗單位不再只是一句話或一張圖,而是一段感知—行動—結果:
看見物體 → 預測結果 → 採取動作 → 感覺接觸 → 觀察成功或失敗 → 修正策略
這使Physical AI更接近人類與動物的成長方式。智慧不只靠閱讀世界,也透過身體進入世界,在成功、失敗與反覆校正中形成。
但機器人不能在現實世界毫無限制地試錯。工廠的一次錯誤可能中斷產線;家庭中的一次錯誤可能打破物品;醫療與照護中的一次錯誤甚至可能傷害人。合理的路徑應是先從人類示範與遙控操作學習,在模擬與數位孿生中練習危險情境,再進入受控實機環境。部署後收集失敗、接管與任務結果,經過審核、訓練和安全驗證,才重新進入現場。
LLM讀取人類留下的世界;Physical AI必須進入世界,並承受自己每一次行動造成的結果。
二、目前發展到哪裡?
今天的人形機器人已經跨過「只能站著展示」的階段。雙足行走、平衡、工廠內導航、固定物件搬運與分揀,在結構化環境中逐漸接近實用。
Unitree表示,2025年實際交付的人形機器人超過5,500台,總產量超過6,500台;UBTECH則在年報中表示,Walker S2已達千台級小規模量產與交付。
這些數字值得重視,但產量不是出貨,出貨不是終端部署,部署也不等於已經創造可持續的生產力。買家可能是工廠,也可能是研究機構、系統整合商、政府示範或展演市場。
模型端同樣快速進步。Google DeepMind的Gemini Robotics已能把視覺與語言指令轉成動作,示範摺紙、裝餐盒、摺衣服等需要精細操作的任務,也能在物件滑落或位置改變後重新規劃。但最強版本仍多處於研究、private preview或合作夥伴測試,而不是已在大量家庭中長期無人監督。
目前較成熟的是移動、辨識與結構化場景中的有限任務;真正困難的仍是五指靈巧操作、接觸物理、跨場景泛化、長時間自主,以及失敗後自行恢復。
模型已開始學會如何做;產業仍在證明它能否每天重複做、低成本做,而且出錯時不需要人來救。
三、中國正在把工廠變成機器人的學校
中國路線最值得注意的,不只是零組件便宜或量產速度快,而是它可能採取了一條和「先造出完美通用機器人」不同的路:先進入結構化產線,先做有限任務,再從大量部署中取得真實資料。
工廠可以調整料架、動線、照明和工作高度來配合機器;任務也可以縮小成搬運特定料箱、分揀固定零件或完成一段重複裝配。機器不必一開始就理解所有人類環境,只要先在一個明確場景中比原來更穩定、更安全或更便宜。
UBTECH Walker S2主打雙電池與自主換電,約三分鐘完成換電,以支援長時間運行。但這只解決能源補充,不能直接等同全天有效自主生產。
「持續工作十幾小時」可能只是持續通電,也可能是持續運動、持續執行固定任務,或在異常發生後仍能自主恢復。企業真正需要衡量的是:
有效自主工時 = 開機時間 × 任務成功率 × 無人接管比例 × 合格率
還要扣除換電、校正、維護、故障恢復和任務切換。
中國正在累積的也許不只是出貨量,而是大量失敗動作、現場異常和人類介入資料。真正稀缺的資料往往不是機器成功了幾次,而是它為什麼失敗、何時需要接管,以及現場如何恢復。只有把這些經驗回收到模型與控制系統,出貨量才可能轉化成學習速度。
工廠不只是市場,也可能成為Physical AI的學校。
四、Tesla能否創造第二個Tesla時刻?
Tesla已經具備多攝影機感知、端側運算、自動標註、模擬、資料閉環、馬達、電池、電力電子和大規模製造能力;更重要的是,它有自己的工廠,可以先成為Optimus的第一個客戶與訓練場。
自駕技術確實能幫助機器人看見和移動。物件辨識、深度與速度估計、遮擋推理、可通行區域、動態物體預測和路徑規劃,都能轉移到機器人。
但兩者有一個根本差異:
自駕主要解決如何不撞到世界;機器人還要解決如何安全地碰觸並改變世界。
汽車的主要控制是方向和速度;機器人卻要一邊保持全身平衡,一邊伸手、施力、抓取、轉動,並根據接觸結果即時修正。行車影片不能取代手指滑動、力量、材質和抓握失敗資料。
因此,Tesla的優勢是真實的,但不能簡化成「有自駕就自然能做好人形機器人」。Optimus仍需證明每小時有效工作成本、無人接管比例、任務切換速度、關節與手部壽命,以及部署增加後是否真的讓整個機器群一起進步。
公司藍圖與已發生的事也必須分開。Tesla的2025年年報仍表示,Bots尚未商業化;2026年資料所列的Optimus設施仍處於建設與大規模生產準備。百萬級或更長期的千萬級產線設計,是產能目標,不是實際產量、外部交付或自主工作時數。
Tesla Moment不會由一場舞蹈或一段剪輯影片證明,只能由長期部署資料證明。
五、真正的瓶頸是手,不只是大腦
馬斯克強調人手的重要性有其道理。門把、杯子、剪刀、工具、衣服和電器,幾乎全部依照人手設計。如果機器人擁有接近人的手,就不必把幾十億個工作與生活環境重新改造成機器專用空間。
但類人外形不等於類人能力。
一隻真正有用的機器手,需要同時具備足夠的自由度、觸覺、力量控制、柔順性和耐用性。自由度只回答「手指能不能到達某個姿勢」,沒有回答它是否知道物體正在滑落、是否抓得太緊,或接觸究竟發生在哪裡。
Queen Mary University of London團隊在2026年7月公布的力致變色觸覺感測器,提供了一個有趣方向。研究團隊讓柔軟材料本身把機械作用轉成顏色:表面受到壓力、拉伸或剪切時,內部微結構改變,反射光形成不同圖樣;普通相機讀取這些變化,就能得到接觸、形變與壓力分布。
機器人的眼睛不只看外部世界,也可以藏在手指裡,用光看見自己的觸覺。
這說明Physical AI的突破不只來自更大的模型,也可能來自材料、光學、感測器、機械結構與控制共同形成的閉環。
22個自由度回答「手能不能像人一樣動」;光學觸覺回答「手能不能像人一樣感覺」。前者沒有後者,機器人可能只是更靈活地盲抓。
六、醫療與照護:Physical AI先延伸人,而不是取代人
談到機器人,人們常先想到取代工廠勞動。但在高齡化社會,更迫切的問題可能不是缺一雙能裝配零件的手,而是缺一個能持續在場的觀察者。
高齡者面對的風險,往往不是一次複雜診斷,而是大量細小但持續的事件:忘記吃藥、重複取藥、夜間起身、逐漸走得更慢、活動量下降,或跌倒後無法呼救。
Physical AI在這裡的第一個價值,是提醒、確認、觀察、記錄、通報,並在需要時連接真人照護者。
既有研究顯示,居家機器式藥物管理系統可以依個人時程配送藥包、記錄漏服並通知照護者,也可能降低例行到宅訪視與服藥管理工時。但界線很清楚:長者較能接受機器提醒服藥,對於由機器決定該吃什麼藥,仍更偏好真人。提醒、給藥、確認服下與醫療決策,不應被混成同一件事。
跌倒也是如此。第一個可行目標不一定是讓機器人把長者抱起來。扶抱與移位涉及高力量、高風險接觸,一次誤判便可能造成二次傷害。
更現實的第一步是:系統發現跌倒或異常後立即用語音確認;長者沒有回應時,依風險通知家屬、照護員、護理站或緊急服務。移動式機器人還可以開燈、保持對話、傳送必要影像或取來電話。
2025年發表的TELEHPAD多中心隨機試驗納入213位護理機構長者,平均年齡約87.7歲。自動遠距監測加個人化二級預防的介入組,每人年均嚴重跌倒為0.24次,對照組為0.49次;至少發生一次嚴重跌倒的比例為20.19%對33.03%。研究支持的不是「機器防止所有跌倒」,而是更早偵測事件,讓照護團隊啟動後續預防。
另一方面,AI預測仍不能被高估。2026年一份系統性回顧納入28項預測社區長者未來跌倒的研究。合併AUC約0.79,但研究間異質性極高,只有一個模型做過外部驗證,而且所有模型都被評為高偏誤風險。穿戴式步態資料也比較像臨床評估的補充,而非替代。
AI負責把日常變化變成可讀的風險訊號;醫療人員、復健師、照護者與長者共同決定如何介入。真正的終點不是預測分數,而是跌倒、傷害、住院和失去獨立生活的時間是否減少。
醫療機器人的另一條路,同樣說明「延伸人」可能比「取代人」重要。Sony的顯微外科原型把醫師手指動作縮小映射到多關節微型器械;SRT-H研究則在離體豬膽囊上,讓機器自主完成膽囊切除中的夾閉與切割步驟,並嘗試從漏抓或器械偏離等失誤恢復。
兩者都不能被寫成「AI已經能自行替病人開刀」。Sony仍是未核准原型;SRT-H不是人類臨床、不是活體,也不是完整手術。但它們共同畫出一條能力階梯:先放大人的動作,再讓機器在明確邊界內完成有限步驟,並確保人能隨時介入。
好的Physical AI不是把責任從人手中拿走,而是在人的感官、時間或生理能力到達極限時,延伸人的看見、觸及與在場。
照護機器人的第一個突破,可能不是把跌倒的人扶起來,而是確保跌倒後不再長時間沒有人知道。
七、從定期檢查走向健康軌跡
現代醫療仍是高齡照護不可取代的核心,但檢查通常發生在特定時間點,九十歲以上長者的狀況卻可能在兩次回診之間慢慢改變。
Physical AI的潛在價值,是把零散的醫療時間點連成一條日常健康軌跡:步行速度、步幅、左右平衡、起身時間、夜間離床、活動量、睡眠與進食型態;在醫療人員指定與使用者同意下,也可以整合血壓、心率、血氧、體重或血糖。
重點不是把長者變成被數據包圍的病人,也不是讓AI自行診斷,而是建立個人基準線,辨識「和她自己平常相比」是否出現持續變化。
一位長者的步行速度逐週變慢、夜間起身增加、白天活動範圍縮小,單一數字可能都沒有超過醫療警戒值;但放在同一條時間線上,可能已經值得家人或醫療人員多看一眼。
日常感測 → 個人基準線 → 趨勢或異常 → 分級確認 → 真人判斷 → 必要介入
如果資料沒有對應的確認方法、責任人與處置流程,再多健康指數只會製造警報疲勞與焦慮。
科學界正積極探討老化能否從根本延緩甚至逆轉;但在生物科技迎來決定性突破之前,Physical AI現階段更務實的定位,是先成為日常健康軌跡的預警系統。
David Sinclair教授提出,細胞逐漸失去身分的表觀遺傳資訊可能是老化的重要原因,並探索這類變化是否具有可逆性。這是一條令人期待的研究路線,但「老化是一種可以治療的疾病」仍是有爭議的主張,不是現行醫學分類共識;實驗室中的重編程、動物壽命或生物標記變化,也不等於已證實能安全延長人類健康壽命。
未來科學或許能延緩甚至逆轉部分老化機制;在那之前,Physical AI可以先幫助我們更早看見能力下降、減少可避免的傷害,並延長長者安全而有尊嚴地生活的時間。
八、人類會先買工人,還是陪伴者?
工業機器人的價值來自有效產出、良率、可用率與投資回收期。家務機器人的門檻更高,因為家庭是高度非結構化環境:兒童、寵物、衣物、玻璃、液體和臨時障礙都會改變任務。
陪伴型仿生人的最低可行產品,卻可能不需要先解決所有家務。它只要能看著你、記得你、回應情緒,以聲音、表情、姿態和適當的主動互動形成存在感。
電腦中的AI等待使用者打開;具身AI可以持續存在於共同空間。它增加的不只是語音,而是目光、距離、姿態、接近和觸碰。陪伴型Physical AI的核心能力未必是最高推理分數,而是Embodied Presence:具身存在感。
但具身存在感越強,治理要求也越高。對孤獨、認知退化或高度依賴照護的長者而言,系統不能刻意模糊「模擬關係」與真人關係的界線,更不能利用依附感推動消費、服從或資料授權。
中國市場已經出現全尺寸仿生陪伴產品的預購熱度。UBTECH在2026年6月底發布U1系列,公開售價從人民幣11.98萬元到99萬元,並宣布累計訂單13,361台。這是值得追蹤的訊號,但截至本文寫作時仍是公司宣布的預售/訂單,不是已完成交付或長期使用資料。
小額訂金只能證明注意力與初步購買意願。真正有意義的證據依序是支付全額、實際交付、三至十二個月留存、訂閱續費、低退貨率,以及可承受的維修成本。
中國市場或許已證明人們願意為「具有身體的AI」付訂金;尚待證明的是,他們是否願意長期與它共同生活。
照護場景還多了一個問題:外形是否越像人越好?對老人而言,一台輪式底盤、溫和聲音、簡單手臂和清楚螢幕的機器,也許比昂貴的全尺寸雙足仿生人更穩定、安全且容易維修。
我們真正需要驗證的,不是完整人形是否最吸睛,而是什麼程度的身體足以提高遵從、安心、互動和求助成功率。
九、真正不能外包給機器的事
Physical AI進入家庭與照護後,收集的將不只是文字,而是最私密的生活資料:人在房間裡如何移動、何時睡覺、吃什麼藥、和誰說話、情緒何時低落,甚至身體如何被觸碰。
這些資料可能讓照護更及時,也可能形成前所未有的監控與操縱能力。因此至少需要幾條不可模糊的界線:
-
長者與家屬知道蒐集什麼、誰能看見,以及保存多久。
-
儘量在裝置端處理原始影像,只傳送必要警訊或經授權摘要。
-
漏報、誤報、斷網和設備故障都有清楚備援。
-
機器不能自行改變藥物或取代合格醫療判斷。
-
情感互動不能利用孤獨、認知退化或依賴誘導消費。
-
使用者隨時能要求停止、離線或呼叫真人。
-
家人不能因為裝了設備,就誤以為現場已經有人即時看守。
科技可以延伸人的在場,卻不能成為人退出關係的藉口。
結論:我們需要的不只是更像人的機器,而是更尊重人的系統
ChatGPT證明機器可以生成人類的語言;Physical AI要證明的,是機器能否理解人類的空間、使用人類的工具,並在沒有人逐步指揮的情況下可靠完成工作。
這個時代不會由第一台會跳舞、摺衣服或擬人對話的機器人開啟。真正的分水嶺,是一個系統首次同時證明有效自主工時、可靠度、單位經濟與規模學習曲線。
但如果只用生產力衡量它,我們可能會錯過Physical AI最重要的價值。
對一位夜裡獨自起身的老人而言,重要的不是機器人的估值、自由度或模型排名,而是它有沒有看見她失去平衡;能不能問一句「你還好嗎」;在沒有回應時,是否知道該找誰;家人趕到之前,它能否讓她知道,已經有人在路上。
機器人未必先以工人的身分進入每個家庭。它可能先成為一個不會忘記提醒、不會忽略求救訊號、能把真人照護者帶回現場的介面;也可能成為一個記得你、看著你、回應你的具身存在。
當AI離開螢幕,我們買下的或許不只是新的勞動力,而是一種新的照護關係。
真正值得期待的,不是機器終於變得像人,而是科技終於有機會在人的能力有限時,幫助我們更長久、更有尊嚴地照顧彼此。
作者註(Author Note)
這篇文章的起點,是作者家庭照護九十多歲母親的親身經驗。本文是一篇關於技術能力、部署經濟、醫療與照護設計、以及社會治理的評論分析;它不是對任何公司或產品的背書,也不是對特定商業化時程的預測。文中刻意把公司聲明、研究原型、預購/訂單、產能規劃、實際交付、長期部署與獨立驗證視為不同層級的證據。
About the Author|關於作者
作者(Po-Sung(Sinclair) Huang)長期關注 Physical AI、機器人、科技策略、高齡照護、醫療科技,以及新興科技對社會所帶來的影響。
Disclosure|利益揭露
本文由作者獨立撰寫,並非受文中任何公司或機構委託、贊助或審閱。作者未因本文的準備或發布而收取文中所討論公司的任何報酬,亦無與本文主題相關的重大財務、顧問、諮詢、研究資助或其他商業關係。
文中提及的公司、產品、研究人員與機構僅供分析,不構成推薦或背書。所有觀點與詮釋均屬作者本人。
Last Editorial Review|最後編輯審閱
最後編輯審閱日期:2026年7月11日
參考資料(References)
-
Stanford HAI, What is Spatial Intelligence?
-
World Labs, About
-
NVIDIA, What is Physical AI?
-
Google DeepMind, Gemini Robotics
-
Tesla, 2025 Annual Report and 2026 company update
-
UBTECH, 2025 Annual Report and Walker S2
-
Sasso et al., High-Resolution Real-Time Mechanochromic Tactile Sensors, Science Advances (2026)
-
Rantanen et al., In-home robotic medication management pilot study
-
Sawadogo et al., TELEHPAD randomized controlled trial
-
Gao et al., ML/DL models for predicting future falls, systematic review and meta-analysis
-
Wu et al., Wearable gait features versus intrinsic fall-risk indicators
-
Sony Group, Microsurgery Assistance Robot
-
Kim et al., SRT-H, Science Robotics (2025)
-
WHO, Healthy ageing and functional ability and clarification on old age in ICD
-
Harvard Medical School, Sinclair Lab
-
Xinhua, UBTECH U1 launch pricing and company-announced orders
延伸閱讀(Further Reading)
-
空間智慧與三維世界理解: Stanford HAI, What is Spatial Intelligence?
-
Physical AI的產業框架: NVIDIA, What is Physical AI?
-
視覺—語言—動作模型: Google DeepMind, Gemini Robotics
-
健康老化與功能能力: WHO, Healthy ageing and functional ability
-
跌倒偵測與二級預防證據: Sawadogo et al., TELEHPAD randomized controlled trial
-
跌倒預測模型的限制: Gao et al., Systematic review and meta-analysis
-
自主外科機器人的能力邊界: Kim et al., SRT-H, Science Robotics (2025)
免責聲明(Disclaimer)
本文僅供一般資訊與教育用途,不構成醫療、臨床、投資、法律、工程安全或緊急應變建議。文中的公司數據可能來自公司自行揭露、預售/訂單公告或前瞻性規劃;產品可用性、效能、法規狀態與研究證據都可能改變。涉及高齡照護、跌倒偵測、藥物管理、手術、身體接觸或緊急通報的決策,應由合格專業人員評估,並設計適當的真人監督、故障備援與責任流程。發生緊急狀況時,請聯絡所在地的緊急服務。