聲學信號還原姿態
在電腦視覺與人機互動領域,如何在不仰賴攝影機的情況下精準捕捉人體動作,一直是備受關注的研究方向。近期一項名為 SoundMHPE 的系統引發學界討論,這套技術嘗試「只靠聲音」還原多人三維姿態,為動態捕捉與感知領域提供了不同於光學或影像式方案的替代路徑。不同於傳統動態捕捉需要穿戴感測器或架設多台攝影機,SoundMHPE 希望從環境中細微的音波變化,推算出人體各關節的位置與動作結構,從而在完全不依賴視覺影像的前提下完成姿態估計。這項技術的核心思路,在於將聲學信號視為一種承載人體運動資訊的載體。
當人體移動或做出各種動作時,身體與衣物、空氣的摩擦、腳步與地面的撞擊、甚至關節活動產生的細微聲音,都會在空間中形成獨特的聲紋。這些聲紋會隨著動作的改變而變化,理論上若能建立聲學特徵與人體姿態之間的映射關係,就能實現「聽音辨位」般的姿態還原。然而,實際操作遠比想像中複雜,尤其是當場景中同時存在多人時,彼此的動作聲紋會在空氣中疊加,形成高度混雜的音訊,讓模型難以區分每一個人的動作細節。為了驗證這條技術路線的可行性,研究團隊投入大量心力建構了一個長達六小時的同步數據集,總共收錄了 432K 幀的姿態與聲學信號對應資料。
這類資料的蒐集難度極高,因為必須同時記錄多人的動作與環境中的音波,並且確保時間軸上的精準對齊。在多人場景下,聲音在空間中反射造成的延遲,會干擾時間序列上的對應關係,進一步增加模型學習的複雜度。這些先天限制正是 SoundMHPE 必須克服的核心挑戰。從技術架構來看,SoundMHPE 系統需要處理的不僅是單一來源的聲學訊號,而是多通道、多反射的複雜聲場。為了從混雜的音訊中分離出不同人的動作特徵,研究團隊可能採用了深度學習中的注意力機制或多模態融合技術,讓模型能夠自動學習哪些頻段或時間片段與特定人物的姿態相關。
儘管來源資料未揭露具體的模型設計細節,但這類研究通常需要結合聲學訊號處理、電腦視覺中的姿態估計網路,以及序列建模技術。這項研究的突破性在於,它將傳統依賴視覺的姿態估計問題,轉化為純聲學的推論問題。一旦這條技術路線能夠持續推進,聲學姿態估計將有機會落地於許多對隱私高度敏感的應用情境。例如在居家照護環境中,長者或病患可能不願被攝影機持續拍攝,但透過麥克風陣列捕捉動作聲音,系統依然能偵測跌倒、異常姿勢或活動量變化,同時保障個人隱私。在智慧空間中,聲學姿態估計可作為人機互動的輔助管道,讓智慧音箱、空調或機器人無需拍攝影像,也能理解使用者的手勢或動作意圖。
此外,這項技術也能為機器人感知環境提供另一條路徑。當機器人在光線不足、煙霧瀰漫或攝影機被遮擋的環境中工作時,傳統視覺方案往往失效,但聲學信號不受光線影響,甚至能穿透部分障礙物。若能搭配麥克風陣列與即時聲源定位,機器人可以在不依賴視覺的情況下,持續追蹤周遭人員的動作,進而更安全地與人類協作。當然,目前 SoundMHPE 仍處於研究階段,距離實際應用還有不少距離。除了多人疊加與反射延遲的挑戰,聲學環境的多變性也是一大考驗。不同材質的地板、牆壁、家具會改變聲音的傳播特性;背景噪音如空調、交通、對話等,也會干擾模型的判斷。
研究團隊需要發展更強健的聲學特徵提取方法,並在更多樣的真實場景中驗證系統的泛化能力。值得一提的是,這項研究的數據集本身也具有重要價值。六小時、432K 幀的同步多模態資料,為後續的學術研究提供了寶貴的訓練與測試資源。其他團隊可以在此基礎上進一步改進模型,或探索聲學與視覺融合的混合方案。從長遠來看,聲學姿態估計或許不會完全取代視覺動捕,但它有機會成為一種互補技術,在特定場景中發揮不可替代的作用。整體而言,SoundMHPE 代表了「聽覺感知」在人體動作理解領域的一次大膽嘗試。它提醒我們,人與環境之間的互動資訊不僅存在於視覺中,聲學信號同樣承載著豐富的運動語義。
當我們能夠正確解讀這些「聲音中的姿勢」,未來的智慧設備將能以更低的隱私代價、更高的環境適應能力,理解並響應人類的行為。這正是這條冷門但具潛力的技術路線,最令人期待的地方。
Related
相關文章

試圖擺脫“變態眼鏡”之名,Meta AI 眼鏡升級後擋住指示燈就立即停止拍攝
作者:清源 責編:清源 評論: 8 月 28 日消息,據外媒 The Verge 今天(28 日)報道,Meta 為旗下 AI 智能眼鏡推出了一項更新,旨在修補一個與拍攝指示燈有關的隱私漏洞。此前,佩戴者在開始錄像後再遮住正面的 LED 指示燈,攝像頭仍能繼續工作。

高德發佈首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,以12幀重建萬幀3D場景
阿里巴巴集團旗下高德發布首個無長程依賴的萬幀級流式3D重建模型ABot-Recon。該模型能以12幀輸入重建萬幀3D場景,為業界首見。此技術突破長程依賴限制,有助於提升3D重建的效能與即時性。

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
作者:故淵 責編:故淵 評論: 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。