A Tutorial on GeoAI: Designing Footprint Extraction from NAIP Imagery Using U-Net, Grounding DINO, SAM, and Mask R-CNN
重點摘要
本教學示範如何從高解析度NAIP航照影像中提取建築物足跡,涵蓋從環境設置、資料下載、圖像切割到模型訓練的完整工作流程。使用U-Net(ResNet-34編碼器)進行語義分割,並與Grounding DINO、SAM及預訓練Mask R-CNN進行零樣本與實例分割比較。最後將預測遮罩轉換為正規化建築物多邊形,並計算IoU與F1指標。
### GeoAI新教程:結合U-Net、Grounding DINO、SAM與Mask R-CNN實現高精度建築物足跡提取
地理空間人工智慧(GeoAI)領域近期出現一套完整的端到端工作流程,專門針對從高解析度航拍影像中提取建築物足跡。該教程由一群技術專家設計,涵蓋從環境配置、資料下載、模型訓練到推論評估的每一個環節,並整合了多種深度學習架構,包括U-Net、Grounding DINO、SAM以及Mask R-CNN。這項工作不僅展示了傳統語意分割的應用,還探索了零樣本分割以及預訓練實例分割模型的效能,為地理空間資料分析樹立了現代化的實作典範。 整份教程以NAIP(國家農業影像計畫)高解析度航拍正射影像作為主要資料來源,並搭配對應的建築物標籤向量資料。研究團隊首先建立一個基於Python的地理空間深度學習環境,安裝必要的套件如`geoai-py`、`segmentation-models-pytorch`與`buildingregulariser`,並確認GPU加速的可用性。在Colab環境中,若無偵測到GPU,訓練速度會大幅下降,因此作者建議使用者啟用T4 GPU運行時。 環境準備完成後,第一步是下載樣本資料。團隊從Hugging Face資料集下載了訓練用的NAIP RGB影像(`naip_rgb_train.tif`)、建築物足跡向量(`naip_train_buildings.geojson`)以及測試影像(`naip_test.tif`)。接著進行資料檢查,利用`geoai`套件提供的函式讀取光柵影像的資訊,包括座標參考系統、維度、波段統計,以及向量資料的欄位結構與幾何類型。視覺化環節中,建築物標籤以黃色邊框疊加在影像上,並提供互動式地圖供進一步探索。 為了讓模型能夠有效學習,團隊將原始NAIP影像切割成固定大小的地理參考圖塊(chips)。每個圖塊尺寸設為512×512像素,步長為256像素,並在標籤遮罩中保留建築物輪廓的緩衝區。切塊後,系統會統計包含建築物的圖塊比例以及前景像素數量,並以6×6的網格展示訓練樣本。這一步驟確保了資料能夠符合模型輸入格式,同時維持空間解析度。 訓練階段採用U-Net架構,並以ResNet-34作為編碼器,預訓練權重來自ImageNet。模型配置包括3個輸入通道(RGB)、2個輸出類別(背景與建築物)、批次大小為8、學習率0.001,最多訓練12個epoch,並保留20%資料作為驗證集。訓練過程中,程式會自動儲存最佳檢查點,並在驗證IoU(交並比)連續5個epoch未改善時提前停止。最終模型檔案大小約為數十MB。 訓練完成後,團隊繪製了損失曲線與IoU曲線,以診斷模型是否過擬合或欠擬合。若驗證損失上升而訓練損失下降,表示過擬合;若兩者均平坦且高,則需增加epoch數或改用更大的編碼器。他們記錄到最佳驗證IoU出現在第幾個epoch,這為後續的模型選擇提供了依據。 接著,他們將訓練好的U-Net應用於未見過的測試場景。由於測試影像可能比訓練圖塊大,團隊採用滑動窗口推論(sliding-window inference),窗口大小與重疊率與訓練時的切塊參數一致。推論結果會輸出為二值化遮罩,並進一步透過後處理轉換為乾淨、規則化的建築物多邊形,同時計算IoU和F1分數作為評估指標。 除了語意分割,教程還探索了零樣本分割的潛力。他們使用Grounding DINO進行開放詞彙目標檢測,結合SAM(Segment Anything Model)對建築物進行分割,無需任何訓練資料即可直接對測試影像進行推論。這項技術展示了強大的泛化能力,但作者也指出,在特定領域中,其精確度可能仍不如專門訓練的模型。 另外,團隊也載入了一個預訓練的Mask R-CNN實例分割模型,並將結果與U-Net進行比較。Mask R-CNN能夠同時輸出邊界框與實例遮罩,適合需要區分個別建築物的場景。透過比較,讀者可以了解不同架構在建築物足跡提取任務上的優缺點。 最後,教程展示了如何將同樣的管線擴展到真實世界區域。他們使用Microsoft Planetary Computer上的NAIP影像以及Overture Maps提供的建築物標籤,重複執行相同的切塊、訓練、推論流程,證明該方法具有可複製性與實用性。研究團隊還將所有配置參數集中管理,包括圖塊大小、步長、學習率、訓練epoch數等,讓使用者可以輕鬆調整以適應不同資料集。 整體而言,這套GeoAI工作流程不僅涵蓋了深度學習模型訓練的標準步驟,更整合了資料處理、視覺化、後處理、零樣本分割以及多模型比較,為地理空間資訊從業者提供了一份詳實的參考藍圖。從環境安裝到最終成果評估,每一個環節都有具體的程式碼與說明,顯示出GeoAI在建築物提取任務上的成熟度與靈活性。隨著遙測資料與開放地理資料的快速增長,這類端到端的解決方案將有助於加速城市規劃、防災減災與環境監測等領域的應用。
Related
相關文章
微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換
AI資訊AI新閒資訊正文微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘科技媒體 TestingCatalog 報道,微軟正在測試其首款原生實時語音模型 MAI Realtime。
京東外賣發佈智能頭盔
京東外賣發佈AI智能頭盔:支持語音接單、路線導航和訂單備註提醒AIbase基地發佈於AI新聞資訊 · 1 分鐘閱讀 · Aug 3, 202642京東外賣宣佈推出 AI 智能頭盔,並將於近期陸續投入使用。首批產品將免費發放給京東全職騎手,後續逐步覆蓋全體騎手。新設備集成 AI 語音助手、智能路線規劃、商戶環境核驗和訂單備註提醒等功能,旨在提升配送效率、騎手安全及用戶服務體驗。
深度搜索終端代理開源
深度搜索終端代理開源。 團隊把深度搜索帶進了命令行終端⚙️。項目提供了終端命令行搜索代理項目源碼。這個代碼庫目前已獲得(29.9k)贊。它主要依靠前綴緩存安定常駐終端。

京東首次在校招流程中引入 AI 面試,面向 2027 年度本科、碩博研究生畢業生開啟網申
京東今日正式宣布開啟2027年度校園招聘,面向2027屆本科、碩博研究生畢業生開放網申通道。與往年相比,本年度校招最顯著的變化在於,京東首次在招聘流程中引入AI面試環節,這標誌著這家電商巨頭在人才選拔數字化轉型上邁出新的步伐。 據了解,本次校招崗位方向覆蓋採銷、物流、技術、產品、運營、設計、健康、工程、職能、保險與金融、市場與商務等多個領域,幾乎囊括了京東現有業務板塊的核心人才需求。無論是面向業務前線的採銷與物流崗位,還是面向技術底座的研發與產品崗位,都向2027屆畢業生敞開大門。

把學習筆記變為遊戲,谷歌 Gemini Notebook 新功能曝光
據外媒爆料,谷歌正在為 AI 筆記應用 Gemini Notebook 開發互動遊戲、可視化儀表等新功能,讓學習像玩遊戲一樣有趣。#谷歌Gemini# 未來可在筆記中直接創建閃卡、思維導圖等學習工具,所有內容與筆記本隔離。

訊飛 AI 眼鏡體驗:翻譯成熟完善,AI 助理近在眼前
AI 眼鏡賽道愈發火熱,科大訊飛今年 5 月推出了首款訊飛 AI 眼鏡,主打全場景翻譯功能。本文分享了實測體驗,這款眼鏡翻譯能力成熟,還加入了 AI 助理構建完整能力閉環。#科大訊飛AI眼鏡#