
烏克蘭前線靠聲音偵測無人機,能拿來訓練的樣本只有 1.1 小時。
三份資料按照時間與地點切開:訓練集錄於非戰區試場,驗證集錄於冬季,測試集錄於春季、全部來自實際交戰區。同一個模型在驗證集的 F1 是 98.18%,測試集是 82.22%。
一支麥克風架在離地約一公尺的地方,位置在前線。它錄到人講話、音樂、機具運轉,還有戰場上各式各樣的雜訊,偶爾有無人機從頭上飛過去。錄音以九秒為單位切開,由人一段一段聽過去標記。
標完之後,被歸為「小型無人機」的片段有 441 段,加起來 1.1 小時。
這批資料屬於 Zvook,一家設在利維夫的聲學偵測公司,把麥克風佈在通訊塔和前線陣地上,聽出空中有什麼。2026 年 5 月在英國巴斯舉行的 ICMCIS 軍事通訊與資訊系統研討會上,Zvook 與基輔理工學院、基輔經濟學院的研究者發表了一篇論文,用的正是這些來自烏克蘭前線、訓練場與現役防空聲學感測器的錄音,全部資料超過三十萬段、取樣率 32 kHz。
被動聲學的長處與代價
麥克風不發射任何訊號,不會因為自己開機而被找到,也不受電子干擾影響。它不需要視線,樹林、夜間、遮蔽物都不妨礙。設備不像紅外線或雷達那樣需要專用硬體,成本低、便於量產,可以大量佈設。代價是有效距離短,而且環境裡所有聲音都會一起進來。
在一場雙方都大量使用小型無人機、電磁環境又極度擁擠的戰爭裡,這幾項特性讓被動聲學成為多層防禦的前端。論文作者也把北約邊境監視列為同一類應用場景。
只用前線資料訓練,模型幾乎一律不報。
研究者的第一次嘗試是最直覺的做法:拿目標環境的資料,訓練目標環境要用的模型。可用的材料就是那 441 段無人機,加上同一支麥克風錄的 2,519 段環境噪音。
結果是作者所說的模型崩潰。測試集上 F1 只有 17.4%,精確率 87.7%,召回率不到一成。它開口說有無人機的時候幾乎都對,但大部分飛過去的無人機它不出聲。
塔上的六萬五千段錄音,和它帶進來的新問題。
另一批資料來自架在通訊塔上的麥克風,高度 10 到 40 公尺。這批多得多:論文主要使用的小型訓練集裡,塔上資料共 65,126 段,其中光環境噪音就有 50,000 段、125 小時,此外還有長程無人機(以 Shahed 類為主)4,758 段、噴射機 6,012 段、直升機 2,559 段、螺旋槳飛機 1,797 段。
兩支麥克風錄到的聲音差得很遠。塔上的位置高、環境穩定,背景是機械振動、風聲、動物叫聲。前線那支貼著地面,收進來的是人聲、音樂、機具與戰場雜訊,低頻能量強得多,起伏也不規則。兩種硬體的頻率響應本來就不一樣。
作者用對抗驗證把這件事量出來:另外訓練一個模型,專門判斷一段噪音錄自哪一支麥克風。基準模型在驗證集上的 ROC AUC 是 99.99%,也就是幾乎每一段都分得出來。直接把兩邊混在一起訓練,模型會去記住塔上的背景質地。
一項一項疊上去
論文把塔上資料當輔助材料用,做法逐項加上去,每一項都回報測試集的 F1。
把塔上資料連同它的四個類別(長程無人機、噴射機、直升機、螺旋槳飛機)一起放進訓練,F1 從 17.4% 升到 49.8%。這些飛行器佔用的頻段與小型無人機重疊,模型必須分辨糾纏在一起的諧波結構才能過關,光靠能量高低不夠。
隨機權重平均(SWA)把不同訓練週期的權重平均起來,壓掉驗證指標在週期之間的震盪,F1 再升 9.9 個百分點,來到 59.7%。
接著是噪音混入式的 Mixup:把來源域或目標域的噪音以最多 0.3 的比例混進訓練音檔,標籤保持原樣,等於合成出一批低訊噪比的樣本,同時把塔上的表徵往前線的聲音空間拉。59.7% 到 75.6%,資料增強裡幅度最大的一步。
再來是 RMS 遮罩。作者發現模型偏好整段音檔裡能量最強的地方,於是找出能量最高的 2 秒區間,隨機挖掉其中 0.3 到 1.0 秒換成噪音,從第 5 個訓練週期開始,遮罩長度隨訓練逐步加大。驗證集 F1 從 83.2% 升到 90.6%,測試集則從 75.6% 微降到 75.2%,模型被迫去聽整段裡較弱的諧波。
頻率投影器處理的是另一件事。原架構在頻率軸上做廣義平均池化,把整個頻譜壓成單一數值;低頻噪音一強,無人機的基頻就被蓋掉。改成沿頻率軸做卷積的可學習投影之後,頻譜結構保留下來,模型能靠諧波比例判斷。75.2% 到 77.8%。
換上 PCEN 前端另跑一條路線。PCEN 做的是逐通道的自動增益控制,壓掉穩定的背景聲、放大微弱的頻譜線條,論文附的頻譜圖裡,Log-Mel 看不到的線在 PCEN 上顯現出來。這條路線配上頻率投影器與完整訓練集,測試集 F1 是 78.6%,也就是論文摘要拿來對比的數字:公開的 AST-Drone 模型在同一套測試集上是 55.4%,SAM-Audio 的零樣本結果是 4.45%,輕量的 TRIDENT LeNet-Audio 是 19.3%。
最後把 Log-Mel 與 PCEN 兩條路線集成起來,兩者的失效方式不同,PCEN 對參數調校敏感,Log-Mel 對增益敏感。用小型訓練集的集成是 81.14%,用完整訓練集是 82.22%。Zvook 自家以完整訓練集訓練的五折集成模型,在同一套測試集上是 69.1%。
驗證集 98%,測試集 82%。
三份資料按時間與地點切開,彼此在時間上完全獨立。訓練集錄於非戰區的控制場測試,驗證集錄於冬季、混合戰區與試場,測試集錄於春季、全部來自實際交戰區。
集成模型在驗證集上的 F1 是 98.18%,測試集是 82.22%。作者比對兩份資料的嵌入分布,飛行器訊號本身看不出季節偏移(輪廓係數 0.0048 到 0.0093),但前線麥克風錄到的環境噪音在冬春之間差異明顯,基準模型在這兩群噪音上的輪廓係數是 0.3851、k 近鄰純度超過 98%。換個季節、換個陣地,那支麥克風周圍的聲音就換了一批。
測試集裡的小型無人機片段另有人工標記的遠近分組。近距與中距共 2,304 段,ROC AUC 97.2%;遠距 241 段,93.8%。距離拉開,訊噪比下降,聲學特徵變弱,掉幅在預期之內。
模型還不會做的事
論文自己列了三項限制。無人機在模型裡是單一類別,分不出 DJI Mavic 與高速 FPV,作者認為要處理戰術問題,這兩者必須分開。音檔以九秒為單位各自判斷,前後段的資訊沒有串起來,誤報因此壓不下去。資料裡沒有距離與高度,只有人耳判斷的遠近分組,誤差分析做不細。
作者提的後續方向裡,有兩項都在補前線標記資料太少這個缺口:加入記憶模組或循環架構,去利用九秒片段之外的聲音脈絡;以及發展半監督流程,好在標記稀少的新陣地快速適應。
完整訓練集裡的目標類別錄音是 4,648 段,比小型訓練集多了十倍,集成模型的測試集 F1 多了一個百分點。
站內延伸
無人機研究:技術情報月報
民用與軍用論文同頁切換,依中國、非中國、台灣分組,看各子主題的活躍度與走向,每月更新。
相關文章
讓無人機少講一點話,它們圍堵野火的成績反而變好。
英國克蘭菲爾德大學的研究讓五架無人機各自學習滅火,只在彼此靠近時交換十筆經驗。1,000 回合測試下來,通訊限制最嚴的那組圍堵率 41.1%,明顯高於不設限分享的 26.5%。而就算是這個第一名,也有將近六成的火燒出了邊界。
一台玩具等級的無人機,已經開始有能力暗殺特定的人。
一台在市面上當玩具賣的 DJI Tello,沒有深度感測器、沒有 GPS、機上算力也很有限。一支羅馬尼亞軍事技術學院的團隊,只用開源模型和一面 3D 列印的斜鏡,就讓它自己找到人、認出臉、沿著地上的線飛。
烏克蘭怎麼讓無人機在看不完的戰場直播裡,記住每一台軍車?
前線上空塞滿偵察無人機,影像多到沒人看得完,畫質又被雲端壓縮得模糊。一支烏克蘭國防部團隊用單幀標注訓練出一套即時追蹤法,讓機器在低幀率的空拍畫面裡,靠著車輛周圍的地景,認出那是不是同一台軍車。
當一群無人機自己做出攸關任務的安全決定,人類要憑什麼相信它做對了。
一篇 2026 年發表於 Scientific Reports 的研究指出,當一群無人機自己做出攸關任務的安全決定,演算法判斷得對,和人類敢把任務交給它,是兩件不同的事。消融實驗顯示,拿掉解釋功能後系統表現分毫未減,操作員的信任分數卻幾乎腰斬。