Skyfaring
首頁/文章/強化學習

強化學習

標記為「強化學習」的文章,5 篇。

夜間空拍的野火,火線沿著山坡分裂成數道細長火舌
無人機

讓無人機少講一點話,它們圍堵野火的成績反而變好。

英國克蘭菲爾德大學的研究讓五架無人機各自學習滅火,只在彼此靠近時交換十筆經驗。1,000 回合測試下來,通訊限制最嚴的那組圍堵率 41.1%,明顯高於不設限分享的 26.5%。而就算是這個第一名,也有將近六成的火燒出了邊界。

2026年8月3日8 分鐘·
藍天白雲下並排飛行的兩架四旋翼無人機
無人機

當一群無人機自己做出攸關任務的安全決定,人類要憑什麼相信它做對了。

一篇 2026 年發表於 Scientific Reports 的研究指出,當一群無人機自己做出攸關任務的安全決定,演算法判斷得對,和人類敢把任務交給它,是兩件不同的事。消融實驗顯示,拿掉解釋功能後系統表現分毫未減,操作員的信任分數卻幾乎腰斬。

2026年6月16日5 分鐘·
一架帶有紅色燈光的無人機在幽暗的工業街道中低空飛行
無人機

五十架無人機要攔截誰,誰說了算。

當攻方同時派出的無人機數量超過防守方的瞬時攔截能力,傳統的一對一分配邏輯就垮了。西北工業大學這篇論文的問題是:五十架藍方無人機要如何在沒有指揮官的情況下,自行決定誰去追誰?

2026年6月1日5 分鐘·
無人機黑色剪影在橙紅色夕陽天空中懸停
無人機

五架無人機在威脅邊緣徘徊了一千步

來自中國北方自動控制技術研究所的這篇論文,揭示了 AI 無人機群訓練中的一個根本矛盾:越安全的策略,越難完成任務。解法是把兩個本來混在一起的問題分開來解。

2026年5月25日4 分鐘·
多架無人機在多雲天空中飛行,象徵無人機群威脅
無人機

不要打已死的無人機:action masking 如何讓 AI 快 10 倍學會防禦決策

一個 AI 系統在 500 次模擬中把無人機群造成的傷害壓低了 22%,不是因為它比規則更聰明,而是因為有人告訴它不要打已死的目標。action masking 這個零成本的設計決策,讓訓練速度快了整整 10 倍。

2026年5月25日3 分鐘·