{"allowContribute":false,"item":{"activeCommit":"25716cae8983df7d8c2a5075e9eef3cde931657b","apis":{"routes":[],"types":{}},"bundleHash":"89af032a8d4c01e3","createdAt":1782570448174,"gitCommit":"25716cae8983df7d8c2a5075e9eef3cde931657b","id":"a7803a09195673e9d9289f80","isPublic":true,"itemType":"PLUGIN","name":"知識捕捉器","pluginDir":"知識捕捉器","repositoryID":"repo_a77e298ed5477d476db81521","status":"active","updatedAt":1785672612040,"version":4},"ownerMemberId":"6a3d3fab005ff51aa67500","ownerName":"張志豪","publicPlugins":{"PLUGIN":{"pluginItemId":"a7803a09195673e9d9289f80","pluginDir":"知識捕捉器","bundleHash":"89af032a8d4c01e3","live":true}},"subtree":[{"activeCommit":"25716cae8983df7d8c2a5075e9eef3cde931657b","apis":{"routes":[],"types":{}},"bundleHash":"89af032a8d4c01e3","createdAt":1782570448174,"gitCommit":"25716cae8983df7d8c2a5075e9eef3cde931657b","id":"a7803a09195673e9d9289f80","isPublic":true,"itemType":"PLUGIN","name":"知識捕捉器","pluginDir":"知識捕捉器","repositoryID":"repo_a77e298ed5477d476db81521","status":"active","updatedAt":1785672612040,"version":4},{"createdAt":1786694588690,"deletedAt":null,"domain":"tech","id":"6a7ecbbca22ecea0cac1f6c1","importance":3,"initialThought":"- 以 U-Net 編碼器/解碼器為主幹，融合殘差連接、空洞卷積、金字塔場景解析池化與多任務推論的遙感影像語意分割框架\n- 提出基於 Dice loss 的新損失變體，應對遙感資料類別極度不平衡\n- 多任務條件推論：依序推論邊界、距離變換、分割遮罩與彩色重建，前一任務輸出作為後一任務條件\n- 於 ISPRS 2D Potsdam 資料集達到平均 F1 92.9%，為遙感分割先進架構","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"ResUNet-a：遙感影像語意分割的深度學習框架（arXiv 1904.00592）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1786694588690},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/1904.00592","status":"done","tags":"語意分割, 遙感影像, U-Net, 深度學習","updatedAt":1786694930260,"updatedBy":{"agentId":"dd4a3a17420b977125c0ef09","agentName":"知識歸檔員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1786694636375,"deletedAt":null,"domain":"tech","id":"6a7ecbeca22ecea0cac1f6c2","importance":3,"initialThought":"- 提出 DCUC-Net：以複數 U-Net 為骨幹、堆疊 Conformer 區塊融合音訊與視覺特徵的音視頻語音增強架構\n- 音訊走複數編碼器、視覺走 ResNet-18，Conformer 同時捕捉全域與局部音視頻依賴\n- 複數域運算保留相位資訊，視覺唇形特徵輔助語音增強\n- COG-MHEAR AVSE Challenge 2023 基線上 PESQ 提升 0.14，TMSV 資料集上與最佳模型相當","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Deep Complex U-Net with Conformer for Audio-Visual Speech Enhancement（arXiv 2309.11059）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1786694636375},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2309.11059","status":"done","tags":"音視頻語音增強, Conformer, 複數U-Net, AVSE","updatedAt":1786694930260,"updatedBy":{"agentId":"dd4a3a17420b977125c0ef09","agentName":"知識歸檔員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1784882742219,"deletedAt":null,"domain":"tech","id":"6a6326363b27b6ee09972b5a","importance":3,"initialThought":"- 與 html 版同一篇論文：以個體 HRTF 線索實現 speaker-independent 雙耳目標說話者提取\n- 全複值神經網路直接在複數 STFT 域操作，明確優於分離實虛部的 RI 網路\n- 在無迴聲與混響條件下皆強健，同時提升語音清晰度與方向感並去混響\n- 降噪與感知品質達 SOTA，雙耳線索保留（ILD/ITD）具明顯優勢，適合助聽器","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Binaural Target Speaker Extraction using HRTFs and a Complex-Valued Neural Network（arXiv 2507.19369）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1784882742219},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2507.19369","status":"done","tags":"#AudioAI,#SpeechSeparation,#BinauralAudio,#HRTF,#ComplexNN","updatedAt":1786453782541,"updatedBy":{"agentId":"ceo","agentName":"CEO","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":5},{"createdAt":1782575297489,"deletedAt":null,"domain":"tech","id":"6a3ff0c1991bf3ba23c0e2be","importance":3,"initialThought":"- 提出以多聲道低階空間特徵改善聲音事件偵測（SED）效能\n- 以「體積分離圖層」形式饋入擴展 CRNN，保留空間結構而非向量拼接\n- TUT-SED 2016 F-score 提升 6.1%、TUT-SED 2009 提升 2.7%\n- CRNN 至今仍是 SED 任務的常用 baseline","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"空間特徵驅動的聲音事件偵測（arXiv 1706.02291）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1782575297489},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/1706.02291","status":"done","tags":"#AI,#音頻處理,#聲音事件偵測,#空間音訊,#CRNN","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1784787642707,"deletedAt":null,"domain":"tech","id":"6a61b2ba8ff97df3ea2a7051","importance":3,"initialThought":"- KAIST 提出 DeFT-Mamba，結合 DeFTAN + Mamba 統一解決多通道聲音分離與複調音頻分類\n- 先分離再分類策略，分類式源計數（SCA 0.55）取代傳統閾值方法\n- 僅 4.2M 參數，SI-SDR 4.95、SDR 7.27，超越 SpatialNet、TF-GridNet\n- Mamba 取代 Transformer 在參數效率與分離性能上皆更優","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"DeFT-Mamba：Mamba 驅動的通用多通道聲音分離框架（arXiv 2409.12413）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1784787642707},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2409.12413","status":"done","tags":"#AI,#Audio,#SoundSeparation,#Mamba,#多通道","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1784859955575,"deletedAt":null,"domain":"tech","id":"6a62cd3399d828be4e7ffd11","importance":3,"initialThought":"- 首個雙耳目標聲音提取神經網路，即時提取目標聲音並保留空間線索\n- Transformer 架構，手機端推理僅 6.56 ms 延遲\n- 支援 20 種聲音類別，跨未見過的室內外場景泛化\n- 從硬體聲學濾波走向神經語義層級的聽覺注意力控制","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Semantic Hearing: Programming Acoustic Scenes with Binaural Hearables（arXiv 2311.00320）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1784859955575},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2311.00320","status":"done","tags":"#AudioAI,#SemanticHearing,#Hearables,#SoundExtraction,#Transformer","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1784882659293,"deletedAt":null,"domain":"tech","id":"6a6325e33b27b6ee09972b59","importance":3,"initialThought":"- 頻域音樂源分離模型，將頻譜圖依樂器特性分割為可自訂頻寬的子帶\n- 交替 band-level RNN（子帶內時序）與 sequence-level RNN（跨帶關聯）建模\n- 半監督微調（self-training）進一步提升分離性能\n- 僅以 MUSDB18-HQ 訓練即顯著超越 MDX Challenge 2021 頂尖模型","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Music Source Separation with Band-split RNN（arXiv 2209.15174）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1784882659293},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2209.15174","status":"done","tags":"#AudioAI,#MusicSourceSeparation,#BSRNN,#MDX,#MIR","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1785421173312,"deletedAt":null,"domain":"tech","id":"6a6b5d753cf0c4d18f0f9a2a","importance":3,"initialThought":"- 在 Demucs 基礎上引入混合頻譜圖與波形域架構，於 MDX 2021 競賽奪冠\n- 三項改良：壓縮殘差分支、局部注意力、奇異值正則化\n- MusDB HQ 平均 SDR 提升 1.4 dB，主觀品質（2.83 vs 2.36）顯著優於純波形模型\n- 開源社群最廣泛使用的音源分離模型之一","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Hybrid Demucs：混合頻譜圖與波形音源分離（arXiv 2111.03600）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1785421173312},"preParentID":null,"sourceType":"article","sourceURL":"https://research.facebook.com/file/168155279123560/htdemucs_paper-(2).pdf","status":"done","tags":"#HybridDemucs,#音樂來源分離,#音頻AI,#深度學習","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1785423240855,"deletedAt":null,"domain":"tech","id":"6a6b6588f606dea53f32d94f","importance":3,"initialThought":"- 僅 383K 參數的即時低延遲音樂源分離模型，演算法延遲僅 23ms\n- 單路徑 TFC-TDF UNET 證明即時場景下優於雙路徑，搭配通道擴展特徵融合\n- 平均 cSDR 5.17 dB 領先同類即時模型；FP16 量化後 GPU 推理僅 1.01ms\n- 適合助聽器、實時混音、低資源平台部署","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"RT-STT：實時低延遲音樂源分離（arXiv 2511.13146）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1785423240855},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2511.13146","status":"done","tags":"#音樂源分離,#即時處理,#輕量模型,#AI","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1785674745876,"deletedAt":null,"domain":"tech","id":"6a6f3bf93a6416499d177c60","importance":3,"initialThought":"- Google Research 提出以 2 層 LSTM 預測 FIR 濾波器係數的語音增強模型\n- 演算法延遲壓至 0.32–1.25 ms，僅 376 MIPS 即可在低功耗 DSP 即時運行\n- 單麥克風平均 SI-SDRi 提升 4.1 dB，未見過錄音 DNSMOS 提升 0.2（跨資料集泛化）\n- 適用助聽器、TWS 耳機通話降噪等亞毫秒延遲場景","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"耳戴裝置亞毫秒即時語音增強：Deep FIR 輕量模型（arXiv 2409.18239）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1785674745876},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/html/2409.18239v2","status":"done","tags":"#語音增強,#即時處理,#耳戴裝置,#LSTM,#邊緣AI,#DSP","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1785676551703,"deletedAt":null,"domain":"tech","id":"6a6f43073a6416499d177c61","importance":3,"initialThought":"- 系統整理複數值神經網路（CVNN）的理論基礎、激活函數設計限制與實作配套\n- CVNN 直接在複數域運算，保留幅度與相位資訊，可用更少參數超越實數值神經網路\n- 複數激活函數受全純條件限制，實務以 Wirtinger 微積分對非全純函數求導\n- 應用場景：複數語音增強、目標說話者提取、電信與電磁模擬","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"CVNN：複數值神經網路的理論與分析（arXiv 2312.06087）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1785676551703},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/html/2312.06087v1","status":"done","tags":"#CVNN,#複數神經網路,#訊號處理,#深度學習,#理論回顧","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1782571525191,"deletedAt":null,"domain":"tech","id":"6a3fe205991bf3ba23c0e2b3","importance":3,"initialThought":"- MERL 於 JAES 發表的 AI 音訊工程綜述論文\n- 四大技術挑戰：人本 AI、泛化能力、音訊品質、即時低延遲處理\n- 六大應用方向：ML 音效器、合成器、自動混音、空間音訊、語音增強、對話分離與音樂生成\n- 倡導人本倫理與技術進步的平衡，反對盲目追求模型規模與分數","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"Audio Signal Processing in the AI Era — 挑戰與方向（MERL TR2025-116）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1782571525191},"preParentID":null,"sourceType":"article","sourceURL":"https://www.merl.com/publications/docs/TR2025-116.pdf","status":"done","tags":"#AI,#音訊訊號處理,#機器學習,#音訊工程,#MERL","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1786067396285,"deletedAt":null,"domain":"tech","id":"6a7539c47418b92fffaa238f","importance":3,"initialThought":"- 從 Ambisonic 環場錄音提取「目標聲音場」，輸入輸出皆為 Ambisonic 格式\n- 空間條件（方位角+仰角）與語意條件（文字描述）雙重引導，以 FiLM 融入 U-Net\n- 近距次要聲源情境下，空間+語意結合比僅空間條件高約 1.8 dB\n- SoundWords 語意編碼器優於 BERT；適合 VR/AR 全景影片空間音訊","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"SoundSculpt：方向與語意驅動的 Ambisonic 目標聲音提取（arXiv 2506.00273）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1786067396285},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/html/2506.00273v1","status":"done","tags":"#音訊AI,#空間音訊,#Ambisonic,#目標聲音提取,#VR","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1782574809672,"deletedAt":null,"domain":"tech","id":"6a3feed9991bf3ba23c0e2bc","importance":4,"initialThought":"- 第一個完全不使用 CNN、純自注意力的音頻分類模型\n- 將 log-mel 頻譜圖切成 16×16 patch 輸入 ViT，ImageNet 預訓練後於 AudioSet 微調\n- AudioSet mAP 0.485、ESC-50 95.6%、Speech Commands V2 98.1%，皆當時 SOTA\n- 開啟音頻領域從 CNN 轉向 Transformer 的里程碑，影響 HTS-AT、BEATs 等後續工作","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"AST：純注意力機制的音頻分類里程碑（arXiv 2104.01778）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1782574809672},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/2104.01778","status":"done","tags":"#AI,#音頻處理,#Transformer,#深度學習,#遷移學習","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1782574960896,"deletedAt":null,"domain":"tech","id":"6a3fef70991bf3ba23c0e2bd","importance":3,"initialThought":"- 在 AudioSet 上大規模預訓練音頻神經網路，建立音頻「預訓練→遷移學習」標準範式\n- Wavegram-Logmel-CNN 同時使用原始波形與對數梅爾頻譜圖兩種互補特徵\n- AudioSet 標記 mAP 0.439 超越前最佳，六項下游任務多達 SOTA\n- 影響後續 AST、CLAP 等音頻預訓練工作","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE","name":"PANNs：音頻領域的大規模預訓練範式（arXiv 1912.10211）","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"default_knowledge_capture_folder_6a3d3fab005ff51aa67500":1782574960896},"preParentID":null,"sourceType":"article","sourceURL":"https://arxiv.org/pdf/1912.10211","status":"done","tags":"#AI,#音頻處理,#預訓練,#遷移學習,#深度學習","updatedAt":1786248419032,"updatedBy":{"agentId":"0e1b4879dca1eb30772f80c3","agentName":"內容搜集員","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":3},{"createdAt":1782570489807,"deletedAt":null,"id":"default_knowledge_capture_folder_6a3d3fab005ff51aa67500","isPublic":false,"itemType":"KNOWLEDGE_CAPTURE_FOLDER","name":"我的知識捕捉","originPluginDir":"知識捕捉器","originPluginID":"a7803a09195673e9d9289f80","parents":{"knowledgeCapture":1782570489807},"preParentID":null,"reviewedAt":1786367689914,"updatedAt":1786367723668,"updatedBy":{"agentId":"ceo","agentName":"CEO","userId":"6a3d3fab005ff51aa67500","userName":"張志豪"},"version":2}]}