動作
Feature #306
進行中
SC
SC
升級至 V4 八類別模型與大規模合併資料集
Feature #306:
升級至 V4 八類別模型與大規模合併資料集
開始日期:
2026-06-25
完成日期:
2026-06-25 (逾期 37 天)
完成比例:
100%
預估工時:
1:00 小時
概述
描述(Description)¶
將插管機器人視覺偵測系統從 V3(3 類別、156 張影像)升級為 V4 八類別模型,
並建立大規模合併資料集流程。
工作內容(What was done)¶
1. 資料集擴張¶
- 影像數:156 → 9,862 張(train 8,382 / val 1,480),標註 29,484 筆
- 合併 6 個來源資料集:Roboflow Larynx v1/v4、6th class、lor_seg、test01
- 新增
merge_datasets.py:多邊形→bbox 轉換、跨資料集類別重映射、重複影像去重
2. 類別擴充(3 → 8)¶
| ID | 類別 | 標註數 |
|---|---|---|
| 0 | arytenoid_cartilage | 181 |
| 1 | epiglottis | 4,227 |
| 2 | larynx | 9,595 |
| 3 | glottic_opening(插管目標,新增) | 460 |
| 4 | uvula | 787 |
| 5 | pyriform_fossa | 14,149 |
| 6 | trachea | 53 |
| 7 | v_point | 32 |
3. V4 模型訓練¶
- 架構:YOLOv11s,100 epochs,imgsz 640,batch 16,RTX 5070 Ti
驗證結果(Validation, val set n=1480)¶
| 類別 | P | R | mAP50 | mAP50-95 |
|---|---|---|---|---|
| arytenoid_cartilage | 0.822 | 0.805 | 0.846 | 0.516 |
| epiglottis | 0.927 | 0.892 | 0.961 | 0.859 |
| larynx | 0.982 | 0.982 | 0.992 | 0.737 |
| glottic_opening | 1.000 | 0.952 | 0.984 | 0.763 |
| uvula | 0.997 | 1.000 | 0.995 | 0.675 |
| pyriform_fossa | 0.953 | 0.939 | 0.973 | 0.690 |
| trachea | 0.789 | 0.625 | 0.859 | 0.531 |
| v_point | 0.936 | 1.000 | 0.995 | 0.628 |
| 整體 | 0.926 | 0.899 | 0.951 | 0.675 |
整體 mAP50 由 V3 的 0.787 提升至 0.951;插管目標 glottic_opening mAP50=0.984。
影片實測(獨立測試影片)¶
| 指標 | 影片1 (20241017) | 影片2 (20240923) |
|---|---|---|
| 偵測穩定度 | 73.4%(V3 66.6%) | 64.4%(V3 65.7%) |
| CENTERED 對準率 | 7.7%(V3 3.0%) | 2.3%(V3 4.8%) |
| FPS | 124.8 | 165.3 |
| 空幀率(無偵測) | 26.6% | 35.6% |
已知問題 / 待辦(Known issues)¶
- 疑似抽幀 train/val 洩漏:稀有類別(v_point 僅 32 標註卻達 0.995 mAP50)
- 影片空幀率 26–36%,顯示 val 分數高估泛化能力。
- ☐ 降低 conf 門檻(~0.15)重跑影片2,改善 35.6% 空幀率
- ☐ 改為「按影片分組」重切 train/val,根治洩漏並取得可信泛化指標
- ☐ 補強弱類別:trachea(R=0.625)、arytenoid_cartilage(mAP50-95=0.516)
版控說明¶
依 .gitignore 政策,模型權重(*.pt)與影像資料集排除於版控,僅提交程式碼、
設定與視覺化產物;權重與資料另行手動上傳至 Redmine。
沒有任何資料可供顯示
動作