Back to Search View Original Cite This Article

Abstract

<title>Abstract</title> <p>Purpose: Real-time visual content classification on resource-constrained edge devices presents a fundamental challenge in multimedia systems, requiring models that balance computational effciency with discriminative accuracy. Exist- ing lightweight architectures sacrifice fine-grained recognition capability for deployment feasibility. Methods: This paper proposes AMS-Net (Attention MobileNet Small), a lightweight architecture that integrates a novel Lightweight Spatial Self-Attention Module (LSSAM) into MobileNetV3-Small. LSSAM achieves 1/4096 computa- tional complexity reduction relative to standard self-attention through channel reduction (r=16), spatial downsampling (s=2), and grouped attention (G=8). A dynamic transfer learning strategy with progressive layer unfreezing and differentiated learning rates further optimizes training effciency. Results: On the Flowers-WTT dataset, AMS-Net attains 97.58% classifica- tion accuracy with 1.53M parameters, 0.124 GFLOPs, and 0.0168s per-image inference latency (≈60 FPS). Ablation studies confirm LSSAM contributes 3.05 percentage points accuracy improvement with merely 0.39% parameter overhead. The dynamic transfer learning strategy reduces training time by 35.4%. Cross- dataset validation on Oxford-17 achieves 94.0% accuracy, surpassing VGG-16 with 90× fewer parameters. Conclusion: AMS-Net establishes a superior accuracy-effciency trade-off for real-time multimedia classification on edge devices. The proposed techniques generalize to other fine-grained visual recognition tasks, enabling practical mul- timedia applications in smart agriculture, ecological monitoring, and botanical education.</p>

Show More

Keywords

accuracy lightweight amsnet lssam learning

Related Articles

PORE

About

Connect