PATSE: Nonlinear Spiral Encoding of Chaotic Acoustic Bursts for Deep Learning-Based Human Scream Recognition

Authors

  • Nuk Ghurroh Setyoningrum Universitas Cipasung Tasikmalaya
  • Alam Universitas Cipasung Tasikmalaya
  • N. Nelis Febriani SM Universitas Cipasung Tasikmalaya
  • De ALi Farizal Universitas Cipasung Tasikmalaya
  • Mae B Lodana STI West Negros University, Bacolod City, Negros Occidental

Keywords:

Nonlinear Spiral Encoding, Human Scream Recognition, Audio Classification, Transfer Learning, Convolutional Neural Networks (CNN)

Abstract

This study proposes PATSE (Nonlinear Spiral Encoding), a novel transformation framework that converts chaotic acoustic bursts into structured two-dimensional spatial representations for deep learning-based human scream recognition. Unlike conventional spectral features, PATSE projects temporal amplitude dynamics into a nonlinear spiral domain, preserving complex burst characteristics in a compact visual form. The resulting representations are standardized to 224×224 RGB images to ensure compatibility with a pretrained MobileNetV2 backbone. The model employs frozen convolutional layers followed by a Dense(128) layer with ReLU activation and Dropout (0.5). Experimental evaluation using a stratified hold-out validation scheme and 30 independent runs demonstrates stable convergence, achieving a mean validation accuracy of 0.772 (±0.006) and a macro F1-score of 0.542 (±0.015). Comparative analysis against a Mel-spectrogram CNN baseline shows statistically significant improvements (p < 0.0001) with large effect sizes. While detection performance for the minority screaming class remains challenging, the results confirm that nonlinear spiral encoding enhances feature discriminability beyond conventional spectral representations. Overall, PATSE establishes an effective bridge between one-dimensional acoustic signals and image-based deep learning architectures for robust audio event recognition.

Published

2026-08-24

Issue

Section

Articles