Ir al contenido

Esta página reúne la teoría de la audición y la psicoacústica: las líneas isofónicas, los modelos de sonoridad de Zwicker, Moore-Glasberg y Sottek, las métricas de calidad sonora (tonalidad, aspereza y sharpness), la prominencia tonal, las métricas del habla STI y SII, y la estadística de los umbrales de audición y de la pérdida auditiva. Forma parte de la referencia de teoría.

Un tono tiene un nivel de sonoridad de fonios cuando se juzga igual de sonoro que un tono puro de 1 kHz a dB SPL. La Fórmula (1) de ISO 226:2023 (cláusula 4.1, p. 2) da el SPL de un tono puro a la frecuencia que alcanza el nivel de sonoridad :

La Fórmula (2) (cláusula 4.2) la invierte, devolviendo el nivel de sonoridad de un tono a SPL :

Los tres parámetros provienen de la Tabla 1 (p. 4), tabulados en las 29 frecuencias preferentes de tercio de octava de ISO 266 desde 20 Hz hasta 12,5 kHz:

  • : exponente de la percepción de sonoridad a la frecuencia ,
  • : magnitud de la función de transferencia lineal, normalizada en 1 kHz ( en 1 kHz),
  • : umbral de audición en , en dB.

La norma no especifica interpolación entre las frecuencias tabuladas. La Fórmula (1) está especificada para 20 fonios a 90 fonios entre 20 Hz y 4 kHz, y solo hasta 80 fonios entre 5 kHz y 12,5 kHz; por encima de 80 fonios la línea isofónica se detiene, por tanto, en 4 kHz. Los valores fuera de estos límites obtenidos con la Fórmula (2) son extrapolaciones que la norma califica de meramente informativas.

Consulta la guía de sonoridad para su uso.

Curvas isofónicas normales de ISO 226:2023 de 20 a 90 fonios con la curva del umbral de audiciónCurvas isofónicas normales de ISO 226:2023 de 20 a 90 fonios con la curva del umbral de audición

Las isófonas de ISO 226:2023 según la Fórmula (1), de 20 a 90 fonios, con el umbral de audición.

Ambos métodos operan sobre un espectro de potencia con ventana de Hann promediado en RMS (cláusulas 11.1 / 12.1) y usan el modelo de bandas críticas de la cláusula 10. El ancho de banda crítico centrado en un tono a es (Fórmula 2):

Los bordes de banda se colocan aritméticamente para Hz (Fórmulas 4–5): , y geométricamente por encima (Fórmulas 7–8): , .

TNR (cláusula 11). La banda del tono abarca los mínimos espectrales a ambos lados del pico dentro del 15 % de (cláusula 11.2). A la potencia del tono se le resta la recta que conecta los bins de los bordes de banda (Fórmula 9): sobre los bins de la banda del tono, . La potencia del ruido enmascarante es la potencia restante de la banda crítica reescalada al ancho de banda crítico completo (Fórmula 10): , y (Fórmula 11). El criterio de prominencia (Fórmulas 12–13) es

PR (cláusula 12) compara el nivel de la banda crítica centrada en el tono, , con la potencia media de las dos bandas críticas contiguas , (bordes según las Fórmulas ajustadas 21–22 con las Tablas 2–3): (Fórmula 23). Para Hz la banda inferior se trunca en 20 Hz y su potencia se reescala a un ancho de banda de 100 Hz (Fórmula 24). El criterio (Fórmulas 25–26) es 9,0 dB para kHz, y crece como por debajo. Los tonos se evalúan dentro del rango de interés de 89,1 Hz – 11,2 kHz (cláusulas 11.5 / 12.6).

Consulta la guía de tonos discretos prominentes para su uso.

El oído analiza el sonido en bandas críticas: regiones de frecuencia dentro de las cuales la energía se suma antes de formarse la sonoridad. La escala Bark transforma la frecuencia en razón de banda crítica , de 0 a 24 Bark, e ISO 532-1:2017 muestrea la sonoridad específica en pasos de 0,1 Bark (240 valores). La implementación es un port de sala limpia del programa de referencia normativo de la norma (Anexo A.4) y procede por etapas:

  1. Niveles de tercio de octava: 28 bandas, de 25 Hz a 12,5 kHz (el banco de filtros del Anexo A a 48 kHz, Tablas A.1/A.2). Para sonidos variables en el tiempo, las salidas de banda al cuadrado se suavizan con tres paso-bajos en cascada con ( limitada a 1 kHz) y se muestrean cada 2 ms.

  2. Agrupación en baja frecuencia: las 11 bandas hasta 250 Hz reciben las correcciones isofónicas de la Tabla A.3 y se suman en las tres primeras bandas críticas (25–80, 100–160, 200–250 Hz).

  3. Transmisión a0: la corrección de transferencia del oído externo/medio de la Tabla A.4 (más la diferencia de campo difuso de la Tabla A.5 con field='diffuse') produce los niveles de banda crítica .

  4. Sonoridad núcleo: cada una de las 20 bandas críticas se transforma con los niveles de umbral en silencio de la Tabla A.6 (tras la adaptación de ancho de banda DCB de la Tabla A.7):

    (la forma que da el programa de referencia a la transformación de sonoridad de Zwicker; las bandas por debajo del umbral aportan cero).

  5. Pendientes: las pendientes superiores de enmascaramiento dependientes del nivel (inclinación por rango de sonoridad específica y banda crítica, Tablas A.8/A.9) añaden flancos decrecientes hacia mayores; la sonoridad total es el área bajo el patrón:

Para sonidos variables en el tiempo, un decaimiento temporal no lineal (constantes de tiempo 5/15/75 ms, cláusula 6.3) y la ponderación dependiente de la duración de la sonoridad total (paso-bajos de 3,5 ms y 70 ms ponderados 0,47/0,53, cláusula 6.4) preceden a la salida de sonoridad frente al tiempo a 500 Hz y a los percentiles N5/N10 (cláusula 6.5).

Sonos y fonios quedan ligados por el ancla de 1 kHz (1 sono = 40 fonios; cláusula 5.6):

por debajo de 1 sono el programa de referencia usa , con suelo en 3 fonios.

Consulta la guía de sonoridad para su uso.

Patrones de sonoridad específica sobre la escala Bark para un sonido de banda estrecha de 1 kHz y un sonido de banda ancha con el mismo nivel de bandaPatrones de sonoridad específica sobre la escala Bark para un sonido de banda estrecha de 1 kHz y un sonido de banda ancha con el mismo nivel de banda

Sonoridad específica N′(z) sobre el eje de Bark: la energía repartida entre muchas bandas críticas suma más sonos que el mismo nivel de banda concentrado en una sola.

Modelos avanzados de sonoridad y calidad sonora

Sección titulada «Modelos avanzados de sonoridad y calidad sonora»

ISO 532-1 es uno de tres modelos de sonoridad; dos familias más recientes refinan el front-end auditivo y añaden las métricas de calidad sonora tonalidad y aspereza.

Sonoridad de Moore-Glasberg (ISO 532-2:2017, ISO 532-3:2023)

Sección titulada «Sonoridad de Moore-Glasberg (ISO 532-2:2017, ISO 532-3:2023)»

En lugar de las bandas críticas fijas de Zwicker, el modelo de Moore-Glasberg forma un patrón de excitación continuo sobre la escala del número ERB (“Cam”) usando filtros auditivos exponenciales redondeados (roex) dependientes del nivel. En función de la desviación de frecuencia normalizada respecto a un filtro centrado en , la ponderación del filtro es

donde la pendiente crece con el nivel de la fuente, ensanchando el flanco inferior a medida que sube el nivel (ISO 532-2, Fórmulas 2–5); esto reproduce la propagación ascendente del enmascaramiento. Al pasar la intensidad del estímulo por cada filtro se obtiene la excitación , y una ley compresiva la transforma en la sonoridad específica en sonos/Cam (Fórmulas 7–9), de la forma de nivel medio

con la constante de calibración sonos/Cam (ISO 532-2; en ISO 532-3). La sonoridad total es el área bajo el patrón,

y una etapa de inhibición binaural (Fórmulas 10–13) combina los oídos de modo que un sonido diótico es más sonoro que el mismo sonido en un solo oído. El ancla de 1 kHz / 40 dB SPL da exactamente 1 sono.

ISO 532-3 lo hace variable en el tiempo. Un espectro deslizante de seis FFT paralelas con ventana de Hann (longitudes de segmento de 2 a 64 ms, cada una aportando su propio rango de frecuencias, actualizado cada ms) alimenta la misma cadena de excitación y sonoridad específica, integrada por dos suavizadores de primer orden en cascada con ,

usando una constante de tiempo rápida en el ataque y una más lenta en la relajación. Esto produce la sonoridad de corto plazo (ataque/relajación en torno a 20–30 ms) y la sonoridad de largo plazo (en torno a 0,1–0,75 s); la sonoridad de largo plazo de pico predice la sonoridad de sonidos de hasta unos 5 s.

ECMA-418-2 construye sus tres métricas sobre un único front-end auditivo (Cláusula 5): un filtro de oído externo/medio, un banco de 53 filtros paso-banda solapados de tipo gammatone espaciados en la escala Bark_HMS ( a ), rectificación de media onda y un RMS de bloque corto por banda y bloque temporal . Una no linealidad compresiva (Fórmula 23) convierte el RMS de banda en la sonoridad de base específica , cuya constante de calibración fija un tono de 1 kHz / 40 dB SPL en 1 sone_HMS. La sonoridad ensambla las sonoridades tonal y de ruido (abajo) sobre bandas y tiempo (Fórmulas 113–117); crece unas por cada 10 dB, más lentamente que el factor de 2 de Zwicker, una propiedad intrínseca de la suma de Sottek.

Tonalidad: autocorrelación de la señal de banda (ECMA-418-2)

Sección titulada «Tonalidad: autocorrelación de la señal de banda (ECMA-418-2)»

Una componente tonal es periódica, así que sobrevive en la función de autocorrelación (ACF) de la señal rectificada de una banda mientras que el ruido de banda ancha se descorrelaciona. Para cada banda, la ACF no sesgada del bloque es

Una estimación espectral con ventana de separa una sonoridad tonal de la sonoridad de ruido (Fórmulas 36–48). La tonalidad específica es la sonoridad tonal escalada por una compuerta suave de relación señal-ruido (Fórmulas 49–51),

y el valor único (tu_HMS) es el promedio temporal con compuerta del máximo por bloque sobre las bandas (Fórmulas 61–64). La constante fija el tono de 1 kHz / 40 dB en 1 tu_HMS, y la banda del pico de la ACF da la frecuencia tonal .

Aspereza: modulación de la envolvente (ECMA-418-2)

Sección titulada «Aspereza: modulación de la envolvente (ECMA-418-2)»

La aspereza es la sensación de modulación de amplitud rápida (aproximadamente 20–300 Hz), máxima cerca de 70 Hz. A partir de la envolvente de cada banda (magnitud de Hilbert) se forma un espectro de modulación ponderado por una función de tasa de modulación con pico cerca de 70 Hz y por la profundidad de modulación; correlacionando la modulación entre bandas vecinas y aplicando el filtrado temporal especificado se obtiene la aspereza específica y la aspereza dependiente del tiempo

(Fórmulas 65–111). El valor único es el percentil 90 de en el tiempo (Cláusula 7.1.10); la constante (Fórmula 104) calibra el sonido de referencia (un portador de 1 kHz modulado en amplitud al 100 % a 70 Hz y 60 dB SPL) a 1 asper.

El sharpness condensa en un solo número el énfasis en alta frecuencia de un sonido: el primer momento ponderado por del patrón de sonoridad específica estacionaria de ISO 532-1 (DIN 45692:2009, Ecuación 1):

evaluado sobre la misma malla de 240 puntos a 0,1 Bark. La constante no está codificada a mano, sino que se deriva del requisito de calibración (cláusula 6): un ruido de banda estrecha de una banda crítica de ancho, 920–1080 Hz a 60 dB SPL, puntúa exactamente 1 acum, y la derivada cae dentro de la ventana normativa (cláusula 5.2). Las ponderaciones informativas del Anexo B se ofrecen bajo el mismo anclaje de 1 acum: von Bismarck (codo en 15 Bark, ) y Aures (dependiente de la sonoridad, ). Los objetivos de banda estrecha de la Tabla A.2 se reproducen dentro de la tolerancia de la cláusula 6 (5 % o 0,05 acum): 0,38 acum a 250 Hz, 1,00 a 1 kHz, 1,78 a 2,5 kHz, 2,82 a 4 kHz.

Consulta la guía de métricas de calidad sonora para su uso.

Transferencia de modulación y STI (IEC 60268-16)

Sección titulada «Transferencia de modulación y STI (IEC 60268-16)»

La inteligibilidad del habla viaja en las modulaciones lentas de intensidad de la envolvente del habla. La función de transferencia de modulación (MTF) de un canal de transmisión es la razón entre la profundidad de modulación recibida y la emitida de la envolvente de intensidad por banda de octava a la frecuencia de modulación ; el STI completo la evalúa en las 14 frecuencias de modulación en tercios de octava de 0,63 a 12,5 Hz en las siete bandas de octava de 125 Hz a 8 kHz (A.2.2). Desde una respuesta al impulso medida, la forma cerrada de Schroeder la da directamente (método indirecto):

El ruido de fondo estacionario multiplica el de cada banda por la razón de intensidades (el término de ruido):

y cuando se conocen los niveles absolutos por banda, la corrección completa añade la intensidad de enmascaramiento auditivo (desde la banda de octava inmediatamente inferior, Tabla A.2) y el umbral absoluto de recepción (Tabla A.3). Cada corregido se transforma en una SNR efectiva, recortada al rango de ±15 dB donde la inteligibilidad varía realmente, y después en un índice de transmisión (A.5.4/A.5.5):

El MTI de banda es la media de los TI sobre las frecuencias de modulación, y el STI pondera las bandas con los factores masculinos , de la Tabla A.1 de la Ed. 5 (A.5.6):

truncado a 1,0. STIPA (Anexo B) muestrea la misma física con solo dos frecuencias de modulación por banda (Tabla B.1) sobre una señal de prueba con índice de modulación de fuente 0,55; las profundidades recibidas se miden por correlación seno/coseno de las envolventes de intensidad filtradas paso-bajo a ~100 Hz sobre un número entero de periodos de modulación:

Consulta la guía del índice de transmisión del habla para su uso.

Índice de inteligibilidad del habla (ANSI S3.5)

Sección titulada «Índice de inteligibilidad del habla (ANSI S3.5)»

Mientras el STI caracteriza un canal de transmisión, el SII (ANSI S3.5-1997) predice la inteligibilidad a partir de lo que el oyente puede oír realmente: 18 bandas de tercio de octava de 160 Hz a 8 kHz, cada una con su importancia de banda (Tabla 3, , con máximo cerca de 2 kHz). Todas las entradas son niveles espectrales equivalentes (cláusulas 3.11/3.55). El habla se enmascara a sí misma hacia arriba: el espectro de enmascaramiento de cada banda (cláusula 5.4) acumula las bandas inferiores con pendientes dB, y la perturbación es el mayor entre el enmascaramiento y el suelo auditivo, (cláusula 5.6), con el espectro de ruido interno de referencia más el desplazamiento del umbral de audición del oyente (cláusulas 5.5/5.6). La audibilidad de banda recorta el margen habla-perturbación al intervalo (cláusula 5.8), un factor de distorsión de nivel descuenta la presentación excesivamente alta (cláusula 5.7), y el índice suma (cláusula 6):

Los espectros normalizados de habla de la Tabla 3 para los esfuerzos vocales normal, elevado, fuerte y grito están incorporados (25,01 / 33,86 / 42,16 / 51,31 dB a 1 kHz); el del factor de distorsión de nivel es siempre el espectro de esfuerzo normal. Los anclajes: el espectro de esfuerzo normal en silencio con audición normal puntúa SII ≈ 0,996, los valores de referencia del espectro de enmascaramiento se reproducen a , y los espectros por esfuerzo vocal están verificados de forma cruzada frente a las implementaciones de referencia de Google y CRAN.

Consulta la guía de inteligibilidad del habla para su uso.

Umbrales de audición y presbiacusia (ISO 389-7, ISO 7029)

Sección titulada «Umbrales de audición y presbiacusia (ISO 389-7, ISO 7029)»

ISO 389-7:2005 Tabla 1 fija el umbral de audición de referencia de adultos jóvenes otológicamente normales: el SPL en campo libre y campo difuso que corresponde a 0 dB HL en las 11 frecuencias audiométricas de 125 Hz a 8 kHz (22,1 dB a 125 Hz en ambos campos, 2,4/0,8 dB libre/difuso a 1 kHz, divergiendo en alta frecuencia hasta 12,6 frente a 6,8 dB a 8 kHz). ISO 7029:2017 describe cómo se desplaza estadísticamente ese umbral con la edad: la desviación mediana respecto a los 18 años es (cláusula 4.2, Tabla 1)

y cualquier fractil sigue un modelo gaussiano bilateral (cláusula 4.4), , usando la dispersión superior para (peor que la mediana) y la inferior en caso contrario, cada una un polinomio de grado 5 en por sexo y frecuencia (cláusula 4.3, Tablas 2–5). A los 18 años toda desviación es cero por construcción. Las fórmulas están establecidas hasta los 80 años a 2 kHz y por debajo, y hasta los 70 años por encima; más allá la evaluación es una extrapolación. Anclajes: a los 60 años las medianas evalúan a 7,85 dB (hombre, 1 kHz), 20,21 dB (hombre, 4 kHz) y 15,32 dB (mujer, 4 kHz), reproduciendo la fórmula de la Tabla 1 a .

Consulta la guía de umbral de audición para su uso.

Dos paneles. Izquierda: la desviación mediana del umbral de audición de ISO 7029 para hombres a los 20, 40, 60 y 80 años en un eje de audiograma invertido, con la banda del 10 al 90 por ciento en torno a la curva de 70 años; la pérdida se acentúa hacia las altas frecuencias y con la edad. Derecha: el umbral de referencia de campo libre y campo difuso de ISO 389-7, que coinciden por debajo de 1 kHz y divergen por encima, con un mínimo cerca de 3 a 4 kHzDos paneles. Izquierda: la desviación mediana del umbral de audición de ISO 7029 para hombres a los 20, 40, 60 y 80 años en un eje de audiograma invertido, con la banda del 10 al 90 por ciento en torno a la curva de 70 años; la pérdida se acentúa hacia las altas frecuencias y con la edad. Derecha: el umbral de referencia de campo libre y campo difuso de ISO 389-7, que coinciden por debajo de 1 kHz y divergen por encima, con un mínimo cerca de 3 a 4 kHz

La desviación mediana con la edad de ISO 7029 con su banda de fractiles (izquierda) y los umbrales de referencia de campo libre y difuso de ISO 389-7 (derecha).

Pérdida auditiva inducida por ruido (ISO 1999)

Sección titulada «Pérdida auditiva inducida por ruido (ISO 1999)»

ISO 1999:2013 predice el desplazamiento permanente del umbral que acumula una población expuesta a ruido. El desplazamiento mediano inducido por ruido (NIPTS) para 10–40 años de exposición es (cláusula 6.3.1, Fórmula 2, Tabla 1):

cuadrático en el exceso sobre el nivel de inicio dependiente de la frecuencia (75 dB a 4 kHz, la banda más sensible, hasta 93 dB a 500 Hz) y cero por debajo; para menos de 10 años escala como (Fórmula 3). Los fractiles añaden la dispersión, con (cláusula 6.3.2, Fórmulas 4–7, Tablas 2/3), acotada en cero; la convención cuenta la fracción de la población con el desplazamiento menor, así que es el decil más susceptible (rango fiable 0,05–0,95). El nivel de umbral de audición asociado a edad y ruido (HTLAN) combina el NIPTS con la componente de edad de ISO 7029 al mismo fractil mediante la suma comprimida (cláusula 6.1, Fórmula 1):

Los ejemplos resueltos del Anexo D (Tablas D.1–D.4; p. ej. 100 dB / 40 años a 3 kHz: 29/38/60 dB en los fractiles 0,10/0,50/0,90) se reproducen exactamente con el redondeo a enteros de la norma, y el valor a mano de la Fórmula 2 a 4 kHz / 20 años / 90 dB es dB.

Consulta la guía de pérdida auditiva inducida por ruido para su uso.