La -d- intervocálica en PRESEEA

Para el trabajo de Sociolingüística y Etnolingüística. La web busca todos los casos de -d- entre vocales en las entrevistas que elijas (también los que la transcripción ya escribe sin d, como tomao o na), los sitúa en el audio, corta un recorte por caso y te da un estudio para escucharlos y decidir cómo se pronuncia cada uno.

1. Procesar

Desde el CSV del buscador de PRESEEA, para una o varias ciudades.

2. Categorizar

Con Jev: categoría gramatical, lema en contexto y elisiones dudosas.

3. Estudiar

Escuchar cada caso y rellenar la columna -d- en grupo.

  1. Haz una consulta en el buscador de PRESEEA. Para tener todas las entrevistas de una ciudad basta con buscar una palabra muy frecuente (de) filtrando por esa ciudad; puedes marcar varias ciudades.
  2. En los resultados, pulsa «Descargar: CSV» y arrastra aquí el archivo.
  3. Elige las opciones y pulsa «Procesar». Tarda cerca de un minuto por entrevista la primera vez que alguien la procesa; después sale al momento.
Arrastra aquí el CSV o elige un archivo
¿No tienes el CSV? Pega las claves a mano

Una o varias claves separadas por espacios, comas o saltos de línea (por ejemplo, BARC_H11_075).

Qué buscar
Qué hacer después
ClaveCiudadSexoEdadNivelCasosAlineación

Si procesaste sin Jev, o quieres repetir la categorización, sube aquí el ZIP que te dio esta web. Se devuelve el mismo ZIP con las columnas «Categoría», «Lema» y «Confianza Jev» rellenas, y con las elisiones dudosas revisadas (las que Jev considera otra palabra pasan a descartados.csv). Lo que ya hubierais rellenado en casos.csv se conserva.

Arrastra aquí el ZIP o elige el archivo

El estudio va dentro de cada ZIP (estudio.html): descomprímelo y ábrelo con el navegador, sin conexión. También puedes abrirlo aquí y cargar el ZIP:

Cada persona del grupo marca sus casos (lo marcado se guarda en su navegador) y exporta su CSV. Con «Fusionar CSV» se juntan los de todos, o se incorpora el que descarguéis de la hoja de cálculo compartida. Para sincronizar automáticamente con una hoja de Google, usad la herramienta de terminal del repositorio.

Cómo funciona

Cada transcripción se limpia de etiquetas (también las que parten palabras, como chancla<alargamiento/>s) y se quedan solo los turnos del informante. El audio se transcribe con Whisper con tiempos por palabra, y esa transcripción se alinea con la de PRESEEA para saber en qué segundo suena cada palabra. Whisper solo aporta el tiempo: la forma, el lema y la decisión salen de la transcripción del corpus y de vuestro oído, porque Whisper «corrige» lo que oye y escribe tomado donde se dijo tomao.

Solo entran los casos que caen dentro del audio: los MP3 abiertos del corpus duran unos diez minutos, aunque la transcripción esté completa. El lema sale de un léxico de formas del español y del catalán; para los participios, Jev decide si funcionan como verbo (ha cansado → cansar) o como adjetivo (estoy cansado → cansado).