Análisis de video
Modelos de percepción multimodal extraen en paralelo la pose corporal, la configuración de cada mano (21 puntos por mano) y la malla facial de la persona señante, cuadro por cuadro.
entrada video → salida pose unificada
Traducir es pasar de una lengua a otra. Lo nuestro es distinto: transferimos una interpretación señada de un medio (el video de una persona señante) a otro (la animación de un avatar), preservando su estructura fonológica y su prosodia. El contenido lingüístico no se transforma — se vuelve a señar.
Eso es accesibilidad de verdad: la información llega en la lengua de la comunidad Sorda — no en la de la mayoría oyente — con un avatar que puede señar cualquier contenido, a cualquier hora, en cualquier pantalla.
Todo lo que percibe el sistema produce una representación fonológica intermedia; todo lo que anima el avatar la consume. Ese desacople permite que la percepción y la producción mejoren de forma independiente.
Modelos de percepción multimodal extraen en paralelo la pose corporal, la configuración de cada mano (21 puntos por mano) y la malla facial de la persona señante, cuadro por cuadro.
entrada video → salida pose unificada
Un clasificador temporal convierte la pose en registros fonológicos estructurados: qué configuración manual, en qué ubicación, con qué movimiento y qué rasgos no manuales — con su tiempo exacto.
entrada pose → salida registro fonológico
El motor de síntesis traduce cada registro en rotaciones de esqueleto, blend shapes faciales y curvas de tiempo que animan al avatar de SignaPlay, con coarticulación entre señas.
entrada registro fonológico → salida animación 3D
a diferencia del habla, una seña no es una secuencia de símbolos: es un haz de canales simultáneos. la notación los codifica en pistas paralelas con tiempo de inicio, núcleo y salida — que se convierten directamente en keyframes de animación.
Los sistemas de transcripción existentes — HamNoSys, SignWriting, Stokoe — nacieron para otras lenguas de señas o como abstracciones generales. Ninguno cubre de forma nativa lo que hace única a la LSM: su alta proporción de señas inicializadas, sus construcciones clasificadoras y su variación regional. Por eso diseñamos una notación propia.
La especificación se construye sobre la Gramática de la Lengua de Señas Mexicana de Miroslava Cruz Aldrete (El Colegio de México, 2008): 1,122 páginas y más de 2,300 registros que constituyen la descripción fonológica más completa de la LSM. Su notación de dedos, matrices y segmentos se importa directamente a nuestro formato computacional.
fundamento empírico · la notación hereda sus inventarios, no los inventa Estudia esta gramática en nuestra plataforma interactiva →Cada configuración se descompone en dedos seleccionados, flexión (extendido, curvado, doblado, gancho, cerrado), separación y postura del pulgar. Como el rig de la mano del avatar se controla por articulación, esta descomposición mapea directo a ángulos de animación.
De la sien al antebrazo, cada punto de articulación se define por contacto o proximidad y se traduce a coordenadas proporcionales del esqueleto del avatar — la misma seña funciona en cualquier avatar, sin re-anotar.
El contorno global de la mano (línea, arco, círculo, zigzag, siete) convive con movimientos internos de los dedos: ondulación, vibración, frotación, soltura. La notación conserva qué combinaciones existen en la LSM y cuáles no — reglas que validan cada registro.
Qué superficie de la mano se alinea con el cuerpo y con el plano horizontal, más el grado de rotación del antebrazo. Se traduce sin intermediarios a los ángulos de la muñeca del avatar.
Cejas, mirada, mejillas, boca, cabeza y torso llevan información gramatical, prosódica y afectiva — y en la LSM son contrastivos: pueden distinguir una seña de otra por sí solos. La notación los registra como una matriz propia que anima los blend shapes faciales del avatar con la temporalidad correcta: léxica, gramatical o afectiva.
Si un avatar ignora los rasgos no manuales, no está simplificando: está diciendo otra cosa. Por eso nuestra notación los trata como fonología de primera clase, no como decoración expresiva.
Cada canal de la notación tiene un destino preciso en el avatar. Si una distinción no se puede renderizar, no se codifica; si un matiz de animación no es fonológico, lo resuelve el motor de estilo — nunca la notación.
Al encadenar señas en enunciados, un avatar sin coarticulación se ve robótico y se entiende menos. Nuestro motor genera las transiciones como lo hace una persona señante: anticipa la siguiente configuración manual, acorta recorridos cuando el ritmo sube y alarga las retenciones al final de frase.
Estas reglas no son heurísticas de animación — son los procesos fonológicos documentados de la LSM (epéntesis, reducción, asimilación) convertidos en el conjunto de reglas del sintetizador.
No existe un corpus de LSM anotado a esta escala — así que lo estamos creando junto con quienes son dueños de la lengua: personas Sordas, lingüistas y docentes de educación especial.
Educadores Sordos, socios de SignaPlay, anotan el corpus semilla de señas en forma de citación con una herramienta diseñada para ser accesible en LSM.
Cada avance se prueba comparando en pares: el video de la persona señante contra la producción del avatar. Personas Sordas evalúan comprensibilidad, naturalidad y aceptabilidad.
La notación registra dialecto desde el primer campo: Guadalajara, Ciudad de México y Monterrey se evalúan por separado, porque la LSM no es una sola.
Inventario de configuraciones manuales con educadores Sordos, herramienta de anotación y corpus semilla de 500 señas. Primer clasificador de manos.
1,500 señas y 200 enunciados. Ubicación y movimiento en el modelo, mapeo IK en el avatar y primera evaluación con la comunidad en Jalisco.
Rasgos no manuales, prosodia y coarticulación avanzada. Ciclo sintético: el avatar genera datos que re-entrenan a la percepción.
Afinado de punta a punta, inferencia en tiempo real sobre iPad, soporte multi-dialecto e integración con el currículo de SignaPlay.
Cada seña nueva entra al avatar como un registro fonológico, no como semanas de animación manual. Así escala el contenido educativo — y así se abre un recurso computacional inédito para la investigación de la LSM.