Noticias IA · fuente primaria
NeoMME comprime la búsqueda multimodal sin separar texto e imagen
Edición: Álvaro MaureiraFecha: Fuente: Hugging Face · H Company

H Company presenta NeoMME como un encoder nativo multimodal y multilingüe que busca hacer más pequeña y rápida la recuperación de documentos con texto e imagen.
Capítulo 01
NeoMME propone una arquitectura que no trata texto e imagen como dos torres separadas que deben encontrarse al final
NeoMME es un encoder multimodal y multilingüe de H Company que procesa tokens de texto y parches de imagen en un Transformer bidireccional. Su Retriever 260M reporta nDCG@10 de 0,523, y una cuantización asimétrica reduce el almacenamiento de una página a 39 kB manteniendo más de 99% del valor base.
NeoMME propone una arquitectura que no trata texto e imagen como dos torres separadas que deben encontrarse al final. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
La pregunta técnica es si una secuencia conjunta puede conservar suficiente señal para recuperar una página y hacerlo con una huella razonable. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
- TextoTokens
- ImagenParches 32×32
- EncoderTransformer
Capítulo 02
El modelo mezcla tokens multilingües con parches de imagen de 32×32 dentro de un Transformer bidireccional
El modelo mezcla tokens multilingües con parches de imagen de 32×32 dentro de un Transformer bidireccional. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
Ese detalle explica por qué el sistema se llama nativo multimodal: la imagen no llega como una etiqueta tardía, sino como parte de la representación que el encoder aprende. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Capítulo 03
La familia Retriever ofrece una salida densa y otra de interacción tardía para equilibrar memoria y precisión
La familia Retriever ofrece una salida densa y otra de interacción tardía para equilibrar memoria y precisión. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
No existe una única dimensión de eficiencia. Una organización puede preferir menos memoria, otra una recuperación más fina y otra una combinación de ambas. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
- DensoVector
- TardíaInteracción
- PáginaConsulta
Capítulo 04
El modelo 260M reporta nDCG@10 de 0,523 y queda a 0,002 de una referencia mayor en esa comparación
El modelo 260M reporta nDCG@10 de 0,523 y queda a 0,002 de una referencia mayor en esa comparación. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
La cifra describe una cercanía concreta en una métrica concreta. No autoriza a decir que el modelo gana en todos los idiomas, documentos o dominios. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Capítulo 05
La diferencia de parámetros resulta relevante porque la representación puede entrar en una arquitectura con menos presión de memoria
La diferencia de parámetros resulta relevante porque la representación puede entrar en una arquitectura con menos presión de memoria. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
Menos parámetros no eliminan el costo de indexar, actualizar y consultar. La decisión debe mirar el sistema completo, no sólo el tamaño del checkpoint. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
- CalidadnDCG@10
- VelocidadPáginas/s
- MemoriaBytes/página
Capítulo 06
El almacenamiento de una página puede estimarse en miles de vectores, y la cuantización cambia de forma fuerte ese presupuesto
El almacenamiento de una página puede estimarse en miles de vectores, y la cuantización cambia de forma fuerte ese presupuesto. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
Esta es la parte operativa de la noticia: la compresión se convierte en una pregunta de bytes por página, tiempo de consulta y degradación aceptable. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Capítulo 07
La fuente reporta más de 99% del nDCG base en 39 kB y más de 95% en 6 kB bajo sus métodos de pooling y cuantización
La fuente reporta más de 99% del nDCG base en 39 kB y más de 95% en 6 kB bajo sus métodos de pooling y cuantización. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
Una pérdida pequeña en una tabla puede ser enorme para una consulta crítica. Por eso conviene guardar un conjunto de casos difíciles y mirar la cola de errores. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Capítulo 08
Una prueba empresarial debe separar calidad de recuperación, velocidad de codificación y costo de almacenamiento en el mismo corpus
Una prueba empresarial debe separar calidad de recuperación, velocidad de codificación y costo de almacenamiento en el mismo corpus. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
El retriever puede ser una pieza muy eficiente y aun así necesitar otra política para documentos sensibles, cambios frecuentes o búsquedas que exigen evidencia exacta. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Capítulo 09
NeoMME aporta una hipótesis clara: un encoder multimodal nativo puede reducir la fricción entre calidad y huella
NeoMME aporta una hipótesis clara: un encoder multimodal nativo puede reducir la fricción entre calidad y huella. La lectura responsable separa el mecanismo descrito, la evidencia disponible y cualquier promesa que todavía no aparece en la fuente.
El veredicto responsable es condicional: la fuente entrega métricas prometedoras y checkpoints abiertos; la transferencia a una biblioteca documental requiere replay propio. Las métricas y tamaños son resultados reportados por la fuente en sus configuraciones; no prueban superioridad universal, calidad jurídica ni comprensión general.
Comunidad IA gratuita
Convierte esta noticia en aprendizaje aplicado
Continúa con clases, recursos y una ruta práctica para entender la inteligencia artificial y llevarla a decisiones reales, a tu ritmo y sin costo.