Un mes, leído en corto y a propósito: qué entró en llama.cpp, qué estableció realmente la literatura de compresión de modelos pequeños y qué pesos abiertos merecen la descarga. El hilo conductor es que las técnicas para encoger modelos salieron de los papers y entraron en las cosas que ejecutamos — y que un grupo de resultados publicados esas mismas semanas dice que hemos estado midiendo el daño de forma equivocada.
De un vistazo
llama.cpp tiene NVFP4 de principio a fin. llama-quantize
ya puede producirlo #26556
y CUDA tiene kernels de repacking lineal de pesos y matriz-vector mixto para consumirlo
#26311. En la
práctica es un formato Blackwell: en Hopper sigues con FP8 y MXFP4.
La mejor aceleración gratis del mes es el clonado de KV cache. Una
nueva acción clone_to en el endpoint /slots comparte un prefijo
ya calculado entre slots en vez de volver a hacer prefill, con hasta 2,12× reportado
en Apple Silicon #26204.
Si lanzas varios agentes sobre un mismo system prompt largo, este es el cambio que hay que
traerse.
Llegó el suffix decoding: speculative decoding sin draft model. Un suffix tree online sobre el contexto propone continuaciones, así que consigues la aceleración sin alojar un segundo modelo #26283.
La on-policy distillation es ya la forma consensuada de hacer bueno un modelo pequeño, desplazando al "poda el grande". Ocho papers sustanciales en cuatro semanas, y es un ingrediente declarado en Qwen3, DeepSeek-V4 y MiMo-V2-Flash. El más útil de todos sostiene que lo que compra sobre todo es eficiencia de muestreo, no capacidad nueva 2608.11829.
La compresión de KV cache es donde se fue el volumen de investigación — una docena de papers serios en un mes, uno reclamando 20× con 99% de precisión 2608.02901, y el suelo de 2 bits ya no se sostiene 2608.07915. Para cargas de contexto largo y agentes esto tiene más palanca que cuantizar pesos.
La compresión no es neutral en comportamiento, y tus evaluaciones no lo van a detectar. Cuatro papers independientes encontraron este mes modelos comprimidos que pasan los controles de calidad habituales mientras se inventan pasos de procedimiento, degradan la validez de la cadena de razonamiento y estereotipan más en generación abierta. Ver §2, última parte — es el hallazgo con más consecuencias operativas de este número.
Unos 100–150 pull requests por semana, builds etiquetadas casi a diario, b10451 a 16 de agosto. Leer un mes de eso como changelog no sirve de nada, así que aquí va agrupado por lo que cambia para quien realmente ejecuta esto.
NVFP4 ya está soportado en todo el camino, no como experimento. Puedes cuantizar a él #26556, CUDA lo consume mediante repacking lineal de pesos con cuantización matriz-vector mixta para aprovechar caché y reutilización de datos #26311, y la cuantización de activaciones W4A4 ganó escalado por canal #25730. Esto último importa: los 4 bits solo en pesos llevan años siendo rutina; bajar también las activaciones es lo que de verdad mueve el ancho de banda de memoria.
Por debajo, mucho trabajo de kernel poco vistoso. Nuevos kernels GEMM de matrix engine para Q4_0, Q5_K y Q8_0 con dequantización de reutilización estática y bias fusionado reportan de 1,04× a 9,5× en prefill según la forma (#26323, #26326, #26371). Q2_0 llegó a CUDA #25603 y después recibió optimizaciones de producto escalar en HIP para AMD #26753. Y se amplió el rango de valores de q8_0 para reducir el error de cuantización manteniendo salidas idénticas bit a bit #25493 — ese tipo de cambio que es invisible hasta que comparas dos ejecuciones y coinciden.
Clonado de KV cache. El endpoint /slots ganó una acción
clone_to que copia una caché ya calculada entre slots, de modo que un prefijo
compartido se hace prefill una vez y no una por petición — hasta 2,12×
reportado en Apple Silicon
#26204. Cualquier
carga que abra varias peticiones sobre un mismo system prompt largo o un documento cargado
se lleva esto casi gratis.
Suffix decoding. Especulación sin modelo, construida sobre suffix trees online #26283. El speculative decoding clásico necesita un draft model residente en memoria y más o menos alineado con el modelo objetivo; un suffix tree sobre lo ya generado no necesita ninguna de las dos cosas. Se combina con una heurística de longitud de draft adaptativa para trabajo multi-turno #25726 y con la especulación por multi-token prediction de Gemma 4 #25679.
Alrededor de eso: índices KV dispersos en flash attention MMA
#25917, workers de
prefill desagregados para que un prompt largo deje de bloquear un slot de decode
#25675, parámetros
de sampling separados para los tramos de razonamiento y los que no
#25709, y un flag
--reasoning-preserve que mantiene el contenido de razonamiento en el historial
para que un turno posterior pueda construir sobre él en vez de volver a derivarlo.
El backend Hexagon se reescribió a un diseño completamente asíncrono — dispositivos multi-NPU, graph compute asíncrono, eventos, sincronización entre dispositivos #26501 — sobre una reforma de la caché L2 con seguimiento de bits sucios y flush perezoso #25762. Eso es inferencia en NPU de móvil y portátil tratada como objetivo real y no como demo.
Apareció un backend nuevo para el ET-SOC-1 de Esperanto
#24179 y se
completó rápido con soporte de K-quants, reescritura del decode GEMV y kernels de matrix
engine con doble buffer
(#26446,
#26327,
#26328). Además:
trabajo de K-quants y flash attention en el lado de decode sobre Adreno en OpenCL más
ajuste para Intel Xe-LP que vale hasta un 32% de throughput
(#26477,
#26428,
#26438);
consolidación de kernels GLU en SYCL para un +14% en Arc B70
#26354; matmul SSD
por chunks en Metal que da un +12% aproximado en el prefill de Mamba-2
#26647 más un
arreglo de NaN en mul_mm_id y reajuste del enfriamiento térmico
#26223; matmul con
constantes de especialización en Vulkan
#25773 y swizzling
XOR para eliminar conflictos de banco en memoria compartida
#25635; y una ruta
experimental de prefill MoE con CUTLASS para SM120
#26704.
El modelo de texto de Kimi K3 entró en
b10448 el 15 de
agosto — atención híbrida, residuales entre capas, expertos enrutados en MXFP4 y su
propia plantilla de chat. También este mes: Motif 3 beta con atención GDLA, PolyNorm
agrupado e hiperconexiones con restricción de variedad
#26298; Qwen3-TTS
#26254 con su
endpoint /tts de streaming en el servidor
#26603; sliding
window attention por capa para Qwen3
#26286; BailingMoE 3
y Ling 3.0 flash con speculative decoding
#26608; y una
operación sinkhorn de hiperconexión fusionada que colapsa buena parte del grafo de
DeepSeek-V4 #25585.
Nemotron-3-Puzzle, el MoE heterogéneo Hy3 de 299B de Tencent, la multi-token prediction de
Qwen3-Next y la visión de Granite 4 llegaron o se arreglaron en la misma ventana.
Un gateway compatible con OpenAI con autenticación, RBAC y registro de auditoría
#25662. Soporte de
cliente MCP saliente, para que el servidor pueda llegar a servidores de herramientas
externos #25736.
Guardado y restauración de slots multimodales
#26640. Enrutado
de modelos con descubrimiento de draft models MTP vía --models-dir. Clases de
error que distinguen el agotamiento de contexto del cliente del del servidor
#26848. Léelo todo
junto y llama-server ya no es un arnés de demostración alrededor de la librería.
El rechazo que conviene conocer
El PR #26794
intentó meter entrenamiento y compresión dentro de llama.cpp de una sola vez:
QLoRA para modelos MoE mediante pases hacia atrás de MUL_MAT_ID,
quantization-aware training con backward de straight-through estimator para
Q8_0/Q6_K/Q4_0/MXFP4, variantes cuantizadas de AdamW, SFT ponderado por tokens críticos,
SFT ponderado por recompensa al estilo GRPO, gradient checkpointing y una herramienta
llama-prune para pruning blando y duro de expertos en MoE basado en
calibración.
Se cerró el 11 de agosto — 215 commits tocando CUDA, Metal y Vulkan a la vez, rechazado por ser "demasiados cambios", no por el fondo. No se publicaron cifras de benchmark. Conviene vigilarlo por si vuelve troceado: un runtime capaz de hacer QAT y pruning de expertos en local, sobre los mismos formatos de cuantización que ya sirve, cambiaría lo que cuesta hacer fine-tuning de un modelo pequeño a cualquiera que no tenga un clúster.
GGML_OP_TOP_K cae a CPU en HIP/ROCm, con un coste de unos 6,4×.DeviceLostError de Vulkan provoca cuelgues en Strix Halo con DeepSeek-V4-Flash./slots?action=save, el parser de gramáticas y los límites de tensores LoRA
(b10451). Si
expones llama-server en algún sitio, actualiza.Todos los identificadores de arXiv de abajo se publicaron dentro de la ventana del 16 de julio al 16 de agosto. El volumen es realmente alto; lo que sigue es la parte que cambia la práctica.
La receta antigua para un buen modelo pequeño era: coge uno grande, pódalo y destila a partir de salidas estáticas del profesor. La nueva es la on-policy distillation — el alumno genera y el profesor puntúa las trayectorias del propio alumno, de modo que los estados de entrenamiento coinciden con los de despliegue. Ha entrado en pipelines de producción en Qwen3, DeepSeek-V4 y MiMo-V2-Flash, y los informes de igualar o superar a RL con aproximadamente una décima parte de las horas de GPU son lo que arrastró a todo el mundo (Thinking Machines, survey 2604.00626).
Este mes fue el de consolidación. Simple-OPD desmitifica la fase de calentamiento y propone inicialización LoRA sobre el chain-of-thought del profesor 2608.06802. "Mismatch Matters" identifica el acuerdo degenerado a nivel de token y trata por separado el exceso y el déficit del alumno 2608.09836. CROP usa sensibilidad contrafactual para encontrar qué posiciones merece la pena supervisar 2608.13387. I-SDPO enruta entre auto-destilación y aprendizaje por recompensa según la dificultad de cada instancia 2608.12957, y un método prescinde por completo de los artefactos del profesor aprendiendo un contexto privilegiado de extremo a extremo 2608.13040.
El paper que hay que leer primero, sin embargo, es el desinflador: analizada desde la óptica del test-time scaling, la on-policy distillation parece mejorar sobre todo la eficiencia de muestreo más que ampliar el razonamiento que un alumno es capaz de hacer 2608.11829. Sigue siendo muy valioso — es casi todo lo que quieres de un modelo pequeño desplegado — pero pone techo a las afirmaciones.
SNIPER unifica el pruning en profundidad y en anchura como un problema de mochila binaria, que es la primera formulación que he visto que de verdad alcanza con precisión un presupuesto de compresión declarado en vez de aproximarse 2608.12953. Como complemento, dos resultados de esparsidad en tiempo de inferencia que no necesitan reentrenamiento: Prox deriva esparsidad de activaciones en el FFN a partir de la saliencia aproximada de canales para 1,99× en decoding con un 70% de esparsidad 2607.27591, y WIDE hace pruning dinámico de anchura a nivel de token con co-diseño de kernels para 1,98× en prefill y 4,95× en decoding 2607.28418.
Dos más fáciles de pasar por alto y baratos de aplicar: pruning de vocabulario dirigido por corpus que recorta un vocabulario de 128K a 10K con un 60% de ahorro de memoria y sin pérdida de calidad en traducción 2608.03480 — las tablas de embeddings y de la LM head son una fracción grande de un modelo pequeño — y análisis con teoría de matrices aleatorias sobre los espectros de atención para encontrar los componentes realmente estructurados que conviene conservar 2608.07921.
El resultado más interesante en la práctica es ScaleQ-1.58 2608.01078: la cuantización post-entrenamiento de modelos de razonamiento venía fallando no porque 1,58 bits sea demasiado agresivo, sino porque el conjunto de calibración era el equivocado. Calibra sobre las propias trazas de razonamiento del modelo y la PTQ ternaria pasa a ser viable — 8,97 puntos absolutos en un Qwen3-4B ternarizado, con 4M de tokens de calibración. La misma forma de intuición, con otro mecanismo, en GaugeQuant, que explota simetrías del transformer para elegir online una base óptima de cuantización y lleva la perplejidad W4A4 de 8,22 a 6,73 2607.20757.
Además: ReRound usa un modelo de difusión para resolver la ambigüedad de redondeo en el punto medio 2608.11045; los tied trit-planes restringen la descomposición ternaria a un cuantizador uniforme de nueve niveles para MoE 2608.08910; ARCHead comprime específicamente la LM head — un núcleo cuantizado de bajo rango más residuales, 3,7–3,9× 2608.02703; y correcciones LoRA condicionadas por idioma recuperan lo que la cuantización le roba a los modelos multilingües 2608.11786. En el lado del análisis, una descomposición señal-ruido del error de cuantización por capa 2608.08188 y un método de contracción de márgenes que predice qué decisiones concretas se le van a torcer a un modelo de pocos bits 2608.06564.
Matryoshka Language Model Suites entrena submodelos anidados de forma conjunta con destilación continua, así que una sola tirada de entrenamiento produce toda la escalera de tamaños — un 36% menos de cómputo que entrenar cada tamaño por separado, y un 14–26% más de throughput en speculative decoding porque los miembros pequeños son drafters nativamente alineados con los grandes 2608.09703. Es el paper de compresión arquitectónicamente más interesante del mes.
Junto a él, Opt.Gear publica una familia híbrida convolución-atención de 1M a 1B de parámetros apuntando directamente a on-device 2608.01034, y "Wiring Beats Blending" caracteriza qué transfiere realmente entre tamaños de transformer, encontrando que la compensación por mínimos cuadrados supera al subcloning con presupuestos bajos de tokens 2608.02829.
Para trabajo de contexto largo y agentes, el problema de memoria es la caché, no los pesos, y la literatura ha ido detrás. AnchorKV representa la caché como anclas más residuales para 20× de compresión con 99% de precisión 2608.02901. SPECTRA aplica transformadas espectrales para descorrelacionar canales y concentrar bits donde importan, superando lo que se trataba como un límite duro de 2 bits 2608.07915. QEvict hace que el desalojo cuantizado sea recuperable cuando la atención futura reactiva una región descartada 2608.05326.
Después, un grupo sobre asignación más que sobre representación: RippleKV reparte presupuesto entre capas midiendo cómo se propagan las perturbaciones a la distribución de salida 2608.08684; GraceKV lo trata como asignación global de recursos entre resolución local y cobertura 2608.07001; DistillCache aprende una política de desalojo por RL contra una recompensa KL 2608.08878. Dos apuntan directamente a agentes: CommitKV usa las fronteras de eventos del agente para distinguir estados latentes de estados completados 2608.07855, y la transferencia de KV entre modelos mapea una caché entre modelos de una misma familia mediante regresión ridge en forma cerrada, de modo que cambiar de modelo no obligue a rehacer el prefill 2608.03893. RotaryQuant es el práctico y directo: precisión mixta más transformadas isotropizantes de la caché para meter un MoE de 120B en hardware de consumo 2608.08081.
Esta parte, léela dos veces
Cuatro papers independientes este mes, con métodos distintos, llegaron a la misma conclusión incómoda: un modelo comprimido puede pasar todas las comprobaciones que haces hoy y aun así comportarse de forma distinta en aspectos que importan.
"Fidelity Is Not Safety" encuentra modelos comprimidos suavemente por bajo rango que superan los controles de calidad habituales mientras se inventan pasos de procedimiento durante la ejecución agéntica 2607.28196. "Does Accuracy Equal Evidence?" encuentra que el desalojo de tokens de la KV cache preserva la precisión de la respuesta final mientras degrada la validez de la cadena de razonamiento que la produjo 2608.01631. QuantiBias encuentra modelos cuantizados que pasan los controles de seguridad estándar y sin embargo estereotipan de forma medible más en generación abierta, en ocho idiomas 2607.21063. Y un benchmark directo de SLMs preentrenados frente a comprimidos encuentra que la cuantización preserva mejor la fiabilidad que el pruning o la destilación 2608.11981.
Dos resultados adyacentes lo afinan: las ediciones secuenciales de memoria degradan catastróficamente los modelos de 4 bits salvo que se estabilicen de forma explícita 2607.28292, y la cuantización a 4 bits daña de forma sustancial las señales internas de confianza de los modelos visión-lenguaje incluso donde la precisión en tarea aguanta 2607.24440.
La regla práctica convergente, repetida en todos ellos y coherente con la literatura previa de pruning frente a cuantización: cuantiza en lugar de podar; el pruning daña específicamente el razonamiento; y valida sobre trazas agénticas, no sobre perplejidad y test de opción múltiple.
Solo pesos abiertos, y solo lo relevante para ejecutar cosas por tu cuenta. Las fechas son de anuncio; varios de estos escalonaron la descarga real, y se indica.
| Fecha | Modelo | Por qué importa |
|---|---|---|
| 10 ago | Meta Muse Glimmer | Meta vuelve a los pesos abiertos. 30B denso (~29,6B en 52 capas) más un encoder ViT-G/14 de 1,8B, contexto de 131K+, Apache 2.0, dimensionado para una sola GPU de consumo y orientado explícitamente a agentes locales siempre activos. Integraciones desde el día cero para llama.cpp, MLX y ExecuTorch — la publicación con más probabilidades de cambiar lo que ejecutas en local. |
| 14 ago | Qwen3.8-27B | La mitad ejecutable en local de la publicación Qwen3.8. Contexto nativo de 262K, viene con un encoder de visión de 27 capas y su propio preprocesado de imagen y vídeo. |
| 3–12 ago | Qwen3.8-Max | MoE de 2,4T de parámetros, 95B activos, contexto de 1M, texto/imagen/ vídeo nativos, Apache 2.0 — el primer Qwen de nivel Max descargable. Anunciado el 3 de agosto, pesos en Hugging Face y ModelScope hacia el 12; la cobertura sobre el escalonamiento fue inconsistente, así que mira el repositorio y no las noticias. |
| jul | Kimi K3 | 2,78T totales, 104B activos. Kimi Delta Attention (atención lineal con control del decaimiento por canal), residuales de atención que permiten a una capa recuperar representaciones de capas anteriores arbitrarias, y enrutado Stable LatentMoE que proyecta 896 expertos a una latente de 3.584 antes del despacho, con 16 activos más 2 compartidos. Reclama ~2,5× la eficiencia de escalado de K2. El soporte en llama.cpp entró el 15 de agosto. |
| 14 ago | GLM-5.3 | MoE de 743B, ~40B activos — la misma base que GLM-5.2, con todas las mejoras reportadas atribuidas a más post-entrenamiento. 66,9% en DeepSWE, veinte puntos por encima de 5.2. Pesos MIT, pero escalonados unas dos semanas después del lanzamiento. |
| 4 y 13 ago | Liquid LFM2.5 | LFM2.5-2.6B (34T tokens de entrenamiento, construido para bucles de agente on-device) y LFM2.5-VL-3B, un modelo visión-lenguaje de 3,1B que lee pantallas, localiza objetos y llama herramientas en local. La opción seria de gama edge este mes. |
Dos piezas de contexto fuera de ventana a las que responde todo lo anterior. El Nemotron-3-Puzzle-75B-A9B de NVIDIA (6 de julio, justo antes de esta ventana) es una variante comprimida de un modelo de la clase 120B producida por un framework de compresión post-entrenamiento llamado "Iterative Puzzle" — compresión a escala como producto que se publica, no como paper. Y DeepSeek-V4 (abril) sigue siendo la arquitectura que persiguen los stacks de inferencia: Compressed Sparse Attention y Heavily Compressed Attention intercaladas que bajan la inferencia a 1M de tokens al 27% de los FLOPs de V3.2 y al 10% de su KV cache. Buena parte del trabajo de Vulkan y CUDA de §1 existe para que esa arquitectura corra en hardware propio.
GLM-5.3 es la evidencia más limpia disponible: idéntica base de 743B que su predecesor, veinte puntos de mejora en DeepSWE, y todo atribuido al post-entrenamiento. Cuando la base se mantiene fija y la ganancia es de ese tamaño, la pregunta interesante de presupuesto deja de ser "cuánto cómputo de preentrenamiento" y pasa a ser "cuánto post-entrenamiento, y de qué tipo".
Que Kimi K3 publique KDA a 2,78T de parámetros es el titular, pero la literatura de apoyo llegó el mismo mes. MixFormer combina varios expertos de memoria con atención lineal consciente del tiempo 2608.09468; un esquema híbrido por bloques reincorpora atención lineal a los modelos de lenguaje por difusión, manteniendo softmax exacto dentro del bloque y pasando a lineal entre bloques anteriores 2608.06628; MARCH escala memoria recurrente con anclas de estado enrutadas por contenido 2608.12435; y un estudio empírico caracteriza los patrones de activaciones masivas que producen estos híbridos, que es justamente el conocimiento que la cuantización necesita para no romperse con ellos 2608.12149.
Macaron-V1 ataca el aprendizaje continuo abierto con auto-mejora y una mezcla de LoRAs 2608.09819; BDH-CQ explora in-context learning con razonamiento latente recurrente 2608.09888; Consolidator aprende a mover memoria de corto a largo plazo cruzando fronteras de contexto 2608.11701. Todavía temprano — pero es la dirección que acabaría haciendo que "el modelo no recuerda la semana pasada" deje de ser un problema de arquitectura que se esquiva con retrieval.
El trabajo interesante dejó de ser "¿puede la difusión hacer lenguaje?" y pasó a ser "¿a qué velocidad decodifica?". DARTree extiende la corrección autorregresiva a árboles de draft, sin entrenamiento 2608.13524; Ripple-Pivot explota el efecto de propagación comprometiendo posiciones de entropía media para paralelizar el decoding 2608.11742; LibraSpec reformula la longitud de especulación como optimización de la aceleración esperada 2608.08721; Archer reutiliza estados ocultos en caché de forma asimétrica para una aceleración media de 2,57× 2608.08086.
Los sistemas de servicio y entrenamiento para agentes ya producen papers de sistemas de verdad: TideRL planifica RL agéntico por disponibilidad con batching continuo de tareas 2608.10402; MISA-T planifica rollouts mixtos de RL más allá de la localidad de prefijo con asignación adaptativa de KV 2608.11152; CRISP entrena agentes de búsqueda distinguiendo la recogida de evidencia necesaria de los turnos redundantes, recortando turnos un 15–33% 2608.01867; HetRoute hace enrutado colaborativo consciente de coste para inferencia MoE distribuida en edge, reportando un 59% menos de latencia y un 72% menos de tráfico 2608.00577. En el lado adversarial, OpenART escala el red-teaming de agentes mediante evolución abierta de entornos 2608.00677.
Ordenado por lo listo que está cada cosa, no por lo interesante que es.
Recompila llama.cpp y activa el clonado de caché. Si una carga abre
varias peticiones sobre un mismo system prompt o un documento cargado — que es lo
que describe la mayoría de montajes con agentes — /slots
clone_to es throughput casi gratis. Combínalo con suffix decoding, que no
necesita alojar draft model, y con prefill desagregado si los prompts largos están
matando de hambre a los slots de decode.
Cuantiza; no podes. Dos líneas de evidencia independientes este mes, sobre la literatura ya existente, dicen que la cuantización preserva mejor el razonamiento y la fiabilidad que el pruning a compresión equivalente. Si necesitas más de lo que da la cuantización, el siguiente movimiento es on-policy distillation hacia un modelo más pequeño — no pruning estructurado del grande.
Cambia cómo se validan los modelos comprimidos. La perplejidad y los benchmarks de opción múltiple se pierden demostrablemente los modos de fallo: pasos de procedimiento inventados en ejecución agéntica, cadenas de razonamiento que ya no sostienen sus propias respuestas correctas, más estereotipos en generación abierta. Un modelo comprimido debería volver a pasarse por trazas de tarea reales inspeccionando la cadena, no solo puntuando la respuesta final.
Compresión de KV cache. Los resultados son fuertes y el volumen alto, pero casi todo tiene un mes y nada ha aterrizado todavía en un runtime mayoritario. Los métodos basados en asignación (RippleKV, GraceKV) y los conscientes de agentes (CommitKV) son los que esperaría ver llegar antes a un stack de servicio. Lo revisitamos en el próximo número.
El PR #26794 de llama.cpp, si vuelve troceado. QAT y pruning de expertos en local sobre los mismos formatos de cuantización que el runtime ya sirve cambiaría lo que cuesta hacer fine-tuning de un modelo pequeño a cualquiera que no tenga un clúster. Se rechazó por tamaño, no por el fondo.
Cuantización post-entrenamiento ternaria y de 1,58 bits, incluso con la intuición de calibración de ScaleQ-1.58, y decoding de LLMs por difusión. Ambos se mueven de verdad; ninguno tiene una historia de despliegue en la que merezca la pena apoyarse este trimestre.
NVFP4 es un formato Blackwell. La ruta NVFP4 de llama.cpp asume soporte de hardware que Hopper no tiene — en H100, las precisiones aplicables son FP8 y MXFP4, no NVFP4. Conviene comprobarlo antes de cuantizar un modelo para el objetivo equivocado.
Lista corta de modelos locales, si estás renovando la tuya: Muse Glimmer 30B para trabajo agéntico en una GPU, Qwen3.8-27B donde importen la visión y el contexto largo, LFM2.5-2.6B o VL-3B para on-device de verdad. Todos Apache 2.0.
El sustrato que da por supuesto el resto del número. Agrupado por área y ordenado para que cada término se apoye en los anteriores, no alfabéticamente — está pensado para leerse de principio a fin, no solo para consultarlo.
llama-prune; cerrado el 11 ago 2026.arxiv.org/abs/ y se obtuvieron vía la API de arXiv filtrada al 16 jul – 16 ago 2026.Compilado el 16 de agosto de 2026 a partir del feed de releases y los informes semanales de GitHub de llama.cpp, la API de arXiv filtrada a esta ventana y la cobertura de publicaciones de modelos. Las cifras citadas como aceleraciones o ratios de compresión son las que reportan los propios autores sobre sus propios benchmarks — trátalas como afirmaciones, no como mediciones, hasta reproducirlas. Todo lo fechado fuera del 16 de julio – 16 de agosto de 2026 se indica en línea como contexto.