LLM Radar

Qué se movió de verdad en LLMs, una vez al mes — sesgado hacia lo que puedes ejecutar tú. llama.cpp, compresión de modelos pequeños y los pesos abiertos que merecen la descarga.

Publicado por Montevive · Mensual · Lectura gratuita

Qué es esto

Qué cubre

Una ventana fija de un mes, leída en corto: qué entró en llama.cpp, qué estableció realmente la literatura de compresión y modelos pequeños, y qué pesos abiertos se publicaron. Más un glosario de la tecnología de base.

Para quién es

Para quien despliega esto, no solo para quien lee sobre ello — cualquiera que esté eligiendo un formato de cuantización, dimensionando un modelo local o decidiendo si una técnica está lista. Da por hecho que construyes.

Quién lo escribe

Montevive, un estudio de ingeniería de IA en Granada. Construimos y operamos sistemas con LLMs para clientes, y este es el resumen que queríamos leer y no encontrábamos.

Sobre el idioma

Los términos técnicos consolidados se mantienen en inglés — KV cache, prefill, speculative decoding — porque es como aparecen en la práctica. Traducirlos dificultaría la lectura en vez de facilitarla.

Cómo se hace

La mayoría de resúmenes de IA son un modelo resumiendo otros resúmenes. Este tiene un método, y el método es lo importante — es la razón por la que se pueden fiar de sus cifras.

La ventana se fija antes de empezar la investigación, y se imprime en el número. Cualquier cosa anterior que merezca mención se etiqueta como contexto, nunca se cuela como novedad.

Cada afirmación lleva un enlace. Sin enlace, no hay afirmación. Los papers citan el identificador de arXiv, el trabajo de llama.cpp cita el pull request, las publicaciones de modelos citan la ficha del modelo.

Las afirmaciones que sostienen el número se verifican en la fuente primaria, no en un resumen de ella. En el número 01 eso detectó un pull request muy difundido descrito como publicado cuando en realidad había sido rechazado, y dos cifras que los resúmenes de búsqueda habían parafraseado mal.

Las cifras de los propios autores se etiquetan como afirmaciones, no como mediciones. Una compresión reportada de 20× es lo que dice el paper, y el número lo indica así.

Los juicios son explícitos y ordenables — cada recomendación lleva un veredicto ADOPTAR, VIGILAR o SOLO LABORATORIO, y el número no tiene reparo en decir solo laboratorio.

Número actual

Número 0116 jul — 16 ago 20266 secciones · ~70 citas

La compresión dejó de ser un tema de investigación y pasó a ser una función del runtime.

  • llama.cpp tiene NVFP4 de principio a fin — y un endpoint de clonado de KV cache que reporta hasta 2,12× en cargas con prefijo compartido.
  • Speculative decoding sin draft model, mediante suffix trees.
  • La on-policy distillation desplazó al "poda el grande" como forma de hacer bueno un modelo pequeño.
  • Cuatro papers independientes encontraron modelos comprimidos que pasan todos los controles de calidad habituales mientras se comportan de forma medible distinta.
Leer el número 01

Todos los números

Recibe el siguiente

Todavía no hay formulario de alta — y antes que recopilar direcciones sin un consentimiento y una baja en condiciones, preferimos que nos lo pidas. Escríbenos para que te añadamos, o suscríbete al feed Atom, que no necesita dirección alguna.