Qué se movió de verdad en LLMs, una vez al mes — sesgado hacia lo que puedes ejecutar tú. llama.cpp, compresión de modelos pequeños y los pesos abiertos que merecen la descarga.
Una ventana fija de un mes, leída en corto: qué entró en llama.cpp, qué estableció realmente la literatura de compresión y modelos pequeños, y qué pesos abiertos se publicaron. Más un glosario de la tecnología de base.
Para quien despliega esto, no solo para quien lee sobre ello — cualquiera que esté eligiendo un formato de cuantización, dimensionando un modelo local o decidiendo si una técnica está lista. Da por hecho que construyes.
Montevive, un estudio de ingeniería de IA en Granada. Construimos y operamos sistemas con LLMs para clientes, y este es el resumen que queríamos leer y no encontrábamos.
Los términos técnicos consolidados se mantienen en inglés — KV cache, prefill, speculative decoding — porque es como aparecen en la práctica. Traducirlos dificultaría la lectura en vez de facilitarla.
La mayoría de resúmenes de IA son un modelo resumiendo otros resúmenes. Este tiene un método, y el método es lo importante — es la razón por la que se pueden fiar de sus cifras.
La ventana se fija antes de empezar la investigación, y se imprime en el número. Cualquier cosa anterior que merezca mención se etiqueta como contexto, nunca se cuela como novedad.
Cada afirmación lleva un enlace. Sin enlace, no hay afirmación. Los papers citan el identificador de arXiv, el trabajo de llama.cpp cita el pull request, las publicaciones de modelos citan la ficha del modelo.
Las afirmaciones que sostienen el número se verifican en la fuente primaria, no en un resumen de ella. En el número 01 eso detectó un pull request muy difundido descrito como publicado cuando en realidad había sido rechazado, y dos cifras que los resúmenes de búsqueda habían parafraseado mal.
Las cifras de los propios autores se etiquetan como afirmaciones, no como mediciones. Una compresión reportada de 20× es lo que dice el paper, y el número lo indica así.
Los juicios son explícitos y ordenables — cada recomendación
lleva un veredicto ADOPTAR, VIGILAR o
SOLO LABORATORIO, y el número no tiene reparo en decir solo laboratorio.
Número 0116 jul — 16 ago 20266 secciones · ~70 citas
Todavía no hay formulario de alta — y antes que recopilar direcciones sin un consentimiento y una baja en condiciones, preferimos que nos lo pidas. Escríbenos para que te añadamos, o suscríbete al feed Atom, que no necesita dirección alguna.