<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="es">
  <id>https://radar.montevive.ai/es/</id>
  <title>LLM Radar</title>
  <subtitle>Qué se movió de verdad en LLMs, una vez al mes. llama.cpp, compresión de modelos pequeños y los pesos abiertos que merecen la descarga.</subtitle>
  <link rel="self" type="application/atom+xml" href="https://radar.montevive.ai/es/feed.xml"/>
  <link rel="alternate" type="text/html" href="https://radar.montevive.ai/es/"/>
  <updated>2026-08-16T12:00:00Z</updated>
  <author>
    <name>Montevive</name>
    <uri>https://montevive.ai</uri>
    <email>ai@montevive.ai</email>
  </author>
  <rights>© 2026 Montevive</rights>

  <entry xml:lang="es">
    <id>https://radar.montevive.ai/es/issues/2026-08-16-estado-del-arte-llm.html</id>
    <title>Número 01 — La compresión dejó de ser un tema de investigación y pasó a ser una función del runtime</title>
    <link rel="alternate" type="text/html" href="https://radar.montevive.ai/es/issues/2026-08-16-estado-del-arte-llm.html"/>
    <updated>2026-08-16T12:00:00Z</updated>
    <published>2026-08-16T12:00:00Z</published>
    <category term="llama.cpp"/>
    <category term="modelos de lenguaje pequeños"/>
    <category term="cuantización"/>
    <summary type="text">Del 16 de julio al 16 de agosto de 2026. llama.cpp tiene NVFP4 de principio a fin más un endpoint de clonado de KV cache que reporta hasta 2,12x en cargas con prefijo compartido, y el suffix decoding trajo speculative decoding sin draft model. La on-policy distillation desplazó al pruning estructurado como forma de hacer bueno un modelo pequeño, y la compresión de KV cache es donde se fue el volumen de investigación. Cuatro papers independientes encontraron modelos comprimidos que pasan todos los controles de calidad habituales mientras se comportan de forma medible distinta. Incluye un glosario de la tecnología de base.</summary>
  </entry>

</feed>
