Cada modelo de IA nuevo, detectado antes de que llegue a tu feed.
Monitoreo continuo de las fuentes donde los lanzamientos aparecen primero — OpenRouter, Hugging Face, Hacker News y r/LocalLLaMA. Un modelo de lenguaje clasifica cada detección por origen (🇺🇸 🇨🇳 🇪🇺), open o closed weights, y relevancia. Recibes solo lo que importa, en español.
Gratis, sin spam: solo lanzamientos. También por Telegram o RSS.
Fig. 01 — Barrido cada 30 min · 4 fuentes públicas
Bitácora de detecciones
Últimos lanzamientos.
🇺🇸 EE.UU.open weights85/100
gemma-4-31B-it-scotoma-2
ReadyArt/gemma-4-31B-it-scotoma-2 es un modelo multimodal de 31 B parámetros basado en Gemma 4, disponible bajo licencia Apache‑2.0 en Hugging Face y con capacidad de generar texto a partir de imágenes; además existen versiones GGUF cuantizadas y un endpoint de inference en FriendliAI.
BTL-4-Compact es una versión cuantizada en GGUF del modelo BTL-4, con arquitectura Mixture of Experts (MoE) y tamaño de 9,967,966,240 bytes (≈9.97 B) y 2.30 bits por peso. Reporta un 94.1 % de comportamiento condicional, lo que lo hace adecuado para ejecución local eficiente en agentes y uso de herramientas.
Se lanzó Genesis-Science-1, un modelo de IA de pesos abiertos desarrollado en conjunto por el Departamento de Energía de EE.UU. y Arcee AI para investigación científica. Forma parte de la iniciativa Genesis Mission, buscando democratizar el acceso a modelos de IA avanzada en la comunidad científica.
DeepSeek-V4-Pro-Qwen3.5-9B-MTP es un modelo de 9 B parámetros, afinado para razonamiento a partir de Qwen3.5‑9B y destilado de las respuestas de DeepSeek‑V4‑Pro en modo Max Effect. Está optimizado para tareas de codificación y lógica, ofreciendo alta eficiencia en hardware doméstico.
Ling-3.0-tiny es un modelo de arquitectura Mixture of Experts (MoE) con 7.9B de parámetros totales y solo 1.3B activos por token. Está diseñado para agentes de IA responsivos, con un enfoque en el seguimiento de instrucciones y conversaciones multi-turno.
BTL-4 es un modelo de razonamiento agente desarrollado por Bad Theory Labs. El modelo se presenta en una versión de 35B parámetros y una versión Compact (MoE) con aproximadamente 2.1B de parámetros activos por token, diseñada para optimizar el uso de memoria y cómputo.
Fuse-1-Lite es un modelo de mezcla de expertos (MoE) orientado a generación de texto y código, que combina la eficiencia de un modelo pequeño de ~2.7 B parámetros con la experiencia de codificación de Qwen3.6‑35B‑A3. Está disponible en Hugging Face bajo licencia Apache‑2.0 y tiene versiones cuantizadas para ejecución en GPUs de consumo.
Kimi K2.7 Code es un modelo de código agente de Moonshot AI, con 1 billón de parámetros, ventana de contexto de 256 K y capacidades multimodales, publicado en Hugging Face y ahora integrado en GitHub Copilot.
OpenAI lanzó el 9 de julio de 2026 su modelo insignia GPT‑5.6 Sol, con 1,05 M de contexto, precios $5/$30 por 1 M tokens y destaca en razonamiento, programación multietapa y ciberseguridad. Es el modelo más avanzado de la serie GPT‑5.6, quedando cerca de Claude Fable 5 en el índice de Inteligencia Artificial y ofreciendo la mayor ventana de contexto del mercado.
OpenAI lanzó el 9 de julio de 2026 el modelo GPT-5.6 Terra Pro, una variante del modelo Terra con modo de razonamiento 'pro' que ofrece una ventana de contexto de 1,1 M de tokens y está disponible a partir de $1 por cada 1 M de tokens de entrada. Se posiciona como la opción más avanzada dentro de la familia Terra para tareas complejas.
GPT-5.6 Luna Pro es un modelo de OpenAI diseñado para tareas complejas mediante el uso de un modo de razonamiento 'pro'. Cuenta con una ventana de contexto de 1.1M de tokens y presenta un rendimiento competitivo en tiempos de respuesta según benchmarks.
Inkling es el primer modelo open-weights de Thinking Machines Lab, basado en una arquitectura MoE de 975B de parámetros totales y 41B activos. Diseñado para el razonamiento general y el uso de herramientas, el modelo utiliza el algoritmo ECHO y es compatible con el entorno agentic RL OpenEnv.
Handoff H1 es el primer modelo de IA para toma de cuartos autónoma en planos de construcción residencial. Según anuncios oficiales de julio 2026, supera a otros modelos líderes en benchmarks por 30+ puntos y está disponible vía API. Su aplicación se enfoca en automatizar procesos de estimación en la industria de la remodelación.
MAGI‑2 es un modelo de 114 B parámetros que genera audio y video de forma unificada, activando solo 6 B parámetros por token mediante arquitectura MoE. Fue presentado en repositorios de GitHub y Hugging Face como una solución de generación multimodal.
Maple-preview es un modelo de razonamiento de 20B parámetros desarrollado por DeepGrove AI, diseñado para una inferencia eficiente en dispositivos. Utiliza una arquitectura Mixture-of-Experts (MoE) con 256 expertos (8 activos) y una configuración de 24 capas.
Wan 3.0 es el modelo de generación de video de Alibaba, lanzado en 2026, que produce clips nativos de 30 s a 1080p con audio sincronizado y estructura de escenas multi‑shot a partir de texto, imagen, audio o video de entrada.
Shieldstral es un modelo de 3 B de pesos abiertos especializado en moderación multimodal, capaz de clasificar texto e imágenes para filtrar contenido inseguro. Fue anunciado por Mistral AI el 4 de agosto de 2026 y está disponible en Hugging Face bajo licencia abierta.
Ling-3.0-flash es un modelo de razonamiento híbrido nativo de inclusionAI (Ant Group) con 124B de parámetros totales y 5.1B activos mediante arquitectura Mixture-of-Experts (MoE). Destaca por su eficiencia computacional, mejora en la precisión de tool calling y estabilidad en tareas de largo horizonte.
LFM2.5-2.6B es un modelo agentic de LiquidAI diseñado para ejecutarse localmente en dispositivos (on-device). Gracias a la arquitectura LFM2, destaca por su alta velocidad de generación, alcanzando hasta 220 tokens/s en hardware optimizado, y está capacitado para planificar y utilizar herramientas en tareas multi-paso.
Qwen2.5-Coder-3B-Instruct es un modelo de código especializado de 3 billion parámetros disponible en formato GGUF cuantizado. Su disponibilidad local permite probar código en CPU sin necesidad de GPU.
Se trata de una versión cuantizada en GGUF del modelo Qwen3‑Zero‑Coder‑Reasoning‑V2 con 0.8 B parámetros, especializada en generación de código. Su disponibilidad local permite probar razonamiento en código en máquinas sin GPU.
Versión cuantizada mediante imatrix del modelo Veriloop-Coder-E1, optimizada para tareas de ingeniería de software. Su formato GGUF permite ejecutar un modelo especializado en código directamente en hardware local sin necesidad de GPU potente.
KAT-Coder-V2.5-Dev es un modelo de código abierto especializado en generación de código, disponible en versión cuantizada 4‑bit. Su disponibilidad local permite probarlo en entornos sin GPU.
MiniMax H3 es un modelo de IA multimodal de código abierto que genera videos de hasta 2K a 24 fps con audio nativo, aceptando texto, imágenes, clips de video y referencias de audio en un solo contexto. Fue lanzado oficialmente por MiniMax en agosto 2026.
Se trata de una versión de 32B de parámetros del modelo DeepSeekV4-Flash, con modificaciones de tipo 'Abliterated' alojada en Hugging Face. El modelo está disponible para despliegue mediante proveedores de inferencia como FriendliAI.
Qwopus3.6‑27B‑Fusion es un modelo de 27 B parámetros fusionado a partir de Qwen3 y Qwen3‑5, disponible en formato GGUF para ejecución local. Combina capacidades de razonamiento y código mediante vectores de tarea, ofreciendo un nuevo enfoque en modelos abiertos.
Versión cuantizada en GGUF del modelo especializado en código de Alibaba. Es extremadamente eficiente para tareas de programación en hardware local sin GPU.
LongCat-Flash-Lite-Sparse es un modelo de mezcla de expertos (MoE) de 69 B parámetros totales, con ~3 B activados por token, que usa atención esparse LongCat y soporta hasta 1 M tokens de contexto. Está bajo licencia MIT y puede desplegarse en un solo nodo mediante SGLang.
Inkling Small es un modelo multimodal de arquitectura Mixture‑of‑Experts con 276 mil millones de parámetros en total y 12 mil millones de parámetros activos, desarrollado por Thinking Machines Lab. Está bajo licencia Apache 2.0 y, según Artificial Analysis, alcanza un rendimiento cercano al de su predecesor usando menos de un tercio de los parámetros.
DeepSeek lanza DeepSeek v4 Flash, un modelo MoE de 284B parámetros con ventana de contexto de 1M de tokens, optimizado para tareas de codificación y agentes. El modelo destaca por su eficiencia económica, con un coste de $0.28/1M de tokens de salida.
DeepSeek-V4-Flash es un modelo de lenguaje de arquitectura Mixture-of-Experts (MoE) desarrollado por DeepSeek-AI. Cuenta con 284 mil millones de parámetros totales (13 mil millones activados) y una ventana de contexto de 1 millón de tokens, optimizado para tareas de codificación y agentes.
Versión cuantizada para MLX del modelo de codificación Qwen3 con arquitectura MoE. Su bajo número de parámetros activos lo hace extremadamente eficiente para desarrollo local.
K-EXAONE-2.0-750B-A37B es un modelo de arquitectura MoE con 750 billion parámetros desarrollado por LG AI Research, disponible en Hugging Face bajo licencia open source para fomentar la democratización de la IA.
Kimi‑K3‑DSpark es un modelo de generación de texto de 4 billion parámetros disponible en Hugging Face, actualizado hace 1 día, que emplea decodificación especulativa para acelerar la generación mediante un draft‑model. Forma parte del esfuerzo de Inferact por democratizar la IA de código abierto.
XYZ-Aquila-pro es un modelo de pesos abiertos (open-weight) desarrollado por XYZ AI Lab, basado en la arquitectura Qwen3.5-397B-A17B. Se presenta como un agente de 'Deep Search' con capacidades de razonamiento y procesamiento multimodal, disponible bajo licencia Apache 2.0.
Google DeepMind ha lanzado Gemma 4, una familia de modelos abiertos con soporte nativo para system prompts y multi-token prediction. Entre sus versiones destaca el modelo de 26B parámetros, diseñado para un rendimiento de vanguardia en GPUs de consumo y estaciones de trabajo bajo licencia Apache 2.0.
A.X-K2 es un modelo de lenguaje de código abierto desarrollado por SKT como parte del proyecto de modelos fundacionales de IA soberana del gobierno de Corea. El modelo está diseñado para ofrecer una comprensión profunda del idioma y la cultura coreana.
Neutrino-8B es un modelo basado en Qwen3-8B que utiliza cuantización ternaria para operar en niveles de precisión sub-2-bit. Se ha comparado con el modelo Ternary-Bonsai-8B en benchmarks que desactivan el proceso de pensamiento para evaluar su eficiencia en hardware limitado.
Apertus-v1.5-8B es un modelo de lenguaje multimodal y totalmente abierto desarrollado por Swiss AI. Con 8 mil millones de parámetros, está diseñado para avanzar en capacidades multilingües y transparencia en IA.
Gemini 3.5 Flash Lite es un modelo de alta eficiencia de Google con capacidades agenteicas, una ventana de contexto de 1,048,576 tokens y precios de $0.30 por millón de tokens de entrada y $2.50 por millón de salida. Se posiciona como una opción ligera y fiable para flujos de trabajo multi‑agente.