Cada modelo de IA nuevo, detectado antes de que llegue a tu feed.
Monitoreo continuo de las fuentes donde los lanzamientos aparecen primero — OpenRouter, Hugging Face, Hacker News y r/LocalLLaMA. Un modelo de lenguaje clasifica cada detección por origen (🇺🇸 🇨🇳 🇪🇺), open o closed weights, y relevancia. Recibes solo lo que importa, en español.
Gratis, sin spam: solo lanzamientos. También por Telegram o RSS.
Fig. 01 — Barrido cada 30 min · 4 fuentes públicas
Bitácora de detecciones
Últimos lanzamientos.
🌍 Otroopen weights🧑💻 local coder85/100
Nex-N2.5-Mini
Nex-N2.5-Mini es un modelo agente especializado en codificación con bucle de retroalimentación visual, anunciado como gratuito en OpenRouter. Su diseño para implementación multi-archivos lo posiciona como candidato a pruebas locales si su tamaño activo es manejable.
Mercury 2.5 es un LLM de razonamiento y difusión (dLLM) de Inception, diseñado para generar tokens en paralelo. Alcanza 1,107 tokens/segundo, ofrece una ventana de contexto de 260K y un aumento del 40% en inteligencia respecto a Mercury 2, según anuncios oficiales y reseñas técnicas.
GLM-5.3 es el último modelo destacado de Z.ai, optimizado para ingeniería de software con ventana de contexto de 1M tokens. Su diseño avanza en razonamiento complejo y capacidades emergentes de ciberseguridad, con un 50% de mejora en pruebas propias de codificación frente a GLM-5.2.
DeepSeek V4 Flash Vision Exp es un modelo multimodal experimental de visión y texto, derivado de DeepSeek V4 Flash 0731, con soporte para 1M de contexto y 384K de salida máxima. Ofrece procesamiento de imágenes (OCR, análisis de gráficos) y razonamiento textual, disponible vía API con precios por token. No hay pesos abiertos para uso local.
Modelo de código Qwen3 con arquitectura MoE y cuantización selectiva INT8, optimizado para eficiencia. Su relevancia depende de su tamaño GGUF y rendimiento en tareas de programación local.
OpenAI lanza GPT-6 Astra Pro, una versión optimizada con modo 'pro' para tareas complejas. Es un modelo cerrado accesible solo vía API, sin disponibilidad local.
Ling 3.0 Flash Sante es un modelo de IA Mixture-of-Experts (MoE) de InclusionAI, especializado en salud y medicina, con 5.1B parámetros activos (de 124B totales). Está disponible gratuitamente y no está optimizado para programación ni uso local en CPU.
GPT-6 Astra logró 3% en el benchmark FrontierMath Erdős, superando a otros modelos que obtuvieron 0%. Este resultado sugiere un avance en razonamiento matemático avanzado, aunque el modelo sigue siendo cerrado y no disponible para pruebas locales.
K2-Horizon-7B es un modelo de IA de 7 mil millones de parámetros (9B incluyendo embeddings) con pesos abiertos para generación de texto, publicado en Hugging Face por IFM. Soporta contextos de hasta 524,288 tokens y está optimizado para tareas conversacionales y de generación local.
Google lanzó TimesFM-3, un modelo de IA para pronóstico de series temporales con 330M parámetros y licencia no comercial. Es relevante para aplicaciones en finanzas, logística y análisis de datos, pero no para tareas de programación.
OpenAI anunció repositorios de pruebas 'lean' en preparación para el lanzamiento de Astra, un modelo no documentado que podría ser su próxima generación. La novedad radica en la posible evolución de su línea de modelos, aunque no hay detalles técnicos claros.
Qwen3.8-27B es un modelo multimodal de 27B parámetros de Alibaba con ventana de contexto de 262K, optimizado para codificación y tareas de razonamiento. Incluye speculative decoding (MTP draft head) y está disponible en Hugging Face, aunque la versión EXL3-3.5bpw mencionada en la alerta no se verifica explícitamente en la evidencia.
Alibaba lanza Qwen3.8-Max, un modelo de IA de 8 mil millones de parámetros con enfoque en razonamiento y posible especialización en código. Su disponibilidad local podría atraer a desarrolladores con recursos limitados.
Granite 4.2 8B es un modelo de razonamiento de IBM optimizado para código, matemáticas y diálogo multilingüe. Según Artificial Analysis, procesa 104.966 tokens por segundo y cuesta $0.06 por millón de tokens de entrada, posicionándolo como una opción para tareas profesionales.
Ornith-1.5-9B es una variante 'abliterated' y sin censura de Qwen3.5, disponible en Hugging Face con 9B parámetros. Aunque abierto y reciente, no está optimizado para tareas de codificación en entornos sin GPU.
Inkling Small es un modelo multimodal de mezcla de expertos (12B activos de 276B totales) de Thinking Machines Lab, optimizado para eficiencia y contexto extenso (524K tokens). Su diseño abierto lo posiciona como una alternativa ligera para tareas complejas, aunque su tamaño activo lo hace inviable para benchmarks locales sin GPU.
Google DeepMind lanzó Gemma 4 31B IT, un modelo multimodal de 30.7B parámetros con ventana de contexto de 256K tokens y soporte para entrada de texto e imagen. Su diseño orientado a razonamiento y modo configurable lo posiciona como un competidor en el ámbito de la IA generativa avanzada.
Modelo sparse MoE abierto con 95B parámetros activos de 2.4T, optimizado para tareas complejas. Bajo costo en API, pero inaccesible para uso local en CPU.
El post de Reddit menciona benchmarks de Hy4, un modelo de IA de Tencent, pero no proporciona detalles suficientes para evaluar su relevancia técnica o viabilidad local. La falta de información sobre arquitectura, pesos o rendimiento específico limita su utilidad inmediata.
Modelo de codificación 27B recién publicado en Hugging Face con soporte GGUF para uso local, pero su tamaño excesivo lo hace inviable para entornos sin GPU. Su enfoque en agentes y contextos largos lo posiciona como candidato para tareas complejas, aunque su implementación requiere recursos elevados.
Mistral Medium 3.1 es un modelo multimodal de IA de clase frontier lanzado en agosto de 2026, optimizado para bajo costo operativo con una ventana de contexto de 131.1K tokens. Sus pesos están disponibles en OpenRouter, y el modelo combina rendimiento avanzado con precios competitivos ($0.40 por millón de tokens de entrada y $2.00 por salida).
Ministral 3 8B 2512 es un modelo multimodal de 8 mil millones de parámetros con contexto de 262k tokens, optimizado para eficiencia energética y disponible en OpenRouter con precios de $0.15 por millón de tokens. Incluye capacidades de visión y está diseñado para entornos sin GPU, según fuentes verificadas como Benchable.ai y Magica.com.
Modelo de IA de voz con Mixture-of-Experts anunciado por pipecat-ai en Hugging Face. No está optimizado para CPU y no está enfocado en tareas de codificación. Disponible bajo licencia open source.
Modelo de código abierto de 3B de Qwen, especializado en generación de código y conversaciones técnicas. Útil para tareas de programación en entornos locales sin necesidad de GPU.
Se anuncia la liberación de pesos del modelo GLM-5.3, una actualización de la serie de Zhipu AI. Su relevancia depende de su aplicación específica y disponibilidad técnica.
Qwen3.8 Flash es un modelo multimodal de Alibaba diseñado para razonamiento complejo, análisis de código y flujos de trabajo agenticos. Su contexto de 1 millón de tokens lo posiciona para tareas de documentos y video largo, pero su acceso está limitado a APIs con precios reducidos.
GLM-5.3-Flash es un modelo multimodal de arquitectura Mixture-of-Experts (MoE) desarrollado por ZAI, con un total de 321B de parámetros y 18B activos por token. El modelo cuenta con 45 capas y utiliza capas de atención lineal KDA, diseñado para capacidades multimodales nativas.
Breeze-TTS-2 es un modelo de generación de voz y clonación de voz open-weight basado en la arquitectura Breeze, optimizado para interacciones en tiempo real. Lidera el leaderboard de Artificial Analysis y supera a modelos propietarios de frontera en calidad de voz.
Z.ai anuncia Ox Alpha, un modelo GLM-series en competencia con DeepSeek, con pesos previstos en apertura. Si es open y pequeño, podría ser relevante para desarrollo local.
Versión GGUF cuantizada del modelo de código DeepSeek-Coder-V2-Lite-Instruct (7B). Aunque útil para uso local, su anuncio original data de 2024, no es novedad.
Nueva variante de la familia Qwen diseñada con una arquitectura optimizada para ejecución rápida. Su estructura sugiere un alto rendimiento en dispositivos locales con recursos limitados.
Apodex-1.1-mini es un modelo multimodal de razonamiento basado en Qwen3.5 MoE con 36B parámetros, optimizado para tareas complejas y código. Disponible en Hugging Face con versiones GGUF y FP8, bajo licencia Apache-2.0.
Hy-MT2-7B es un modelo de traducción multilingüe de 7 mil millones de parámetros desarrollado por Tencent. Pertenece a la familia Hy-MT2, diseñada para escenarios complejos con soporte para 33 pares de idiomas y variantes chinas. Ofrece versiones cuantizadas (GGUF, FP8) para despliegue eficiente en vLLM y llama.cpp.
Qwen3.8-27B es un modelo multimodal de 27 mil millones de parámetros desarrollado por Qwen (Alibaba), disponible en formato open-weight bajo licencia Apache 2.0. Incluye capacidades de visión, razonamiento y contexto nativo de 262K tokens, con benchmarks destacados en DeepSWE 42.2, Terminal Bench 73.0 y OSWorld 84.3.
Muse Spark 1.2 Contributor es un modelo de razonamiento de Meta con ventana de contexto de 1 M de tokens, disponible a través de varios proveedores con precios desde $0.10 por 1 M de tokens de entrada y $0.20 por 1 M de salida, y obtuvo una puntuación de razonamiento de 1646, posicionándose en el top 3 entre 20 modelos.
Inkling es un modelo multimodal de 975 billion parámetros (41 billion activos) de Thinking Machines Lab, basado en arquitectura MoE y disponible en open‑weights y gratis. Está diseñado para razonamiento general y uso de herramientas.
Inkling Small es un modelo multimodal de mezcla de expertos (MoE) de Thinking Machines Lab con 276B parámetros totales y 12B activos, disponible gratuitamente bajo licencia Apache 2.0. Diseñado para razonamiento y codificación, fue lanzado en julio de 2026 y compite con modelos más grandes en rendimiento.
SenseTime ha abierto el modelo SenseNova U1.5‑Lite‑Preview, una arquitectura multimodal de 8 B parámetros (MoT) basada en NEO‑Unify, capaz de generación de imágenes 4K y edición precisa, con resultados que superan benchmarks anteriores. El modelo está disponible bajo licencia open‑source en Hugging Face y GitHub.
Qwen2.5-Coder-1.5B es un modelo de código abierto especializado en generación de código, con 1.5 billion de parámetros. Su disponibilidad en formato GGUF permite ejecutarlo localmente en CPUs sin GPU, lo que lo hace útil para desarrolladores que prueban algoritmos en entornos con recursos limitados.
Hy-MT2-1.8B es un modelo de traducción multilingüe de 1.8 B parámetros de Tencent que soporta 33 pares de idiomas y varios dialectos chinos, formando parte de la familia Hy-MT2 que incluye versiones de 7 B y 30 B (MoE).