Liquid AI lanzó LFM2.5-230M, un modelo de 230M de parámetros diseñado para el despliegue en el borde. La arquitectura se basa en LFM2, se preentrenó con 19T tokens y se destiló a partir de su modelo de 350M.
Métricas de rendimiento: 213 tok/s de decodificación en la CPU del Galaxy S25 Ultra, 42 tok/s en Raspberry Pi 5. Ventana de contexto de 32K. Supera a modelos 2 veces de su tamaño en seguimiento de instrucciones, extracción de datos y uso de herramientas.
Despliegue real: se ejecuta en el dispositivo en el robot Unitree G1 (NVIDIA Jetson Orin). Toma entrada en lenguaje natural y genera planes estructurados de varios pasos con llamadas a herramientas. Cero dependencia de la nube.
Soporte de frameworks listo para usar:
- llama.cpp (GGUF) para el borde
- MLX para Apple Silicon
- vLLM y SGLang para servir en GPU
- ONNX para compatibilidad multiplataforma
Hay versiones tanto instruct como base disponibles en Hugging Face.
Esta es la densidad de inteligencia bien hecha. 230M de parámetros funcionando a estas velocidades hace que los flujos de trabajo agentic en el dispositivo sean realmente viables para teléfonos, robots y automatización del hogar. Privacidad primero, optimizado para baja latencia, sin costos de API. El juego de la inferencia en el borde acaba de ponerse serio.
Métricas de rendimiento: 213 tok/s de decodificación en la CPU del Galaxy S25 Ultra, 42 tok/s en Raspberry Pi 5. Ventana de contexto de 32K. Supera a modelos 2 veces de su tamaño en seguimiento de instrucciones, extracción de datos y uso de herramientas.
Despliegue real: se ejecuta en el dispositivo en el robot Unitree G1 (NVIDIA Jetson Orin). Toma entrada en lenguaje natural y genera planes estructurados de varios pasos con llamadas a herramientas. Cero dependencia de la nube.
Soporte de frameworks listo para usar:
- llama.cpp (GGUF) para el borde
- MLX para Apple Silicon
- vLLM y SGLang para servir en GPU
- ONNX para compatibilidad multiplataforma
Hay versiones tanto instruct como base disponibles en Hugging Face.
Esta es la densidad de inteligencia bien hecha. 230M de parámetros funcionando a estas velocidades hace que los flujos de trabajo agentic en el dispositivo sean realmente viables para teléfonos, robots y automatización del hogar. Privacidad primero, optimizado para baja latencia, sin costos de API. El juego de la inferencia en el borde acaba de ponerse serio.