Beelink SER9 Pro para IA local y agentes
Vídeo relacionado: https://youtu.be/xHpK2HJDSxw
El Beelink SER9 Pro puede ejecutar modelos locales y usarse con agentes como OpenClaw, pero la conclusión práctica no depende solo de tokens/s. Para un usuario normal importa sobre todo esto: si la tarea se completa, cuánto tarda y si la combinación se puede instalar y mantener sin pelearse demasiado.
Lectura actual: para empezar, la ruta más clara sigue siendo OpenClaw + Ollama ROCm + Qwen3.5 9B. Funciona bien para lectura, búsquedas, pequeñas tareas de código y acciones sencillas sobre Home Assistant. Hermes también puede conectarse a Ollama ROCm y completar algunas tareas, pero en esta batería queda por detrás de OpenClaw: tarda más, se atasca más con contexto largo y falla más cuando tiene que crear artefactos o razonar sobre muchos datos de Home Assistant.
Índice
- Entorno de pruebas
- Cómo funciona la pila
- Qué mide cada tarea
- Qwen3.5 9B + OpenClaw + Ollama ROCm
- Qwen3.5 9B + OpenClaw + FastFlowLM NPU
- Qwen3-Coder 30B A3B + OpenClaw + Ollama ROCm
- GLM-4.7-Flash Q4_K_M + OpenClaw + Ollama ROCm
- Gemma4 26B A4B Q4 + OpenClaw + Ollama ROCm
- Qwen3.6 27B IQ4 (batiai) + OpenClaw + Ollama ROCm
- Paperless-ngx con documentos reales
- Proxmox: auditoría de seguridad con OpenClaw
- Programación: agenda en Quarkus
- Programación: agenda en Quarkus con Qwen3.6
- Dashboard local para monitorizar OpenClaw
- Programación sencilla con modelos candidatos
- Hermes + Qwen3-Coder 14B 64K + Ollama ROCm
- Comparativa directa: OpenClaw vs Hermes con Qwen3.5 9B
- Pruebas de contexto largo con OpenClaw
- Respuesta a @e270889o sobre contexto largo
- Te interesa probarlo?
Entorno de pruebas
Estas pruebas se han hecho siempre sobre el mismo equipo y con los modelos ejecutándose en contenedores LXC separados dentro de Proxmox. Las versiones importan: un cambio de Ollama, ROCm, Vulkan o del propio modelo puede cambiar los tiempos y también la capacidad de usar herramientas.
| Categoría | Configuración usada |
|---|---|
| Equipo | Beelink SER9 Pro, hardware AZW SER9, BIOS SER9T407. |
| CPU | AMD Ryzen AI 9 HX PRO 370, 12 núcleos / 24 hilos. |
| GPU | AMD Radeon 890M integrada. Es la GPU usada para las pruebas con ROCm y Vulkan. |
| NPU | AMD Strix/Krackan/Strix Halo NPU detectada. No se usa en la recomendación final con OpenClaw. |
| Memoria | 27 GiB visibles para Proxmox durante las pruebas, con memoria compartida con la iGPU. |
| Almacenamiento | NVMe Crucial CT1000E100SSD8 de 1 TB. |
| Host | Proxmox VE 9.1.0 / pve-manager 9.1.9 sobre Debian 13 trixie. |
| Kernel | Linux 7.0.0-3-pve. |
| Contenedores LXC | Ubuntu 24.04.4 LTS. LXC 6.0.5-4 y lxcfs 6.0.4-pve1. |
| OpenClaw | OpenClaw 2026.5.7 (eeef486). |
| Ollama ROCm | Ollama 0.23.2 con librerías ROCm incluidas en Ollama: HIP/HSA/rocBLAS 7.2.70201. |
| llama.cpp Vulkan | llama.cpp commit f9cd456, build del 2026-05-08. Vulkan RADV/Mesa 25.2.8, API 1.4.318. |
| Lemonade Vulkan | Lemonade 10.4.0 sobre Vulkan/RADV/Mesa 25.2.8. |
| Estado de paquetes | Sin actualizaciones pendientes al comprobar host, LXC de Ollama y LXC de OpenClaw. |
Cómo funciona la pila
Una forma sencilla de entender las pruebas es separar las capas. El modelo es lo que razona y genera texto. El motor es el programa que ejecuta ese modelo. El backend de aceleración es la tecnología que usa el motor para hablar con la GPU, NPU o CPU. El hardware es la máquina física.
Modelo IA
↓
Motor: Ollama / llama.cpp / Lemonade / LM Studio
↓
Backend de aceleración: ROCm / Vulkan / CUDA / Metal / DirectML / OpenCL
↓
Hardware: GPU AMD / GPU NVIDIA / Apple Silicon / NPU / CPU
En esta review estamos comparando principalmente motor, backend y modelo sobre el mismo equipo. Por eso no basta con decir que un modelo genera rápido: también tiene que usar herramientas, aguantar contexto y resolver la tarea.
Qué mide cada tarea
| Tarea | En qué se basa | Dificultad |
|---|---|---|
| A0 Bugfix guiado | Encontrar y corregir un bug pequeño en Python, editar el archivo y ejecutar una comprobación básica. | Baja-media |
| A1 Contexto largo 20k | Procesar un contexto grande, parecido al historial de un agente, y extraer la instrucción relevante. | Media-alta |
| A2 Noticias IA del día | Buscar información actual, seleccionar fuentes y resumir los resultados en una tabla legible. | Media |
| A3 Informe / PDF | Leer datos, hacer cálculos, escribir un informe y generar un PDF verificable. | Alta |
| A4 Refactor multiarchivo | Entender varios archivos relacionados, modificar varias piezas y comprobar que todo sigue funcionando. | Muy alta |
| A5 Conectar con Home Assistant | Usar la API local de Home Assistant, contar entidades y devolver un resumen básico sin exponer credenciales. | Media |
| A6 Listar automatizaciones | Leer automatizaciones reales, agruparlas por estado y devolver ejemplos útiles. | Media |
| A7 Diagnosticar entidades problemáticas | Encontrar entidades en estado unavailable o unknown, agruparlas por dominio y dar ejemplos accionables. |
Media-alta |
| A8 Crear informe local de Home Assistant | Leer estados, generar un JSON y un Markdown local, y verificar que los archivos existen y parsean bien. | Alta |
| A9 Sugerir automatizaciones | Leer entidades, dispositivos, áreas y automatizaciones para proponer ideas útiles sin modificar nada. | Alta |
| A10 Apagar luces de la oficina | Identificar las luces correctas, llamar al servicio de Home Assistant y verificar el estado después. | Alta |
| A11 Crear automatización real | Crear una automatización real en Home Assistant, dejarla desactivada y verificar que existe. | Muy alta |
Qwen3.5 9B + OpenClaw + Ollama ROCm
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 Bugfix guiado | 1m 59s | Corrigió el bug guiado y dejó los tests pasando. | |
| A1 Contexto largo 20k | 1m 56s | Manejó el contexto largo y aplicó la instrucción correcta. | |
| A2 Noticias IA del día | 2m 10s | Usó búsqueda y devolvió noticias resumidas con enlaces. | |
| A3 Informe / PDF | 7m 07s | Generó el informe y el PDF verificable. | |
| A4 Refactor multiarchivo | 18m 45s | Resolvió el refactor multiarchivo, aunque fue la tarea más larga. | |
| A5 Conectar con Home Assistant | 1m 08s | Conectó con Home Assistant y resumió entidades y estados. | |
| A6 Listar automatizaciones | 3m 37s | Listó automatizaciones reales con sus estados. | |
| A7 Diagnosticar entidades problemáticas | 1m 26s | Diagnosticó entidades problemáticas y dio ejemplos útiles. | |
| A8 Crear informe local de Home Assistant | 5m 10s | Creó el informe local, pero quedó como resultado parcial. | |
| A9 Sugerir automatizaciones | 10m 01s | No consiguió cerrar bien las sugerencias de automatizaciones. | |
| A10 Apagar luces de la oficina | 2m 15s | Apagó luces de la oficina y verificó el estado después. | |
| A11 Crear automatización real | 10m 01s | No creó una automatización real verificable. |
Lectura rápida: Qwen3.5 9B sigue siendo la opción más equilibrada para empezar con OpenClaw en el SER9 Pro. No completa todas las tareas, pero es el modelo que mejor combina instalación sencilla, velocidad razonable y más tareas reales completadas.
Qwen3.5 9B + OpenClaw + FastFlowLM NPU
FastFlowLM permite usar la NPU del SER9 Pro y OpenClaw llegó a usar herramientas reales, pero la experiencia no queda al nivel de Ollama ROCm. Funciona en tareas pequeñas de código y contexto, pero se atasca mucho más con Home Assistant y con artefactos.
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 - Bugfix guiado | 1m 54s | Corrigió el bug guiado y dejó los tests pasando usando herramientas reales. | |
| A1 - Contexto largo 20k | 1m 57s | Encontró la instrucción dentro del contexto largo y aplicó la política correcta. | |
| A2 - Noticias IA del día | 2m 15s | Usó búsqueda web, pero no encontró 5 noticias específicas de IA del día; devolvió resultados demasiado genéricos. | |
| A3 - Informe / PDF | 10m 31s | No generó un PDF verificable ni cerró correctamente el flujo de artefactos. | |
| A4 - Refactor multiarchivo | 1m 04s | Apenas leyó el proyecto, no corrigió los archivos y los tests siguieron fallando. | |
| A5 - Conectar con Home Assistant | 15m 02s | Llegó al timeout sin respuesta final útil. | |
| A6 - Listar automatizaciones | 15m 02s | Llegó al timeout sin listar automatizaciones. | |
| A7 - Diagnóstico de entidades | 15m 02s | Llegó al timeout y confundió variables/archivos de Home Assistant. | |
| A8 - Informe local de Home Assistant | 6m 13s | Creó Markdown y JSON parseable, pero el razonamiento intermedio muestra conteos confusos; lo dejo como parcial. | |
| A9 - Sugerir automatizaciones de Home Assistant | 15m 02s | Llegó al timeout y confundió lectura de archivos con comandos shell. | |
| A10 - Apagar luces de la oficina | 2m 02s | Apagó una luz y verificó estados antes/después. | |
| A11 - Crear automatización | 15m 02s | La automatización real quedó creada y desactivada, pero el agente no llegó a responder antes del timeout. |
Lectura rápida: FastFlowLM NPU demuestra que la NPU puede ejecutar Qwen3.5 9B con OpenClaw, pero no lo recomendaría como ruta principal. Para código pequeño funciona, pero para un uso normal con agentes y Home Assistant es demasiado irregular y se queda muchas veces en timeout. Ollama ROCm sigue siendo la opción más práctica.
Qwen3-Coder 30B A3B + OpenClaw + Ollama ROCm
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 Bugfix guiado | 2m 43s | Corrigió el código y dejó los tests pasando. | |
| A1 Contexto largo 20k | 2m 33s | Encontró la instrucción importante dentro del contexto largo y la aplicó bien. | |
| A2 Noticias IA del día | 1m 06s | Devolvió páginas genéricas sobre IA, no noticias concretas y recientes. | |
| A3 Informe / PDF | 4m 32s | Creó un informe en Markdown, pero no generó el PDF pedido. | |
| A4 Refactor multiarchivo | 5m 22s | Leyó el proyecto y ejecutó tests, pero no terminó arreglando los archivos. | |
| A5 Conectar con Home Assistant | 1m 42s | Conectó, contó entidades y resumió dominios y automatizaciones. | |
| A6 Listar automatizaciones | 33s | Respondió como si hubiera acabado, pero no listó las automatizaciones. | |
| A7 Diagnosticar entidades problemáticas | 3m 41s | Encontró entidades problemáticas, aunque algunos conteos no parecían fiables. | |
| A8 Crear informe local de Home Assistant | 2m 28s | Dijo que había terminado, pero no creó los archivos solicitados. | |
| A9 Sugerir automatizaciones | 8m 17s | En el reintento dio sugerencias basadas en entidades reales, pero la calidad fue irregular. | |
| A10 Apagar luces de la oficina | 2m 11s | Apagó una luz de la oficina y comprobó el estado después. | |
| A11 Crear automatización real | 6s | Dijo que la había creado, pero la automatización no existía. |
Lectura rápida: Qwen3-Coder 30B A3B es interesante para seguir probando porque entiende bien contexto y código, pero en esta ronda no lo recomendaría como opción principal para OpenClaw. Varias veces respondió como si hubiera completado la tarea sin crear los archivos o cambios reales.
GLM-4.7-Flash Q4_K_M + OpenClaw + Ollama ROCm
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 Bugfix guiado | 4m 14s | Corrigió el código y dejó los tests pasando, aunque fue lento. | |
| A1 Contexto largo 20k | 1m 25s | Muy buen resultado con contexto largo; encontró y aplicó la instrucción correcta. | |
| A2 Noticias IA del día | 1m 17s | Usó búsqueda y devolvió enlaces, pero alguna fila no era estrictamente una noticia del día. | |
| A3 Informe / PDF | 5m 15s | Creó Markdown, pero no generó el PDF solicitado. | |
| A4 Refactor multiarchivo | 10m 36s | Resolvió el refactor y pasó tests, pero necesitó recuperación por exceso de contexto. | |
| A5 Conectar con Home Assistant | 1m 29s | Conectó con Home Assistant, aunque algunos conteos parecían poco fiables. | |
| A6 Listar automatizaciones | 2m 16s | Listó automatizaciones reales con sus estados. | |
| A7 Diagnosticar entidades problemáticas | 4m 46s | Encontró entidades problemáticas y dio ejemplos accionables. | |
| A8 Crear informe local de Home Assistant | 7m 59s | Terminó creando archivos, pero el propio agente indicó que había usado datos simulados. | |
| A9 Sugerir automatizaciones | 11m 09s | Propuso ideas usando entidades reales, pero la calidad fue irregular y terminó de forma incompleta. | |
| A10 Apagar luces de la oficina | 54s | Apagó una luz de la oficina y verificó el estado después. | |
| A11 Crear automatización real | 15m 02s | Se quedó en timeout y la automatización no existía al verificar. |
Lectura rápida: GLM-4.7-Flash Q4_K_M es interesante para código y contexto largo, pero no lo pondría por encima de Qwen3.5 9B como recomendación práctica para OpenClaw. Es más lento, tiene más tensión con herramientas y contexto, y falla en tareas de creación de artefactos o automatizaciones reales.
Gemma4 26B A4B Q4 + OpenClaw + Ollama ROCm
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 Bugfix guiado | 57s | Corrigió el bug guiado y dejó los tests pasando. | |
| A1 Contexto largo 20k | 36s | Manejó bien el contexto largo y aplicó la instrucción correcta. | |
| A2 Noticias IA del día | 1m 49s | No resolvió correctamente la tarea de búsqueda e información reciente. | |
| A3 Informe / PDF | 4m 09s | Completó el flujo de datos y artefactos verificables. | |
| A4 Refactor multiarchivo | 5m 22s | Editó archivos y ejecutó pruebas, pero dejó varios casos fallando. | |
| A5 Conectar con Home Assistant | 1m 28s | Conectó con Home Assistant y resumió entidades, dominios y estados problemáticos. | |
| A6 Listar automatizaciones | 1m 14s | Terminó sin devolver una lista útil de automatizaciones. | |
| A7 Diagnosticar entidades problemáticas | 1m 34s | Agrupó entidades problemáticas por dominio y dio ejemplos útiles. | |
| A8 Crear informe local de Home Assistant | 1m 51s | Creó el resumen local en Markdown y JSON con datos reales de Home Assistant. | |
| A9 Sugerir automatizaciones | 4m 19s | Usó entidades reales y propuso automatizaciones, pero la respuesta salió cortada y con formato corrupto. | |
| A10 Apagar luces de la oficina | 54s | Detectó una luz de oficina encendida, la apagó y verificó que quedó apagada. | |
| A11 Crear automatización real | 3m 06s | Dijo que había terminado, pero la automatización no existía al verificar. |
Lectura rápida: Gemma4 26B mejora mucho frente a la variante pequeña y puede ser interesante para contexto largo, Home Assistant básico y alguna tarea con artefactos. Aun así, no lo pondría por encima de Qwen3.5 9B como recomendación principal: falla más en búsqueda, automatizaciones y refactors complejos, y a veces da una salida final poco limpia.
Qwen3.6 27B IQ4 (batiai) + OpenClaw + Ollama ROCm
Probé varias variantes no oficiales de Qwen3.6 27B. Las versiones GGUF de Bartowski, cHunter y Ornstein-Hermes cargan en Ollama, pero en esta configuración Ollama las expone sin soporte de herramientas. Para OpenClaw eso las descarta, porque el agente necesita poder leer archivos, ejecutar comandos y llamar herramientas.
La variante que sí funcionó con herramientas fue batiai/qwen3.6-27b:iq4. Es un modelo capaz para tareas difíciles, pero también mucho más lento y no del todo estable.
| Tarea | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|
| A0 - Bugfix guiado | 4m 14s | Corrigió el bug guiado y dejó los tests pasando. | |
| A1 - Contexto largo 20k | 3m 42s | Manejó el contexto largo y aplicó la instrucción correcta. | |
| A2 - Refactor multiarchivo | 9m 50s | Corrigió los archivos y pasó todos los tests. | |
| A3 - Pipeline de datos | 6m 32s | Calculó datos, escribió artefactos y dejó la validación pasando. | |
| A4 - Informe / PDF | 10m 22s | Generó el informe y el PDF verificable, pero con bastante espera. | |
| A5 - Conectar con Home Assistant | 4m 29s | Conectó con Home Assistant y resumió los datos principales. | |
| A6 - Listar automatizaciones | 3m 00s | Listó automatizaciones reales con sus estados. | |
| A7 - Diagnóstico de entidades | 3m 14s | Ejecutó la tarea, pero solo respondió COMPLETADO y no entregó el diagnóstico pedido. | |
| A8 - Informe local de Home Assistant | 4m 26s | Creó el resumen local en Markdown y JSON con validación correcta. | |
| A9 - Sugerir automatizaciones de Home Assistant | 17m 23s | Propuso automatizaciones basadas en entidades reales, aunque fue una tarea muy lenta. | |
| A10 - Apagar luces de la oficina | 1m 43s | Apagó las luces de oficina solicitadas y verificó el estado después. | |
| A11 - Crear automatización | 20m 02s | Llegó al timeout y no creó una automatización real verificable. |
Lectura rápida: Qwen3.6 27B IQ4 (batiai) es el modelo más interesante de la tanda no oficial porque sí puede usar herramientas con OpenClaw. Aporta capacidad en tareas difíciles, pero no lo pondría como recomendación principal para un usuario normal: genera muy lento, falla algunas tareas y no consiguió crear una automatización real en Home Assistant.
Paperless-ngx con documentos reales
Respondiendo a @lastsquat, probé el SER9 Pro con Paperless-ngx y clasificación local de documentos usando IA.
La prueba mide tres tiempos: cuánto tarda Paperless en importar y hacer OCR, cuánto tarda la IA local en clasificar/resumir el documento y el tiempo total hasta tener un resultado usable. El modelo usado para clasificar fue Qwen3.5 9B en Ollama ROCm.
Lectura rápida: Paperless importó los 9 documentos en unos 55 segundos. La IA tardó de media 15,8 segundos por documento. El resultado práctico fue 7 correctos, 2 parciales y 0 fallos totales.
| ID | Documento | Dificultad | OCR | IA local | Tiempo OCR | Tiempo IA | Tiempo total | Lectura rápida |
|---|---|---|---|---|---|---|---|---|
| R001 | Factura proveedor NYU | Fácil | 4,9 s | 13,2 s | 18,1 s | Correcto. | ||
| R002 | Factura eléctrica EPA | Media | 7,2 s | 25,1 s | 32,2 s | Extrae bien proveedor e importe, pero la etiqueta como recibo en vez de factura. | ||
| R003 | Extracto de tarjeta CFPB | Media | 14,3 s | 15,3 s | 29,6 s | Correcto. | ||
| R004 | Contrato alquiler Consumer.gov | Media | 7,7 s | 20,0 s | 27,8 s | Correcto. | ||
| R005 | Carta fiscal Philadelphia | Media | 2,0 s | 16,1 s | 18,1 s | Correcto. | ||
| R006 | Certificado seguro PDGA | Media | 3,5 s | 14,8 s | 18,4 s | Correcto. | ||
| R007 | Recibo SROIE 1 | Difícil | 2,1 s | 12,1 s | 14,2 s | Correcto. | ||
| R008 | Recibo SROIE 2 | Difícil | 3,9 s | 13,6 s | 17,5 s | Correcto. | ||
| R009 | Recibo SROIE 3 | Difícil | 6,6 s | 11,5 s | 18,2 s | OCR sucio: acierta tipo, fecha e importe, pero falla el remitente. |
Lectura práctica: el SER9 Pro sí parece viable para Paperless-ngx con IA local cuando el documento es razonablemente legible. La parte clásica de OCR va rápida y Qwen3.5 9B puede clasificar documentos normales en unos 15-25 segundos. Donde empieza a romperse no es tanto por potencia, sino por calidad del escaneo y por errores de clasificación fina.
Proxmox: auditoría de seguridad con OpenClaw
Respondiendo a @djsluisitos, añadí una prueba distinta: usar OpenClaw como asistente de administración de Proxmox en modo solo lectura.
La idea no era instalar escáneres ni modificar el host, sino ver si el agente podía conectarse por una vía controlada, leer información del sistema, detectar riesgos básicos y generar un plan de hardening sin tocar nada. Por eso quité Lynis de la prueba: implicaba instalar paquetes y mezclaba una prueba de agente con cambios en el sistema.
Las pruebas se hicieron con un helper de solo lectura para Proxmox. El agente no debía usar SSH directo, no debía instalar nada y no debía exponer IPs privadas ni datos internos en los informes.
| Prueba | Qué mide |
|---|---|
| P0 - Conexión segura | Si el agente puede leer datos básicos del host usando solo el helper de lectura. |
| P1 - Inventario Proxmox | Si resume versión, kernel, CPU, RAM, disco, almacenamiento, contenedores y red sin publicar datos privados. |
| P2 - Superficie expuesta | Si detecta puertos, servicios, firewall, SSH y accesos recientes, separando riesgos y recomendaciones. |
| P3 - Salud del host | Si revisa actualizaciones, servicios fallidos, logs, almacenamiento y estado del NVMe. |
| P4 - Plan de hardening | Si convierte los hallazgos en un plan ordenado sin ejecutar cambios. |
| P5 - Informe final | Si consolida todo en un informe técnico y un resumen para usuario final. |
| Prueba | Qwen3.5 9B | Devstral Small 2 24B | Lectura rápida |
|---|---|---|---|
| P0 - Conexión segura | Ambos conectan bien usando el helper de solo lectura. | ||
| P1 - Inventario Proxmox | Ambos hacen el inventario, pero filtran algún dato privado en la salida. Requiere revisión antes de publicar. | ||
| P2 - Superficie expuesta | Devstral mejora claramente: detecta riesgos y respeta mejor la redacción segura. | ||
| P3 - Salud del host | Qwen entiende la tarea, pero falla el formato. Devstral entrega un resultado más limpio. | ||
| P4 - Plan de hardening | Devstral crea un plan más ordenado y respetando mejor el esquema pedido. | ||
| P5 - Informe final | Ambos fallan al consolidar todo en un informe final fiable. Devstral llega al timeout. |
Lectura práctica: para chequeos rápidos, Qwen3.5 9B sigue siendo más ágil. Para tareas de auditoría, diagnóstico y hardening, Devstral Small 2 24B da mejores resultados y respeta mejor el formato, pero tarda más y en el SER9 Pro no va sobrado: Ollama lo cargó repartido entre CPU y GPU. La conclusión por ahora es que Devstral es más interesante para tareas de administración serias, pero todavía no confiaría en ningún modelo para generar un informe final de seguridad sin revisión humana.
Programación: agenda en Quarkus
Respondiendo a @Rodri, añadí una prueba de programación más grande: pedir una agenda en Java con Quarkus, arquitectura hexagonal, contactos con fotos, teléfonos, direcciones, perfiles sociales y campos personalizables, además de tests unitarios e integración.
Esta prueba mide si el agente puede crear un proyecto completo, usar herramientas, iterar con mvn test y entregar algo que compile. La validación no se basa en que la respuesta parezca correcta, sino en que el proyecto generado mantenga el contrato pedido y pase mvn test.
| Variante | Resultado | Tiempo | Input tok/s | Output tok/s | Validación | Lectura rápida |
|---|---|---|---|---|---|---|
| OpenClaw 2026.5.7 + Qwen3-Coder 30B | 27m 58s | n/d | n/d | mvn test falla |
Generó 13 archivos Java y respetó la estructura principal, pero Quarkus no pudo inyectar servicios porque faltaban anotaciones CDI. No añadió tests propios. | |
| OpenClaw 2026.5.12 beta + Qwen3-Coder 30B | 19m 21s | n/d | n/d | mvn test falla |
Generó 15 archivos Java y arrancó más lejos, pero falló el contrato funcional por problemas de serialización/deserialización y no añadió tests propios. | |
| Ollama directo + Qwen3-Coder 30B | 5m 04s | 248,57 | 15,98 | mvn test falla |
Fue mucho más rápido y generó un proyecto que arrancaba, pero no resolvió bien la lógica: el listado de contactos devolvía vacío donde el test esperaba datos. | |
| OpenClaw 2026.5.12 beta + Qwen3.5 9B | 1h 00m 02s | n/d | n/d | mvn test falla |
Generó 28 archivos Java y montó las capas principales, pero terminó por timeout. No compiló por mezclar tipos api.* y domain.* en ContactResource.java, no añadió tests propios y entró en overflow/compaction. |
Lectura práctica: esta prueba queda por encima de lo que ahora mismo recomendaría hacer con OpenClaw en el SER9 Pro si necesitas un resultado fiable a la primera. Qwen3-Coder 30B directo llegó más cerca y fue mucho más rápido, pero no sustituye a un agente real porque no usa herramientas ni itera sobre los errores. Con OpenClaw, tanto Qwen3-Coder 30B como Qwen3.5 9B fueron capaces de crear bastante estructura, pero ninguno dejó un proyecto Quarkus que pasara mvn test.
Programación: agenda en Quarkus con Qwen3.6
Respondiendo a @djsluisitos, repetí la prueba de programación propuesta por @Rodri, pero usando variantes de Qwen3.6 para ver si una familia más moderna mejoraba el resultado.
La prueba sigue siendo la misma: crear una agenda en Java con Quarkus, arquitectura hexagonal, contactos con fotos, teléfonos, direcciones, perfiles sociales y campos personalizables, además de tests. La validación importante es si el proyecto termina pasando mvn test.
| Modelo / variante | Configuración | ¿Carga? | Resultado OpenClaw | Tiempo | Validación | Lectura rápida |
|---|---|---|---|---|---|---|
qwen3.6:35b oficial |
Ollama ROCm, prueba de carga | No se pudo probar | 6,6 s | OOM al cargar | No viable en este SER9 Pro. | |
qwen3.6:35b-a3b |
Ollama ROCm | No se pudo probar | n/d | Mismo blob/modelo que la variante oficial | No aporta una variante separada útil para esta prueba. | |
qwen3.6:27b oficial |
Ollama ROCm, prueba de carga | No se pudo probar | 12-14 s | HTTP 500 / OOM | No viable en esta configuración. | |
batiai/qwen3.6-35b:iq3 |
Ollama ROCm + OpenClaw | 24m 27s | mvn test falla |
Carga y trabaja, pero no deja un proyecto Quarkus válido. | ||
qwen36-35b-iq3-32k |
Alias optimizado a 32k | 5m 50s | mvn test falla por POM inválido |
Mejora el tiempo, pero el resultado sigue sin ser usable. | ||
qwen36-27b-iq4-16k |
24 GB RAM, 16k | 12m 24s | OOM/inestable, sin proyecto válido | No viable con esa memoria. | ||
qwen36-27b-iq4-16k |
26 GB RAM + 16 GB swap | 10m 52s | 0 archivos creados | Carga, pero OpenClaw no avanza de forma útil. |
Lectura práctica: aumentar memoria ayuda a evitar algunos errores de carga, pero no convierte estas variantes grandes en una opción recomendable para OpenClaw en el SER9 Pro. En esta prueba el límite real no fue solo cargar el modelo: fue mantener herramientas, contexto e iteración hasta dejar un proyecto que compile. Para un usuario normal, Qwen3.5 9B sigue siendo un punto de partida más práctico; Qwen3.6 grande queda como experimento, no como recomendación principal.
Dashboard local para monitorizar OpenClaw
A raíz de una petición del foro, añadí una prueba más ambiciosa: pedir al agente que crease un dashboard local para monitorizar el host donde corre OpenClaw.
La tarea exigía crear una pequeña aplicación local sin servicios externos ni paquetes instalados, usando solo Python estándar, HTML, CSS y JavaScript. El dashboard debía servir una interfaz web, exponer /api/metrics, mostrar métricas reales del sistema, tener vista técnica y vista cliente, alertas útiles, estado de OpenClaw e instrucciones de uso.
Esta prueba es bastante más dura que un bugfix pequeño porque obliga al modelo a coordinar varios archivos, leer requisitos largos, usar herramientas, crear código ejecutable y validar que el servidor responde.
| Modelo / variante | Resultado | Tiempo | Validación | Lectura rápida |
|---|---|---|---|---|
freehuntx/qwen3-coder:14b |
4m 38s | No creó dashboard/server.py ni los archivos obligatorios. |
El modelo cargó y leyó contexto, pero OpenClaw no llegó a generar el proyecto. No lo veo viable para esta tarea agéntica larga. | |
qwen2.5-coder:14b |
1m 31s | No creó el dashboard. Respondió con una llamada de herramienta escrita como texto. | Termina rápido, pero no ejecuta la tarea con OpenClaw. Para uso agentico real queda descartado en esta prueba. |
Lectura práctica: estos dos modelos no mejoran la recomendación actual. Para tareas largas con OpenClaw, freehuntx/qwen3-coder:14b se queda sin crear el proyecto y qwen2.5-coder:14b no usa correctamente las herramientas. La ruta práctica sigue siendo Qwen3.5 9B con Ollama ROCm mientras no aparezca un modelo que complete mejor tareas largas sin disparar tiempos ni errores.
Programación sencilla con modelos candidatos
Después de la prueba del dashboard, bajé la dificultad para separar dos cosas: si un modelo falla porque la tarea era demasiado larga, o si directamente no se lleva bien con OpenClaw y sus herramientas.
La prueba easy_slugify es pequeña: el agente tiene que crear o corregir una función sencilla de Python, usar archivos reales y pasar una validación externa. No demuestra que un modelo sea bueno para tareas largas, pero sí sirve como filtro mínimo. Si no supera esto, no tiene sentido dedicarle pruebas más pesadas.
| Modelo / variante | Resultado | Tiempo | Input tok/s | Output tok/s | Herramientas | Lectura rápida |
|---|---|---|---|---|---|---|
freehuntx/qwen3-coder:14b |
3m 12s | 505,11 | 2,82 | 9 | Completó la tarea y pasó la validación externa. Puede resolver tareas pequeñas, aunque falló en la prueba larga del dashboard. | |
qwen2.5-coder:14b |
1m 11s | 126,31 | 0,04 | 0 | Terminó rápido, pero no usó herramientas y la validación externa falló. | |
qwen3-coder-30b-8k |
10m 02s | n/d | n/d | 0 | OpenClaw/modelo no terminó correctamente. No resulta práctico para esta prueba sencilla. | |
qwen36-35b-iq3-32k |
1m 11s | 260,98 | 1,46 | 2 | Usó alguna herramienta, pero no completó la tarea y la validación externa falló. | |
batiai/qwen3.6-35b:iq3 |
1m 13s | 255,82 | 1,39 | 2 | Resultado parecido al alias de 32k: toca herramientas, pero no llega a una solución válida. |
Lectura práctica: freehuntx/qwen3-coder:14b no sirve para la tarea larga del dashboard, pero sí supera una prueba pequeña de programación con OpenClaw. Los demás modelos de esta tanda quedan descartados por ahora incluso para tareas sencillas, al menos con esta configuración.
Hermes + Qwen3-Coder 14B 64K + Ollama ROCm
Después de probar OpenClaw, repetí la batería principal con Hermes. En esta ronda Hermes estaba configurado con Ollama ROCm y Supermemory activo. La primera prueba con el modelo normal falló porque Hermes rechazó trabajar con un contexto efectivo de 40.960 tokens, así que creé un alias en Ollama con num_ctx 65536 para poder ejecutar la batería completa.
Esto permitió completar las pruebas, pero no cambia la recomendación práctica: Hermes funciona y es interesante para seguir probando, pero con Qwen3-Coder 14B 64K queda por detrás de OpenClaw en fiabilidad para este equipo.
| Prueba | Qué mide | Resultado | Tiempo | Lectura rápida |
|---|---|---|---|---|
| A0 Bugfix guiado | Corregir un bug pequeño y pasar tests. | 2m 11s | Corrige el bug y pasa 4 tests. | |
| A1 Contexto largo 20k | Procesar contexto largo tipo agente. | 5m 50s | Crea el archivo esperado; funciona, pero lento. | |
| A2 Noticias IA del día | Buscar información actual y resumirla. | 3m 55s | Devuelve titulares/enlaces genéricos, no verificables; no crea un resultado válido. | |
| A3 Informe / PDF | Crear informe y PDF verificable. | 5m 21s | No crea los archivos requeridos. | |
| A4 Refactor multiarchivo | Modificar varios archivos y pasar tests. | 17m 06s | No pasa tests; queda 1 failed, 1 passed. |
|
| A5 Conectar con Home Assistant | Verificar conexión real con Home Assistant. | 2m 07s | Dice que conecta, pero deja ha_connect_A5.json con connection_check: pending y no hay verificación válida. |
|
| A6 Listar automatizaciones | Leer automatizaciones reales de Home Assistant. | 3m 28s | Lista automatizaciones reales. | |
| A7 Diagnosticar entidades problemáticas | Leer entidades y detectar estados problemáticos. | 9m 34s | Aunque el validador lo marcó OK, el contenido incluye entidades inventadas como light.living_room, así que lo marco como fallo real. |
|
| A8 Sugerir automatizaciones | Proponer automatizaciones a partir de Home Assistant. | 3m 45s | Genera sugerencias, pero basadas sobre todo en automatizaciones existentes; sirve como borrador, no como resultado final. | |
| A9 Planificar automatización real | Diseñar automatización usando entidades reales. | 3m 46s | Genera YAML con entidades inventadas y estructura dudosa. | |
| A10 Apagar luces de la oficina | Ejecutar una acción real en Home Assistant. | 4m 47s | No encuentra las luces reales de oficina y no ejecuta la acción. | |
| A11 Crear automatización real | Crear una automatización verificable en Home Assistant. | 13m 21s | No crea una automatización válida; deriva hacia escenas/sensores inventados. |
No incluyo tokens/s en esta tabla porque este runner de Hermes no expone todavía input/output tokens de forma consistente.
Lectura práctica: Hermes con Qwen3-Coder 14B 64K gana algunas pruebas de contexto y listado, pero falla en fiabilidad: inventa entidades, no crea artefactos obligatorios y tarda demasiado en tareas complejas. Por ahora lo dejaría como línea de pruebas, no como recomendación frente a OpenClaw + Ollama ROCm + Qwen3.5 9B.
Nota adicional: también intenté Devstral Small 2507 Q4_K_M, pero no llegó a una prueba completa con Hermes porque en Ollama ROCm se quedó atascado cargando/respondiendo. Lo dejo descartado para esta ronda.
Te interesa probarlo?
Si quieres que pruebe algún modelo concreto o una tarea específica, déjalo como nuevo mensaje en el foro. Mis agentes de IA están vigilando los comentarios y pueden ejecutar nuevas pruebas directamente en el SER9 Pro.