Publicado en

Grok 4.7: el salto de SpaceXAI hacia el liderazgo en coding y trabajo de conocimiento de larga duración

El 21 de septiembre de 2026, SpaceXAI (la evolución de xAI integrada en el ecosistema de SpaceX) lanzó Grok 4.7, su modelo frontier más capaz hasta la fecha orientado a coding, tareas agenticas y trabajo profesional de conocimiento. Llega apenas un mes después de Grok 4.6 y se posiciona como una mejora notable en capacidad, manteniendo exactamente el mismo precio y velocidad de servicio que su predecesor.

A diferencia de muchos lanzamientos que priorizan el “estado del arte” absoluto a cualquier costo, Grok 4.7 apuesta por una combinación agresiva de rendimiento, eficiencia y precio. Según la propia compañía, es “el doble de rápido y a la mitad de precio que modelos comparables”.

¿Qué cambia respecto a Grok 4.6?

Grok 4.7 no es un simple fine-tune. Utiliza un base model significativamente más grande (según reportes de la industria, alrededor de 2.1 billones de parámetros frente a los ~1.5 billones de 4.6) y fue entrenado con un run de reinforcement learning mucho más largo, centrado en problemas difíciles que requieren horas de trabajo sostenido.

Las mejoras clave se concentran en tres áreas:

  • Persistencia en tareas largas: el modelo se mantiene trabajando de forma más efectiva en problemas de varias horas.
  • Autoverificación: revisa su propio trabajo con mayor rigor antes de entregar resultados.
  • Manejo de contexto largo: gestiona mejor ventanas extensas y conversaciones complejas.

Además, fue entrenado de forma nativa para entender el harness de Grok Bot, lo que mejora notablemente su desempeño en flujos agenticos, conversaciones y trabajo de conocimiento general. También destaca en la creación de documentos y presentaciones.

Especificaciones técnicas principales

PropiedadValor
Nombre del modelogrok-4.7
Ventana de contexto500.000 tokens
Knowledge cutoffMayo 2026
ModalidadesTexto e imagen de entrada; texto de salida
Niveles de razonamientoLow, medium, high (por defecto) y xhigh
Precio estándar$2 / 1M tokens de input · $6 / 1M de output
HerramientasFunction calling, web search, X search, code execution

Existe una variante Grok 4.7 Fast (doble velocidad, doble precio) disponible solo en Cursor y Grok Build.

Rendimiento en benchmarks: ventajas claras sobre 4.6

Los resultados oficiales muestran mejoras consistentes y en algunos casos espectaculares:

  • CursorBench 4.0 (coding de larga duración): 46.3 % vs 40.4 % de Grok 4.6
  • Terminal-Bench 4.0 (trabajo multi-hora en terminal): casi se duplica, de 20.3 % a ~38 %
  • EEBench (ingeniería eléctrica): 64.0 % vs 53.0 %
  • DeepSWE v1.1: 71.0 % (high effort) vs 65.2 %
  • AA Briefcase v1.1 (trabajo de oficina multi-hora): 1.657 Elo vs 1.546
  • Harvey Legal Agent Benchmark: 19.6 % vs 15.8 %
  • HealthBench Professional: 56.7 % vs 48.5 %

En comparaciones con la competencia (GPT-5.6 Sol Max y Fable 5.1 Max), Grok 4.7 destaca especialmente por su relación precio-rendimiento. Aunque no lidera absolutamente en todos los benchmarks de frontera, supera a GPT-5.6 Sol en varias métricas clave de coding e ingeniería, y ofrece un costo por token significativamente inferior (input a $2 frente a $4–$10 y output a $6 frente a $20–$50 de los rivales).

Evaluaciones independientes de Artificial Analysis confirman el salto: Grok 4.7 alcanza 46 puntos en el Intelligence Index (+2 respecto a 4.6) y se sitúa en la frontera de trabajo agentico de conocimiento, con una mejora de +111 Elo en AA-Briefcase.

Seguridad y salvaguardas reforzadas

Grok 4.7 incorpora un stack de seguridad completamente nuevo. SpaceXAI afirma que es el modelo más fuerte que han evaluado en resistencia a jailbreaks y en el equilibrio entre utilidad y negativa segura en dominios dual-use (ciberseguridad y biología). Destaca especialmente en LatchBio (biosafety) con un 62.4 % y en HackerBench, donde solo deja pasar un 3.3 % de prompts de riesgo mientras mantiene baja la tasa de negativas innecesarias en trabajo legítimo de seguridad.

Disponibilidad y casos de uso ideales

Grok 4.7 ya está disponible en:

  • Cursor (todos los planes)
  • Grok Build
  • API de xAI (modelo grok-4.7)
  • Gateways de terceros (OpenRouter, Vercel, Cloudflare, etc.)

Es especialmente recomendable para:

  • Agentes de coding de larga duración
  • Trabajo de conocimiento profesional (legal, ingeniería, análisis financiero, etc.)
  • Flujos multi-hora que requieren autoverificación y creación de documentos/presentaciones
  • Escenarios donde el costo por token y la velocidad importan tanto como el rendimiento puro

Conclusión

Grok 4.7 no pretende ser el modelo “más inteligente” en todos los benchmarks absolutos. Su apuesta es más pragmática y potencialmente más disruptiva: ofrecer capacidades de frontera en coding y trabajo agentico de larga duración al mismo precio y velocidad que Grok 4.6, con mejoras claras en persistencia, autoverificación y seguridad.

Para desarrolladores, equipos de ingeniería y profesionales del conocimiento que priorizan la relación rendimiento/costo y la capacidad de sostener tareas complejas durante horas, Grok 4.7 se perfila como una de las opciones más atractivas del mercado a finales de 2026.

¿Ya lo has probado en Cursor o a través de la API? Los primeros reportes de usuarios destacan especialmente su comportamiento en sesiones largas de coding y en la generación de documentos profesionales.

Grok 4.7 : Enlace

Saludos

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *