El 21 de septiembre de 2026, SpaceXAI (la evolución de xAI integrada en el ecosistema de SpaceX) lanzó Grok 4.7, su modelo frontier más capaz hasta la fecha orientado a coding, tareas agenticas y trabajo profesional de conocimiento. Llega apenas un mes después de Grok 4.6 y se posiciona como una mejora notable en capacidad, manteniendo exactamente el mismo precio y velocidad de servicio que su predecesor.
A diferencia de muchos lanzamientos que priorizan el “estado del arte” absoluto a cualquier costo, Grok 4.7 apuesta por una combinación agresiva de rendimiento, eficiencia y precio. Según la propia compañía, es “el doble de rápido y a la mitad de precio que modelos comparables”.
¿Qué cambia respecto a Grok 4.6?
Grok 4.7 no es un simple fine-tune. Utiliza un base model significativamente más grande (según reportes de la industria, alrededor de 2.1 billones de parámetros frente a los ~1.5 billones de 4.6) y fue entrenado con un run de reinforcement learning mucho más largo, centrado en problemas difíciles que requieren horas de trabajo sostenido.
Las mejoras clave se concentran en tres áreas:
- Persistencia en tareas largas: el modelo se mantiene trabajando de forma más efectiva en problemas de varias horas.
- Autoverificación: revisa su propio trabajo con mayor rigor antes de entregar resultados.
- Manejo de contexto largo: gestiona mejor ventanas extensas y conversaciones complejas.
Además, fue entrenado de forma nativa para entender el harness de Grok Bot, lo que mejora notablemente su desempeño en flujos agenticos, conversaciones y trabajo de conocimiento general. También destaca en la creación de documentos y presentaciones.
Especificaciones técnicas principales
| Propiedad | Valor |
| Nombre del modelo | grok-4.7 |
| Ventana de contexto | 500.000 tokens |
| Knowledge cutoff | Mayo 2026 |
| Modalidades | Texto e imagen de entrada; texto de salida |
| Niveles de razonamiento | Low, medium, high (por defecto) y xhigh |
| Precio estándar | $2 / 1M tokens de input · $6 / 1M de output |
| Herramientas | Function calling, web search, X search, code execution |
Existe una variante Grok 4.7 Fast (doble velocidad, doble precio) disponible solo en Cursor y Grok Build.
Rendimiento en benchmarks: ventajas claras sobre 4.6
Los resultados oficiales muestran mejoras consistentes y en algunos casos espectaculares:
- CursorBench 4.0 (coding de larga duración): 46.3 % vs 40.4 % de Grok 4.6
- Terminal-Bench 4.0 (trabajo multi-hora en terminal): casi se duplica, de 20.3 % a ~38 %
- EEBench (ingeniería eléctrica): 64.0 % vs 53.0 %
- DeepSWE v1.1: 71.0 % (high effort) vs 65.2 %
- AA Briefcase v1.1 (trabajo de oficina multi-hora): 1.657 Elo vs 1.546
- Harvey Legal Agent Benchmark: 19.6 % vs 15.8 %
- HealthBench Professional: 56.7 % vs 48.5 %
En comparaciones con la competencia (GPT-5.6 Sol Max y Fable 5.1 Max), Grok 4.7 destaca especialmente por su relación precio-rendimiento. Aunque no lidera absolutamente en todos los benchmarks de frontera, supera a GPT-5.6 Sol en varias métricas clave de coding e ingeniería, y ofrece un costo por token significativamente inferior (input a $2 frente a $4–$10 y output a $6 frente a $20–$50 de los rivales).
Evaluaciones independientes de Artificial Analysis confirman el salto: Grok 4.7 alcanza 46 puntos en el Intelligence Index (+2 respecto a 4.6) y se sitúa en la frontera de trabajo agentico de conocimiento, con una mejora de +111 Elo en AA-Briefcase.
Seguridad y salvaguardas reforzadas
Grok 4.7 incorpora un stack de seguridad completamente nuevo. SpaceXAI afirma que es el modelo más fuerte que han evaluado en resistencia a jailbreaks y en el equilibrio entre utilidad y negativa segura en dominios dual-use (ciberseguridad y biología). Destaca especialmente en LatchBio (biosafety) con un 62.4 % y en HackerBench, donde solo deja pasar un 3.3 % de prompts de riesgo mientras mantiene baja la tasa de negativas innecesarias en trabajo legítimo de seguridad.
Disponibilidad y casos de uso ideales
Grok 4.7 ya está disponible en:
- Cursor (todos los planes)
- Grok Build
- API de xAI (modelo grok-4.7)
- Gateways de terceros (OpenRouter, Vercel, Cloudflare, etc.)
Es especialmente recomendable para:
- Agentes de coding de larga duración
- Trabajo de conocimiento profesional (legal, ingeniería, análisis financiero, etc.)
- Flujos multi-hora que requieren autoverificación y creación de documentos/presentaciones
- Escenarios donde el costo por token y la velocidad importan tanto como el rendimiento puro
Conclusión
Grok 4.7 no pretende ser el modelo “más inteligente” en todos los benchmarks absolutos. Su apuesta es más pragmática y potencialmente más disruptiva: ofrecer capacidades de frontera en coding y trabajo agentico de larga duración al mismo precio y velocidad que Grok 4.6, con mejoras claras en persistencia, autoverificación y seguridad.
Para desarrolladores, equipos de ingeniería y profesionales del conocimiento que priorizan la relación rendimiento/costo y la capacidad de sostener tareas complejas durante horas, Grok 4.7 se perfila como una de las opciones más atractivas del mercado a finales de 2026.
¿Ya lo has probado en Cursor o a través de la API? Los primeros reportes de usuarios destacan especialmente su comportamiento en sesiones largas de coding y en la generación de documentos profesionales.
Grok 4.7 : Enlace
Saludos