La factura de la IA te come el margen. Cada resumen, cada chatbot, cada clasificación que automatizas con la API de Google o de OpenAI suma tokens y, a final de mes, euros. Google acaba de lanzar tres nuevos modelos Gemini Flash que prometen reducir el consumo de tokens hasta un 65%. Y no es una promesa vacía: los precios por millón de tokens se desploman, sobre todo para tareas sencillas. Si eres autónomo o llevas una pyme y usas IA a diario, cambiar a estos modelos puede ser la acción más rentable que hagas esta semana.
Los modelos son: Gemini 3.6 Flash, Flash-Lite y Flash Cyber. Los tres están optimizados para ser baratos y rápidos, pero cada uno tiene su punto fuerte. El Flash-Lite, por ejemplo, cuesta una fracción de lo que pagabas antes y sigue siendo suficiente para resúmenes, clasificaciones o chatbots simples. En este artículo te cuento qué modelo elegir, cómo cambiar tu código en 10 minutos y cuánto puedes ahorrar al mes.
¿Cuánto cuestan realmente los nuevos Gemini Flash? Tabla comparativa de precios
Hablemos de números. Aquí tienes una comparativa de precios por 1 millón de tokens (entrada y salida) para los modelos más usados por negocios pequeños. Los datos son oficiales de Google a fecha de hoy y los comparo con GPT-4o-mini, el modelo barato de OpenAI, y con los antiguos Gemini Flash.
| Modelo | Precio entrada (por 1M tokens) | Precio salida (por 1M tokens) | Ahorro vs. GPT-4o-mini |
|---|---|---|---|
| GPT-4o-mini | $0.15 | $0.60 | - |
| Gemini 1.5 Flash (antiguo)Recomendado | $0.075 | $0.30 | ~50% |
| Gemini 3.6 Flash | $0.05 | $0.20 | ~67% |
| Gemini Flash-Lite | $0.02 | $0.08 | ~87% |
| Gemini Flash Cyber | $0.03 | $0.12 | ~80% |
El ahorro es bestial. Flash-Lite cuesta 7,5 veces menos que GPT-4o-mini en tokens de salida. Para tareas masivas, la diferencia es de cientos de euros al mes. El modelo 3.6 Flash es más equilibrado y el Cyber está pensado para tareas de ciberseguridad, pero también es muy barato.
¿Para qué tareas vale la pena cambiarse ya?
No todo es precio. Estos modelos Flash brillan en tareas concretas, pero tienen limitaciones. Te cuento dónde sí y dónde no.
Tareas donde el cambio es un acierto seguro
- Resúmenes de textos: artículos, correos, documentos. Con un prompt claro, Flash-Lite resume igual de bien que modelos 10 veces más caros.
- Clasificación y extracción de datos: etiquetar tickets de soporte, extraer nombres y fechas de facturas, categorizar opiniones.
- Chatbots simples: si tu bot responde preguntas frecuentes o guía al usuario por un flujo predefinido, Flash-Lite o 3.6 Flash bastan.
- Generación de texto estructurado: crear descripciones de producto, metaetiquetas, traducciones sencillas.
Cuándo no usar estos modelos
Si tu tarea requiere razonamiento complejo, creatividad o seguir instrucciones muy largas y enrevesadas, mejor quédate con un modelo más potente. Por ejemplo: generar código desde cero, resolver problemas matemáticos paso a paso o escribir artículos completos con tono y estilo muy definidos. En esos casos, Gemini 3.6 Flash puede funcionar, pero Flash-Lite se queda corto. La regla: si tu prompt es simple y la respuesta esperada es predecible, tira por el más barato.
Guía rápida: cambia tu código a Gemini Flash en 10 minutos
Si ya usas la API de Google AI, el cambio es trivial. Aquí tienes un ejemplo en Python con la librería oficial google-generativeai. Supón que ahora usas Gemini 1.5 Flash así:
import google.generativeai as genai
genai.configure(api_key="TU_API_KEY")
model = genai.GenerativeModel('gemini-1.5-flash')
response = model.generate_content("Resume este texto: ...")
print(response.text)Para cambiarte a Flash-Lite, solo modifica el nombre del modelo:
model = genai.GenerativeModel('gemini-flash-lite') # o 'gemini-3.6-flash', 'gemini-flash-cyber'Si vienes de OpenAI, la migración es un poco más larga pero sencilla. Instala la librería de Google (pip install google-generativeai), consigue una API key gratuita desde Google AI Studio y adapta tu función de llamada. Aquí un ejemplo equivalente a ChatCompletion:
import google.generativeai as genai
genai.configure(api_key="TU_API_KEY")
model = genai.GenerativeModel('gemini-flash-lite')
messages = [
{"role": "user", "parts": ["Resume este texto: ..."]}
]
response = model.generate_content(messages)
print(response.text)Atención: los prompts muy largos o con instrucciones complejas pueden dar peor resultado en Flash-Lite. Prueba primero con un lote pequeño y compara. Si la calidad baja, sube a 3.6 Flash antes de volver a GPT-4o-mini.
Calcula tu ahorro mensual estimado
Para que veas el impacto real, he preparado una calculadora rápida. Coge tu consumo mensual aproximado en tokens (si no lo sabes, mira el dashboard de uso de tu proveedor) y aplica estos números.
Ejemplo: imagina que generas 10 millones de tokens de salida al mes con GPT-4o-mini. Eso te cuesta: 10M * $0.60/1M = $6.00. Con Flash-Lite: 10M * $0.08/1M = $0.80. Ahorro: $5.20 al mes (87% menos).
Si tu volumen es mayor, la diferencia se dispara. Para 100M tokens de salida al mes, el ahorro es de $52.00. Para un negocio que procesa miles de documentos, el ahorro puede superar los 200 € al mes. Vale la pena dedicar 10 minutos a probarlo.
¿Qué haría yo en tu lugar?
Coge una tarea concreta y no crítica. Esta misma semana: elige un proceso que uses a diario (resúmenes, clasificación de correos, lo que sea), crea una API key gratuita de Google y cambia el endpoint a Flash-Lite. Haz 50 pruebas. Si la calidad aguanta, despliega el cambio y empieza a ahorrar desde ya. Si no, prueba con 3.6 Flash. El coste de probar es casi cero y el ahorro potencial es inmediato. No necesitas ser ingeniero ni contratar a nadie. En 10 minutos puedes tener la respuesta.


