# Benchmark Gemma 4 12B vs Gemma 4 4B ## Objetivo Comparar si Gemma 4 12B mejora de forma material el flujo real de Feadulta frente a Gemma 4 4B sin ejecutar todavía una batería grande. Este benchmark propone una sola prueba pequeña pero representativa: traducción + preparación para TTS. ## Condiciones fijas Usar exactamente la misma configuración para ambos modelos: - mismo prompt - misma temperatura (`0.2` recomendada) - mismo max tokens - misma context window - sin herramientas externas - misma máquina / mismo backend de LM Studio ## Caso de uso elegido Feadulta suele necesitar: - traducciones ES ↔ EN - preservar tono espiritual/catequético - mantener nombres propios y citas bíblicas correctas - dejar el texto listo para TTS sin frases raras ## Prueba ### Input sugerido Tomar un fragmento real de Feadulta de 600 a 900 palabras en español con: - tono espiritual o doctrinal - al menos 2 citas bíblicas - nombres propios o referencias litúrgicas - frases largas y algún matiz teológico ### Prompt ```text Actúa como editor bilingüe para Feadulta. Tarea: 1. Traduce al inglés el texto español adjunto. 2. Mantén el tono espiritual, cercano y claro; no lo vuelvas académico ni robótico. 3. Conserva correctamente citas bíblicas, nombres propios, referencias litúrgicas y términos doctrinales. 4. Después de la traducción, genera una segunda versión "TTS-ready" del mismo texto en inglés: - frases algo más cortas - puntuación natural para locución - sin enumeraciones artificiales - sin emojis - sin notas del traductor 5. No inventes contenido ni expliques decisiones. Devuelve exactamente este formato: [EN_TRANSLATION] ... [TTS_READY_EN] ... ``` [PEGAR TEXTO FUENTE AQUÍ] ``` ## Qué evaluar Puntuar 1–5 en cada eje: 1. Fidelidad al original - no omite matices importantes - no simplifica demasiado - no añade ideas 2. Naturalidad del inglés - suena humano - no parece traducción literal - mantiene buen ritmo 3. Precisión religiosa / terminológica - citas bíblicas bien mantenidas - términos doctrinales consistentes - nombres y referencias correctos 4. Calidad TTS-ready - frases respirables - puntuación ayuda a narración - no hay giros torpes para voz 5. Necesidad de edición manual - 5 = casi publicar - 1 = rehacer bastante ## Señales de que gana el 12B - conserva mejor el matiz del original - hace menos traducción literal rara - entrega una versión TTS más fluida - requiere menos retoques antes de publicar ## Regla práctica de decisión Si el 12B gana claramente en 3 o más ejes y la latencia extra sigue siendo tolerable, merece ser el modelo por defecto para traducción/TTS de Feadulta. Si la mejora es pequeña, el 4B puede seguir siendo suficiente para borradores rápidos.