Files
feadulta/docs/benchmarks/gemma4-12b-vs-4b.md
T
2026-06-04 09:19:27 -04:00

100 lines
2.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Benchmark Gemma 4 12B vs Gemma 4 4B
## Objetivo
Comparar si Gemma 4 12B mejora de forma material el flujo real de Feadulta frente a Gemma 4 4B sin ejecutar todavía una batería grande.
Este benchmark propone una sola prueba pequeña pero representativa: traducción + preparación para TTS.
## Condiciones fijas
Usar exactamente la misma configuración para ambos modelos:
- mismo prompt
- misma temperatura (`0.2` recomendada)
- mismo max tokens
- misma context window
- sin herramientas externas
- misma máquina / mismo backend de LM Studio
## Caso de uso elegido
Feadulta suele necesitar:
- traducciones ES ↔ EN
- preservar tono espiritual/catequético
- mantener nombres propios y citas bíblicas correctas
- dejar el texto listo para TTS sin frases raras
## Prueba
### Input sugerido
Tomar un fragmento real de Feadulta de 600 a 900 palabras en español con:
- tono espiritual o doctrinal
- al menos 2 citas bíblicas
- nombres propios o referencias litúrgicas
- frases largas y algún matiz teológico
### Prompt
```text
Actúa como editor bilingüe para Feadulta.
Tarea:
1. Traduce al inglés el texto español adjunto.
2. Mantén el tono espiritual, cercano y claro; no lo vuelvas académico ni robótico.
3. Conserva correctamente citas bíblicas, nombres propios, referencias litúrgicas y términos doctrinales.
4. Después de la traducción, genera una segunda versión "TTS-ready" del mismo texto en inglés:
- frases algo más cortas
- puntuación natural para locución
- sin enumeraciones artificiales
- sin emojis
- sin notas del traductor
5. No inventes contenido ni expliques decisiones.
Devuelve exactamente este formato:
[EN_TRANSLATION]
...
[TTS_READY_EN]
...
```
[PEGAR TEXTO FUENTE AQUÍ]
```
## Qué evaluar
Puntuar 15 en cada eje:
1. Fidelidad al original
- no omite matices importantes
- no simplifica demasiado
- no añade ideas
2. Naturalidad del inglés
- suena humano
- no parece traducción literal
- mantiene buen ritmo
3. Precisión religiosa / terminológica
- citas bíblicas bien mantenidas
- términos doctrinales consistentes
- nombres y referencias correctos
4. Calidad TTS-ready
- frases respirables
- puntuación ayuda a narración
- no hay giros torpes para voz
5. Necesidad de edición manual
- 5 = casi publicar
- 1 = rehacer bastante
## Señales de que gana el 12B
- conserva mejor el matiz del original
- hace menos traducción literal rara
- entrega una versión TTS más fluida
- requiere menos retoques antes de publicar
## Regla práctica de decisión
Si el 12B gana claramente en 3 o más ejes y la latencia extra sigue siendo tolerable, merece ser el modelo por defecto para traducción/TTS de Feadulta.
Si la mejora es pequeña, el 4B puede seguir siendo suficiente para borradores rápidos.