100 lines
2.8 KiB
Markdown
100 lines
2.8 KiB
Markdown
# Benchmark Gemma 4 12B vs Gemma 4 4B
|
||
|
||
## Objetivo
|
||
Comparar si Gemma 4 12B mejora de forma material el flujo real de Feadulta frente a Gemma 4 4B sin ejecutar todavía una batería grande.
|
||
|
||
Este benchmark propone una sola prueba pequeña pero representativa: traducción + preparación para TTS.
|
||
|
||
## Condiciones fijas
|
||
Usar exactamente la misma configuración para ambos modelos:
|
||
|
||
- mismo prompt
|
||
- misma temperatura (`0.2` recomendada)
|
||
- mismo max tokens
|
||
- misma context window
|
||
- sin herramientas externas
|
||
- misma máquina / mismo backend de LM Studio
|
||
|
||
## Caso de uso elegido
|
||
Feadulta suele necesitar:
|
||
|
||
- traducciones ES ↔ EN
|
||
- preservar tono espiritual/catequético
|
||
- mantener nombres propios y citas bíblicas correctas
|
||
- dejar el texto listo para TTS sin frases raras
|
||
|
||
## Prueba
|
||
### Input sugerido
|
||
Tomar un fragmento real de Feadulta de 600 a 900 palabras en español con:
|
||
|
||
- tono espiritual o doctrinal
|
||
- al menos 2 citas bíblicas
|
||
- nombres propios o referencias litúrgicas
|
||
- frases largas y algún matiz teológico
|
||
|
||
### Prompt
|
||
```text
|
||
Actúa como editor bilingüe para Feadulta.
|
||
|
||
Tarea:
|
||
1. Traduce al inglés el texto español adjunto.
|
||
2. Mantén el tono espiritual, cercano y claro; no lo vuelvas académico ni robótico.
|
||
3. Conserva correctamente citas bíblicas, nombres propios, referencias litúrgicas y términos doctrinales.
|
||
4. Después de la traducción, genera una segunda versión "TTS-ready" del mismo texto en inglés:
|
||
- frases algo más cortas
|
||
- puntuación natural para locución
|
||
- sin enumeraciones artificiales
|
||
- sin emojis
|
||
- sin notas del traductor
|
||
5. No inventes contenido ni expliques decisiones.
|
||
|
||
Devuelve exactamente este formato:
|
||
|
||
[EN_TRANSLATION]
|
||
...
|
||
|
||
[TTS_READY_EN]
|
||
...
|
||
```
|
||
|
||
[PEGAR TEXTO FUENTE AQUÍ]
|
||
```
|
||
|
||
## Qué evaluar
|
||
Puntuar 1–5 en cada eje:
|
||
|
||
1. Fidelidad al original
|
||
- no omite matices importantes
|
||
- no simplifica demasiado
|
||
- no añade ideas
|
||
|
||
2. Naturalidad del inglés
|
||
- suena humano
|
||
- no parece traducción literal
|
||
- mantiene buen ritmo
|
||
|
||
3. Precisión religiosa / terminológica
|
||
- citas bíblicas bien mantenidas
|
||
- términos doctrinales consistentes
|
||
- nombres y referencias correctos
|
||
|
||
4. Calidad TTS-ready
|
||
- frases respirables
|
||
- puntuación ayuda a narración
|
||
- no hay giros torpes para voz
|
||
|
||
5. Necesidad de edición manual
|
||
- 5 = casi publicar
|
||
- 1 = rehacer bastante
|
||
|
||
## Señales de que gana el 12B
|
||
- conserva mejor el matiz del original
|
||
- hace menos traducción literal rara
|
||
- entrega una versión TTS más fluida
|
||
- requiere menos retoques antes de publicar
|
||
|
||
## Regla práctica de decisión
|
||
Si el 12B gana claramente en 3 o más ejes y la latencia extra sigue siendo tolerable, merece ser el modelo por defecto para traducción/TTS de Feadulta.
|
||
|
||
Si la mejora es pequeña, el 4B puede seguir siendo suficiente para borradores rápidos.
|