docs: add Gemma 4 benchmark plan for Feadulta

This commit is contained in:
OpenClaw Agent
2026-06-04 09:19:27 -04:00
parent 08d203249d
commit fb7eec883c
+99
View File
@@ -0,0 +1,99 @@
# Benchmark Gemma 4 12B vs Gemma 4 4B
## Objetivo
Comparar si Gemma 4 12B mejora de forma material el flujo real de Feadulta frente a Gemma 4 4B sin ejecutar todavía una batería grande.
Este benchmark propone una sola prueba pequeña pero representativa: traducción + preparación para TTS.
## Condiciones fijas
Usar exactamente la misma configuración para ambos modelos:
- mismo prompt
- misma temperatura (`0.2` recomendada)
- mismo max tokens
- misma context window
- sin herramientas externas
- misma máquina / mismo backend de LM Studio
## Caso de uso elegido
Feadulta suele necesitar:
- traducciones ES ↔ EN
- preservar tono espiritual/catequético
- mantener nombres propios y citas bíblicas correctas
- dejar el texto listo para TTS sin frases raras
## Prueba
### Input sugerido
Tomar un fragmento real de Feadulta de 600 a 900 palabras en español con:
- tono espiritual o doctrinal
- al menos 2 citas bíblicas
- nombres propios o referencias litúrgicas
- frases largas y algún matiz teológico
### Prompt
```text
Actúa como editor bilingüe para Feadulta.
Tarea:
1. Traduce al inglés el texto español adjunto.
2. Mantén el tono espiritual, cercano y claro; no lo vuelvas académico ni robótico.
3. Conserva correctamente citas bíblicas, nombres propios, referencias litúrgicas y términos doctrinales.
4. Después de la traducción, genera una segunda versión "TTS-ready" del mismo texto en inglés:
- frases algo más cortas
- puntuación natural para locución
- sin enumeraciones artificiales
- sin emojis
- sin notas del traductor
5. No inventes contenido ni expliques decisiones.
Devuelve exactamente este formato:
[EN_TRANSLATION]
...
[TTS_READY_EN]
...
```
[PEGAR TEXTO FUENTE AQUÍ]
```
## Qué evaluar
Puntuar 15 en cada eje:
1. Fidelidad al original
- no omite matices importantes
- no simplifica demasiado
- no añade ideas
2. Naturalidad del inglés
- suena humano
- no parece traducción literal
- mantiene buen ritmo
3. Precisión religiosa / terminológica
- citas bíblicas bien mantenidas
- términos doctrinales consistentes
- nombres y referencias correctos
4. Calidad TTS-ready
- frases respirables
- puntuación ayuda a narración
- no hay giros torpes para voz
5. Necesidad de edición manual
- 5 = casi publicar
- 1 = rehacer bastante
## Señales de que gana el 12B
- conserva mejor el matiz del original
- hace menos traducción literal rara
- entrega una versión TTS más fluida
- requiere menos retoques antes de publicar
## Regla práctica de decisión
Si el 12B gana claramente en 3 o más ejes y la latencia extra sigue siendo tolerable, merece ser el modelo por defecto para traducción/TTS de Feadulta.
Si la mejora es pequeña, el 4B puede seguir siendo suficiente para borradores rápidos.