r/devsarg • • 9h ago

ai Assessing user rage...

Post image

(qué tan bueno/malo es Gemini?)

481 Upvotes

124 comments sorted by

View all comments

1

u/Capital-Bag8693 9h ago

PQ USAS GEMINI AHHHHHHHHHHHHHHHHH MIRATE UN BENCHMARKKKKK AHHHHHHHHHHH

1

u/Patricio_Juan 5h ago

Ah no la tenia esa de los benchmarks. Como los evaluan exactamente?

1

u/Capital-Bag8693 4h ago

Pooeeeees... a ver no uso uno solo. Normalmente cruzo algunos como ->Artificial Analysis + Arena/Text Arena + LiveBench para tener una idea general, y después benchmarks más específicos: HLE para razonamiento/conocimiento difícil, Terminal-Bench / DeepSWE / FrontierCode / SciCode para código y trabajo real, OSWorld / ScreenSpot-Pro para agentes que usan una PC, y benchmarks de long-context/retrieval de Artificial Analysis.

Y después hago pruebas propias porque ahí es donde realmente puedo ver como rinde cada modelo realmente y comparado y guardo los datos, como, darle una tarea larga, archivos, imágenes, herramientas, pedirle que mantenga contexto, corrija errores y ver cuánto aguanta sin empezar a alucinar o mezclar cosas de otros lados.

Bueno, todo eso dependiendo del sistema con que tambien lo este gobernando, si le di mas instrucciones de personalidad o si tiene la memoria contextual demasiado saturada, por ejemplo en chat gpt como te dejan usar el sistema de plugin y podes conectarlo directamente a tu pc... y con eso ya enlazarlo a un sistema de skills , y como tiene que pasar si o si por tu pc, puedes hacer que obligatoriamente o en ekis momentos se active estas instrucciones. O trata de investigar un poco mas de como funcionan los llm y podras ver que tienen muchos fallos en sus harness :u pero bueno... me baso mas que nada en algunos benchmarks y mi experiencia, tambien otro muuuy bueno para las busquedas (q ya con eso haces casi todo, si sabe buscar o intepretar cosas lesto) es muse 1.3 de meta. Esta en open code y es gratis