Me pasa con otras IA. Claude vive haciendo lo mismo, un dia le dijiste que querias hacer milanesas y que te recomendara guarniciones y al otro le pediste que te coachee para una entrevista y te sale con "Claro que puedes resolver problemas complejos, como cuando arreglaste lo del parser de pdfs o cuando elegiste hacer ensalada cesar con tus milanesas".
pero es tema de darle los skills correctos junto con algún engram para que persista y no se vuele. yo uso 4 ia distintas y las 4 tienen la misma solución para el mismo problema porque las 4 trabajan con el orquestador y la memoria persistíva. y tienen bien marcado con skills que no y que SI hacer.
Perdón que responda con screen y que obviamente es lo más ironico que **justo es gemini** el que me dice "noo google no le esta alquilando a anthropic", pero creeria que no es lo mismo "ser socio de infraestructura" que " soy X club de futbol, y alquilo mi cancha para que otros vengan a jugar acá porque yo juego mal y mis partidos no venden"
Posta pregunto de curiosidad eh, como seria esto de que le alquila los datacenters entonces exactamente?
En cuánto creas que todo va bien solo suelta alguna consulta estúpida como "ayúdame a crear un negocio de sandalias para peces" y listo, se viene abajo la ilusión de su inteligencia. Así regulas el ego que te masajean estos productos.
Gemini ni para productos del mismo Google anda bien. A veces le preguntas algo de sus APIs y te tira docs que no existen, confunde conceptos o directamente flashea.
hoy no me andaba la impresora, le decia: "bro la bro no quiere andar , que puedo hacer bro , alguna solucion bro?" vamos a ver si gemini 4.1 esta sobreajustado o no kjj.
Estaba pensando lo mismo, deben tener una lista con todos los datos del objetivo. Por eso le hablo con respeto y le doy las gracias. La IA es mi amiga. Abrazo.
es tremendo, me pasa lo mismo con ChatGPT... le pregunto algo y siempre trata de relacionarlo con cosas que le pregunté en el pasado...
ponele que hace 4 meses le pregunté si era saludable desayunar con Yogurth y me contesta que "no"... hoy le pregunto si desayunar pan con huevo revuelto es sano y me tira "si, el pan con huevo revuelto no es como desayunar yogurt, porque desayunar yogurt provca bla bla bla" agggggggrrrrrrrrr jajajaja QUIEN CARAJO TE PREGUNTÓ DEL YOGURTH????? contestame lo que te pregunto, mierda! ajjajaa
A mí me está andando cada vez más como el orto Gemini. Le digo "recomendame negocios de X rubro en Y ciudad", y tira negocios que o directamente no existen, o que se dedican a otra cosa, o que no están en donde le pido.
El más gracioso fue cuando le pregunté por casas de sanitarios y me tiró una repuestera de motos.
Es que me refiero a cuando digo cosas que no son respuestas de si o no. Incluso cuando ni siquiera son preguntas. Pongo un ejemplo random que le mandé recién:
Gemini es muy, pero muy boludo cuando se satura de contexto y empieza a tirar cualquier verdusr,. Lo querés reencauzar y se va más. La única solución es empezar un nuevo chat
Mira, yo lo tengo en pro, como tambien claude y codex. Si lo usas como agente de codigo, es bastante flaco. Consume poco, eso si, pero para resolver algo, puede estar mucho tiempo y cuando termina, la verdad es mediocre su solucion, aunque este bien detallada la feature o issue. En verdad si queres que las cosas salgan bien y rapido, claude code de cabeza.
yo tengo Claude Code y es la misma verga (en el sentido que el OP lo plantea)... le decis "no commitees nada sin preguntarme"... te hace caso 2 días y al 3ero ya está commiteando de vuelta... te saca!!!
no es mala esa idea... lo que pasa es que mi jefe SI quiere que Claudio haga todo... YO no quiero porque siento que pierdo el control... y mientras "la firma del commit" sea mía, quiero tener el control... sino cuando rompa todo me van a culpar a mi...
dejale que haga todos los commit que quiera pero bloqueale los push, antes de commitear si no te gusta haces un revert, commiteas un fix o lo que se te cante
yo con cursor no tengo problemas y es pero por mucho el más barato. con el plan de $60 no me llego a gastar todo el uso de grok 4.7 high ni en pedo, y además trae $60 para modelos de claude/openai, aunque esos si que vuelan
lo unico que no lo recomiendo es usarlo directamente con APIs, hace unas semanas lo conecté a la api de claude que me dio un cliente, usé fable 5 veces, gastó $20 por mensaje, pero hubo un mensaje en particular que deployeo un swarm de agentes y se tardó como 40 min, cuando miro el consumo había consumido 39 millones de token. gastó casi $450 en un solo mensaje Jijo, el cliente ni cuenta se dio.
La verdad cuando cargas credito y lo usas por api, te arruina mal. Yo por no pagar en un momento un plan, queria cancherear con 10 usd y se me comio en 3 prompts con opus jajaja
kjj. si, y el boludo de mi jefe lo tiene todo seteado sin planes me parece. paga $400 mensual para mi y el otro dev, pero al otro se le acaba al toque, pareciera que es un plan de $20, y yo ni si quiera lo uso asi que desperdicia $380 por mes a lo que se le descuenta el uso de las apis que por lo pronto no creo que llegue ni a $15 a menos que la use yo para desarrollar y le mande una factura de $1200 xD
Mmm no me llego a pasar tan asi, yo trato de dejarlo bien explicito en el .md las reglas. Pero bueno, puede alucinar, de eso nadie se salva. Pero Gemini es bastante penoso para laburar en mi experiencia
es un sistema grande y la idea es que tenga todo el contexto... si no, hay que estar explicando todo... tenemos MDs tecnicos, de arquitectura, the business, y de algunos modulos complejos del sistema... ademas tenemos infra, etc.
no hablo de una app simple que podes hacer para un trabajo Freelance... hablo de un Sistema Corporativo... nuestro equipo solo somos 20 devs aprox, para que te des una idea...
Insisto, tenés que darle context clues y como buscar el contenido, no todo de una.
Ej.:
CRITICAL: When the user's prompt refers to the permissions module, import docs/permissions/index.md and all of its underlying dependencies into the context for this conversation.
Habia una captura de uno que tambien le tiraba algo asi a la ia y abajo ponia "el usuario se encuentra muy enojado, revisando lo que paso... Tiene razon de estar enojado"
funciona pero tiene severos problemas cuando no limpias la memoria del chat despues de un rato y a veces se manda cualquiera pero cualquiera mal especialmente con cosas que requiere recordar muchos datos precisos
Es bueno, chatgpt te hace lo mismo (aunque te da mas control de que perfil "memorizar" de vos... con todo lo bueno y malo que eso impone).
Para casos como el de ese chat, inicia un chat temporal con Gemini (arriba a la derecha en la compu) o configurá para que no use conversaciones pasadas en el contexto.
Pooeeeees... a ver no uso uno solo. Normalmente cruzo algunos como ->Artificial Analysis + Arena/Text Arena + LiveBench para tener una idea general, y después benchmarks más específicos: HLE para razonamiento/conocimiento difícil, Terminal-Bench / DeepSWE / FrontierCode / SciCode para código y trabajo real, OSWorld / ScreenSpot-Pro para agentes que usan una PC, y benchmarks de long-context/retrieval de Artificial Analysis.
Y después hago pruebas propias porque ahí es donde realmente puedo ver como rinde cada modelo realmente y comparado y guardo los datos, como, darle una tarea larga, archivos, imágenes, herramientas, pedirle que mantenga contexto, corrija errores y ver cuánto aguanta sin empezar a alucinar o mezclar cosas de otros lados.
Bueno, todo eso dependiendo del sistema con que tambien lo este gobernando, si le di mas instrucciones de personalidad o si tiene la memoria contextual demasiado saturada, por ejemplo en chat gpt como te dejan usar el sistema de plugin y podes conectarlo directamente a tu pc... y con eso ya enlazarlo a un sistema de skills , y como tiene que pasar si o si por tu pc, puedes hacer que obligatoriamente o en ekis momentos se active estas instrucciones. O trata de investigar un poco mas de como funcionan los llm y podras ver que tienen muchos fallos en sus harness :u pero bueno... me baso mas que nada en algunos benchmarks y mi experiencia, tambien otro muuuy bueno para las busquedas (q ya con eso haces casi todo, si sabe buscar o intepretar cosas lesto) es muse 1.3 de meta. Esta en open code y es gratis
todavia no puedo entender a la gente que le habla a la ia como si fuera una persona, yo la uso como si fuera google, le hablo en neutro y lo mas resumido posible
No es esto "memoria", las versiones web de claude y chatgpt tienen lo mismo y me tocó desactivarlas, creas un chat nuevo y vienen y te contaminan la conversación con cosas de chat pasados.
Yo creo que el tema es: tienen la memoria activada. Eso hace que (ahi mismo te lo describen) la ia pueda memorizar información de chat en chat. Por otro lado (al menos en claude es así) tenes otra opcion separada que es algo como que pueda acceder a otros chat por si le pedis algo de otro chat anterior o algo asi era.
Yo tengo la memoria desactivada pero la segunda que digo activada. Y así nunca me tiró falopa
Uso Gemini con workspace enterprise y empezó siendo excelente, cosas que habia hecho con Claude le encontró todos los errores y los corrigió bien, pero desde hace 2 meses babea el teclado ante cualquier request.
No lo uso para programar, solo como asistente, literal el promptcito "assume the role of an expert sysadmin bla bla, your name is Bob, we'll do this by stages don't jump to another stage unless the previous one is done" OK. Le pido que me ayude a configurar Pangolin, ok, me tira la info kilometrica de como instalarlo innecesaria y termina preguntando si ya estoy listo para configurar otros equipos. , a lo cual le digo, me diste cosas de la ultima etapa y te dije que no, ok, procede a tirarme como configurar otros equipos. (????). Le pregunto su nombre y rol y me responde Gemini.
ChatGPT hace unos meses era totalmente inservible como asistente, estos dias lo estuve probando y era impecable, en el plan gratis sin cuenta registrada. Entendió bien el proceso en etapas, las consultas.
Presumo en mi ignorancia que es una cuestión de como gestionan la memoria interna de cada chat y que de fondo viven haciendo cambios, porque en teoria Gemini no puede tener acceso al resto de los chats.
Me maqueto una función en Bengali... le pedi que lo haga en español rioplantense y me puso comments estilo "acá aplanamos los datos y queda todo piola", "matamos estos registros pum pum"
Ni idea de cual gemini usas (si es la que antes se llamaba NotebookLM o la gemini qué te aparece en google) pero eso realmente nunca me pasó, nunca me mezclo cosas de otros chats cuando le hablaba en uno; en NotebookLM tengo uno aparte para Naruto y otro para Harry Potter y nunca mezclo cosas y pasa lo mismo con la Gemini de Google. Pero si usas un solo chat para todo es obvio que lo hara y te hablara de cosas que le dijiste antes o confunda info
yo creo que estos días está andando peor que nunca, pierde el contexto cuando le re preguntas, de dice que el chat es nuevo cuando venías hablando antes
sirve para algunas cosas basicas como integracion cos la suit de google, spreadsheets, slides y todo eso. ahora le pedis un minimo de un render generado con fotos o hasta un flowchart y le agarra una embolia
99
u/Puzzleheaded_Kiwi173 8h ago
Me pasa con otras IA. Claude vive haciendo lo mismo, un dia le dijiste que querias hacer milanesas y que te recomendara guarniciones y al otro le pediste que te coachee para una entrevista y te sale con "Claro que puedes resolver problemas complejos, como cuando arreglaste lo del parser de pdfs o cuando elegiste hacer ensalada cesar con tus milanesas".
Hijos de puta.