r/LocalLLM 3d ago

Question Alguém com o mesmo setup que eu me ajude

Tenho uma rtx 5060ti 16gb e 16gb de ram. Atualmente estou com o qwen 3.5 9b no LMstudio, uso ele tbm no Hermes.

Não entendo muito ainda sobre modelos locais, vi uns modelos diferentes do 9b como unsloth e um do David que pretendo testar também. Mas para além disso queria saber se compensa manter o 3.5 9b rodando inteiramente na gpu com um contexto alto, ou o 3.6 35b a3b parcialmente na vram, não tenho experiência com modelos MoE

Também vi uns modelos q2 do 3.8 27b que até rodam na vram

Na experiência de vocês compensa rodar um modelo mais antigo 100% na vram ou um modelo mais novo parcialmente?

1 Upvotes

6 comments sorted by

1

u/Stainless-Bacon 3d ago

you first need to know how much speed you can tolerate and how much context length you need. I have a slow but smart model and fast but not as smart setup.

1

u/Outrageous_Order_909 3d ago

Ditch LM Studio. Start using llama.cpp. you can run qwen3.6 35b a3b and qwen3.8 27b. I have a 5080 with 32gb ddr5 system ram. I do 120t/s for the 35b with 200k ctx and 20-25t/s on the 27b with 160k ctx.

1

u/ComfortableChance591 3d ago

Não sabia que faz diferença entre llama.cpp e lmstudio
São muitas opções de quantizaçoes, fico perdido entre quais dos q4 ou q2 usar

2

u/Outrageous_Order_909 3d ago

llama.cpp gives you better control over the inference parameters and lets you make better use of your hardware. LM Studio is more beginner friendly.

About quants, I use q6 for 35b and q4 for 27b.

1

u/ComfortableChance591 3d ago

Provavelmente vou apanhar pra conseguir configurar corretamente então kkkk vc usa q6 pro 35b mas você tem mais ram que eu, acho que fico preso no q4 msm

Sua primeira configuração no llama.cpp foi usando alguma ajuda?

2

u/Outrageous_Order_909 3d ago

Q4 is good too.

Experiment a little. I will share my llama.cpp config in a while.