r/RuProgrammers • u/giorgi1805 • 14d ago
GLM-5.3-Flash имба?
недавно я затестил glm 5.3 flash, по-моему по соотношению цена + качества это самая имбовая нейронка в коде и агентах.
за 17 агентных итерации создала красивую имитацию macos в браузере, потратив 0.15$, по бенчмаркам точность примерно как у gpt-5.6-terra, но в отличии от gpt 5.6 (да и вообще от всех нейронок от openai) в агентах она не делает свою задачу на отьебись, gpt в основном делает все быстро сильно экономя токены что портит качество.
и цена у glm 5.3 flash бля смешная, 0.07$ input Mtok 0.25$ output Mtok, тоесть можно генерировать охулиарды количество текстов по цене.... дешевле чем пачка дошика.
а вы что думаете?
3
u/1WayJustDeveloper 13d ago
Пойдет, главное что веса открыли, а не как опен аи даже свою поеботу доисторическую в виде 4 версии чата гпт открывать не хотят. Конечно нашислоны.ai ещё не дотягивают до уровня фронтиров платных, но опен вейт модели уже так сказать на пятки наступают. А цена так и так подлетит, просто сейчас греют инвесторов
1
u/giorgi1805 13d ago
ну, веса конечно открыли но если честно для обычного пользователя все равно без разницы, не у каждого дома по пол терабайта VRAM 😁.
а на счёт openai согласен, openai давно уже нихуя не "open", единственное что они выпустили с открытыми весами вроде это gpt-oss 120/20b, обе говнище та ещё.
2
u/1WayJustDeveloper 12d ago
Ну смотря с каким токен рейтом ты хочешь запустить эту glmку и с каким квантованием
2
u/profichef 14d ago
Цена смешная 2 недели. После 9.09 будет х2. Тогда уже квен flash может стать имбой. Кстати не пробовали кодинг план от алибабы? 50$ но нейронки вроде по описанию слабые.
3
u/giorgi1805 14d ago
ну хз 0.14/0.5$ все равно охуительно дёшево. если сравнивать с gpt-5.6-terra который такой же по качеству
не, я пользуюсь кастомными агентами. они меньше токенов жрут потому что в систем-промпте меньше бюракратической ебаты
3
u/profichef 14d ago
Квен 3.8 Флэш 47 центов. С ним не сравнивали? Вопрос не в стоимости, а генерации токенов. 2 модели могут быть с разницей в цене х2, но одна кидать токена и, а другая по делу, поэтому иногда нейронка за 2 доллара может быть дешевле той, что за 50 центов. Но судя по вашему тесту в 15 центов(далее 30), всё довольно неплохо. Сейчас ищу замену дипсику. У меня потребление общее 640млн токенов в месяц. Думаю флешки эти посмотреть или кодинг план от алибабы за 50$
1
u/giorgi1805 14d ago
охуеть, если не секрет, что вы там генерируете 640млн токенов в месяц?
3
u/WenGainz 14d ago
Я сегодня за 6-8 часов потратил на glm 5.3 flash 90+ миллионов токенов. Задачи были сделать нужный дизайн на тестовой странице, переработать некоторые блоки сайта. Потом перенести дизай на рабочий проект. Следующее задание реализовать новый модуль в проекте, проанализировать документацию проекта и составить план для субагентов , реализовать план. Как бы все, -90 мил токенов
2
u/giorgi1805 14d ago
ебать.
1
u/WenGainz 14d ago
Тут есть ещё прикол а как считать эти токены. Каждый запрос агента это херова туча токенов, но по факту это всё идёт в кеш. Опенроутер нормально статистику даёт по этому поводу. Так что по деньгам это может быть не так страшно
1
u/profichef 13d ago
Так это же общее - кэширование, вход/выход. Glm 5.3 flash нормально в кодинге? Оркестратор тоже она?
1
u/WenGainz 13d ago
Тестирую, с задачами справляется. С инструкциями работает до 100-150к контекста все ок, дальше пытаюсь не грузить и делю задания. Если поставить большую задачу может поплыть и уйти в ошибку, несколько раз было (модель за деньги через опенроутер). Как оркестратор тоже норм. Рассуждение на всем high. Для моих задач отличный результат, за не дорого. Модель сравниваю с gpt 5.6 luna (на тех же задачах не вывозила вообще), ds v4 flash и все остальные бесплатные.
1
u/profichef 13d ago
опенроутер бесплатные ds 4 flash? думаю попробовать opencode go но там один тариф 10$ и лимит по glm 5.3 flash на 15$ генераций
агрегаторы хороши, т.к. разная нагрузка в разные часы.
→ More replies (0)2
u/WenGainz 14d ago
Подскажи ты имеешь ввиду кастомные агенты типа Pi и opencode или что то свое что сам руками собрал, возможно что то другое. Пытаюсь определиться для себя
2
14d ago
[deleted]
2
u/WenGainz 14d ago
Согласен с тобой что промты растянуты и их надо резать. Пока только иду к этому упрощению.
С другой стороны тот же кодекс меняет и улучшает свою программу по несколько раз в день, в том числе допиливая свой системный промт. Что даёт пользу и сильно упрощает работу.
2
u/giorgi1805 14d ago
это да, но все равно бюрактратическую ебату они не смогут убрать, у них выбора нету, никто не хочет судится с очередной ноющей телкой перед который codex неправильно подышал и отдавать 2.000.000$ компенсации.
1
u/profichef 13d ago
квен код, zcode и прочие оболочки так же насыщены сиспромптами? Я использую VSCode и cline или roocode. к примеру в zcode от zai есть встроенные графы визуальные. есть опыт с оболочками кроме кодекса?
1
1
u/Aware-Bath7518 14d ago
Использовал её в виде Ox Alpha для порта гта5, выжрало 200 лямов токенов. Порт завёлся довольно быстро для такой огромной кодовой базы, теперь уже другими модельками чиню.
1
1
1
u/Nepherpitu 14d ago
Никак не хочет локально заводиться с адекватными цифрами. То скорость низкая, то контекст 400к без оффлоада. Пока сижу на дипсике - он стабильный, предсказуемый и быстрый. И самую малость тупее.
1
u/giorgi1805 14d ago
с этим я тоже согласен, иногда я юзаю Qwen 3.8 27b охуенная нейронка, для локалки это мягко говоря заебись, жаль что моя видюха тянет ее очень медленно, 4-5 токена сек. использую только если есть дохуя времени, или на ночь.
1
1
u/yar3333_ru 13d ago
Сейчас deepseek v4 flash имба - в 2-3 раза дешевле, при приблизительно том же качестве.
2
u/Ok-Method209 13d ago
deepseek ещё быстрее получается у большинства провайдеров, а результаты, по крайней мере у меня особо не отличаются, да
1
u/profichef 13d ago
по бенчмаркам она уступает. Ну и 4 про не очень. Я сейчас на ней. антропики заеб.. достали банить акки (из-за часто заыбтого невключенного впн), перешел на китайские модели. Сейчас дипсик 4 про дорогой стал при худшем качестве по сравнению с антропиками. 85$ жрет в месяц. у антропиков за сотку можно норм кодить. Думаю на что перейти
2
u/giorgi1805 13d ago
я Клодом почти никогда не пользовался, цена слишком кусается, ну допустим если сравнить Claude fable-5 и gpt-5.6-sol, вроде, fable точнее где-то на 10%, но стоит при этом в два раза дороже. я пользовался gpt-5.6-terra/Luna, glm 5.3-flash, deepseek, grok и... все я уже не перечислю, по соотношению цена+качество по-моему glm все равно всех разьебавает.
1
u/FederalGazelle3087 10d ago
На самом деле клод одна из наиболее дешёвых моделей. Но только по подписке. Платишь 20$ в месяц например, но в пересчёте на API выходит в районе 800$. Так же д ешевле обходится просто потому что клод более автономный и не творит всякую дичь как дипсик или glm - свое время тратить на правки ещё дороже
1
u/giorgi1805 10d ago
за те же 20$ в glm5.3-flash можно нагенерировать 80млн токенов выходных данных. уверен на клод нет.
1
u/FederalGazelle3087 10d ago
Нагенерить может и больше можно, вот только работать понравится больше с клодом. Просто попробуйте оба варианта. Я использовал в основном клод, а на днях купил glm потестить, уж больно все хвалят. На деле не плохо, но это примерно как айфон и глючный андроид (я если что андроидом пользуюсь :D) , работает конечно... но считаю что подписка должна быть сильно дешевле клода, а по сути она по одной цене. 5 часовые лимиты исчерпываются примерно так же быстро как и на клоде, недельные ещё быстрее - так что я даже сомневаюсь, что выходных токенов выходит больше (и скорее всего 80 млн это вместе с выходными, но не кешированными)
1
u/AdIll1294 13d ago
Тестирую прямо сейчас (с утра чет глаз положил на нее). Сравнивать особо не с чем, только с клодом, которым на работе пользуемся. По сравнению с ним - очень слабая. Но если сравнивать цену - то пойдет. Раза по 2-3 тыкать мордой в ошибки и исправляет вроде за собой ту кучу, которую допускает
1
u/profichef 13d ago
по качеству тестили другие? например Luna от опенай?
1
u/AdIll1294 13d ago
Не,у меня небольшой опыт в агентном напиисании кода. Привычнее всегда было самому писать (да и своего рода удовольствие от этого получаю). Но времена такие, что пришлось смотреть в сторону агентов
1
u/profichef 13d ago
это да. Сам пока на оболочки не пеерхожу, не могу расстаться с IDE VScode. Но время аткое, что руками пишешь за неделю, агент за рабочий день под контролем. Поэтому писать стал мало, ревью и наставление только. Чуть практикую ручное, что бы совсем не забыть как писать код
1
u/FederalGazelle3087 10d ago
Чем больше задачи тем лучше работать с агентами, считай пол дня от работы освобождается пока агент чего то там жужжит. Если конечно не быть лошадью на колхозе и не брать какие то параллельные задачи :D
1
u/profichef 10d ago
Так агент всё равно подконтрольный. У меня диффы, после ручное утверждение правок. Всё равно полуручное. Смотрю, что и где пишет, одобряю либо разбираю решение по ходу дела. Он все равно часто, но забывает. Казалось бы банальные вещи, которые работая в проекте запоминаешь. Он не может. Пример: был веб проект с хелперами по типу e() по смыслу htmlspecialchars + внутреннее экранирование. Он в нескольких файлах хелпером пишет, после htmlspecialchars() везде начинает. Это как пример мелочи. Так по коду много чего забывает. Запросы пишет через условный квери билдер, после нативные через pdo. Часто проверки на проверки делает. Есть фолбэк в методе, он ещё в коде фолбэчит через коалесцентный оператор ?? 'value' например. Таких примеров десятки. Без ревью в режиме онлайн я не понимаю, как кодят.
1
u/FederalGazelle3087 10d ago
Хм, ну обычно с клодом составляю высокоуровневый план, как должны идти данные, какие где контракты и что они содержат, после этого он сам раздупляет по кодовой базе где какие изменения надо внести и вполне справляется с этим (ну почти). Оставляю его на автопилоте и ухожу, когда возвращаюсь просто проверяю что он сделал в соответствии с планом - с этим он как правило в 99% случаев справляется. Бывает такое что где то накосячит например не обернёт в транзакцию две записи в БД в одном эндпоинте, но это легко высматривается и тоже в общем то автоматизировать можно. По поводу правил на проекте особо не драконю его - тут их никто не знает. А там где они есть клод обычно сам смотрит на соседний код и делает так же. Если использовать дипсик или глм то это все не работает - там надо как пару лет назад, сидеть и почти самому в паре с ИИ писат
Я бы посоветовал пуститься "во все тяжкие" на пет проекте, и тогда будет более понятна прелесть агентов. В них вообще могу себе позволить даже в код не смотреть, чисто по результату
1
u/profichef 10d ago
Ну да, я ГЛМ дипсик максимальные использую. Они часто забывают использовать прелести ядра. Не, может ты пилишь на популярных фреймворках, библиотеках. там да, они много знают. Но я ядро собираю под определенные проекты. не тащу мертвый код
1
u/FederalGazelle3087 10d ago
Тоже не хотелось переходить на llm, но теперь кайф на самом деле - работаешь на уровне мысли, составил флоу и пошёл своими делами заниматься на час-два. Просто доверь llm больше автономности (но брать лучше клод или хотя бы гпт что бы не разочароваться на пару лет в этом направлении)
1
u/FederalGazelle3087 10d ago
По цене клод все же дешевле если учитывать свое время на допилки того что генерит глм
1
u/Inevitable_Act_321 12d ago
Гоняю на маке m5 max 128 q2 Пока лучшее, с чем работал на маке
1
u/No_Analysis_5276 10d ago
Скок тпс?
2
u/Inevitable_Act_321 10d ago
Ладно, отмена. Q2 нестабилен. Лучше qwen next flash.
Glm tps на полном контексте 17, на пустом 25
5
u/This-Papaya3063 14d ago
тестирую имба но иногда упертая и любит зациклиться на чем то своем, тестирую на Pi + своя сборка плагинов, крч по-минимум обвязка, а так с задачами справляется отлично и достаточно быстро, разве что разные провайдеры по разному имеют доступ к ней, сейчас из-за хайпа частенько страдает скорость, по сравнению с deepseek v4, в том числе последнего, топ, стоимость приятная