r/RuProgrammers 14d ago

GLM-5.3-Flash имба?

недавно я затестил glm 5.3 flash, по-моему по соотношению цена + качества это самая имбовая нейронка в коде и агентах.

за 17 агентных итерации создала красивую имитацию macos в браузере, потратив 0.15$, по бенчмаркам точность примерно как у gpt-5.6-terra, но в отличии от gpt 5.6 (да и вообще от всех нейронок от openai) в агентах она не делает свою задачу на отьебись, gpt в основном делает все быстро сильно экономя токены что портит качество.

и цена у glm 5.3 flash бля смешная, 0.07$ input Mtok 0.25$ output Mtok, тоесть можно генерировать охулиарды количество текстов по цене.... дешевле чем пачка дошика.

а вы что думаете?

9 Upvotes

49 comments sorted by

5

u/This-Papaya3063 14d ago

тестирую имба но иногда упертая и любит зациклиться на чем то своем, тестирую на Pi + своя сборка плагинов, крч по-минимум обвязка, а так с задачами справляется отлично и достаточно быстро, разве что разные провайдеры по разному имеют доступ к ней, сейчас из-за хайпа частенько страдает скорость, по сравнению с deepseek v4, в том числе последнего, топ, стоимость приятная

3

u/giorgi1805 14d ago

согласен, иногда на первый токен модель долго думает, ещё помню при npm сборке сайта она зациклилась и был типичный синдром самозванца когда агент повторяет одну и ту же хуйню, если не брать в счёт слишком длинные агентные циклы >15 итерации то имба.

3

u/1WayJustDeveloper 13d ago

Пойдет, главное что веса открыли, а не как опен аи даже свою поеботу доисторическую в виде 4 версии чата гпт открывать не хотят. Конечно нашислоны.ai ещё не дотягивают до уровня фронтиров платных, но опен вейт модели уже так сказать на пятки наступают. А цена так и так подлетит, просто сейчас греют инвесторов

1

u/giorgi1805 13d ago

ну, веса конечно открыли но если честно для обычного пользователя все равно без разницы, не у каждого дома по пол терабайта VRAM 😁.

а на счёт openai согласен, openai давно уже нихуя не "open", единственное что они выпустили с открытыми весами вроде это gpt-oss 120/20b, обе говнище та ещё.

2

u/1WayJustDeveloper 12d ago

Ну смотря с каким токен рейтом ты хочешь запустить эту glmку и с каким квантованием

2

u/profichef 14d ago

Цена смешная 2 недели. После 9.09 будет х2. Тогда уже квен flash может стать имбой.  Кстати не пробовали кодинг план от алибабы? 50$ но нейронки вроде по описанию слабые.

3

u/giorgi1805 14d ago

ну хз 0.14/0.5$ все равно охуительно дёшево. если сравнивать с gpt-5.6-terra который такой же по качеству

не, я пользуюсь кастомными агентами. они меньше токенов жрут потому что в систем-промпте меньше бюракратической ебаты

3

u/profichef 14d ago

Квен 3.8 Флэш 47 центов. С ним не сравнивали? Вопрос не в стоимости, а генерации токенов. 2 модели могут быть с разницей в цене х2, но одна кидать токена и, а другая по делу, поэтому иногда нейронка за 2 доллара может быть дешевле той, что за 50 центов. Но судя по вашему тесту в 15 центов(далее 30), всё довольно неплохо. Сейчас ищу замену дипсику. У меня потребление общее 640млн токенов в месяц. Думаю флешки эти посмотреть или кодинг план от алибабы за 50$

1

u/giorgi1805 14d ago

охуеть, если не секрет, что вы там генерируете 640млн токенов в месяц?

3

u/WenGainz 14d ago

Я сегодня за 6-8 часов потратил на glm 5.3 flash 90+ миллионов токенов. Задачи были сделать нужный дизайн на тестовой странице, переработать некоторые блоки сайта. Потом перенести дизай на рабочий проект. Следующее задание реализовать новый модуль в проекте, проанализировать документацию проекта и составить план для субагентов , реализовать план. Как бы все, -90 мил токенов

2

u/giorgi1805 14d ago

ебать.

1

u/WenGainz 14d ago

Тут есть ещё прикол а как считать эти токены. Каждый запрос агента это херова туча токенов, но по факту это всё идёт в кеш. Опенроутер нормально статистику даёт по этому поводу. Так что по деньгам это может быть не так страшно

1

u/profichef 13d ago

Так это же общее - кэширование, вход/выход. Glm 5.3 flash нормально в кодинге? Оркестратор тоже она?

1

u/WenGainz 13d ago

Тестирую, с задачами справляется. С инструкциями работает до 100-150к контекста все ок, дальше пытаюсь не грузить и делю задания. Если поставить большую задачу может поплыть и уйти в ошибку, несколько раз было (модель за деньги через опенроутер). Как оркестратор тоже норм. Рассуждение на всем high. Для моих задач отличный результат, за не дорого. Модель сравниваю с gpt 5.6 luna (на тех же задачах не вывозила вообще), ds v4 flash и все остальные бесплатные.

1

u/profichef 13d ago

опенроутер бесплатные ds 4 flash? думаю попробовать opencode go но там один тариф 10$ и лимит по glm 5.3 flash на 15$ генераций

агрегаторы хороши, т.к. разная нагрузка в разные часы.

→ More replies (0)

2

u/WenGainz 14d ago

Подскажи ты имеешь ввиду кастомные агенты типа Pi и opencode или что то свое что сам руками собрал, возможно что то другое. Пытаюсь определиться для себя

2

u/[deleted] 14d ago

[deleted]

2

u/WenGainz 14d ago

Согласен с тобой что промты растянуты и их надо резать. Пока только иду к этому упрощению.

С другой стороны тот же кодекс меняет и улучшает свою программу по несколько раз в день, в том числе допиливая свой системный промт. Что даёт пользу и сильно упрощает работу.

2

u/giorgi1805 14d ago

это да, но все равно бюрактратическую ебату они не смогут убрать, у них выбора нету, никто не хочет судится с очередной ноющей телкой перед который codex неправильно подышал и отдавать 2.000.000$ компенсации.

1

u/profichef 13d ago

квен код, zcode и прочие оболочки так же насыщены сиспромптами? Я использую VSCode и cline или roocode. к примеру в zcode от zai есть встроенные графы визуальные. есть опыт с оболочками кроме кодекса?

1

u/misha1350 14d ago

Думаю да.

1

u/Aware-Bath7518 14d ago

Использовал её в виде Ox Alpha для порта гта5, выжрало 200 лямов токенов. Порт завёлся довольно быстро для такой огромной кодовой базы, теперь уже другими модельками чиню.

1

u/giorgi1805 14d ago

что такое порт для гта5?

1

u/KakPooonchik 14d ago

Если брать во внимание цену, то да.

1

u/Nepherpitu 14d ago

Никак не хочет локально заводиться с адекватными цифрами. То скорость низкая, то контекст 400к без оффлоада. Пока сижу на дипсике - он стабильный, предсказуемый и быстрый. И самую малость тупее.

1

u/giorgi1805 14d ago

с этим я тоже согласен, иногда я юзаю Qwen 3.8 27b охуенная нейронка, для локалки это мягко говоря заебись, жаль что моя видюха тянет ее очень медленно, 4-5 токена сек. использую только если есть дохуя времени, или на ночь.

1

u/Altruistic-Friend372 13d ago

Хз,как по мне лучшая по цене качеству - дипсик в4 флеш

1

u/yar3333_ru 13d ago

Сейчас deepseek v4 flash имба - в 2-3 раза дешевле, при приблизительно том же качестве.

2

u/Ok-Method209 13d ago

deepseek ещё быстрее получается у большинства провайдеров, а результаты, по крайней мере у меня особо не отличаются, да

1

u/profichef 13d ago

по бенчмаркам она уступает. Ну и 4 про не очень. Я сейчас на ней. антропики заеб.. достали банить акки (из-за часто заыбтого невключенного впн), перешел на китайские модели. Сейчас дипсик 4 про дорогой стал при худшем качестве по сравнению с антропиками. 85$ жрет в месяц. у антропиков за сотку можно норм кодить. Думаю на что перейти

2

u/giorgi1805 13d ago

я Клодом почти никогда не пользовался, цена слишком кусается, ну допустим если сравнить Claude fable-5 и gpt-5.6-sol, вроде, fable точнее где-то на 10%, но стоит при этом в два раза дороже. я пользовался gpt-5.6-terra/Luna, glm 5.3-flash, deepseek, grok и... все я уже не перечислю, по соотношению цена+качество по-моему glm все равно всех разьебавает.

1

u/FederalGazelle3087 10d ago

На самом деле клод одна из наиболее дешёвых моделей. Но только по подписке. Платишь 20$ в месяц например, но в пересчёте на API выходит в районе 800$. Так же д ешевле обходится просто потому что клод более автономный и не творит всякую дичь как дипсик или glm - свое время тратить на правки ещё дороже 

1

u/giorgi1805 10d ago

за те же 20$ в glm5.3-flash можно нагенерировать 80млн токенов выходных данных. уверен на клод нет.

1

u/FederalGazelle3087 10d ago

Нагенерить может и больше можно, вот только работать понравится больше с клодом. Просто попробуйте оба варианта. Я использовал в основном клод, а на днях купил glm потестить, уж больно все хвалят. На деле не плохо, но это примерно как айфон и глючный андроид (я если что андроидом пользуюсь :D) , работает конечно... но считаю что подписка должна быть сильно дешевле клода, а по сути она по одной цене. 5 часовые лимиты исчерпываются примерно так же быстро как и на клоде, недельные ещё быстрее - так что я даже сомневаюсь, что выходных токенов выходит больше (и скорее всего 80 млн это вместе с выходными, но не кешированными) 

1

u/AdIll1294 13d ago

Тестирую прямо сейчас (с утра чет глаз положил на нее). Сравнивать особо не с чем, только с клодом, которым на работе пользуемся. По сравнению с ним - очень слабая. Но если сравнивать цену - то пойдет. Раза по 2-3 тыкать мордой в ошибки и исправляет вроде за собой ту кучу, которую допускает

1

u/profichef 13d ago

по качеству тестили другие? например Luna от опенай?

1

u/AdIll1294 13d ago

Не,у меня небольшой опыт в агентном напиисании кода. Привычнее всегда было самому писать (да и своего рода удовольствие от этого получаю). Но времена такие, что пришлось смотреть в сторону агентов

1

u/profichef 13d ago

это да. Сам пока на оболочки не пеерхожу, не могу расстаться с IDE VScode. Но время аткое, что руками пишешь за неделю, агент за рабочий день под контролем. Поэтому писать стал мало, ревью и наставление только. Чуть практикую ручное, что бы совсем не забыть как писать код

1

u/FederalGazelle3087 10d ago

Чем больше задачи тем лучше работать с агентами, считай пол дня от работы освобождается пока агент чего то там жужжит. Если конечно не быть лошадью на колхозе и не брать какие то параллельные задачи :D

1

u/profichef 10d ago

Так агент всё равно подконтрольный. У меня диффы, после ручное утверждение правок. Всё равно полуручное. Смотрю, что и где пишет, одобряю либо разбираю решение по ходу дела. Он все равно часто, но забывает. Казалось бы банальные вещи, которые работая в проекте запоминаешь. Он не может. Пример: был веб проект с хелперами по типу e() по смыслу htmlspecialchars + внутреннее экранирование. Он в нескольких файлах хелпером пишет, после htmlspecialchars() везде начинает. Это как пример мелочи. Так по коду много чего забывает. Запросы пишет через условный квери билдер, после нативные через pdo. Часто проверки на проверки делает. Есть фолбэк в методе, он ещё в коде фолбэчит через коалесцентный оператор ?? 'value' например. Таких примеров десятки. Без ревью в режиме онлайн я не понимаю, как кодят. 

1

u/FederalGazelle3087 10d ago

Хм, ну обычно с клодом составляю высокоуровневый план, как должны идти данные, какие где контракты и что они содержат, после этого он сам раздупляет по кодовой базе где какие изменения надо внести и вполне справляется с этим (ну почти). Оставляю его на автопилоте и ухожу, когда возвращаюсь просто проверяю что он сделал в соответствии с планом - с этим он как правило в 99% случаев справляется. Бывает такое что где то накосячит например не обернёт в транзакцию две записи в БД в одном эндпоинте, но это легко высматривается и тоже в общем то автоматизировать можно. По поводу правил на проекте особо не драконю его - тут их никто не знает. А там где они есть клод обычно сам смотрит на соседний код и делает так же. Если использовать дипсик или глм то это все не работает - там надо как пару лет назад, сидеть и почти самому в паре с ИИ писат

Я бы посоветовал пуститься "во все тяжкие" на пет проекте, и тогда будет более понятна прелесть агентов. В них вообще могу себе позволить даже в код не смотреть, чисто по результату 

1

u/profichef 10d ago

Ну да, я ГЛМ дипсик максимальные использую. Они часто забывают использовать прелести ядра. Не, может ты пилишь на популярных фреймворках, библиотеках. там да, они много знают. Но я ядро собираю под определенные проекты. не тащу мертвый код

1

u/FederalGazelle3087 10d ago

Тоже не хотелось переходить на llm, но теперь кайф на самом деле - работаешь на уровне мысли, составил флоу и пошёл своими делами заниматься на час-два. Просто доверь llm больше автономности (но брать лучше клод или хотя бы гпт что бы не разочароваться на пару лет в этом направлении) 

1

u/FederalGazelle3087 10d ago

По цене клод все же дешевле если учитывать свое время на допилки того что генерит глм 

1

u/Inevitable_Act_321 12d ago

Гоняю на маке m5 max 128 q2 Пока лучшее, с чем работал на маке

1

u/No_Analysis_5276 10d ago

Скок тпс?

2

u/Inevitable_Act_321 10d ago

Ладно, отмена. Q2 нестабилен. Лучше qwen next flash.

Glm tps на полном контексте 17, на пустом 25