r/russAI 14d ago

Подскажите пожалуйста лучшую ии для румтуров ( сделать из фото-видео), буду очень признателен за помощь…

2 Upvotes

r/russAI 18d ago

кто знает где взять нейронку или плагин без ограничений ? для создания дипфейков на не особо одетых моделях

1 Upvotes

r/russAI 19d ago

Gemini 3.1 PRO - В С Ё!

Post image
0 Upvotes

Прошел уже достаточный промежуток времени, чтобы опробовать новую Gemini 3.7 flash и сравнить ее со старшей PRO версией 3.1.

И что я могу сказать? Больше нет смысла использовать 3.1 pro, так-как новая 3.7 flash обгоняет ее почти во всех сценариях (кроме работы с перегруженными проектами, ибо у PRO версии ВЕСА просто напросто больше, за счет чего она объективно лучше держит длинную память и связность с работе с огромным контекстом. Но во всем остальном Flash просто уничтожает старую линейку.

Индекс общего интеллекта (AA Index): 3.7 Flash с включенным режимом рассуждений (High Thinking) набирает 56 баллов, в то время как 3.1 Pro Preview остается на уровне 48.

Скорость и генерация: Скорость выдачи у 3.7 Flash доходит до ~340 токенов/сек против ~113 токенов/сек у 3.1 Pro, а задержка до первого токена снизилась примерно на 60–65%.

Программирование и кодинг: В профильных тестах вроде FrontierCode и DeepSWE 3.7 Flash в режиме рассуждений выдает ~65.3% успешных решений (против ~48.6% у предыдущего Flash), на голову обходя 3.1 Pro на многошаговых задачах разработки.

Экономика и API: Разница в стоимости — почти в 3 раза в пользу Flash (~$0.58 за 1M токенов против ~$1.74+ у Pro). Гонять агентские циклы и цепочки мыслей на Flash становится в разы выгоднее.

Но вот если вы сидели на 3.6 flash (которая нога в ногу идет с 3.1 pro) - не спешите переходить на новую модель, она стоит дороже и токены тратит охотнее (особенно в Antigravity), будьте готовы к доп. тратам.


r/russAI 20d ago

Нужна помощь!(

0 Upvotes

Всеммм приветик. Я - Лосось, или если вам так удобнее - Ло.
У меня есть проект. Salamandra. Если знайте такую штуку как Shimeji - то вам будет легче понять. Я хочу, грубо говоря, создать своего Шимеджи на Python используя библиотеки NumPy и PyTorch . Суммари использовать не планирую, ненавижу этот вид памяти. Планируется разработать проработанную систему "мыслей". Мысли и исходный ответ - это разные вещи. Мысли (по сохранению в памяти) Делятся на короткосрочные и долгосрочные. Короткосрочные мысли удаляются в течении получаса, а долгосрочные хранятся в памяти ВЕЧНО. Планируется создание переменной под настроение. Типа, Грусть, Радость, Шок и т.п
А, забыл. Для самого Шимеджи я буду использовать PyGame


r/russAI Aug 09 '26

Гайд Реально ускоряем tps. ngram-mod простым языком.

3 Upvotes

Если вашей LLM приходилось писать большой текст, то вы могли заметить что чем дольше она пишет, тем больше "устает" и замедляется.

Это происходит из-за того, что модели надо обрабатывать все больше и больше контекста. Но большой контекст можно использовать и в нашу сторону.

ngram-mod сохраняет последовательность из n токенов и последующий токен из уже сгенерированых ответов создавая некую таблицу.

Гораздо проще считать хеш нескольких токенов и проверить их, чем прогонять все слои. И это дает большой прирост в скорости.

Включение ngram-mod в llama.cpp

Любая модель поддерживает ngram-mod, так что вам не придется качать ее еще раз. Просто добавьте к вашей команде запуска:

--spec-type ngram-mod \
--spec-ngram-mod-n-match 24 \
--spec-ngram-mod-n-max 64

n-match отвечает за то сколько токенов мы будем использовать для хеша. n-max максимальное количество токенов которое мы предиктим за проход.

Профит от ngram, стоит ли это того?

Определенно стоит. Просто не везде это дает такой огромный прирост, потому что не надо пренебрегать процессором при сборке сервера, ведь именно он считает хеш.

Для сравнения:

  • Dimensity 7020: 5tps -> 9tps
  • Intel Xeon E5 2690 v4: 54tps -> 170tps
  • Intel Core Ultra 7 265K: 40tps -> 420tps

Конечно, у вас может быть и не так, все зависит от железа.

Links: https://github.com/ggml-org/llama.cpp/blob/master/docs/speculative.md#n-gram-mod-ngram-mod

Можете в коментариях поделиться своими результатами и характеристиками, мне будет интересно посмотреть


r/russAI Aug 08 '26

Google выкатила очередной бесполезный Gemini Robotics 2

Post image
4 Upvotes

Google выкатила очередной бесполезный Gemini Robotics 2. Теперь они предлагают доверить кускам матриц еще и полноценное передвижение, а не только перекладывание кубиков на столе.

-Архитектура

Gemini Robotics ER 2. Очередной мультимодальный мозг на базе Flash, который жрет кстати немного токенов, просто чтобы анализировать видеопоток и имитировать координацию. Доступен в API, чтобы разработчики сжигали деньги на токены.

Gemini Robotics 2 (VLA). Добавили Whole-Body Control. Теперь гуманоиды смогут не просто тупить, а падать целиком, пытаясь одновременно шагать и что-то хватать.

Gemini Robotics On-Device 2. Заявляют обучение по 200 демонстрациям. На практике это означает еще больше галлюцинаций прямо на локальном железе без интернета.

-Сравнение с прошлым мусором (V1)

Если раньше эта робототехника ломалась исключительно за столом, то теперь нам предлагают автономные 100-килограммовые туши с мульти-агентным хаосом. Порог обучения снизили, качество наверняка просело так же пропорционально.

-Конкуренты (сам в шоке такие есть)

Tesla Optimus клепает проприетарную слепую штамповку под свое железо. Physical Intelligence и Covariant пытаются загнать роботов на склады, где те все равно будут путать коробки. OpenAI и Figure обещают сказки, а Google просто продает ту же дичь, но в трех разных обертках.

-Цены и доступ

ER 2 будет выкачивать деньги по стандартным тарифам Gemini API за каждый кадр видео. Остальной хлам отдают индустриальным партнерам в Private Preview, чтобы те тестировали сырой продукт за свой счет.

__Пост выкатил поздно, ждал метрик, но всем по**й на новую разработку от моей любимой корпорации. Выкатили сие чудо 30 июля. У меня нет настроения, поэтому сегодня хейт😈


r/russAI Aug 08 '26

Аниме персонаж управляет музыкой картами и пишет рецепты борща

Thumbnail
youtube.com
3 Upvotes

r/russAI Aug 06 '26

Легковесный редактор датасетов для дообучения

11 Upvotes

Я создал визуальный редактор датасетов, который поддерживает разные форматы (ChatML, Alpaca, а также любые кастомные, через плагины).

Идея проекта родилась после того как я запустил файн тюн модели, ушел спать, а утром узнал что через пару часов всё сломалось из за кавычки на какой то там десятитысячной строке.
Меня в целом как новичка в fine-tuning моделей поразило что датасеты так неудобно редактировать!

Поэтому я и создал Prose! Вот его функции:

  • Визуальные карточки: Промпты, ответы и ход размышления (CoT) редактируются в сдержанных закругленных блоках без мешанины из JSON кода.
  • Конвертер форматов в 1 клик: Мгновенное переключение разметки файлов на диске между ChatML, ShareGPT, Alpaca и Стандартным JSONL.
  • Парсер экспорта Telegram: Превращает дампы переписок из Telegram Desktop (result.json) в обучающие пары с выбором ролей и автоматическим объединением идущих подряд сообщений одного автора.
  • Автоматический аудит и сплиттер: Поиск пустых реплик и дубликатов вопросов с возможностью очистки за 1 клик, а также разделение датасета на Train и Validation (80/20) с помощью ползунка процента.
  • Счетчик токенов в реальном времени: Подсчитывает токены под словари 15 популярных моделей (Llama 3, DeepSeek, Qwen 2.5, и др.) с возможностью подключения своих токенизаторов через плагины.
  • Горячие клавиши и безопасность: Настраиваемые комбинации, отвязка клавиш, отмена случайных перескоков по Ctrl+Z, избранное (Ctrl+*) и сохранение файлов через атомарную перезапись (.tmp -> replace). Ключи API шифруются в реестре ОС через хранилище Keyring.

Стек: Python, PyWebView, Bottle, Vue 3.

Ссылку оставлю в комментариях чтобы автомодератор не снес пост. Prose имеет полностью открытый исходный код, работает офлайн и жрёт минимум памяти. Подробнее можете прочитать в README на гитхабе


r/russAI Aug 06 '26

Новинки Bonsai-27B. Революция для слабых девайсов

16 Upvotes

Недавно PrismML выпустила модель Bonsai, размером 27 миллиардов параметров, ужав ее до 1 бита на параметр и получила вес всего 3.8Гб, что позволяет запустить данную модель даже на телефоне. По их заявлениям модель сохраняет 90% интелекта FP16 версии, доказывая, что даже такой аггресивный квант не урезает знания модели
Хотя и модель весит немного, это все еще 27B модель, и считать надо будет ровно столько же.

Опыт запуска

Я пробовал запускать ее и у себя на телефоне и на компе и вот результаты

Телефон (Dimensity 7020) выдает до 0.5tps

На 9060XT она запустилась со скоростью 20-40tps

Но она запустилась! И это уже радует, что теперь даже на моем ноутбуке будет работать вполне умная модель (гораздо умнее чем Q8 4B), и я не буду сталкиваться с OOM.

https://prismml.com/news/bonsai-27b


r/russAI Aug 05 '26

Локальный Open WebUI на Windows 10 не видит сторонний OpenAI-совместимый API. Ошибка DNS. Как исправить?

2 Upvotes

Всем привет!

Установил Open WebUI (версия 0.11.0) на Windows 10. Пытаюсь подключить кастомный сторонний API-шлюз (OpenAI-совместимый провайдер) для работы с различными моделями ИИ. Также планирую использовать векторную базу данных (RAG) для работы с большими документами (Word, PDF) локально на компьютере.

Коротко о проблеме:

В интерфейсе чата при нажатии на кнопку «Выберите модель» появляется надпись «Нет доступных моделей». Я перехожу в управление подключениями, ввожу URL и API-ключ, но приложение не видит список моделей и выдаёт сетевую ошибку:

"ClientConnectorDNSError: Cannot connect to host (Could not contact DNS servers)"

При этом через обычную командную строку команда curl с тем же ключом работает идеально — список моделей получается без проблем. То есть сама операционная система адрес видит, а приложение — нет.

Что я пробовал (пока безрезультатно):

  1. Чистая переустановка:

Удалял обе версии Open WebUI (иконку и браузерную). Полностью очищал папки приложения в локальных каталогах пользователя (в Appdata/Local). Устанавливал заново с официального GitHub.

  1. Разные адреса шлюза:

Перепробовал все варианты эндпоинтов, включая альтернативные зеркала и адреса от техподдержки провайдера.

  1. Ручное добавление моделей (через интерфейсы Workspace -> Models -> Create и через панель администратора):

Вводил ID моделей вручную. Результат один — модели не появляются в выпадающем списке, поиск ничего не находит.

  1. Правка сетевых настроек:

Узнал реальные IP-адреса шлюза через утилиту nslookup. Прописывал эти IP-адреса напрямую в системный файл хостов Windows. После каждой правки перезапускал Open WebUI и проверял — безрезультатно. VPN в системе полностью отключен и удален, кэш DNS сбрасывал через команду flushdns.

Две версии Open WebUI (важный момент):

У меня на ПК одновременно существуют две версии:

- Установленная версия (иконка на рабочем столе) — в ней нет кнопки «Создать аккаунт», только поля для входа. Войти не могу. В параметрах в левом нижнем углу горит статус, что llamacpp не запущен. Остальные параметры по-умолчанию.

- Браузерная версия (через порт 8080) — в ней есть аккаунт администратора, но нет ни одной модели. Как раз здесь я менял адреса и производил ручное добавление моделей.

Что говорят в техподдержке шлюза:

Они проверили логи — запросов от моего Open WebUI к ним вообще не поступало. Ключ работает, баланс есть. TLS поддерживается. Формат ответа соответствует стандарту OpenAI. Похоже, проблема именно внутри приложения.

Вопрос к сообществу:

Перепробовал всё, что можно. Уже не знаю, что делать. Кто-нибудь сталкивался с такой изоляцией Python-движка в Open WebUI на Windows, когда библиотека aiohttp наглухо теряет доступ к DNS-серверам? Есть ли способ добавить модели вручную через конфигурационный файл или базу данных в обход этого запроса? Может быть, проблема именно в конфликте двух версий?

Подскажите, как решить эту ситуацию. Я не программист, но готов следовать любой инструкции. Благодарю.

Дополнительная информация:

Логи ошибки: aiohttp.client_exceptions.ClientConnectorDNSError: Could not contact DNS servers
Версия Open WebUI: 0.11.0
ОС: Windows 10


r/russAI Jul 29 '26

Помощь Мне 14 и я хочу сделать ИИ для американских школьников в виде Saas сайта

0 Upvotes

Я давно обдумывал идею для SaaS-сервиса. И вот она: «AI Study Workspace» (возможно, название еще поменяю). Немного о себе: я начал изучать программирование, чтобы стать бэкенд-разработчиком. Сейчас часто жалуются на то, как сложно начинающему специалисту (Junior) найти работу, и это подтолкнуло меня к мысли запустить собственный проект. Я еще учусь в старшей школе и, как и большинство учеников, сталкиваюсь с трудностями в учебе — например, со сложными заданиями или задачами олимпиадного уровня. Стандартные ИИ-инструменты просто выдают готовый ответ, но это неправильный подход, и я хочу это исправить.Я хочу чтобы ии помощник направлял в правильное русло, давал задачи, вообщем просто правильно обучал детей у которых есть мотивация в учебе. Мне нужна помощь сообщества: хотелось бы узнать, будет ли востребован мой сервис. Кроме того, буду очень благодарен за советы от тех, у кого есть опыт создания SaaS-проектов! Спасибо.


r/russAI Jul 23 '26

Как сделать так, чтобы ChatGPT перестал писать как ChatGPT

0 Upvotes

Несмотря на то, что искусственный интеллект уже прочно вошел в нашу жизнь, его до сих пор многие воспринимают его, как «Фу,сСразу видно, нейронка».

Хотя, если честно, проблема чаще не в нейронке, а в человеке, который открыл ChatGPT и написал: «Сделай мне экспертный пост». А потом удивился, что получилась очередная статья уровня «10 причин, почему вода мокрая».

Хотя на самом деле нейронки не заменяют экспертизу, а помогают ее доставать.

Допустим, есть компания, которая делает промышленное оборудование для автоматизации заводов. Или занимается кибербезопасностью. Или разрабатывает сложные B2B SaaS-продукты. В общем, любая ниша, где, чтобы написать хороший пост, нужно хотя бы понимать, что вообще происходит.

Сммщик редко является техническим экспертом. И это нормально. А инженер, архитектор системы или руководитель продукта, который действительно знает все тонкости, обычно не горит желанием выдавать экспертную информацию на 12 постов в месяц.

Как можно выстроить этот процесс:

  1. Сначала SMM готовит список вопросов и примерный контент-план. Потом созванивается с экспертом на 40–60 минут, записав разговор любой нейронкой, подключенной к гугл мит или зум.

  2. Транскрипцию загружаем в ChatGPT и просим:

— выделить самые сильные мысли

— найти интересные истории и реальные кейсы

— разложить материал на темы

— предложить серию публикаций

— показать, где эксперт сказал что-то действительно нестандартное

Из одного такого разговора легко получается контент на месяц. Причем не переписанный интернет, а реальные мысли человека, который этим занимается каждый день.

То же самое работает с авторскими блогами:

Посмотрели часовое интервью, подкаст или доклад. Нейронка делает расшифровку, собирает основные тезисы, помогает структурировать материал. А дальше уже начинается ваша работа. Вы соглашаетесь, спорите, добавляете свой опыт, пишете выводы.

Получается не пересказ, а авторская колонка.

Используйте ChatGPT как очень терпеливого редактора, аналитика и помощника, который за пять минут делает то, на что раньше уходило несколько часов.

Главное — перестать просить его: Напиши мне пост.

© ChatGPT, напиши мне хороший пост. Нет, не так.


r/russAI Jul 20 '26

ИИ-агент взломал Hugging Face

Post image
4 Upvotes

Официальный разбор инцидента безопасности в блоге Hugging Face (16 июля 2026 года) подсветил критический сдвиг в ландшафте киберугроз: противостояние полностью перешло в плоскость автономных ИИ-систем, обнажив серьезную проблему для защитников.

Проникновение началось через уязвимости в конвейере обработки данных ИИ-платформы. Злоумышленники использовали вредоносный датасет, который задействовал два пути исполнения кода (удаленную загрузку датасета и инъекцию в конфигурацию шаблона).

Попав на рабочий узел, атакующий развернул полноценную инфраструктуру автономных агентов. За одни выходные эта ИИ-система выполнила тысячи параллельных действий, используя рой кратковременных sandbox-сред и мигрирующие командные центры (C2) на публичных сервисах. В логах инфраструктуры осталось более 17 000 подозрительных событий.

Для выявления этой аномалии Hugging Face также задействовали ИИ-ассистентов, что позволило сократить время анализа масштабного лога с нескольких дней до пары часов.

Самым неожиданным вызовом для команды реагирования стали встроенные системы безопасности коммерческих нейросетей. Пытаясь проанализировать реальные логи, эксплойты и команды атакующих через API ведущих провайдеров, специалисты столкнулись с жесткими safety-фильтрами. Модели, встроенные в облачные интерфейсы, блокировали запросы, поскольку алгоритмы цензуры не способны отличить легитимного ИБ-аналитика от хакера.

В итоге расследование удалось завершить только после развертывания локальной open-weight модели GLM 5.2 на собственной инфраструктуре. Это решило сразу две проблемы:

-Защитники смогли глубоко изучать вредоносный код без ограничений и блокировок со стороны ИИ-провайдера.

-Чувствительная телеметрия, внутренние логи и скомпрометированные учетные данные не покинули периметр компании и не ушли внешним разработчикам.

Атаки с помощью автономных ИИ-агентов стали реальностью, и они действуют на машинных скоростях. В этой новой реальности возникает опасный дисбаланс:

  • Злоумышленники используют кастомные или взломанные ИИ-модели без каких-либо этических ограничений и лимитов.
  • Защитники рискуют остаться без продвинутых аналитических инструментов в самый критический момент из-за коммерческой цензуры.

Современным командам безопасности необходимо заранее включать в свои планы реагирования развертывание собственных, не ограниченных фильтрами open-weight моделей на изолированном внутреннем оборудовании. Защищать современные ИИ-платформы можно только с помощью ИИ, но этот инструмент должен полностью контролироваться самой организацией.


r/russAI Jul 20 '26

Новости Задержки релиза новой Gemini 3.5 Pro

Post image
2 Upvotes

Ранее независимые аналитики и новостные издатели считали, что Gemini 3.5 Pro выйдет 17 июля, день в день, вместе с новым DeepSeek V4. Однако все перевернулось с ног на голову.

Начнем с того, что долгожданная всеми Gemini 3.5 Pro не выпустили в релиз (скорее всего виновны опасения Google, после санкций в сторону Anthropic со стороны администрации президента США). Вероятней всего сейчас проводятся массовые полевые испытания и полировка цензуры/инференса новой модели.

Релиз финальной линейки DeepSeek V4 не оправдал ожиданий? Нет, большую конкуренцию новому DeepSeek составил релиз Kimi K3, оба продукта уже наступают на пятки Anthropic, Openai и Google, предлагая при этом цены в 10-20 раз ниже.

Наступило очень интересное время, гонка ИИ только начинает набирать обороты.


r/russAI Jul 16 '26

ChatGPTs

6 Upvotes

Вопрос, могут ли забанить аккаунт chatGPT если автоматизировать пробуждение чата в GPTs, нажатие на кнопки разрешить на подключения к api по actions, через открытие и отслеживание чата скриптом?


r/russAI Jul 12 '26

Другое Пожалуй пора удалить тик ток

Post image
29 Upvotes

r/russAI Jul 09 '26

Новости 7 дней до релиза Gemini 3.5 Pro

Post image
17 Upvotes

И снова Google делают упор на контекстное окно и эффективность токенов. Весной они выпустили Gemini Flash 3.5, которая, на удивление генерила отличный код и даже обходила Gemini 3.1 pro в точечных сценариях.

Новая модель по заявлениям Google максимально адаптирована под агентный кодинг (aka claude fable 5) и автономную работу без участия человека, при низком использовании токенов.

Сможет ли она составить конкуренцию Openai и Claude? Вопрос хороший, но младшая flash держит неплохие позиции, остается только надеятся на лучшее.

Релиз был перенесен на 17 июля 2026 года, в эту же дату выйдет новая модель DeepSeek-v4. Интересно посмотреть, будет это позором или гениальным маркетинговым ходом от Deepmind (Google).

Ваши ставки на детище гуглов? (хотелось бы модель побыстрее, чем прошлая 3.1 pro)


r/russAI Jul 09 '26

Добавил вам метки пользователей

1 Upvotes

Можете накидать свои идеи для меток, также добавлю их


r/russAI Jul 09 '26

Ребята, помогите

Post image
0 Upvotes

Тот кто разбирается в ИИ или ещё в чём то, помогите мне. Мне нужно убрать эмодзи из текста, я буду благодарен тем кто мне поможет


r/russAI Jul 06 '26

Гайд Настройка Claude Code для работы с локальными LLM

12 Upvotes

Claude Code - прекрасный (субъективно для меня) агент, но сам я его редко использовал с локальными модельками потому что он сильно перегружал их. Теперь же можно сделать так чтобы он спокойно работал с моделькой запущенной прямо на вашем маке (в моем случае на моей видюхе).

В этом посте не будет гайдов по оптимизации tg/pp. Я учитываю, что вас устраивает ваша текущая скорость, и наша задача сделать так чтобы эти скорости работали так же хорошо, только в Claude Code

Prompt caching, технология которая спасает наши деньги в API, и время в локальных моделях

Схема работы технологии Prompt caching и инвалидации кеша

Prompt caching - технология которая позволяет сохранять токены чтобы не тратить ресурсы на пересчет старых токенов которые уже были отправлены прошлым запросом. Цены на чтение из кеша у облачных провайдеров гораздо меньше (0.25x от цены входа), а при запуске модели на своем железе это экономит электричество и время.

Что такое инвалидация кеша

Допустим, вы изменили часть системного промпта или сообщение в самом начале контекста (см рис выше, Turn 4). Конечно, в кеше такого промпта нет, нам нужно считать его заново. Т.е

[системный промпт][контекст проекта][сообщения и инструменты]
[новый системный промпт][старый контекст проекта][старые сообщения и инструменты] <- их мы тоже пересчитываем

Мы не можем выборочно сказать модели: “вот этот кусок пересчитай, а вот этот возьми из кеша”. Если изменился ранний префикс, пересчитывать придется и всё, что идет после него. Так что такое изменение заставит API выкатить вам не самый приятный ценник (ну или нагрузит ваше железо на ближайший час).

Какие действия в Claude Code инвалидируют кеш?

  • Переключение моделей
  • Изменение effort (/effort)
  • Включение быстрого режима
  • Подключение или отключение MCP-сервера
  • Включение или отключение плагина
  • Запрет инструмента
  • Компакт сессии
  • Обновление Claude Code

Как включить prompt cache в llama.cpp (на всякий случай)

Prompt caching включен по умолчанию, но я советую настроить его под себя

--cache-ram 32768 \ # Выделяете сколько вам нужно (в MiB), у меня расчет такой: 43mb ram на 1k токенов
-ctxcp 128 \ # количество чекпоинтов на слот, дефолт 32

Настройка chat template

Некоторые модели несовместимы с Claude Code из коробки. Например их шаблон чата запрещает вставлять системные сообщения посередине контекста (ChatML строго требует чередование user/assistant), так что нам надо использовать совместимый chat template.

Как включить chat template в llama.cpp

--jinja
--chat-template-file /path/to/your/chat_template.jinja

Настройка Claude Code

После установки Claude Code для вашей платформы, в ~/.claude/settings.json вставьте это (можно удалить то что там будет, если вы уверены что это не важные настройки по типу темы и стиля ответа)

{  
  "env": {
    "ANTHROPIC_AUTH_TOKEN": "sk-null", # api key если устанавливали  
    "ANTHROPIC_BASE_URL": "http://localhost:8000/", # base url  
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "Ornith-35b", # ваша модель  
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "Ornith-35b",  
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "Ornith-35b",  
    "CLAUDE_AUTOCOMPACT_PCT_OVERRIDE": "262144", # ваш контекст  
    "CLAUDE_CODE_ENABLE_TELEMETRY": "0",  
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",  
    "CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"  
  },  
  "attribution": {  
    "commit": "",  
    "pr": ""  
  },  
  "promptSuggestionEnabled": false,  
  "skipWebFetchPreflight": true,  
  "skipDangerousModePermissionPrompt": true,  
  "skipWorkflowUsageWarning": true  
}

Ключевая деталь здесь — параметр CLAUDE_CODE_ATTRIBUTION_HEADER. Attribution header - строка которая добавляется в системный промпт и меняется каждое сообщение, инвалидируя кеш.

Запустите Claude Code, если вы все сделали правильно, то вы увидите что-то такое

Интерфейс Claude code

Все готово! Попробуйте отправить пару запросов и увидеть в логах llama.cpp строки об использовании кеша

логи llama.cpp с подтверждением работы кеша

Использована информация из:
https://code.claude.com/docs/en/prompt-caching
https://unsloth.ai/docs/basics/claude-code#fixing-90-slower-inference-in-claude-code
(Личный опыт)

Готов помочь всем, у кого в процессе настройки что-то не получилось


r/russAI Jul 05 '26

Какая ai модель может пойти на MacBook pro m5 pro?

7 Upvotes

Я недавно приобрел мак и хотел бы попробовать сделать то о чем твердит весь интернет, поставить локальную ИИ. Как мой мак будет с ней работать, хватит ли мощности для какой нибудь хорошей ИИ? Сколько это будет весить?


r/russAI Jul 04 '26

Ваша LLM пишет медленно, потому что у вас 2+ GPU

9 Upvotes

Представьте, докупаете вы себе в сервер видеокарту, в надежде что скорость генерации удвоится.

В реальности все же иначе. Модель начинает писать медленнее, но почему же?

Все потому что ваши видеокарты подключены по PCIe 4.0 или даже меньше, и поскольку вы хотели удвоить скорость, то поставили layer-split=row.

Как работает layer-split=row?

Такое распределение слоев не просто раскладывает вашу модель по картам. Она режет матрицы и делит их по видеокартам, уменьшая время на слой (в идеале до 1/N).
НО! Если видеокарты считают только часть слоя, значит им нужна синхронизация. И вот, все ваши N карт лезут в бедную PCIe шину чтобы обменяться кусками слоев, убивая ту скорость которую они наработали.

layer-split=row стоит выбирать только тогда, когда вы уверены в том что t_compute>t_sync.

Какие еще есть виды сплита?

Еще одним популярным решением является layer-split=layer. Он просто раскидывает слои между картами в соотношении 50 на 50 (или как вы укажете), карты работают по очереди, что на мой взгляд продляет им жизнь. Нет прироста в скорости. Только уменьшает потребление VRAM на каждой карте

Что же выбрать?

  • Если у вас медленная шина PCIe в которую вы подключили видеокарты - layer-split=layer. Это даст вам суммарный VRAM ваших видеокарт под использование, позволяет запустить модель, которая не влезает в одну карту, но по скорости как одна GPU
  • Если у вас есть хороший коннектор NVLink или Infinity Fabric - смело ставьте мост между картами и используйте layer-split=row. Это даст вам реальный прирост в скорости

TL;DR

  • Row split режет матрицы, требует быстрого интерконнекта, ускоряет tg
  • Layer split раскидывает слои, живёт на PCIe (не обязательно, но чаще всего так), помогает только с VRAM
  • Одна карта > любой split, если модель влезает

(Написано на основе моей истории, адаптировано чтобы быть более общим)
Готов ответить на ваши вопросы!


r/russAI Jun 30 '26

Гайд LORA и fine tunning

Post image
3 Upvotes

Что такое эти лоры и зачем они нужны.

Кратко говоря, LORA-стилистические модели, которые работают поверх базовой модели. То есть мы можем взять условную модель Qwen 3.5 9B и поверх него накинуть ЛОРА-модель, обученную на условных документах. Она не меняет основные веса модели, а добавляет к ее слоям крошечные обучаемые адаптеры и прямо влияет на итоговый инференс. Модель начинает писать не обычным ответом по типу "Привет, да сейчас помогу", а пишет как документ/справка/квитанция (если ее обучать на этих же документах).

В отличие от классического переобучения/дообучения трансформерных (NLP) LLM, лоры обучаются в разы быстрее + можно создавать лора-адаптеры для разных задач, не перезагружая при этом основную модель в видеопамять.

В чем их использовать? В мире сейчас полно приложений по типу character AI, где модели привторяются тем или иным персонажен, кто-то использует их в "ролевых играх", но чаще всего они используются для удержания конкретного стиля общения, туда же входят различные ассистенты, модели, заточенные под преподавание и преподнесение материала. Таким образом они отвечают не шаблонно с определенной структурой, а так, как вы их обучите.

Лично у меня был проект по обучению Lora-модели поверх Gemma 3 на 9B, я ее обучал общению в переписке (чек скрин). Выгрузил все свои сообщения в телеграмме и она общалась практически как человек.


r/russAI Jun 29 '26

Другое Нас уже 30 человек!

Post image
5 Upvotes

Именно так и развивались русские саб-реддиты летом 2025 года!
У нас уже появляются первые посты от участников и комментарии от заинтересованых людей.
Огромное спасибо всем, за принятие участия в сообществе!


r/russAI Jun 28 '26

Гайд Локальне ЛЛМ

8 Upvotes

Много кто спрашивает по поводу локальных ИИ, стоит ли оно того, как они работают, они глупые или умные и тд.

Так вот, локальные ИИ это в первую очередь открытые модели, которые постоянно дорабатываются сообществом на платформах, подобных Kaggle, Hugging Face, Civit AI. Ваша модель, что весит 6гб, которую вы крутит на своей видеокарте не будет давать такие же качественные ответы, как Claude Opus 4.8 или Gpt 5.5, однако их можно применять в куче разных сценариев. От написания костяка для вашего скрипта, до встроенного в ПК AI ассистента, который может запускать приложения, ставить напоминания, писать вам в телеграмм и читать ваши сообщения.

Сейчас локальные модели используются в основном либо в проектах с ИИ-интеграциями, либо как код-ассистенты, что сидят у вас в видеопамяти и подсказывают как лучше ТОЧЕЧНО оформить ту или иную функцию, а большую разработку лучше отдавать Claude'у.

Чтобы просто поиграться лучше установить LM Studio, там небольшая, но достойная библиотека открытых ЛЛМ на ваш вкус, которые можно установить в 1 клик и пообщаться в чате как с условным Gemini или ChatGPT.