Sly32

Рейтинг
391
Регистрация
29.03.2012
Должность
Software engineer

Встретил тут слезы, что мол  нет денег чтоб зайти и протестировать мой сервис. Это при том что каждый зареганный получает бонус, достаточный чтобы поиграться с хорошими моделями, которые напрямую из РФ недоступны.
Решил пойти навстречу, тряхнуть стариной и запилитьс свой сервис с моедлями, которце будут крутиться прямо в облаке моем и будут практически даром. В итоге добавил контецнер с ollama,  он полностью независим, никуда не ходит, работает для посетителей. Вопрос - какие модели до 4Гигов лучше всего работают? 
чтоб не получать примерно такой урок 😂

рассматриваю такие

| Модель | Размер | Скорость (CPU) | Описание | Pull |
|---|---|---|---|---|
| `gemma3:latest` | 3.3 GB | ~5–10 tok/s | ✅ **уже установлена**. Хороший диалог, приемлемая скорость | — |
| `qwen2.5:1.5b` | 986 MB | ~18–28 tok/s | Qwen 1.5B — лучше чем 0.5b, почти такой же быстрый | `ollama pull qwen2.5:1.5b` |
| `qwen2.5:3b` | 1.9 GB | ~10–18 tok/s | Хороший баланс скорость/качество | `ollama pull qwen2.5:3b` |
| `llama3.2:1b` | 1.3 GB | ~20–30 tok/s | Meta Llama 3.2 1B — быстро, хорошо на инструкциях | `ollama pull llama3.2:1b` |
| `llama3.2:3b` | 2.0 GB | ~10–16 tok/s | Meta Llama 3.2 3B — оптимальный выбор для диалога | `ollama pull llama3.2:3b` |
| `mistral:7b-instruct-q4` | 4.1 GB | ~4–8 tok/s | Mistral 7B quantized — высокое качество | `ollama pull mistral:7b-instruct-q4_0` |

### Tier 3 — Качественные (7+ GB) ⚡ (медленно без GPU)

| Модель | Размер | Скорость (CPU) | Описание |
|---|---|---|---|
| `llama3.1:8b` | 4.9 GB | ~2–5 tok/s | Хорошее качество, но тяжело на CPU |
| `mistral:latest` | 4.1 GB | ~3–6 tok/s | Отличный диалог, но медленно |
| `deepseek-r1:7b` | 4.7 GB | ~2–4 tok/s | Reasoning модель, медленная |


Что еще посоветуете?
Все-таки пока что Github Copilot остается в моих фаворитах. Оценил возможности handoff  агентов. Увепен что все о гих знают поэтому кратко - ёто дополнительный агент с узкикми скилами, который активируется под определенные задачи. То есть не нужно писать огромный базовый промпт с перечислением всего что только вспомнишь
Просто в главного агента добавляешь метку
handoffs:
- label: "Handoff to AWS Infra Builder"
agent: AWS Infra Builder
prompt: "Continue this task as AWS Infra Builder. Focus on Terraform/AWS deployment implementation, validation, rollout steps, and rollback guidance based on the current conversation context."
- label: "Handoff to GCP Architect"
agent: gcp-architect
prompt: "Continue this task as GCP Architect. Focus on GCP infrastructure design, cost estimates, Terraform implementation, and deployment plan based on the current conversation context."

А у же в профильном агенте расписываешь все, что от него требуется.
Чем это отличается от skills? Обязательностью выполнения. Скилы агент может и проигнорить. Субагента - почти никогда.
При этом промпт и короче и хорошо кэшируется.

Проверил сегодня на кейсе с дебагом сервера - реально работает. Он теперь понимает куда деплой и не лезет править все подряд. У меня разнесены скрипты под гугл и амазон и он теперь хорошо понимает, что я от него хочу. Раньше он мог нацти аналогию в амазоне и уверенно его поломать. Теперь же четко забирает нужное.

В общем, мне понравилось.  Надо доделать такое для клода. у него тоже есть субагенты но вроде как правила пишутся немного не так.

LikeAVirgin #:

Можно. Нужно только правильные ниши найти, где очень много чайников, небольшой бюджет и большой спрос. ;)

Ну и это не единственный проект и метод заработка. Жить только на это было бы не очень комфортно. Здесь ловлю только через SEO и низкочастотники. Расходов на рекламу нет. Если делать рекламу, то, наверное, можно было бы только на этом выезжать. Но я не складываю яйца в одну корзину.

Круто 👍 Интересно было узнать, спасибо
LikeAVirgin #:

Если это про меня, то я конкретно написала файлы .wpress. Продаю готовые сборки для узких ниш. Все нужные плагины, настроенные под ключ, все страницы с контентом, который нужно под себя подогнать плюс полная инструкция от импорта до работы с сайтом.

Понятно, спасибо. Неужели на этом можно заработать в наше время? Это чисто так, мое удивление, но я сильно в другой нише
Vladimir SEO #:
Индус подливает масла в огонь
Так об этом уже давно идет речь. Но вот не уверен что этим гугл не выстрелит себе в ногу в итоге...
ArbNet #:
Спасибо, за идею, может надумаю.

Это примерная схема, как работает

Можно взять и стандарт - MCP,  но наверное это избыточно. Достаточно написать свои инструменты, просто грамотно дать им премишены, что агент твой не снес весь репо и не сказал "Извините" 😂 На Пайтон это довольно просто реализуется, но не думаю что на Раст сильно сложнее будет. 
Я когда-то баловался таким, даже где-то валяется готовый код агента, если нужно- могу показать. Но он сильно уступает по качеству хорошим моделям, чисто для изучения и понимания как это все работает писал...

ArbNet #:

Локально без интернета? Какая у тебя оперативка(сколько гиг), какую модель используешь? Агент может удалять файлы?

ЗЫ. Я пробовал несколько моделей, удалять файлы не могут.

Да, локально поднимаю. У меня мак М4 и всего 24 гига оперативы. Кроме того есть докер, там вообще оллама крутится в 5 гигах оперативы.  Естественно только самые простые модели. 

Ну и ты неправильно прочитал мой текст. Я развернул олламу для сервера, для экономии токенов. Разработку делал агент в гитхаб копайлоттни одна модель не умеет запускать файлы или выполнять команды. Для этого нужен специальный тул. В моем случае это гитхабовский аналог МСР сервера. Если ты сам разворачиваешь локально модель, для стандартизации ты можешь исплльзовать именн MCP. Но зная, что ты любитель граблей -ничто не мешает на том же Раст написать свой тул

Опять в соседней теме слезы про то как ИИ сносит базы...

Мой сегодняшний кейс. Решил как алтернативу поднять отдельно как провайдера Оллама и посмотреть - сможет ли он тянуть какие либо задачи?
Протестировал локально. Вроде работает. Развернул в проде ловлю ошибку: "Не хватает памяти" 
Решил посмотреть, что сделает агент. Пишу - "Вот тебе ошибка, вот тебе команды для доступа в консоль сайта - определи что случилось"
Ну и он пошел. Реально было интересно наблюдать как он это делает. Первым делом посмотрел память, убедился что достаточно. Ну это логично. 

Потом начал смотреть во что упирается оллама. Вот не знаю, сколько бы я потратил времени, чтобы узнать, что Оллама изначально смотрит в кэш а не в реальную память, а он забит.  Он ее почистил, перезапустил контейнеры, изменил таймаут(ответ еще падал по времени) Почистил дисковое пространство.
Проверил контейнеры( там было еще много итераций, но все по делу) В Итоге рапортует - все работает. Я только хотел попросить его  внести изменения в гит, но получаю сообщение что все уже добавлено в коммит, осталось смержить в мэйн. 

То есть он отработал как грамотный девопс, используя все скилы что у него есть.
В итоге ушло минут 15 на то, что сам бы я делал хорошо если час.

Кстати в копайлоте нравится мне система агентов Handoff - создаешь  их под определенные задачи и они железно применяются, в отличие от скилов.

Nil2024 #:

На днях агент там какому то крупному проекту базу данных снес. А они будут наделять его большими полномочиями. 

Уже же есть результаты тестов когда он атакует оператора, когда использует стратегию недопускать отключения даже путем хитрости. 

Меньше читай блогеров всяких.

Чтобы агент это сделал - нужно быть уже совсем без мозгов.
Nil2024 #:
Гораздо продуктивнее и удобнее
Гораздо продуктивнее и удобнее, как уже тебе сказали, использовать не чаты, а встроенные в ИДЕ плагины с агентами.
Всего: 8319