Как с точки зрения машинного обучения устроены Нейрохам и аналогичные ему боты?

Недавно наткнулся на бота, который шутит и подкалывает пользователей — иногда довольно грубо, но при этом часто очень смешно: использует мемы из TikTok и известные мемные фразы. Хочется понять, как это реализовано «изнутри». В сети почти нет информации — нашёл только один похожий проект.
  • 24 июня 2026 г. 17:01
Ответы на вопрос 2
Кратко и по‑сути — такие «жёсткие», мемные и подколистые боты обычно делаются не волшебством, а комбинацией больших языковых моделей + дообучения/ретривала + правил/фильтров. Ниже — разбор «изнутри»: какие блоки, какие приёмы и какие практические шаги используются.

1) Бэкенд: модель
- Основа — большой трансформер (GPT‑подобный, decoder‑only). В простых проектах — GPT‑J/NeoX/Llama/Mistral или их форки; в продакшне — коммерческие LLM.
- Для экономии ресурсов часто используют LoRA/adapter/PEFT (адаптивное дообучение) или знаниестиснение (distillation).

2) Данные и дообучение (как получить «хард‑кор» юмор)
- Supervised fine‑tuning (SFT): берут реплики из соцсетей/комментов/скриптов мемов, диалоги и примерные ответы в желаемом стиле. Метки «подколы», «сарказм», «токсичность», «мем‑фразы».
- Сбор мемного корпуса: TikTok/Reddit/Twitter/ VK/YouTube‑комменты, субреддиты типа r/memes/r/roast, сбор популярных мемпейстов и текстов мемов (с транскриптами видео).
- Аннотации: люди помечают, какие ответы смешные/удачные/слишком оскорбительные — для обучения reward‑модели.
- Data augmentation: шаблоны, замены синонимами, вставки популярных фраз/слэнга.

3) Управление стилем и личности
- Instruction tuning: дообучение на примерах «будь дерзким, но не переходи на личности» или наоборот.
- Persona tokens / system prompt: фиксированные подсказки («Ты — NeuroHam, ироничный бот, отвечай коротко, используй мемы»).
- Контролируемая генерация: classifier‑guidance (классификатор стиля/токсичности) или RLHF (reward model + PPO) чтобы поднять «вес» юмора и снизить неприемлемость.

4) Актуальность и мемы — Retrieval Augmented Generation (RAG)
- Модель сама не знает свежие TikTok‑мемы, поэтому добавляют компонент поиска: индексируют заголовки/транскрипты/тексты из соцсетей, хранят embeddings (sentence‑transformers) в FAISS/Milvus/Elastic.
- При генерации извлекаются ближайшие мемные примеры и подставляются в контекст (инструментально: Fusion‑in‑Decoder, RAG‑style prompts).
- Часто комбинируют: LLM генерирует на основе вспомогательных retrieved snippets и шаблонов.

5) Техники генерации
- Сэмплинг: temperature, top‑p (nucleus) и repetition‑penalty для креативности и разнообразия.
- Beam rarely used for humor — чаще стохастические методы.
- Пост‑обработка: замена стоп‑слов, корректировка пунктуации, вставка эмодзи, сокращение фраз.

6) Фильтрация и безопасность
- Токсичность/модерация: классификаторы (Perspective API, Detoxify), набор правил для запрещённых тем (личные оскорбления, призывы к насилию).
- Trade‑off: либо строгая фильтрация (меньше юмора), либо мягкая (возможны «жёсткие» шутки). Некоторые боты обходят модерацию через эвфемизмы или сарказм.
- Логирование, человеческая модерация и механизм жалоб для улучшения.

7) Мультимодальность (если бот «понимает» видео/картинки)
- Видео/картинки: транскрибируют аудио (STT), извлекают ключевые кадры, используют CLIP/ViT для эмбеддингов, затем делают RAG по мультимодальным индексам.
- Часто достаточно текстовых транскриптов и мем‑словаря.

8) Инфраструктура и продакшн
- Инференс на GPU/TPU или quantized модели для CPU (int8/int4) + batching.
- Embedding‑store (FAISS/Milvus) + быстрый retrieval.
- Логирование взаимодействий, A/B тесты, дообучение на данных из логов.

9) Простые альтернативы (если не нужны LLM)
- Марковские цепи/шаблоны/кривые правила + база мемных фраз — быстрый «шутливый» бот, но с ограниченным разнообразием.
- Retrieval + шаблонная вставка (без генеративной модели) — часто даёт аккуратные мемные отсылки.

10) Оценка качества
- Human eval: юмор очень субъективен — основная метрика — вовлечённость (clicks, replies), оценки пользователей.
- Автоматические: классификаторы стиля, перплексия, diversity‑метрики.

11) Этические и правовые риски
- Риск оскорблений, травли, клеветы; проблемы с авторскими правами и контентом из TikTok; необходимость модерации и соответствия платформным правилам.

12) Типичный стек/инструменты
- Модели: Llama, Mistral, GPT‑J, GPT‑NeoX, Vicuna, Falcon.
- Библиотеки: Hugging Face Transformers/Datasets, sentence‑transformers, FAISS/Milvus, trl/trlx (для RLHF), Detoxify/Perspective.
- Инфраструктура: Docker, Kubernetes, CUDA, inference servers (like Ray Serve, Triton).

Реализация «из коробки» — шаги
1. Собрать корпус мемов/диалогов (с разрешением/без личных данных).
2. Подготовить аннотации для желаемого стиля.
3. Дообучить модель через SFT или LoRA.
4. Построить retriever (embeddings + FAISS) для свежих трендов.
5. Настроить промпты/персону и параметры сэмплинга.
6. Внедрить фильтры модерации и логи.
7. Тестировать с реальными пользователями и корректировать reward/фильтры.

Если хочешь — могу:
- Привести пример промпта для «дразнящего» бота.
- Показать минимальную архитектуру RAG + LLM.
- Посоветовать конкретные репозитории/статьи и инструменты для реализации.

Хочешь, начнём с примера промпта и списка открытых моделей, которые подойдут для прототипа?
Вопрос не в том что шутки смешные, а в контексте. Может ли он удачно пошутить согласно ситуации. <br/> <br/> Забить с помощью RAG в систему 100500 готовых шуток и анекдотов, не проблема (тогда они будут появляться более менее под ситуацию). <br/> <br/> А еще, облачные модели, не топовые, более чем неплохие, заплатить реально копейку за сообщение, вполне по силам. <br/> p.s. правда вопрос про uncensored, я вопрос не изучал но не вижу тут особых проблем. Сам по себе мат не цензурится, обычно модели цензурят на политику, секс и причинение вреда другим (очень абстрактно, типа создать бомбу дома) <br/> <br/> p.p.s. 2 шт nvidia gpu 4060ti 16gb (в сумме 32gb) позволяют запускать неплохие открытые модели на скоростях под 3000 input/80 output tps - цена вопроса +100т.р. за видеокарты. И под неплохие, я говорю про способные к программированию. <br/> Для анекдотов хватит моделей в разы слабее, с меньшими требованиями. <br/> <br/> Если делать на базе майнинговых китайских переделанных из P102/P104 с ценой порядка 5тр.-8т.р.  за 16gb то скорость конечно будет ниже раза в три но и дешевле в 5 раз. <br/> <br/> p.p.p.s не нужно покупать железо. Изучите вопрос на облачных сервисах, есть роутеры типа openrouter, где собраны наверное все существующие модели, имеющие смысл.
Похожие вопросы