Применения ML в финансах к фундаментальным исследованиям — это совершенно иной уровень задач |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-28 12:09 Разберем оба направления, так как они тесно связаны (пост-тренинг LLM сейчас активно использует Online RL, а именно алгоритмы вроде PPO и GRPO). 1. Online RL (Reinforcement Learning) в STEM Это чистая математика и алгоритмика. Здесь нет "бизнес-задач", только среда, агент и функция вознаграждения. Ключевые области применения: · Управление роботами/дронами (Sim-to-Real transfer). · Оптимизация цепочек поставок и маршрутизации (VRP). · Химия/Биология (дизайн молекул, RL для поиска оптимальных условий реакций). · Классические игры (Go, StarCraft, Minecraft) — бенчмарк для алгоритмов. Что нужно знать (Hard Skills): · Алгоритмы: PPO, SAC, DQN, TD3, Impala. · Библиотеки: Ray/RLLib, Stable-Baselines3, ACME (DeepMind), или чистый JAX. · Математика: MDP, Bellman-уравнения, Importance Sampling, GAE. · Вызовы: Sample efficiency (как обучаться с малым числом шагов), стабильность обучения (критично для реальных систем). 2. Post-Training LLM (с фокусом на RL) Это самая горячая тема в 2025–2026. Post-Training включает этапы после пре-тренинга базовой модели: · Supervised Fine-Tuning (SFT) — обучение на идеальных примерах. · RLHF / RLAIF — обучение с подкреплением на основе обратной связи (человека или ИИ). · Online RL в LLM — это когда модель во время обучения генерирует ответы, получает награду (Reward Model) и обновляет веса (онлайн-политика). Ключевые технологии: · Алгоритмы: PPO, GRPO (Group Relative Policy Optimization — от DeepSeek, более стабильный без отдельной Value Network), Rejection Sampling. · Фреймворки: TRL (Transformer Reinforcement Learning), Axolotl, OpenRLHF. · Датасеты: Preference datasets (например, UltraFeedback, HelpSteer). Главный челлендж: Как заставить LLM улучшать свои рассуждения (CoT — Chain of Thought) в реальном времени, получая награду не за финальный ответ, а за процесс мышления (процессные супервизоры). Связь между ними (Ваш профиль) Если вы Quant Research Lead (ML), у вас уже есть: · Навыки работы с временными рядами (похоже на MDP в RL). · Опыт с нестабильными распределениями данных (смена рыночного режима = non-stationarity в RL). · Понимание trade-offs (exploration vs exploitation в трейдинге = exploration vs exploitation в генерации текста). Переход: Вам нужно будет глубже уйти в NLP/LLM-архитектуры (attention, KV-cache) и научиться работать с процессными reward-моделями (а не только бинарными предпочтениями). Что дальше? У вас есть конкретный проект (например, улучшить математические рассуждения LLM через Online RL) или вы изучаете теорию для смены карьерного трека в AI-Research (OpenAI, DeepMind, Anthropic)? Напишите: 1. Ваш текущий стек (PyTorch / JAX?). 2. Есть ли доступ к вычислительным ресурсам (кластеры GPU)? 3. Что именно привлекло: RL-алгоритмы как математика или LLM-пост-тренинг как инженерия? Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|