Применения ML в финансах к фундаментальным исследованиям — это совершенно иной уровень задач

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Разберем оба направления, так как они тесно связаны (пост-тренинг LLM сейчас активно использует Online RL, а именно алгоритмы вроде PPO и GRPO).

1. Online RL (Reinforcement Learning) в STEM

Это чистая математика и алгоритмика. Здесь нет "бизнес-задач", только среда, агент и функция вознаграждения.

Ключевые области применения:

· Управление роботами/дронами (Sim-to-Real transfer).

· Оптимизация цепочек поставок и маршрутизации (VRP).

· Химия/Биология (дизайн молекул, RL для поиска оптимальных условий реакций).

· Классические игры (Go, StarCraft, Minecraft) — бенчмарк для алгоритмов.

Что нужно знать (Hard Skills):

· Алгоритмы: PPO, SAC, DQN, TD3, Impala.

· Библиотеки: Ray/RLLib, Stable-Baselines3, ACME (DeepMind), или чистый JAX.

· Математика: MDP, Bellman-уравнения, Importance Sampling, GAE.

· Вызовы: Sample efficiency (как обучаться с малым числом шагов), стабильность обучения (критично для реальных систем).

2. Post-Training LLM (с фокусом на RL)

Это самая горячая тема в 2025–2026. Post-Training включает этапы после пре-тренинга базовой модели:

· Supervised Fine-Tuning (SFT) — обучение на идеальных примерах.

· RLHF / RLAIF — обучение с подкреплением на основе обратной связи (человека или ИИ).

· Online RL в LLM — это когда модель во время обучения генерирует ответы, получает награду (Reward Model) и обновляет веса (онлайн-политика).

Ключевые технологии:

· Алгоритмы: PPO, GRPO (Group Relative Policy Optimization — от DeepSeek, более стабильный без отдельной Value Network), Rejection Sampling.

· Фреймворки: TRL (Transformer Reinforcement Learning), Axolotl, OpenRLHF.

· Датасеты: Preference datasets (например, UltraFeedback, HelpSteer).

Главный челлендж:

Как заставить LLM улучшать свои рассуждения (CoT — Chain of Thought) в реальном времени, получая награду не за финальный ответ, а за процесс мышления (процессные супервизоры).

Связь между ними (Ваш профиль)

Если вы Quant Research Lead (ML), у вас уже есть:

· Навыки работы с временными рядами (похоже на MDP в RL).

· Опыт с нестабильными распределениями данных (смена рыночного режима = non-stationarity в RL).

· Понимание trade-offs (exploration vs exploitation в трейдинге = exploration vs exploitation в генерации текста).

Переход: Вам нужно будет глубже уйти в NLP/LLM-архитектуры (attention, KV-cache) и научиться работать с процессными reward-моделями (а не только бинарными предпочтениями).

Что дальше?

У вас есть конкретный проект (например, улучшить математические рассуждения LLM через Online RL) или вы изучаете теорию для смены карьерного трека в AI-Research (OpenAI, DeepMind, Anthropic)?

Напишите:

1. Ваш текущий стек (PyTorch / JAX?).

2. Есть ли доступ к вычислительным ресурсам (кластеры GPU)?

3. Что именно привлекло: RL-алгоритмы как математика или LLM-пост-тренинг как инженерия?


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: