Интуитивное объяснение проксимальной оптимизации политики (PPO) для больших языковых моделей11просмотровгод назад
GRPO (групповая относительная оптимизация политики) от DeepSeek | Обучение с подкреплением для LLM15просмотровгод назад
Визуализация скрытого пространства: PCA, t-SNE, UMAP | Анимация для глубокого обучения16просмотровгод назад