FeynmanWiki
ExploreLibraryRoadmapsCreateMy blogsPricing

Library

Search the public knowledge base.

Filters

Reset all

Categories

Machine Learning22Reinforcement Learning11Transformers5LLMs4Attention3Diffusion2AI Interpretability1BPE1causal interventions1context paradigm1Cordis1Databases1Distributed Machine Learning Systems1Distributed Training1DTensor1Dynamic software composition1energy-based models1FSDP1GPU-Parallel Robot Learning1importance sampling1

Sort by

LatestMost readRecently updated

Library

Search the public knowledge base.

K
Machine LearningReinforcement LearningTransformersLLMsAttentionDiffusionAI InterpretabilityBPEcausal interventionscontext paradigm

11 results

Sort by
LatestMost readRecently updated

WarpSAC: When More Data Changes the Right RL Algorithm

Imagine training a robot arm from a replay buffer that contains plenty of examples of ordinary motions—move left, move right, lower ...

Reinforcement LearningSoft Actor-CriticScalable Off-Policy RL
Aug 28, 2026 25 min read 173

From Imitation to Refinement – Residual RL for Precise Robotic Assembly

A diagram-rich generated explanation from the public library.

Reinforcement LearningDiffusion
Jun 16, 2026 45 min read 440

HIL-SERL: Human-in-the-Loop Sample-Efficient Robotic Reinforcement Learning for Dexterous Manipulation

A diagram-rich generated explanation from the public library.

Machine LearningReinforcement Learning
Jun 10, 2026 45 min read 584

Imitation Bootstrapped Reinforcement Learning (IBRL)

A diagram-rich generated explanation from the public library.

Machine LearningReinforcement Learning
Jun 2, 2026 45 min read 205

Imitation Bootstrapped Reinforcement Learning (IBRL): Using Demonstrations in Exploration and Bootstrapping

A diagram-rich generated explanation from the public library.

Machine LearningReinforcement Learning
May 26, 2026 45 min read 105

Odysseus: Stable RL Training of VLMs for Long-Horizon Game Decision-Making

A diagram-rich generated explanation from the public library.

Machine LearningReinforcement Learning
May 18, 2026 45 min read 105

ECHO: Turning Terminal Feedback into Dense Supervision for Agent RL

A diagram-rich generated explanation from the public library.

Machine LearningReinforcement Learning
May 18, 2026 45 min read 80

Maximum Likelihood Reinforcement Learning (MaxRL): A Compute-Indexed Bridge from RL to Log-Likelihood

RL framework that approximates maximum likelihood for binary-outcome tasks.

Machine LearningReinforcement Learning
May 17, 2026 45 min read 128

Reinforcement Learning for Large Language Models: Group Relative Policy Optimization (GRPO)

GRPO and RL for LLM's

Machine LearningReinforcement LearningLLMs
May 17, 2026 45 min read 152

LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architectures from Pixels

Stable JEPA-based world model that learns and plans from raw pixels.

Machine LearningReinforcement Learning
May 11, 2026 45 min read 222

Policy Gradient Methods

policy gradient methods

Machine LearningReinforcement Learning
Apr 26, 2026 45 min read 94