Grilled Cheese

ExploreLog inSign up
Terms of UsePrivacy PolicyCommunity StandardsHelpGet the app

Grilled Cheese is a product of Village Compute

Version devBuilt at: 2026-10-10 20:13:24 EDT

Explore

PostsPeople
LatestRanked
@igrgavilan.bsky.socialOct 4, 2026, 7:19 PM

La semana en [Blue Chip]. Lunes 28-Sep: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@igrgavilan.bsky.socialSep 28, 2026, 8:31 PM

Hoy en [Blue Chip]: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@igrgavilan.bsky.socialSep 28, 2026, 7:58 AM

[Blue Chip]: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@k-i-news.bsky.socialSep 19, 2026, 6:00 AM

Async GRPO mit LoRA über HF Jobs: Synchronisation läuft über einen Bucket und einen Proxy statt über NCCL. Kein Lockstep, kein spezielles Interconnect – das senkt die Hürde für RL-Finetuning deutlich. #GRPO

Mehr von mir: linkedin.com/in/maurice-putinas

@donwebmedia.bsky.socialSep 18, 2026, 7:43 AM

GRPO reward model: el critic se fue, no él

¿GRPO elimina el reward model? No: solo el critic desaparece, y así GRPO ahorra memoria sin perder precisión en el entrenamiento RL de modelos

#grpo #rewardmodel #ppo #deepseek #reinforcementlearning

@harushark3.bsky.socialSep 16, 2026, 12:15 AM

[JP] LLM強化学習の罠「マシュー効果」とは?難問を攻略するNever Give Up(NGU)アプローチ
[EN] The Trap of LLM Reinforcement Learning: What is the "Matthew Effect"? Introducing the Never Give Up (NGU…

https://ai-minor.com/blog/en/2026-09-16-1789512937387-learning_to_solve_hard_problems_in_rl_for_llms_by_

#強化学習 #LLM #GRPO #AI #Tech

@k-i-news.bsky.socialSep 5, 2026, 6:00 PM

Ein 350M-Modell, in 100 GRPO-Schritten trainiert, liefert bessere strukturierte Outputs als große Modelle. Effizientes Fine-Tuning wird zum echten Hebel für lokale KI und Automatisierung. #GRPO

Mehr von mir: linkedin.com/in/maurice-putinas