Grilled Cheese

ExploreLog inSign up
Terms of UsePrivacy PolicyCommunity StandardsHelpGet the app

Grilled Cheese is a product of Village Compute

Version devBuilt at: 2026-10-11 02:37:10 EDT

Explore

PostsPeople
LatestRanked
@igrgavilan.bsky.socialOct 4, 2026, 7:19 PM

La semana en [Blue Chip]. Lunes 28-Sep: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@igrgavilan.bsky.socialSep 28, 2026, 8:31 PM

Hoy en [Blue Chip]: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@igrgavilan.bsky.socialSep 28, 2026, 7:58 AM

[Blue Chip]: "Cómo hacemos que un modelo razone (IV): aprendizaje por refuerzo basado en recompensas verificables (RLVR)" ignaciogavilan.com/como-hacemos... #RLVR #GRPO #ReinforcementLearning #AprendizajePorRefuerzo #ModelosRazonadores #ReasoningModels #IA #AI #LLM

@informaq-es.bsky.socialSep 23, 2026, 6:24 PM

El aprendizaje por refuerzo permite la preparación 100 veces más rápida de códigos bosónicos con alta fidelidad bajo ruido, impulsando la computación cuántica tolerante a fallos mediante ingeniería de Floquet.

#CorrecciónDeErroresCuánticos #AprendizajePorRefuerzo #Noticias