ReAgent
Getting Started
Installation
Usage
RASP (Not Actively Maintained)
Advanced Topics
Continuous Integration
Package Reference
Core
Data
Gym
Evaluation
Lite
MAB
Model Managers
Model Utils
Net Builders
Optimizers
Models
Prediction
Preprocessing
Training
Workflow
All Modules
Others
Github
License
ReAgent
»
Index
Index
A
|
B
|
C
|
D
|
E
|
F
|
G
|
H
|
I
|
K
|
L
|
M
|
N
|
O
|
P
|
Q
|
R
|
S
|
T
|
U
|
V
|
W
|
X
|
Y
|
Z
A
acc_reward (reagent.core.types.Seq2RewardOutput attribute)
acc_rewards_of_all_solutions() (reagent.models.cem_planner.CEMPlannerNetwork method)
acc_rewards_of_one_solution() (reagent.models.cem_planner.CEMPlannerNetwork method)
acquisition() (reagent.lite.optimizer.BayesianOptimizer method)
act() (reagent.gym.Agent method)
(reagent.gym.agents.agent.Agent method)
(reagent.gym.policies.Policy method)
(reagent.gym.policies.policy.Policy method)
(reagent.gym.policies.predictor_policies.ActorPredictorPolicy method)
(reagent.gym.policies.predictor_policies.DiscreteDQNPredictorPolicy method)
(reagent.gym.policies.random_policies.ContinuousRandomPolicy method)
(reagent.gym.policies.random_policies.DiscreteRandomPolicy method)
(reagent.gym.policies.random_policies.MultiDiscreteRandomPolicy method)
(reagent.mab.simulation.BernoilliMAB method)
(reagent.mab.simulation.MAB method)
(reagent.model_managers.actor_critic_base.ActorPolicyWrapper method)
(reagent.model_managers.discrete.discrete_crr.ActorPolicyWrapper method)
(reagent.model_managers.model_based.cross_entropy_method.CEMPolicy method)
Action (class in reagent.gym.envs.pomdp.pocman)
ACTION (reagent.core.parameters.NormalizationKey attribute)
action (reagent.core.types.ActorOutput attribute)
(reagent.core.types.BanditRewardModelInput attribute)
(reagent.core.types.CBInput attribute)
(reagent.core.types.DiscreteDqnInput attribute)
(reagent.core.types.MemoryNetworkInput attribute)
(reagent.core.types.ParametricDqnInput attribute)
(reagent.core.types.PolicyGradientInput attribute)
(reagent.core.types.PolicyNetworkInput attribute)
(reagent.core.types.SlateQInput attribute)
(reagent.gym.types.Transition attribute)
(reagent.models.mdn_rnn.MDNRNNMemorySample attribute)
(reagent.ope.estimators.sequential_estimators.Transition attribute)
ACTION (reagent.preprocessing.types.InputColumn attribute)
action_activation (reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
action_dim (reagent.core.parameters.MDNRNNTrainerParameters attribute)
(reagent.net_builder.value.seq2reward_rnn.Seq2RewardNetBuilder attribute)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
action_dist() (reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter.EDPSeqPolicy method)
(reagent.ope.estimators.sequential_estimators.EpsilonGreedyRLPolicy method)
(reagent.ope.estimators.sequential_estimators.RandomRLPolicy method)
(reagent.ope.estimators.sequential_estimators.RLPolicy method)
(reagent.ope.test.cartpole.ComboPolicy method)
(reagent.ope.test.cartpole.PyTorchPolicy method)
(reagent.ope.trainers.rl_tabular_trainers.TabularPolicy method)
action_embedding_kld_weight (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
action_embedding_mean (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
action_embedding_variance (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
action_extractor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
(reagent.gym.envs.toy_vm.ToyVM method)
(reagent.gym.envs.ToyVM method)
action_feature_config (reagent.model_managers.actor_critic_base.ActorCriticBase property)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward property)
(reagent.model_managers.model_based.SyntheticReward property)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase property)
action_feature_override (reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
action_float_features (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
action_mask (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
action_mask_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
action_mask_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
action_names (reagent.core.parameters.MDNRNNTrainerParameters attribute)
(reagent.core.parameters.Seq2RewardTrainerParameters attribute)
(reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN property)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR property)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN property)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN property)
(reagent.model_managers.discrete.DiscreteC51DQN property)
(reagent.model_managers.discrete.DiscreteCRR property)
(reagent.model_managers.discrete.DiscreteDQN property)
(reagent.model_managers.discrete.DiscreteQRDQN property)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase property)
(reagent.model_managers.policy_gradient.PPO property)
(reagent.model_managers.policy_gradient.ppo.PPO property)
(reagent.model_managers.policy_gradient.Reinforce property)
(reagent.model_managers.policy_gradient.reinforce.Reinforce property)
ACTION_NOT_POSSIBLE_VAL (reagent.training.dqn_trainer_base.DQNTrainerMixin attribute)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin attribute)
action_preprocessing_options (reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
action_prob (reagent.core.types.BanditRewardModelInput attribute)
(reagent.ope.estimators.sequential_estimators.Transition attribute)
action_probability (reagent.core.types.ExtraData attribute)
ACTION_PROBABILITY (reagent.preprocessing.types.InputColumn attribute)
action_space (reagent.gym.envs.changing_arms.ChangingArmsEnv property)
(reagent.gym.envs.oracle_pvm.OraclePVM property)
(reagent.gym.envs.OraclePVM property)
(reagent.ope.estimators.contextual_bandits_estimators.BanditsEstimatorInput attribute)
(reagent.ope.estimators.sequential_estimators.RLPolicy property)
(reagent.ope.estimators.types.Policy property)
ActionCountAggregator (class in reagent.core.aggregators)
ActionDistribution (class in reagent.ope.estimators.types)
ActionRewards (class in reagent.ope.estimators.contextual_bandits_estimators)
actions (reagent.ope.datasets.logged_dataset.BanditsDataset property)
(reagent.training.C51TrainerParameters attribute)
(reagent.training.CRRTrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
actions_logged_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
actions_logged_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
actions_logged_train (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
actions_logged_valid (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
ActionSpace (class in reagent.ope.estimators.types)
activation (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
activations (reagent.net_builder.categorical_dqn.categorical.Categorical attribute)
(reagent.net_builder.continuous_actor.dirichlet_fully_connected.DirichletFullyConnected attribute)
(reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.dueling.Dueling attribute)
(reagent.net_builder.discrete_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.fully_connected_with_embedding.FullyConnectedWithEmbedding attribute)
(reagent.net_builder.parametric_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.quantile_dqn.dueling_quantile.DuelingQuantile attribute)
(reagent.net_builder.quantile_dqn.quantile.Quantile attribute)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward attribute)
(reagent.net_builder.value.fully_connected.FullyConnected attribute)
actor_critic_report (reagent.workflow.types.RLTrainingReport attribute)
actor_net_builder (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic.td3.TD3 attribute)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
actor_network_optimizer (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
ActorCriticBase (class in reagent.model_managers.actor_critic_base)
ActorCriticDataModule (class in reagent.model_managers.actor_critic_base)
ActorCriticReporter (class in reagent.reporting.actor_critic_reporter)
ActorCriticTrainingReport (class in reagent.workflow.training_reports)
ActorDQN (class in reagent.model_managers.discrete.discrete_crr)
ActorOutput (class in reagent.core.types)
ActorPolicyWrapper (class in reagent.model_managers.actor_critic_base)
(class in reagent.model_managers.discrete.discrete_crr)
ActorPredictorPolicy (class in reagent.gym.policies.predictor_policies)
ActorPredictorUnwrapper (in module reagent.prediction.predictor_wrapper)
ActorPredictorWrapper (class in reagent.prediction.predictor_wrapper)
ActorWithPreprocessor (class in reagent.prediction.predictor_wrapper)
Adadelta (reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
Adagrad (reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
Adam (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
Adamax (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
AdamW (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
add() (reagent.ope.test.yandex_web_search.TrainingQuery method)
(reagent.ope.utils.RunningAverage method)
(reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
add_batch_observations() (reagent.mab.mab_algorithm.MABAlgo method)
(reagent.mab.thompson_sampling.NormalGammaThompson method)
add_custom_scalars() (reagent.core.tensorboardX.SummaryWriterContext class method)
add_custom_scalars_multilinechart() (reagent.core.tensorboardX.SummaryWriterContext class method)
add_histogram() (reagent.core.tensorboardX.SummaryWriterContext class method)
add_observer() (reagent.core.tracker.ObservableMixin method)
(reagent.evaluation.evaluator.Evaluator method)
add_observers() (reagent.core.tracker.ObservableMixin method)
(reagent.evaluation.evaluator.Evaluator method)
add_replay_buffer_post_step() (in module reagent.gym.agents.post_step)
add_single_observation() (reagent.mab.mab_algorithm.MABAlgo method)
(reagent.mab.thompson_sampling.NormalGammaThompson method)
add_transition() (reagent.gym.types.Trajectory method)
Agent (class in reagent.gym)
(class in reagent.gym.agents.agent)
aggregate() (reagent.core.aggregators.ActionCountAggregator method)
(reagent.core.aggregators.EpochListAggregator method)
(reagent.core.aggregators.FunctionsByActionAggregator method)
(reagent.core.aggregators.ListAggregator method)
(reagent.core.aggregators.MeanAggregator method)
(reagent.core.aggregators.RecentValuesAggregator method)
(reagent.core.aggregators.TensorBoardActionCountAggregator method)
(reagent.core.aggregators.TensorBoardActionHistogramAndMeanAggregator method)
(reagent.core.aggregators.TensorBoardHistogramAndMeanAggregator method)
(reagent.core.tracker.Aggregator method)
aggregating_observers (reagent.reporting.actor_critic_reporter.ActorCriticReporter property)
(reagent.reporting.reward_network_reporter.RewardNetworkReporter property)
(reagent.reporting.seq2reward_reporter.Seq2RewardCompressReporter property)
(reagent.reporting.seq2reward_reporter.Seq2RewardReporter property)
(reagent.reporting.slate_q_reporter.SlateQReporter property)
(reagent.reporting.td3_reporter.TD3Reporter property)
(reagent.reporting.world_model_reporter.WorldModelReporter property)
Aggregator (class in reagent.core.tracker)
AGGRESSIVE (reagent.core.parameters_seq2slate.IPSClampMethod attribute)
all_features (reagent.ope.test.mslr_slate.MSLRDatasets property)
all_steps_lstm_hidden (reagent.core.types.MemoryNetworkOutput attribute)
allow_zero_length_dataloader_with_multiple_devices (reagent.training.BanditRewardNetTrainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.cb.linucb_trainer.LinUCBTrainer attribute)
(reagent.training.CEMTrainer attribute)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer attribute)
(reagent.training.cfeval.BanditRewardNetTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.MDNRNNTrainer attribute)
(reagent.training.MultiStageTrainer attribute)
(reagent.training.PPOTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer attribute)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer attribute)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer attribute)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer attribute)
(reagent.training.ReAgentLightningModule attribute)
(reagent.training.reinforce_trainer.ReinforceTrainer attribute)
(reagent.training.ReinforceTrainer attribute)
(reagent.training.reward_network_trainer.RewardNetTrainer attribute)
(reagent.training.RewardNetTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.TD3Trainer attribute)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer attribute)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer attribute)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer attribute)
allowedlist_features (reagent.workflow.types.PreprocessingOptions attribute)
alpha (reagent.core.parameters.CEMTrainerParameters attribute)
alpha_optimizer (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
amsgrad (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
anchor_url_features (reagent.ope.test.mslr_slate.MSLRDatasets property)
anneal_strategy (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
append() (reagent.evaluation.evaluation_data_page.EvaluationDataPage method)
(reagent.ope.estimators.estimator.EstimatorResults method)
AppendConstant (class in reagent.preprocessing.transforms)
apply_global_reward() (reagent.training.gradient_free.evolution_pool.EvolutionPool method)
apply_kld_on_mean (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
apply_possible_actions_mask() (in module reagent.gym.policies.scorers.discrete_scorer)
argmax_with_mask() (reagent.training.c51_trainer.C51Trainer method)
(reagent.training.C51Trainer method)
(reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
ARSOptimizer (class in reagent.training.gradient_free.ars_util)
as_dict_shallow() (reagent.core.types.BaseInput method)
as_feature_data() (reagent.core.types.DocList method)
asdict() (reagent.gym.types.Transition method)
(reagent.training.C51TrainerParameters method)
(reagent.training.CRRTrainerParameters method)
(reagent.training.DQNTrainerParameters method)
(reagent.training.parameters.C51TrainerParameters method)
(reagent.training.parameters.CRRTrainerParameters method)
(reagent.training.parameters.DQNTrainerParameters method)
(reagent.training.parameters.LinUCBTrainerParameters method)
(reagent.training.parameters.ParametricDQNTrainerParameters method)
(reagent.training.parameters.PPOTrainerParameters method)
(reagent.training.parameters.QRDQNTrainerParameters method)
(reagent.training.parameters.ReinforceTrainerParameters method)
(reagent.training.parameters.RewardNetworkTrainerParameters method)
(reagent.training.parameters.SACTrainerParameters method)
(reagent.training.parameters.Seq2SlateTrainerParameters method)
(reagent.training.parameters.SlateQTrainerParameters method)
(reagent.training.parameters.TD3TrainerParameters method)
(reagent.training.ParametricDQNTrainerParameters method)
(reagent.training.PPOTrainerParameters method)
(reagent.training.QRDQNTrainerParameters method)
(reagent.training.ReinforceTrainerParameters method)
(reagent.training.RewardNetworkTrainerParameters method)
(reagent.training.SACTrainerParameters method)
(reagent.training.Seq2SlateTrainerParameters method)
(reagent.training.SlateQTrainerParameters method)
(reagent.training.TD3TrainerParameters method)
ASGD (reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
assert_allowedlist_feature_coverage (reagent.workflow.types.PreprocessingOptions attribute)
attention() (in module reagent.model_utils.seq2slate_utils)
AUTOREGRESSIVE (reagent.model_utils.seq2slate_utils.Seq2SlateOutputArch attribute)
average (reagent.ope.utils.RunningAverage property)
average_next_v (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
B
backprop_through_log_prob (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
BanditRewardModelInput (class in reagent.core.types)
BanditRewardNetTrainer (class in reagent.training)
(class in reagent.training.cfeval)
(class in reagent.training.cfeval.bandit_reward_network_trainer)
BanditsDataset (class in reagent.ope.datasets.logged_dataset)
BanditsEstimatorInput (class in reagent.ope.estimators.contextual_bandits_estimators)
BanditsModel (class in reagent.ope.estimators.contextual_bandits_estimators)
base_lr (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
base_momentum (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
BaseDataClass (class in reagent.core.base_dataclass)
BaseInput (class in reagent.core.types)
baseline_optimizer (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
BaselineNet (class in reagent.models.seq2slate)
BaselineParameters (class in reagent.core.parameters)
BaseThompsonSampling (class in reagent.mab.thompson_sampling)
BaseUCB (class in reagent.mab.ucb)
BasicReplayBufferInserter (class in reagent.gym.preprocessors.replay_buffer_inserters)
batch_quadratic_form() (in module reagent.models.linear_regression)
batch_size (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
batch_size() (reagent.core.types.BaseInput method)
(reagent.core.types.PreprocessedRankingInput method)
(reagent.core.types.PreprocessedTrainingBatch method)
batch_to_device() (in module reagent.preprocessing.batch_preprocessor)
BatchConstrainedDQN (class in reagent.models)
(class in reagent.models.bcq)
BatchPreprocessor (class in reagent.preprocessing.batch_preprocessor)
BayesianMLPEnsemblerOptimizer (class in reagent.lite.optimizer)
BayesianOptimizer (class in reagent.lite.optimizer)
BCELoss (reagent.training.reward_network_trainer.LossFunction attribute)
bcq (reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
BCQConfig (class in reagent.training.dqn_trainer)
BernoilliMAB (class in reagent.mab.simulation)
BernoulliBetaThompson (class in reagent.mab.thompson_sampling)
best_solutions() (reagent.lite.optimizer.ComboOptimizerBase method)
BestResultsQueue (class in reagent.lite.optimizer)
beta (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
betas (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.Adamax attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
(reagent.optimizer.uninferrable_optimizers.NAdam attribute)
(reagent.optimizer.uninferrable_optimizers.RAdam attribute)
(reagent.optimizer.uninferrable_optimizers.SparseAdam attribute)
bias (reagent.ope.estimators.estimator.ResultDiffs property)
BinaryDifferenceScorerPredictorWrapper (class in reagent.prediction.predictor_wrapper)
BinaryDifferenceScorerWithPreprocessor (class in reagent.prediction.predictor_wrapper)
body_features (reagent.ope.test.mslr_slate.MSLRDatasets property)
boost_rewards() (reagent.training.c51_trainer.C51Trainer method)
(reagent.training.C51Trainer method)
(reagent.training.dqn_trainer_base.DQNTrainerBaseLightning method)
(reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
bootstrap_num_samples (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
BOOTSTRAP_SAMPLE_PCT (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator attribute)
bootstrap_sample_percent (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
bootstrapped_std_error_of_mean() (in module reagent.evaluation.cpe)
bope_mode (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
bope_num_samples (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
boxcox_lambda (reagent.core.parameters.NormalizationParameters attribute)
boxcox_shift (reagent.core.parameters.NormalizationParameters attribute)
build_action_normalizer() (in module reagent.gym.utils)
build_actor() (reagent.net_builder.continuous_actor.dirichlet_fully_connected.DirichletFullyConnected method)
(reagent.net_builder.continuous_actor.fully_connected.FullyConnected method)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected method)
(reagent.net_builder.continuous_actor_net_builder.ContinuousActorNetBuilder method)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected method)
(reagent.net_builder.discrete_actor_net_builder.DiscreteActorNetBuilder method)
build_actor_module() (reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteCRR method)
build_batch_preprocessor() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.model_managers.actor_critic_base.ActorCriticDataModule method)
(reagent.model_managers.discrete_dqn_base.DiscreteDqnDataModule method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticRewardDataModule method)
(reagent.model_managers.parametric_dqn_base.ParametricDqnDataModule method)
(reagent.model_managers.world_model_base.WorldModelDataModule method)
build_binary_difference_scorer() (reagent.net_builder.discrete_dqn_net_builder.DiscreteDQNNetBuilder method)
build_normalizer() (in module reagent.gym.utils)
build_q_network() (reagent.net_builder.categorical_dqn.categorical.Categorical method)
(reagent.net_builder.categorical_dqn_net_builder.CategoricalDQNNetBuilder method)
(reagent.net_builder.discrete_dqn.dueling.Dueling method)
(reagent.net_builder.discrete_dqn.fully_connected.FullyConnected method)
(reagent.net_builder.discrete_dqn.fully_connected_with_embedding.FullyConnectedWithEmbedding method)
(reagent.net_builder.discrete_dqn_net_builder.DiscreteDQNNetBuilder method)
(reagent.net_builder.parametric_dqn.fully_connected.FullyConnected method)
(reagent.net_builder.parametric_dqn_net_builder.ParametricDQNNetBuilder method)
(reagent.net_builder.quantile_dqn.dueling_quantile.DuelingQuantile method)
(reagent.net_builder.quantile_dqn.quantile.Quantile method)
(reagent.net_builder.quantile_dqn_net_builder.QRDQNNetBuilder method)
build_ranking_serving_module() (reagent.net_builder.continuous_actor_net_builder.ContinuousActorNetBuilder method)
build_serving_module() (reagent.model_managers.actor_critic.SAC method)
(reagent.model_managers.actor_critic.sac.SAC method)
(reagent.model_managers.actor_critic.TD3 method)
(reagent.model_managers.actor_critic.td3.TD3 method)
(reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN method)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN method)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN method)
(reagent.model_managers.discrete.DiscreteC51DQN method)
(reagent.model_managers.discrete.DiscreteDQN method)
(reagent.model_managers.discrete.DiscreteQRDQN method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward method)
(reagent.model_managers.model_based.SyntheticReward method)
(reagent.model_managers.model_manager.ModelManager method)
(reagent.model_managers.parametric.parametric_dqn.ParametricDQN method)
(reagent.model_managers.parametric.ParametricDQN method)
(reagent.model_managers.policy_gradient.PPO method)
(reagent.model_managers.policy_gradient.ppo.PPO method)
(reagent.model_managers.policy_gradient.Reinforce method)
(reagent.model_managers.policy_gradient.reinforce.Reinforce method)
(reagent.model_managers.ranking.slate_q.SlateQ method)
(reagent.model_managers.ranking.SlateQ method)
(reagent.net_builder.categorical_dqn_net_builder.CategoricalDQNNetBuilder method)
(reagent.net_builder.continuous_actor_net_builder.ContinuousActorNetBuilder method)
(reagent.net_builder.discrete_actor_net_builder.DiscreteActorNetBuilder method)
(reagent.net_builder.discrete_dqn_net_builder.DiscreteDQNNetBuilder method)
(reagent.net_builder.parametric_dqn_net_builder.ParametricDQNNetBuilder method)
(reagent.net_builder.quantile_dqn_net_builder.QRDQNNetBuilder method)
(reagent.net_builder.synthetic_reward_net_builder.SyntheticRewardNetBuilder method)
build_serving_modules() (reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN method)
(reagent.model_managers.discrete.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteDQN method)
(reagent.model_managers.model_manager.ModelManager method)
build_slate_ranking_network() (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer method)
(reagent.net_builder.slate_ranking.slate_ranking_transformer.SlateRankingTransformer method)
(reagent.net_builder.slate_ranking_net_builder.SlateRankingNetBuilder method)
build_slate_reward_network() (reagent.net_builder.slate_reward.slate_reward_gru.SlateRewardGRU method)
(reagent.net_builder.slate_reward.slate_reward_transformer.SlateRewardTransformer method)
(reagent.net_builder.slate_reward_net_builder.SlateRewardNetBuilder method)
build_state_normalizer() (in module reagent.gym.utils)
build_synthetic_reward_network() (reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward method)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward method)
(reagent.net_builder.synthetic_reward.sequence_synthetic_reward.SequenceSyntheticReward method)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward method)
(reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward method)
(reagent.net_builder.synthetic_reward_net_builder.SyntheticRewardNetBuilder method)
build_trainer() (reagent.model_managers.actor_critic.SAC method)
(reagent.model_managers.actor_critic.sac.SAC method)
(reagent.model_managers.actor_critic.TD3 method)
(reagent.model_managers.actor_critic.td3.TD3 method)
(reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN method)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN method)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN method)
(reagent.model_managers.discrete.DiscreteC51DQN method)
(reagent.model_managers.discrete.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteDQN method)
(reagent.model_managers.discrete.DiscreteQRDQN method)
(reagent.model_managers.model_based.cross_entropy_method.CrossEntropyMethod method)
(reagent.model_managers.model_based.CrossEntropyMethod method)
(reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel method)
(reagent.model_managers.model_based.Seq2RewardModel method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward method)
(reagent.model_managers.model_based.SyntheticReward method)
(reagent.model_managers.model_based.world_model.WorldModel method)
(reagent.model_managers.model_based.WorldModel method)
(reagent.model_managers.model_manager.ModelManager method)
(reagent.model_managers.parametric.parametric_dqn.ParametricDQN method)
(reagent.model_managers.parametric.ParametricDQN method)
(reagent.model_managers.policy_gradient.PPO method)
(reagent.model_managers.policy_gradient.ppo.PPO method)
(reagent.model_managers.policy_gradient.Reinforce method)
(reagent.model_managers.policy_gradient.reinforce.Reinforce method)
(reagent.model_managers.ranking.slate_q.SlateQ method)
(reagent.model_managers.ranking.SlateQ method)
build_value_network() (reagent.net_builder.value.fully_connected.FullyConnected method)
(reagent.net_builder.value.seq2reward_rnn.Seq2RewardNetBuilder method)
(reagent.net_builder.value_net_builder.ValueNetBuilder method)
C
C51Trainer (class in reagent.training)
(class in reagent.training.c51_trainer)
C51TrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
cache_file (reagent.ope.test.mslr_slate.MSLRDatasets property)
calc_cpe (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
calc_cpe_in_training (reagent.core.parameters.EvaluationParameters attribute)
calc_custom_reward() (in module reagent.data.oss_data_fetcher)
calc_reward_multi_steps() (in module reagent.data.oss_data_fetcher)
calculate_cumulative_reward() (reagent.gym.types.Trajectory method)
calculate_feature_importance() (in module reagent.gym.tests.test_world_model)
calculate_feature_sensitivity() (in module reagent.gym.tests.test_world_model)
calculate_recent_window_average() (in module reagent.core.report_utils)
calculate_reward() (reagent.ope.estimators.slate_estimators.SlateMetric method)
calculate_step_return() (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator static method)
call_spark_class() (in module reagent.data.spark_utils)
can_be_traced() (reagent.prediction.predictor_wrapper.Seq2SlateWithPreprocessor method)
CANDIDATE (reagent.core.parameters.NormalizationKey attribute)
candidate_dim (reagent.models.seq2slate.Seq2SlateNet attribute)
candidate_docs (reagent.core.types.FeatureData attribute)
candidate_feat_dim (reagent.gym.envs.oracle_pvm.OraclePVM attribute)
(reagent.gym.envs.OraclePVM attribute)
CANDIDATE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
candidate_sorted_features (reagent.prediction.predictor_wrapper.Seq2SlateRewardWithPreprocessor property)
CANDIDATES (reagent.ope.estimators.contextual_bandits_estimators.SwitchEstimator attribute)
Cat (class in reagent.preprocessing.transforms)
Categorical (class in reagent.net_builder.categorical_dqn.categorical)
(reagent.net_builder.unions.CategoricalDQNNetBuilder__Union attribute)
CategoricalDQN (class in reagent.models)
(class in reagent.models.categorical_dqn)
CategoricalDQNNetBuilder (class in reagent.net_builder.categorical_dqn_net_builder)
CategoricalDQNNetBuilder__Union (class in reagent.net_builder.unions)
CBInput (class in reagent.core.types)
cem_num_iterations (reagent.core.parameters.CEMTrainerParameters attribute)
cem_population_size (reagent.core.parameters.CEMTrainerParameters attribute)
CEMPlannerNetwork (class in reagent.models.cem_planner)
CEMPolicy (class in reagent.model_managers.model_based.cross_entropy_method)
CEMTrainer (class in reagent.training)
(class in reagent.training.cem_trainer)
CEMTrainerParameters (class in reagent.core.parameters)
ChainedScheduler (reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
ChangingArms (class in reagent.gym.envs)
(class in reagent.gym.envs.changing_arms)
(reagent.gym.envs.Env__Union attribute)
ChangingArmsEnv (class in reagent.gym.envs.changing_arms)
check_estimates_exist() (reagent.evaluation.cpe.CpeEstimateSet method)
clamp_max (reagent.core.parameters_seq2slate.IPSClamp attribute)
(reagent.core.parameters_seq2slate.RewardClamp attribute)
clamp_method (reagent.core.parameters_seq2slate.IPSClamp attribute)
clamp_min (reagent.core.parameters_seq2slate.RewardClamp attribute)
Clamper (class in reagent.ope.utils)
CLEAR_WALK_WAY (reagent.gym.envs.pomdp.pocman.Element attribute)
click() (reagent.ope.test.yandex_web_search.LoggedQuery method)
click_to_relevances() (in module reagent.ope.test.yandex_web_search)
clicks (reagent.ope.test.yandex_web_search.LoggedQuery property)
clip_limit (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
clip_param (reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
clones() (in module reagent.model_utils.seq2slate_utils)
close() (reagent.ope.test.envs.Environment method)
(reagent.ope.test.gridworld.GridWorld method)
(reagent.ope.test.gridworld.NoiseGridWorldModel method)
collate_and_preprocess() (in module reagent.data.manual_data_module)
(in module reagent.workflow.utils)
ColumnVector (class in reagent.preprocessing.transforms)
ComboOptimizerBase (class in reagent.lite.optimizer)
ComboPolicy (class in reagent.ope.test.cartpole)
compare_bandit_algos() (in module reagent.mab.simulation)
Compose (class in reagent.preprocessing.transforms)
CompositeObserver (class in reagent.core.observers)
CompoundReporter (class in reagent.reporting)
(class in reagent.reporting.compound_reporter)
compress_model_learning_rate (reagent.core.parameters.Seq2RewardTrainerParameters attribute)
compress_net_builder (reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel attribute)
(reagent.model_managers.model_based.Seq2RewardModel attribute)
CompressModelTrainer (class in reagent.training.world_model.compress_model_trainer)
CompressModelWithPreprocessor (class in reagent.prediction.predictor_wrapper)
compute_actor_loss() (reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
compute_all_local_rewards() (reagent.training.gradient_free.evolution_pool.EvolutionPool method)
compute_discount_tensor() (reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.DQNTrainer method)
compute_feature_importance() (reagent.evaluation.feature_importance.feature_importance_base.FeatureImportanceBase method)
(reagent.evaluation.feature_importance.feature_importance_perturbation.FeatureImportancePerturbation method)
compute_local_reward() (reagent.training.gradient_free.evolution_pool.EvolutionPool method)
(reagent.training.gradient_free.evolution_pool.OneMaxEvolutionPool method)
compute_median_feature_value() (reagent.evaluation.world_model_evaluator.FeatureImportanceEvaluator method)
compute_target_q_values() (reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
compute_td_loss() (reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
(reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.DQNTrainer method)
compute_values() (reagent.evaluation.evaluation_data_page.EvaluationDataPage method)
compute_values_for_mdps() (reagent.evaluation.evaluation_data_page.EvaluationDataPage static method)
compute_weighted_doubly_robust_point_estimate() (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator method)
Concat (class in reagent.models.synthetic_reward)
concat_user_doc() (reagent.core.types.FeatureData method)
confidence_bounds() (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator static method)
CONFIDENCE_INTERVAL (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator attribute)
config_file (reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
configure_optimizers() (reagent.training.BanditRewardNetTrainer method)
(reagent.training.c51_trainer.C51Trainer method)
(reagent.training.C51Trainer method)
(reagent.training.cb.linucb_trainer.LinUCBTrainer method)
(reagent.training.cem_trainer.CEMTrainer method)
(reagent.training.CEMTrainer method)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer method)
(reagent.training.cfeval.BanditRewardNetTrainer method)
(reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
(reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.DQNTrainer method)
(reagent.training.MDNRNNTrainer method)
(reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.parametric_dqn_trainer.ParametricDQNTrainer method)
(reagent.training.ParametricDQNTrainer method)
(reagent.training.ppo_trainer.PPOTrainer method)
(reagent.training.PPOTrainer method)
(reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer method)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer method)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer method)
(reagent.training.reinforce_trainer.ReinforceTrainer method)
(reagent.training.ReinforceTrainer method)
(reagent.training.reward_network_trainer.RewardNetTrainer method)
(reagent.training.RewardNetTrainer method)
(reagent.training.sac_trainer.SACTrainer method)
(reagent.training.SACTrainer method)
(reagent.training.slate_q_trainer.SlateQTrainer method)
(reagent.training.SlateQTrainer method)
(reagent.training.td3_trainer.TD3Trainer method)
(reagent.training.TD3Trainer method)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer method)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer method)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
ConstantLR (reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
constrained_variance() (reagent.models.cem_planner.CEMPlannerNetwork method)
construct_action_scale_tensor() (in module reagent.preprocessing.normalization)
consume() (reagent.core.running_stats.RunningStats method)
context (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
(reagent.ope.estimators.slate_estimators.LogSample attribute)
context_action_features (reagent.core.types.CBInput attribute)
context_size (reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward attribute)
contexts (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
contexts_actions_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
contexts_actions_train (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
contexts_actions_valid (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
contexts_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
contexts_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
contexts_train (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
contexts_valid (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
CONTINUOUS_ACTION (reagent.core.parameters.ProblemDomain attribute)
continuous_planning() (reagent.models.cem_planner.CEMPlannerNetwork method)
ContinuousActorNetBuilder (class in reagent.net_builder.continuous_actor_net_builder)
ContinuousActorNetBuilder__Union (class in reagent.net_builder.unions)
ContinuousRandomPolicy (class in reagent.gym.policies.random_policies)
conv_dims (reagent.core.parameters.ConvNetParameters attribute)
conv_forward() (reagent.models.convolutional_network.ConvolutionalNetwork method)
conv_height_kernels (reagent.core.parameters.ConvNetParameters attribute)
conv_net_params (reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
conv_width_kernels (reagent.core.parameters.ConvNetParameters attribute)
convert_to_one_hots() (in module reagent.ope.utils)
ConvNetParameters (class in reagent.core.parameters)
ConvolutionalNetwork (class in reagent.models.convolutional_network)
CosineAnnealingLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
CosineAnnealingWarmRestarts (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
count (reagent.ope.test.yandex_web_search.TrainingQuery property)
(reagent.ope.utils.RunningAverage property)
cpe_net_builder (reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR attribute)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN attribute)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN attribute)
(reagent.model_managers.discrete.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteDQN attribute)
(reagent.model_managers.discrete.DiscreteQRDQN attribute)
cpe_optimizer (reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
CpeDetails (class in reagent.evaluation.cpe)
CpeEstimate (class in reagent.evaluation.cpe)
CpeEstimateSet (class in reagent.evaluation.cpe)
cpu (reagent.workflow.types.ResourceOptions attribute)
cpu() (reagent.core.types.TensorDataClass method)
cpu_model() (reagent.models.base.ModelBase method)
(reagent.models.ModelBase method)
create_cache() (in module reagent.ope.test.yandex_web_search)
create_default_perturb_fn() (in module reagent.evaluation.feature_importance.feature_importance_perturbation)
create_df_from_replay_buffer() (in module reagent.gym.utils)
create_embed_rl_dataset() (in module reagent.gym.tests.test_world_model)
create_for_env() (reagent.gym.Agent class method)
(reagent.gym.agents.agent.Agent class method)
(reagent.gym.policies.random_policies.ContinuousRandomPolicy class method)
(reagent.gym.policies.random_policies.DiscreteRandomPolicy class method)
(reagent.gym.policies.random_policies.MultiDiscreteRandomPolicy class method)
(reagent.gym.preprocessors.replay_buffer_inserters.RecSimReplayBufferInserter class method)
(reagent.gym.preprocessors.trainer_preprocessor.DiscreteDqnInputMaker class method)
(reagent.gym.preprocessors.trainer_preprocessor.MemoryNetworkInputMaker class method)
(reagent.gym.preprocessors.trainer_preprocessor.ParametricDqnInputMaker class method)
(reagent.gym.preprocessors.trainer_preprocessor.PolicyGradientInputMaker class method)
(reagent.gym.preprocessors.trainer_preprocessor.PolicyNetworkInputMaker class method)
(reagent.gym.preprocessors.trainer_preprocessor.SlateQInputMaker class method)
create_for_env_with_serving_policy() (reagent.gym.Agent class method)
(reagent.gym.agents.agent.Agent class method)
create_for_trainer() (reagent.gym.datasets.replay_buffer_dataset.OfflineReplayBufferDataset class method)
(reagent.gym.datasets.replay_buffer_dataset.ReplayBufferDataset class method)
create_from_env() (reagent.gym.preprocessors.default_preprocessors.RecsimObsPreprocessor class method)
create_from_example() (reagent.replay_memory.circular_replay_buffer.DenseMetadata class method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata class method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata class method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata class method)
create_from_tensors_dqn() (reagent.evaluation.evaluation_data_page.EvaluationDataPage class method)
create_from_tensors_parametric_dqn() (reagent.evaluation.evaluation_data_page.EvaluationDataPage class method)
create_from_tensors_seq2slate() (reagent.evaluation.evaluation_data_page.EvaluationDataPage class method)
create_from_training_batch() (reagent.evaluation.evaluation_data_page.EvaluationDataPage class method)
create_multiclick_environment() (in module reagent.gym.envs.recsim)
create_normalization_spec_spark() (in module reagent.workflow.identify_types_flow)
create_policy() (reagent.model_managers.actor_critic_base.ActorCriticBase method)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteCRR method)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase method)
(reagent.model_managers.model_based.cross_entropy_method.CrossEntropyMethod method)
(reagent.model_managers.model_based.CrossEntropyMethod method)
(reagent.model_managers.model_manager.ModelManager method)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase method)
(reagent.model_managers.policy_gradient.PPO method)
(reagent.model_managers.policy_gradient.ppo.PPO method)
(reagent.model_managers.policy_gradient.Reinforce method)
(reagent.model_managers.policy_gradient.reinforce.Reinforce method)
(reagent.model_managers.slate_q_base.SlateQBase method)
create_predictor_policy_from_model() (in module reagent.gym.policies.predictor_policies)
create_storage() (reagent.replay_memory.circular_replay_buffer.DenseMetadata method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata method)
critic_net_builder (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic.td3.TD3 attribute)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
CrossEntropyMethod (class in reagent.model_managers.model_based)
(class in reagent.model_managers.model_based.cross_entropy_method)
(reagent.model_managers.union.ModelManager__Union attribute)
crr_config (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
CRRTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
CRRWeightFn (class in reagent.training.sac_trainer)
cuda() (reagent.core.types.TensorDataClass method)
current_state (reagent.ope.test.envs.Environment property)
(reagent.ope.test.gridworld.NoiseGridWorldModel property)
cursor() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
custom_reward_expression (reagent.workflow.types.RewardOptions attribute)
cycle_momentum (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
CyclicLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
D
d_model (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
dampening (reagent.optimizer.uninferrable_optimizers.SGD attribute)
data_loader (reagent.evaluation.feature_importance.feature_importance_perturbation.FeatureImportancePerturbation attribute)
dataclass() (in module reagent.core.dataclasses)
DataFetcher (class in reagent.data)
(class in reagent.data.data_fetcher)
Dataset (class in reagent.workflow.types)
DCGSlateMetric (class in reagent.ope.estimators.slate_estimators)
DecisionTreeClassifierTrainer (class in reagent.ope.trainers.linear_trainers)
DecisionTreeTrainer (class in reagent.ope.trainers.linear_trainers)
decode() (reagent.models.seq2slate.Seq2SlateTransformerModel method)
(reagent.models.seq2slate_reward.Seq2SlateTransformerRewardNet method)
decode_lambdas() (reagent.optimizer.scheduler.LearningRateSchedulerConfig method)
DECODE_ONE_STEP_MODE (reagent.model_utils.seq2slate_utils.Seq2SlateMode attribute)
Decoder (class in reagent.models.seq2slate)
DecoderLastLayerPytorch (class in reagent.models.seq2slate)
DecoderLayer (class in reagent.models.seq2slate)
DecoderPyTorch (class in reagent.models.seq2slate)
default() (reagent.optimizer.Optimizer__Union class method)
(reagent.optimizer.union.Optimizer__Union class method)
default_action_preprocessing (reagent.net_builder.continuous_actor.dirichlet_fully_connected.DirichletFullyConnected property)
(reagent.net_builder.continuous_actor.fully_connected.FullyConnected property)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected property)
(reagent.net_builder.continuous_actor_net_builder.ContinuousActorNetBuilder property)
delayed_policy_update (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
dense_normalization_parameters (reagent.core.parameters.NormalizationData attribute)
DenseMetadata (class in reagent.replay_memory.circular_replay_buffer)
DenseNormalization (class in reagent.preprocessing.transforms)
deque_sample() (reagent.models.mdn_rnn.MDNRNNMemoryPool method)
deserialize() (in module reagent.preprocessing.normalization)
deserialize_and_run() (in module reagent.core.multiprocess_utils)
DeterminantalPointProcessPredictorWrapper (class in reagent.prediction.ranking.predictor_wrapper)
deterministic_env (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
device (reagent.ope.estimators.estimator.EstimatorResults attribute)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
dict_to_tensor() (in module reagent.core.torch_utils)
dim_feedforward (reagent.core.parameters.BaselineParameters attribute)
(reagent.core.parameters.TransformerParameters attribute)
(reagent.models.seq2slate.Seq2SlateTransformerNet attribute)
(reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
dim_model (reagent.core.parameters.GRUParameters attribute)
(reagent.core.parameters.TransformerParameters attribute)
(reagent.models.seq2slate.Seq2SlateNet attribute)
direct_method (reagent.evaluation.cpe.CpeEstimateSet attribute)
DirichletFullyConnected (class in reagent.net_builder.continuous_actor.dirichlet_fully_connected)
(reagent.net_builder.unions.ContinuousActorNetBuilder__Union attribute)
DirichletFullyConnectedActor (class in reagent.models)
(class in reagent.models.actor)
discount_time_scale (reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
discounted_returns() (in module reagent.training.utils)
DISCRETE_ACTION (reagent.core.parameters.ProblemDomain attribute)
discrete_action_names (reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
discrete_action_normalizer() (in module reagent.gym.normalizers)
discrete_action_preprocessing() (in module reagent.data.oss_data_fetcher)
discrete_dqn_scorer() (in module reagent.gym.policies.scorers.discrete_scorer)
discrete_dqn_serving_scorer() (in module reagent.gym.policies.scorers.discrete_scorer)
discrete_planning() (reagent.models.cem_planner.CEMPlannerNetwork method)
discrete_states (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
DiscreteActorNetBuilder (class in reagent.net_builder.discrete_actor_net_builder)
DiscreteActorNetBuilder__Union (class in reagent.net_builder.unions)
DiscreteC51DQN (class in reagent.model_managers.discrete)
(class in reagent.model_managers.discrete.discrete_c51dqn)
(reagent.model_managers.union.ModelManager__Union attribute)
DiscreteCRR (class in reagent.model_managers.discrete)
(class in reagent.model_managers.discrete.discrete_crr)
(reagent.model_managers.union.ModelManager__Union attribute)
DiscreteCRRReporter (class in reagent.reporting.discrete_crr_reporter)
DiscreteCRRTrainer (class in reagent.training)
(class in reagent.training.discrete_crr_trainer)
DiscreteDQN (class in reagent.model_managers.discrete)
(class in reagent.model_managers.discrete.discrete_dqn)
(reagent.model_managers.union.ModelManager__Union attribute)
DiscreteDQNBase (class in reagent.model_managers.discrete_dqn_base)
DiscreteDqnBatchPreprocessor (class in reagent.preprocessing.batch_preprocessor)
DiscreteDqnDataModule (class in reagent.model_managers.discrete_dqn_base)
DiscreteDqnInput (class in reagent.core.types)
DiscreteDqnInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
DiscreteDQNNetBuilder (class in reagent.net_builder.discrete_dqn_net_builder)
DiscreteDQNNetBuilder__Union (class in reagent.net_builder.unions)
DiscreteDQNPredictorPolicy (class in reagent.gym.policies.predictor_policies)
DiscreteDqnPredictorUnwrapper (in module reagent.prediction.predictor_wrapper)
DiscreteDqnPredictorWrapper (class in reagent.prediction.predictor_wrapper)
DiscreteDQNReporter (class in reagent.reporting.discrete_dqn_reporter)
DiscreteDqnWithPreprocessor (class in reagent.prediction.predictor_wrapper)
DiscreteQRDQN (class in reagent.model_managers.discrete)
(class in reagent.model_managers.discrete.discrete_qrdqn)
(reagent.model_managers.union.ModelManager__Union attribute)
DiscreteRandomPolicy (class in reagent.gym.policies.random_policies)
distance_penalty (reagent.core.parameters_seq2slate.SimulationParameters attribute)
distribution() (reagent.ope.estimators.slate_estimators.FrechetDistribution method)
(reagent.ope.estimators.slate_estimators.PassThruDistribution method)
(reagent.ope.estimators.slate_estimators.RankingDistribution method)
(reagent.ope.estimators.slate_estimators.RewardDistribution method)
(reagent.ope.estimators.types.ActionSpace method)
div_factor (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
DMEstimator (class in reagent.ope.estimators.contextual_bandits_estimators)
(class in reagent.ope.estimators.sequential_estimators)
(class in reagent.ope.estimators.slate_estimators)
do_publish() (reagent.publishers.model_publisher.ModelPublisher method)
(reagent.publishers.no_publishing.NoPublishing method)
do_validate() (reagent.validators.model_validator.ModelValidator method)
(reagent.validators.no_validation.NoValidation method)
DocList (class in reagent.core.types)
dot_value_fn() (in module reagent.gym.envs.recsim)
double_q_learning (reagent.training.C51TrainerParameters attribute)
(reagent.training.CRRTrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.ParametricDQNTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.ParametricDQNTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
doubly_robust (reagent.evaluation.cpe.CpeEstimateSet attribute)
DoublyRobustEstimator (class in reagent.evaluation.doubly_robust_estimator)
(class in reagent.ope.estimators.contextual_bandits_estimators)
(class in reagent.ope.estimators.sequential_estimators)
(class in reagent.ope.estimators.slate_estimators)
DoublyRobustHP (class in reagent.evaluation.doubly_robust_estimator)
DOWN (reagent.gym.envs.pomdp.pocman.Action attribute)
DPTrainer (class in reagent.ope.trainers.rl_tabular_trainers)
DPValueFunction (class in reagent.ope.trainers.rl_tabular_trainers)
dqn_report (reagent.workflow.types.RLTrainingReport attribute)
DqnPolicyActionSet (class in reagent.core.types)
DQNTrainer (class in reagent.training)
(class in reagent.training.dqn_trainer)
DQNTrainerBaseLightning (class in reagent.training.dqn_trainer_base)
DQNTrainerMixin (class in reagent.training.dqn_trainer_base)
DQNTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
DQNTrainingReport (class in reagent.workflow.training_reports)
DR_EPSILON (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators attribute)
drop_threshold (reagent.training.dqn_trainer.BCQConfig attribute)
dropout (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
dropout_ratio (reagent.net_builder.discrete_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.fully_connected_with_embedding.FullyConnectedWithEmbedding attribute)
(reagent.net_builder.quantile_dqn.quantile.Quantile attribute)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
dtype (reagent.replay_memory.circular_replay_buffer.DenseMetadata attribute)
Dueling (class in reagent.net_builder.discrete_dqn.dueling)
(reagent.net_builder.unions.DiscreteDQNNetBuilder__Union attribute)
DuelingQNetwork (class in reagent.models)
(class in reagent.models.dueling_q_network)
DuelingQuantile (class in reagent.net_builder.quantile_dqn.dueling_quantile)
(reagent.net_builder.unions.QRDQNNetBuilder__Union attribute)
dump_policy() (reagent.ope.test.gridworld.GridWorld method)
dump_state_values() (reagent.ope.test.gridworld.GridWorld method)
dump_value_func() (reagent.ope.test.gridworld.GridWorld method)
E
edp_to_contextual_bandit_log() (reagent.evaluation.ope_adapter.OPEstimatorAdapter static method)
edp_to_rl_input() (reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter static method)
Element (class in reagent.gym.envs.pomdp.pocman)
ElementMetadata (class in reagent.replay_memory.circular_replay_buffer)
embed() (reagent.models.seq2slate_reward.Seq2SlateGRURewardNet method)
embed_state() (reagent.gym.envs.pomdp.state_embed_env.StateEmbedEnvironment method)
Embedder (class in reagent.models.seq2slate)
embedding_dim (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
(reagent.net_builder.discrete_dqn.fully_connected_with_embedding.FullyConnectedWithEmbedding attribute)
EmbeddingBagConcat (class in reagent.models)
(class in reagent.models.embedding_bag_concat)
encode() (reagent.models.seq2slate.Seq2SlateTransformerModel method)
(reagent.models.seq2slate_reward.Seq2SlateTransformerRewardNet method)
Encoder (class in reagent.models.seq2slate)
encoder_output_to_scores() (reagent.models.seq2slate.Seq2SlateTransformerModel method)
ENCODER_SCORE (reagent.model_utils.seq2slate_utils.Seq2SlateOutputArch attribute)
ENCODER_SCORE_MODE (reagent.model_utils.seq2slate_utils.Seq2SlateMode attribute)
encoder_scores (reagent.core.types.RankingOutput attribute)
(reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
EncoderLayer (class in reagent.models.seq2slate)
EncoderPyTorch (class in reagent.models.seq2slate)
ensemble_population_size (reagent.core.parameters.CEMTrainerParameters attribute)
entropy() (reagent.gym.policies.samplers.discrete_sampler.SoftmaxActionSampler method)
entropy_coeff (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
entropy_temperature (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
entropy_weight (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
Env__Union (class in reagent.gym.envs)
env_name (reagent.gym.envs.Gym attribute)
(reagent.gym.envs.gym.Gym attribute)
(reagent.gym.Gym attribute)
Environment (class in reagent.ope.test.envs)
EnvironmentModel (class in reagent.ope.test.cartpole)
EnvWrapper (class in reagent.gym.envs.env_wrapper)
EpisodicDataset (class in reagent.gym.datasets.episodic_dataset)
EpochEndObserver (class in reagent.core.observers)
EpochListAggregator (class in reagent.core.aggregators)
epochs (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
eps (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.Adamax attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
(reagent.optimizer.uninferrable_optimizers.NAdam attribute)
(reagent.optimizer.uninferrable_optimizers.RAdam attribute)
(reagent.optimizer.uninferrable_optimizers.SparseAdam attribute)
EPS (reagent.samplers.frechet.FrechetSort attribute)
(reagent.samplers.FrechetSort attribute)
epsilon (reagent.core.parameters.CEMTrainerParameters attribute)
(reagent.core.parameters.RLParameters attribute)
EPSILON (reagent.models.actor.DirichletFullyConnectedActor attribute)
(reagent.models.DirichletFullyConnectedActor attribute)
(reagent.ope.estimators.contextual_bandits_estimators.SwitchEstimator attribute)
EpsilonGreedyActionSampler (class in reagent.gym.policies.samplers.discrete_sampler)
EpsilonGreedyRLPolicy (class in reagent.ope.estimators.sequential_estimators)
equiv_len (reagent.core.types.FrechetSortConfig attribute)
ERRSlateMetric (class in reagent.ope.estimators.slate_estimators)
estimate() (reagent.evaluation.doubly_robust_estimator.DoublyRobustEstimator method)
(reagent.evaluation.ope_adapter.OPEstimatorAdapter method)
(reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter method)
(reagent.evaluation.sequential_doubly_robust_estimator.SequentialDoublyRobustEstimator method)
(reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator method)
estimate_value() (in module reagent.ope.test.cartpole)
estimated_reward (reagent.ope.estimators.estimator.EstimatorResult attribute)
estimated_reward_normalized (reagent.ope.estimators.estimator.EstimatorResult attribute)
estimated_reward_normalized_std_error (reagent.ope.estimators.estimator.EstimatorResult attribute)
estimated_reward_std_error (reagent.ope.estimators.estimator.EstimatorResult attribute)
estimated_weight (reagent.ope.estimators.estimator.EstimatorResult attribute)
EstimatedStateValueFunction (class in reagent.ope.trainers.rl_tabular_trainers)
EstimationData (class in reagent.evaluation.doubly_robust_estimator)
Estimator (class in reagent.ope.estimators.estimator)
estimator_result_to_cpe_estimate() (reagent.evaluation.ope_adapter.OPEstimatorAdapter static method)
estimator_results_to_cpe_estimate() (reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter static method)
EstimatorResult (class in reagent.ope.estimators.estimator)
EstimatorResults (class in reagent.ope.estimators.estimator)
EstimatorSampleResult (class in reagent.ope.estimators.estimator)
EsWorker (class in reagent.training.gradient_free.es_worker)
eta_min (reagent.optimizer.uninferrable_schedulers.CosineAnnealingLR attribute)
(reagent.optimizer.uninferrable_schedulers.CosineAnnealingWarmRestarts attribute)
etas (reagent.optimizer.uninferrable_optimizers.Rprop attribute)
eval_action_idxs (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
eval_parameters (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic.td3.TD3 attribute)
(reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteDQN attribute)
(reagent.model_managers.discrete.DiscreteQRDQN attribute)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase attribute)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.parametric.ParametricDQN attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
eval_policy() (in module reagent.gym.tests.test_gym)
eval_sample_range (reagent.data.manual_data_module.TrainEvalSampleRanges attribute)
eval_table_sample (reagent.workflow.types.TableSpec attribute)
evaluate() (in module reagent.ope.test.mslr_slate)
(in module reagent.ope.test.yandex_web_search)
(reagent.evaluation.world_model_evaluator.FeatureImportanceEvaluator method)
(reagent.evaluation.world_model_evaluator.FeatureSensitivityEvaluator method)
(reagent.evaluation.world_model_evaluator.LossEvaluator method)
(reagent.ope.estimators.contextual_bandits_estimators.DMEstimator method)
(reagent.ope.estimators.contextual_bandits_estimators.IPSEstimator method)
(reagent.ope.estimators.estimator.Estimator method)
(reagent.ope.estimators.estimator.Evaluator method)
(reagent.ope.estimators.sequential_estimators.DMEstimator method)
(reagent.ope.estimators.sequential_estimators.DoublyRobustEstimator method)
(reagent.ope.estimators.sequential_estimators.IPSEstimator method)
(reagent.ope.estimators.sequential_estimators.MAGICEstimator method)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE method)
(reagent.ope.estimators.slate_estimators.DMEstimator method)
(reagent.ope.estimators.slate_estimators.DoublyRobustEstimator method)
(reagent.ope.estimators.slate_estimators.IPSEstimator method)
(reagent.ope.estimators.slate_estimators.PBMEstimator method)
(reagent.ope.estimators.slate_estimators.PseudoInverseEstimator method)
evaluate_all() (in module reagent.ope.test.multiclass_bandits)
evaluate_cem() (in module reagent.gym.tests.test_gym_offline)
evaluate_for_n_episodes() (in module reagent.gym.runners.gymrunner)
evaluate_gym() (in module reagent.workflow.gym_batch_rl)
evaluate_post_training() (reagent.evaluation.evaluator.Evaluator method)
evaluation (reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
EvaluationDataPage (class in reagent.evaluation.evaluation_data_page)
EvaluationParameters (class in reagent.core.parameters)
Evaluator (class in reagent.evaluation.evaluator)
(class in reagent.ope.estimators.estimator)
EvolutionParameters (class in reagent.core.parameters)
EvolutionPool (class in reagent.training.gradient_free.evolution_pool)
EXACT (reagent.core.parameters.SlateOptMethod attribute)
EXP_BASE (reagent.ope.estimators.contextual_bandits_estimators.SwitchEstimator attribute)
expect_slate_wise_reward (reagent.core.parameters_seq2slate.LearningMethod property)
(reagent.net_builder.slate_reward.slate_reward_gru.SlateRewardGRU property)
(reagent.net_builder.slate_reward.slate_reward_transformer.SlateRewardTransformer property)
(reagent.net_builder.slate_reward_net_builder.SlateRewardNetBuilder property)
expectations (reagent.ope.estimators.slate_estimators.SlateSlotItemExpectations property)
expected_rewards() (reagent.ope.estimators.slate_estimators.SlateSlotItemExpectations method)
explicit_mapping (reagent.core.types.IdMappingUnion attribute)
ExplicitMapIDList (class in reagent.preprocessing.sparse_preprocessor)
ExplicitMapIDScoreList (class in reagent.preprocessing.sparse_preprocessor)
ExplicitMapping (class in reagent.core.types)
exploration_variance (reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
exponent_beta (reagent.training.sac_trainer.CRRWeightFn attribute)
exponent_clamp (reagent.training.sac_trainer.CRRWeightFn attribute)
ExponentialLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
export_mlp() (reagent.models.synthetic_reward.SyntheticRewardNet method)
export_module_to_buffer() (in module reagent.core.torch_utils)
extract_state_first_step() (reagent.training.world_model.compress_model_trainer.CompressModelTrainer static method)
ExtraData (class in reagent.core.types)
extras (reagent.core.types.DiscreteDqnInput attribute)
(reagent.core.types.MemoryNetworkInput attribute)
(reagent.core.types.ParametricDqnInput attribute)
(reagent.core.types.PolicyNetworkInput attribute)
(reagent.core.types.PreprocessedRankingInput attribute)
(reagent.core.types.PreprocessedTrainingBatch attribute)
(reagent.core.types.SlateQInput attribute)
EXTRAS (reagent.preprocessing.types.InputColumn attribute)
F
f (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
fconjugate (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
feat2table (reagent.models.EmbeddingBagConcat attribute)
feature (reagent.ope.test.multiclass_bandits.MultiClassDataRow attribute)
feature_config() (reagent.models.base.ModelBase method)
(reagent.models.ModelBase method)
feature_id (reagent.core.types.FloatFeatureInfo attribute)
(reagent.core.types.IdListFeatureConfig attribute)
(reagent.core.types.IdScoreListFeatureConfig attribute)
feature_overrides (reagent.workflow.types.PreprocessingOptions attribute)
feature_transform() (in module reagent.gym.utils)
feature_type (reagent.core.parameters.NormalizationParameters attribute)
FeatureData (class in reagent.core.types)
FeatureImportanceBase (class in reagent.evaluation.feature_importance.feature_importance_base)
FeatureImportanceEvaluator (class in reagent.evaluation.world_model_evaluator)
FeatureImportancePerturbation (class in reagent.evaluation.feature_importance.feature_importance_perturbation)
features (reagent.ope.datasets.logged_dataset.BanditsDataset property)
(reagent.ope.estimators.slate_estimators.SlateSlotFeatures property)
(reagent.ope.test.mslr_slate.MSLRDatasets property)
(reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
FeatureSensitivityEvaluator (class in reagent.evaluation.world_model_evaluator)
FileSystemPublisher (class in reagent.publishers.file_system_publisher)
fill() (reagent.ope.estimators.slate_estimators.SlateSlotObjects method)
(reagent.ope.estimators.slate_estimators.SlateSlots method)
(reagent.ope.estimators.types.Items method)
fill_empty_with_zero() (reagent.evaluation.cpe.CpeEstimateSet method)
fill_replay_buffer() (in module reagent.gym.utils)
fill_union() (reagent.core.registry_meta.RegistryMeta method)
Filter (class in reagent.preprocessing.transforms)
final_div_factor (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
final_layer (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
finalize() (reagent.ope.test.yandex_web_search.TrainingQuery method)
FinalLayer (class in reagent.net_builder.slate_ranking.slate_ranking_scorer)
fit_only_one_next_step (reagent.core.parameters.MDNRNNTrainerParameters attribute)
fit_slate_wise_reward (reagent.net_builder.slate_reward.slate_reward_gru.SlateRewardGRU attribute)
(reagent.net_builder.slate_reward.slate_reward_transformer.SlateRewardTransformer attribute)
FixedLengthSequenceDenseNormalization (class in reagent.preprocessing.transforms)
FixedLengthSequences (class in reagent.preprocessing.transforms)
float_feature_infos (reagent.core.types.ModelFeatureConfig attribute)
float_features (reagent.core.types.DocList attribute)
(reagent.core.types.FeatureData attribute)
float_features_with_presence (reagent.core.types.ServingFeatureData attribute)
FloatFeatureFullyConnected (class in reagent.models.fully_connected_network)
FloatFeatureInfo (class in reagent.core.types)
flush() (reagent.core.aggregators.EpochListAggregator method)
(reagent.core.observers.IntervalAggregatingObserver method)
(reagent.core.tracker.Aggregator method)
(reagent.reporting.compound_reporter.CompoundReporter method)
(reagent.reporting.CompoundReporter method)
(reagent.reporting.reporter_base.ReporterBase method)
(reagent.reporting.ReporterBase method)
folder (reagent.ope.test.mslr_slate.MSLRDatasets property)
FOOD_PELLET (reagent.gym.envs.pomdp.pocman.Element attribute)
forward (reagent.prediction.predictor_wrapper.ActorPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.BinaryDifferenceScorerPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.DiscreteDqnPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.ParametricDqnPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.RankingActorPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.Seq2SlatePredictorWrapper attribute)
(reagent.prediction.ranking.predictor_wrapper.DeterminantalPointProcessPredictorWrapper attribute)
forward() (reagent.core.types.TensorFeatureData method)
(reagent.mab.mab_algorithm.GreedyAlgo method)
(reagent.mab.mab_algorithm.MABAlgo method)
(reagent.mab.mab_algorithm.RandomActionsAlgo method)
(reagent.mab.thompson_sampling.BaseThompsonSampling method)
(reagent.mab.ucb.BaseUCB method)
(reagent.model_managers.discrete.discrete_crr.ActorDQN method)
(reagent.models.actor.DirichletFullyConnectedActor method)
(reagent.models.actor.FullyConnectedActor method)
(reagent.models.actor.GaussianFullyConnectedActor method)
(reagent.models.actor.StochasticActor method)
(reagent.models.BatchConstrainedDQN method)
(reagent.models.bcq.BatchConstrainedDQN method)
(reagent.models.categorical_dqn.CategoricalDQN method)
(reagent.models.CategoricalDQN method)
(reagent.models.cem_planner.CEMPlannerNetwork method)
(reagent.models.convolutional_network.ConvolutionalNetwork method)
(reagent.models.critic.FullyConnectedCritic method)
(reagent.models.DirichletFullyConnectedActor method)
(reagent.models.dqn.FullyConnectedDQN method)
(reagent.models.dueling_q_network.DuelingQNetwork method)
(reagent.models.dueling_q_network.ParametricDuelingQNetwork method)
(reagent.models.DuelingQNetwork method)
(reagent.models.embedding_bag_concat.EmbeddingBagConcat method)
(reagent.models.EmbeddingBagConcat method)
(reagent.models.fully_connected_network.FloatFeatureFullyConnected method)
(reagent.models.fully_connected_network.FullyConnectedNetwork method)
(reagent.models.fully_connected_network.SlateBatchNorm1d method)
(reagent.models.FullyConnectedActor method)
(reagent.models.FullyConnectedCritic method)
(reagent.models.FullyConnectedDQN method)
(reagent.models.FullyConnectedNetwork method)
(reagent.models.GaussianFullyConnectedActor method)
(reagent.models.linear_regression.LinearRegressionUCB method)
(reagent.models.mdn_rnn.MDNRNN method)
(reagent.models.mlp_scorer.MLPScorer method)
(reagent.models.MLPScorer method)
(reagent.models.ParametricDuelingQNetwork method)
(reagent.models.seq2reward_model.Seq2RewardNetwork method)
(reagent.models.Seq2RewardNetwork method)
(reagent.models.seq2slate.BaselineNet method)
(reagent.models.seq2slate.Decoder method)
(reagent.models.seq2slate.DecoderLastLayerPytorch method)
(reagent.models.seq2slate.DecoderLayer method)
(reagent.models.seq2slate.DecoderPyTorch method)
(reagent.models.seq2slate.Embedder method)
(reagent.models.seq2slate.Encoder method)
(reagent.models.seq2slate.EncoderLayer method)
(reagent.models.seq2slate.EncoderPyTorch method)
(reagent.models.seq2slate.Generator method)
(reagent.models.seq2slate.MultiHeadedAttention method)
(reagent.models.seq2slate.PositionalEncoding method)
(reagent.models.seq2slate.PositionwiseFeedForward method)
(reagent.models.seq2slate.Seq2SlateNet method)
(reagent.models.seq2slate.Seq2SlateTransformerModel method)
(reagent.models.seq2slate.SublayerConnection method)
(reagent.models.seq2slate_reward.Seq2SlateGRURewardNet method)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetEnsemble method)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetJITWrapper method)
(reagent.models.seq2slate_reward.Seq2SlateTransformerRewardNet method)
(reagent.models.synthetic_reward.Concat method)
(reagent.models.synthetic_reward.NGramConvolutionalNetwork method)
(reagent.models.synthetic_reward.NGramFullyConnectedNetwork method)
(reagent.models.synthetic_reward.PETransformerEncoderLayer method)
(reagent.models.synthetic_reward.PositionalEncoding method)
(reagent.models.synthetic_reward.ResidualBlock method)
(reagent.models.synthetic_reward.SequenceSyntheticRewardNet method)
(reagent.models.synthetic_reward.SequentialMultiArguments method)
(reagent.models.synthetic_reward.SingleStepSyntheticRewardNet method)
(reagent.models.synthetic_reward.SyntheticRewardNet method)
(reagent.models.synthetic_reward.TransformerSyntheticRewardNet method)
(reagent.models.world_model.MemoryNetwork method)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.ScoreCap method)
(reagent.ope.test.cartpole.EnvironmentModel method)
(reagent.ope.trainers.linear_trainers.LinearNet method)
(reagent.prediction.predictor_wrapper.ActorWithPreprocessor method)
(reagent.prediction.predictor_wrapper.BinaryDifferenceScorerWithPreprocessor method)
(reagent.prediction.predictor_wrapper.CompressModelWithPreprocessor method)
(reagent.prediction.predictor_wrapper.DiscreteDqnWithPreprocessor method)
(reagent.prediction.predictor_wrapper.LearnVMSlateWithPreprocessor method)
(reagent.prediction.predictor_wrapper.MDNRNNWithPreprocessor method)
(reagent.prediction.predictor_wrapper.OSSPredictorUnwrapper method)
(reagent.prediction.predictor_wrapper.OSSSparsePredictorUnwrapper method)
(reagent.prediction.predictor_wrapper.ParametricDqnWithPreprocessor method)
(reagent.prediction.predictor_wrapper.RankingActorWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2RewardPlanShortSeqWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2RewardWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2SlateRewardWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2SlateWithPreprocessor method)
(reagent.prediction.predictor_wrapper.SlateRankingPreprocessor method)
(reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper.SyntheticRewardPredictorWrapper method)
(reagent.preprocessing.batch_preprocessor.DiscreteDqnBatchPreprocessor method)
(reagent.preprocessing.batch_preprocessor.ParametricDqnBatchPreprocessor method)
(reagent.preprocessing.batch_preprocessor.PolicyNetworkBatchPreprocessor method)
(reagent.preprocessing.postprocessor.Postprocessor method)
(reagent.preprocessing.preprocessor.Preprocessor method)
(reagent.preprocessing.sparse_preprocessor.ExplicitMapIDList method)
(reagent.preprocessing.sparse_preprocessor.ExplicitMapIDScoreList method)
(reagent.preprocessing.sparse_preprocessor.MapIDList method)
(reagent.preprocessing.sparse_preprocessor.MapIDScoreList method)
(reagent.preprocessing.sparse_preprocessor.ModuloMapIDList method)
(reagent.preprocessing.sparse_preprocessor.ModuloMapIDScoreList method)
frac_train (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
frac_valid (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
FRECHET_SORT (reagent.model_utils.seq2slate_utils.Seq2SlateOutputArch attribute)
FrechetDistribution (class in reagent.ope.estimators.slate_estimators)
FrechetSort (class in reagent.samplers)
(class in reagent.samplers.frechet)
FrechetSortConfig (class in reagent.core.types)
from_dict() (reagent.core.types.BanditRewardModelInput class method)
(reagent.core.types.BaseInput static method)
(reagent.core.types.CBInput class method)
(reagent.core.types.DiscreteDqnInput class method)
(reagent.core.types.ExtraData class method)
(reagent.core.types.MemoryNetworkInput class method)
(reagent.core.types.ParametricDqnInput class method)
(reagent.core.types.PolicyGradientInput class method)
(reagent.core.types.PolicyNetworkInput class method)
(reagent.core.types.SlateQInput class method)
from_grid() (reagent.ope.test.gridworld.GridWorld class method)
from_input() (reagent.core.types.PreprocessedRankingInput class method)
from_tensors() (reagent.core.types.PreprocessedRankingInput class method)
FullyConnected (class in reagent.net_builder.continuous_actor.fully_connected)
(class in reagent.net_builder.discrete_actor.fully_connected)
(class in reagent.net_builder.discrete_dqn.fully_connected)
(class in reagent.net_builder.parametric_dqn.fully_connected)
(class in reagent.net_builder.value.fully_connected)
(reagent.net_builder.unions.ContinuousActorNetBuilder__Union attribute)
(reagent.net_builder.unions.DiscreteActorNetBuilder__Union attribute)
(reagent.net_builder.unions.DiscreteDQNNetBuilder__Union attribute)
(reagent.net_builder.unions.ParametricDQNNetBuilder__Union attribute)
(reagent.net_builder.unions.ValueNetBuilder__Union attribute)
FullyConnectedActor (class in reagent.models)
(class in reagent.models.actor)
FullyConnectedCritic (class in reagent.models)
(class in reagent.models.critic)
FullyConnectedDQN (class in reagent.models)
(class in reagent.models.dqn)
FullyConnectedNetwork (class in reagent.models)
(class in reagent.models.fully_connected_network)
FullyConnectedWithEmbedding (class in reagent.net_builder.discrete_dqn.fully_connected_with_embedding)
(reagent.net_builder.unions.DiscreteDQNNetBuilder__Union attribute)
FunctionsByActionAggregator (class in reagent.core.aggregators)
G
gamma (reagent.core.parameters.RLParameters attribute)
(reagent.core.parameters.Seq2RewardTrainerParameters attribute)
(reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
(reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.ExponentialLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiStepLR attribute)
(reagent.optimizer.uninferrable_schedulers.StepLR attribute)
(reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
gather() (in module reagent.core.torch_utils)
gather_eval_data() (reagent.training.dqn_trainer_base.DQNTrainerBaseLightning method)
gaussian_fill_w_gain() (in module reagent.models.fully_connected_network)
GaussianFullyConnected (class in reagent.net_builder.continuous_actor.gaussian_fully_connected)
(reagent.net_builder.unions.ContinuousActorNetBuilder__Union attribute)
GaussianFullyConnectedActor (class in reagent.models)
(class in reagent.models.actor)
GaussianSampler (class in reagent.gym.policies.samplers.continuous_sampler)
GaussianSamplerScore (class in reagent.gym.types)
gen_permutations() (in module reagent.training.utils)
generate_log() (reagent.ope.test.envs.PolicyLogGenerator method)
generate_logs() (in module reagent.ope.test.cartpole)
generate_training_report() (reagent.reporting.actor_critic_reporter.ActorCriticReporter method)
(reagent.reporting.compound_reporter.CompoundReporter method)
(reagent.reporting.CompoundReporter method)
(reagent.reporting.discrete_crr_reporter.DiscreteCRRReporter method)
(reagent.reporting.discrete_dqn_reporter.DiscreteDQNReporter method)
(reagent.reporting.parametric_dqn_reporter.ParametricDQNReporter method)
(reagent.reporting.reporter_base.ReporterBase method)
(reagent.reporting.ReporterBase method)
(reagent.reporting.seq2reward_reporter.Seq2RewardReporter method)
(reagent.reporting.slate_q_reporter.SlateQReporter method)
(reagent.reporting.world_model_reporter.WorldModelReporter method)
Generator (class in reagent.models.seq2slate)
get() (reagent.net_builder.slate_ranking.slate_ranking_scorer.FinalLayer method)
(reagent.replay_memory.sum_tree.SumTree method)
get_action() (reagent.mab.mab_algorithm.MABAlgo method)
get_action_extractor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
get_action_preprocessing_options() (reagent.model_managers.actor_critic_base.ActorCriticBase method)
get_add_args_signature() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
get_arm_indices() (in module reagent.mab.mab_algorithm)
get_avg_reward_values() (reagent.mab.mab_algorithm.MABAlgo method)
get_bernoulli_tuned_ucb_scores() (in module reagent.mab.ucb)
get_cumulative_distributions() (reagent.core.aggregators.ActionCountAggregator method)
get_data_module() (reagent.model_managers.actor_critic_base.ActorCriticBase method)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward method)
(reagent.model_managers.model_based.SyntheticReward method)
(reagent.model_managers.model_manager.ModelManager method)
get_dataloader() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
get_default_score_fns() (in module reagent.gym.envs.oracle_pvm)
get_detached_model_outputs() (reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
(reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.DQNTrainer method)
(reagent.training.parametric_dqn_trainer.ParametricDQNTrainer method)
(reagent.training.ParametricDQNTrainer method)
(reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
get_device() (in module reagent.core.torch_utils)
get_distinct_keys() (in module reagent.data.oss_data_fetcher)
get_distributed_data_parallel_model() (reagent.models.actor.StochasticActor method)
(reagent.models.base.ModelBase method)
(reagent.models.ModelBase method)
(reagent.models.seq2slate.Seq2SlateNet method)
get_distributions() (reagent.core.aggregators.ActionCountAggregator method)
get_feature_config() (in module reagent.preprocessing.normalization)
get_feature_norm_metadata() (in module reagent.preprocessing.normalization)
get_feature_start_indices() (in module reagent.preprocessing.normalization)
get_ground_truth_weights() (in module reagent.gym.envs.oracle_pvm)
get_initial_hidden_state() (reagent.models.mdn_rnn.MDNRNN method)
(reagent.models.seq2reward_model.Seq2RewardNetwork method)
(reagent.models.Seq2RewardNetwork method)
get_initial_mus() (in module reagent.gym.envs.changing_arms)
get_legal_indices_mask() (in module reagent.gym.envs.changing_arms)
get_log_prob() (reagent.models.actor.DirichletFullyConnectedActor method)
(reagent.models.actor.GaussianFullyConnectedActor method)
(reagent.models.DirichletFullyConnectedActor method)
(reagent.models.GaussianFullyConnectedActor method)
get_loss() (reagent.training.MDNRNNTrainer method)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer method)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer method)
get_max_q_values() (reagent.training.dqn_trainer_base.DQNTrainerMixin method)
get_max_q_values_with_target() (reagent.training.dqn_trainer_base.DQNTrainerMixin method)
get_mean_of_recent_values() (in module reagent.core.report_utils)
get_metrics_to_score() (in module reagent.evaluation.evaluator)
get_model_feature_config() (reagent.models.model_feature_config_provider.ModelFeatureConfigProvider method)
(reagent.models.model_feature_config_provider.RawModelFeatureConfigProvider method)
get_mse_loss() (reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
get_mu_changes() (in module reagent.gym.envs.changing_arms)
get_new_named_entity_ids() (in module reagent.workflow.env)
get_normalization_data_map() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.data.reagent_data_module.ReAgentDataModule method)
(reagent.data.ReAgentDataModule method)
get_num_output_features() (in module reagent.preprocessing.normalization)
get_obs_preprocessor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
get_observation() (reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
get_observing_keys() (reagent.core.tracker.Observer method)
get_optimizers() (reagent.training.ppo_trainer.PPOTrainer method)
(reagent.training.PPOTrainer method)
get_optional_fields() (in module reagent.gym.types)
get_parametric_input() (in module reagent.gym.policies.scorers.discrete_scorer)
get_petastorm_dataloader() (in module reagent.workflow.utils)
get_possible_actions_for_gym() (in module reagent.gym.preprocessors.trainer_preprocessor)
get_priority() (reagent.replay_memory.prioritized_replay_buffer.PrioritizedReplayBuffer method)
(reagent.replay_memory.PrioritizedReplayBuffer method)
get_Q() (in module reagent.training.world_model.seq2reward_trainer)
get_rank() (in module reagent.core.utils)
(in module reagent.workflow.utils)
get_ranking_state() (reagent.core.types.FeatureData method)
get_reporter() (reagent.model_managers.actor_critic.SAC method)
(reagent.model_managers.actor_critic.sac.SAC method)
(reagent.model_managers.actor_critic.TD3 method)
(reagent.model_managers.actor_critic.td3.TD3 method)
(reagent.model_managers.actor_critic_base.ActorCriticBase method)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN method)
(reagent.model_managers.discrete.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteDQN method)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase method)
(reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel method)
(reagent.model_managers.model_based.Seq2RewardModel method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward method)
(reagent.model_managers.model_based.SyntheticReward method)
(reagent.model_managers.model_manager.ModelManager method)
(reagent.model_managers.slate_q_base.SlateQBase method)
get_reward() (reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
get_sample_range() (in module reagent.data.manual_data_module)
get_scores_from_batch() (reagent.mab.mab_algorithm.MABAlgo class method)
get_serving_action_extractor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
get_serving_obs_preprocessor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
get_spark_session() (in module reagent.data.spark_utils)
get_state_preprocessing_options() (reagent.model_managers.actor_critic_base.ActorCriticBase method)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase method)
get_step_entropy_loss() (reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
get_step_prediction() (in module reagent.training.world_model.seq2reward_trainer)
get_storage_signature() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
get_table_row_count() (in module reagent.workflow.utils)
get_table_url() (in module reagent.data.spark_utils)
get_target_distribution_error() (reagent.evaluation.evaluator.Evaluator method)
get_target_network() (reagent.models.base.ModelBase method)
(reagent.models.ModelBase method)
get_tensor() (in module reagent.evaluation.evaluator)
get_tiled_batch() (reagent.core.types.FeatureData method)
get_torch_lr_schedulers() (in module reagent.optimizer.scheduler_union)
get_torch_optimizers() (in module reagent.optimizer.union)
get_transition_elements() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.prioritized_replay_buffer.PrioritizedReplayBuffer method)
(reagent.replay_memory.PrioritizedReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
get_ucb_scores() (reagent.mab.ucb.BaseUCB method)
(reagent.mab.ucb.MetricUCB method)
(reagent.mab.ucb.UCB1 method)
get_valid_actions_from_imitator() (in module reagent.training.imitator_training)
get_weight_from_advantage() (reagent.training.sac_trainer.CRRWeightFn method)
get_workflow_id() (in module reagent.workflow.env)
GetEye (class in reagent.preprocessing.transforms)
Ghost (class in reagent.gym.envs.pomdp.pocman)
gmm_loss() (in module reagent.models.mdn_rnn)
gpu (reagent.workflow.types.ResourceOptions attribute)
GREEDY (reagent.core.parameters.SlateOptMethod attribute)
greedy (reagent.core.types.DqnPolicyActionSet attribute)
greedy() (reagent.ope.estimators.types.Values method)
greedy_act_name (reagent.core.types.DqnPolicyActionSet attribute)
greedy_select() (reagent.prediction.ranking.predictor_wrapper.DeterminantalPointProcessPredictorWrapper method)
greedy_serving (reagent.core.parameters.RankingParameters attribute)
GreedyActionSampler (class in reagent.gym.policies.samplers.discrete_sampler)
GreedyAlgo (class in reagent.mab.mab_algorithm)
GridWorld (class in reagent.ope.test.gridworld)
ground_truth (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
ground_truth_reward (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
(reagent.ope.estimators.estimator.EstimatorResult attribute)
(reagent.ope.estimators.estimator.EstimatorSampleResult attribute)
(reagent.ope.estimators.slate_estimators.LogSample attribute)
gru (reagent.net_builder.slate_reward.slate_reward_gru.SlateRewardGRU attribute)
GRUParameters (class in reagent.core.parameters)
gumbel_softmax() (in module reagent.lite.optimizer)
GumbelSoftmaxOptimizer (class in reagent.lite.optimizer)
Gym (class in reagent.gym)
(class in reagent.gym.envs)
(class in reagent.gym.envs.gym)
(reagent.gym.envs.Env__Union attribute)
H
has_float_features_only (reagent.core.types.FeatureData property)
has_model_outputs (reagent.ope.estimators.contextual_bandits_estimators.BanditsEstimatorInput attribute)
has_test_step_override() (in module reagent.training.reagent_lightning_module)
has_user_feat (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
hash_mdp_id_and_subsample() (in module reagent.data.oss_data_fetcher)
hidden_dim (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
hidden_layers (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
hidden_size (reagent.core.parameters.MDNRNNTrainerParameters attribute)
history_size (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
home (reagent.gym.envs.pomdp.pocman.Ghost attribute)
horizon (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
huber() (reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
huberLoss() (reagent.evaluation.evaluator.Evaluator static method)
I
id2config (reagent.core.types.ModelFeatureConfig property)
id2index (reagent.core.types.ExplicitMapping property)
id2name (reagent.core.types.ModelFeatureConfig property)
id_list_feature_configs (reagent.core.types.ModelFeatureConfig attribute)
id_list_features (reagent.core.types.FeatureData attribute)
(reagent.core.types.ServingFeatureData attribute)
id_mapping_config (reagent.core.types.ModelFeatureConfig attribute)
id_mapping_name (reagent.core.types.IdListFeatureConfig attribute)
(reagent.core.types.IdScoreListFeatureConfig attribute)
id_score_list_feature_configs (reagent.core.types.ModelFeatureConfig attribute)
id_score_list_features (reagent.core.types.FeatureData attribute)
(reagent.core.types.ServingFeatureData attribute)
identify_and_train_network() (in module reagent.workflow.training)
identify_normalization_parameters() (in module reagent.workflow.identify_types_flow)
identify_parameter() (in module reagent.preprocessing.normalization)
identify_sparse_normalization_parameters() (in module reagent.workflow.identify_types_flow)
identify_type() (in module reagent.preprocessing.identify_types)
identity_collate() (in module reagent.gym.tests.test_gym)
(in module reagent.gym.tests.test_gym_offline)
IdListFeatureConfig (class in reagent.core.types)
IDListMetadata (class in reagent.replay_memory.circular_replay_buffer)
IdMappingUnion (class in reagent.core.types)
ids (reagent.core.types.ExplicitMapping attribute)
IdScoreListFeatureConfig (class in reagent.core.types)
IDScoreListMetadata (class in reagent.replay_memory.circular_replay_buffer)
importance_weight (reagent.evaluation.doubly_robust_estimator.ImportanceSamplingData attribute)
ImportanceSamplingData (class in reagent.evaluation.doubly_robust_estimator)
increase_global_step() (reagent.core.tensorboardX.SummaryWriterContext class method)
increase_next_stopping_epochs() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
index_of() (reagent.ope.estimators.types.Items method)
(reagent.ope.estimators.types.Objects method)
indicator_fn_threshold (reagent.training.sac_trainer.CRRWeightFn attribute)
indices_to_raw_choices() (reagent.lite.optimizer.ComboOptimizerBase method)
infer_action_names() (in module reagent.data.oss_data_fetcher)
infer_metrics_names() (in module reagent.data.oss_data_fetcher)
infer_states_names() (in module reagent.data.oss_data_fetcher)
info (reagent.gym.types.Transition attribute)
initial_seed (reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
(reagent.gym.envs.toy_vm.ToyVM attribute)
(reagent.gym.envs.ToyVM attribute)
initialize_buffer() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
initialize_seed() (in module reagent.workflow.gym_batch_rl)
input_prototype() (reagent.core.types.CBInput class method)
(reagent.core.types.DiscreteDqnInput class method)
(reagent.core.types.PolicyGradientInput class method)
(reagent.model_managers.discrete.discrete_crr.ActorDQN method)
(reagent.models.actor.DirichletFullyConnectedActor method)
(reagent.models.actor.FullyConnectedActor method)
(reagent.models.actor.GaussianFullyConnectedActor method)
(reagent.models.actor.StochasticActor method)
(reagent.models.base.ModelBase method)
(reagent.models.BatchConstrainedDQN method)
(reagent.models.bcq.BatchConstrainedDQN method)
(reagent.models.categorical_dqn.CategoricalDQN method)
(reagent.models.CategoricalDQN method)
(reagent.models.containers.Sequential method)
(reagent.models.critic.FullyConnectedCritic method)
(reagent.models.DirichletFullyConnectedActor method)
(reagent.models.dueling_q_network.DuelingQNetwork method)
(reagent.models.dueling_q_network.ParametricDuelingQNetwork method)
(reagent.models.DuelingQNetwork method)
(reagent.models.embedding_bag_concat.EmbeddingBagConcat method)
(reagent.models.EmbeddingBagConcat method)
(reagent.models.fully_connected_network.FloatFeatureFullyConnected method)
(reagent.models.fully_connected_network.FullyConnectedNetwork method)
(reagent.models.FullyConnectedActor method)
(reagent.models.FullyConnectedCritic method)
(reagent.models.FullyConnectedNetwork method)
(reagent.models.GaussianFullyConnectedActor method)
(reagent.models.linear_regression.LinearRegressionUCB method)
(reagent.models.mlp_scorer.MLPScorer method)
(reagent.models.MLPScorer method)
(reagent.models.ModelBase method)
(reagent.models.ParametricDuelingQNetwork method)
(reagent.models.seq2reward_model.Seq2RewardNetwork method)
(reagent.models.Seq2RewardNetwork method)
(reagent.models.seq2slate.Seq2SlateNet method)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetBase method)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetJITWrapper method)
(reagent.models.Sequential method)
(reagent.models.world_model.MemoryNetwork method)
(reagent.prediction.predictor_wrapper.ActorWithPreprocessor method)
(reagent.prediction.predictor_wrapper.BinaryDifferenceScorerWithPreprocessor method)
(reagent.prediction.predictor_wrapper.DiscreteDqnWithPreprocessor method)
(reagent.prediction.predictor_wrapper.LearnVMSlateWithPreprocessor method)
(reagent.prediction.predictor_wrapper.MDNRNNWithPreprocessor method)
(reagent.prediction.predictor_wrapper.ParametricDqnWithPreprocessor method)
(reagent.prediction.predictor_wrapper.RankingActorWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2SlateRewardWithPreprocessor method)
(reagent.prediction.predictor_wrapper.Seq2SlateWithPreprocessor method)
(reagent.prediction.predictor_wrapper.SlateRankingPreprocessor method)
(reagent.preprocessing.postprocessor.Postprocessor method)
(reagent.preprocessing.preprocessor.Preprocessor method)
input_to_storage() (reagent.replay_memory.circular_replay_buffer.DenseMetadata method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata method)
InputColumn (class in reagent.preprocessing.types)
insert() (reagent.lite.optimizer.BestResultsQueue method)
insert_into_memory() (reagent.models.mdn_rnn.MDNRNNMemoryPool method)
InternalState (class in reagent.gym.envs.pomdp.pocman)
IntervalAggregatingObserver (class in reagent.core.observers)
inverse_propensity (reagent.evaluation.cpe.CpeEstimateSet attribute)
ips_clamp (reagent.core.parameters.Seq2SlateParameters attribute)
ips_clamp() (in module reagent.training.ranking.helper)
IPSClamp (class in reagent.core.parameters_seq2slate)
IPSClampMethod (class in reagent.core.parameters_seq2slate)
IPSEstimator (class in reagent.ope.estimators.contextual_bandits_estimators)
(class in reagent.ope.estimators.sequential_estimators)
(class in reagent.ope.estimators.slate_estimators)
is_array() (in module reagent.ope.estimators.types)
is_deterministic (reagent.ope.estimators.slate_estimators.SlateItemProbabilities property)
is_empty() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
is_fb_environment() (in module reagent.core.fb_checker)
is_full() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
is_interest_exploration (reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
is_match() (reagent.gym.envs.oracle_pvm.OraclePVM method)
(reagent.gym.envs.OraclePVM method)
is_pos_def() (reagent.gym.envs.dynamics.linear_dynamics.LinDynaEnv static method)
is_sequence (reagent.ope.estimators.types.Items property)
(reagent.ope.estimators.types.Objects property)
is_strict_subclass() (in module reagent.optimizer.utils)
is_terminal (reagent.ope.estimators.sequential_estimators.State attribute)
is_to_calculate_expectation() (in module reagent.ope.estimators.slate_estimators)
is_torch_lr_scheduler() (in module reagent.optimizer.utils)
is_torch_optimizer() (in module reagent.optimizer.utils)
is_trained (reagent.ope.estimators.types.Trainer property)
is_valid_transition() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
isinstance_namedtuple() (in module reagent.core.types)
ITEM (reagent.core.parameters.NormalizationKey attribute)
item_feature (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
item_feature_config (reagent.model_managers.slate_q_base.SlateQBase property)
item_features (reagent.ope.estimators.slate_estimators.LogSample attribute)
item_float_features (reagent.model_managers.slate_q_base.SlateQBase attribute)
ITEM_MASK (reagent.preprocessing.types.InputColumn attribute)
item_preprocessing_options (reagent.model_managers.slate_q_base.SlateQBase attribute)
ITEM_PROBABILITY (reagent.preprocessing.types.InputColumn attribute)
item_relevances() (reagent.ope.test.mslr_slate.MSLRModel method)
(reagent.ope.test.yandex_web_search.TrainingDataset method)
item_rewards() (reagent.ope.estimators.slate_estimators.SlateModel method)
(reagent.ope.test.mslr_slate.MSLRModel method)
(reagent.ope.test.yandex_web_search.YandexSlateModel method)
Items (class in reagent.ope.estimators.types)
items (reagent.ope.estimators.slate_estimators.LogSample property)
(reagent.ope.estimators.slate_estimators.Slate property)
(reagent.ope.estimators.slate_estimators.SlateItemFeatures property)
(reagent.ope.estimators.slate_estimators.SlateItemValues property)
(reagent.ope.estimators.types.Objects attribute)
(reagent.ope.estimators.types.Values attribute)
K
Kernel (class in reagent.prediction.ranking.predictor_wrapper)
KEY (reagent.gym.envs.wrappers.recsim.ValueWrapper attribute)
keys (reagent.ope.estimators.types.Objects property)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata attribute)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata attribute)
L
L1Loss (reagent.training.reward_network_trainer.LossFunction attribute)
label (reagent.ope.test.multiclass_bandits.MultiClassDataRow attribute)
labels (reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
Lambda (class in reagent.preprocessing.transforms)
LambdaLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
LassoTrainer (class in reagent.ope.trainers.linear_trainers)
last_epoch (reagent.optimizer.uninferrable_schedulers.CosineAnnealingLR attribute)
(reagent.optimizer.uninferrable_schedulers.CosineAnnealingWarmRestarts attribute)
(reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.ExponentialLR attribute)
(reagent.optimizer.uninferrable_schedulers.LambdaLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiplicativeLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiStepLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
(reagent.optimizer.uninferrable_schedulers.StepLR attribute)
last_layer_activation (reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.sequence_synthetic_reward.SequenceSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
last_state (reagent.ope.estimators.sequential_estimators.Transition attribute)
last_step_lstm_cell (reagent.core.types.MemoryNetworkOutput attribute)
last_step_lstm_hidden (reagent.core.types.MemoryNetworkOutput attribute)
layer_norm_eps (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
lazy_property (class in reagent.core.utils)
LBFGS (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
learning_method (reagent.core.parameters.Seq2SlateParameters attribute)
learning_rate (reagent.core.parameters.EvolutionParameters attribute)
(reagent.core.parameters.MDNRNNTrainerParameters attribute)
(reagent.core.parameters.Seq2RewardTrainerParameters attribute)
LearningMethod (class in reagent.core.parameters_seq2slate)
LearningRateScheduler__Union (class in reagent.optimizer.scheduler_union)
LearningRateSchedulerConfig (class in reagent.optimizer.scheduler)
LearnVMSlateWithPreprocessor (class in reagent.prediction.predictor_wrapper)
LEFT (reagent.gym.envs.pomdp.pocman.Action attribute)
LinDynaEnv (class in reagent.gym.envs.dynamics.linear_dynamics)
line_search_fn (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
Linear (reagent.prediction.ranking.predictor_wrapper.Kernel attribute)
LinearLR (reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
LinearNet (class in reagent.ope.trainers.linear_trainers)
LinearRegressionUCB (class in reagent.models.linear_regression)
LinearTrainer (class in reagent.ope.trainers.linear_trainers)
LinUCBTrainer (class in reagent.training.cb.linucb_trainer)
LinUCBTrainerParameters (class in reagent.training.parameters)
list (reagent.ope.test.yandex_web_search.LoggedQuery property)
ListAggregator (class in reagent.core.aggregators)
load() (reagent.ope.test.mslr_slate.MSLRDatasets method)
(reagent.ope.trainers.rl_tabular_trainers.TabularPolicy method)
(reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
load_dataset() (in module reagent.ope.test.mslr_slate)
load_logged_queries() (in module reagent.ope.test.yandex_web_search)
load_model() (reagent.ope.estimators.types.Trainer method)
load_queries() (reagent.ope.test.yandex_web_search.TrainingDataset method)
loc (reagent.gym.types.GaussianSamplerScore attribute)
log (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
log() (reagent.evaluation.cpe.CpeDetails method)
(reagent.evaluation.cpe.CpeEstimateSet method)
(reagent.reporting.compound_reporter.CompoundReporter method)
(reagent.reporting.CompoundReporter method)
(reagent.reporting.reporter_base.ReporterBase method)
(reagent.reporting.ReporterBase method)
log_action (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
log_action_probabilities (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
log_dist() (reagent.models.categorical_dqn.CategoricalDQN method)
(reagent.models.CategoricalDQN method)
log_prob (reagent.core.types.ActorOutput attribute)
(reagent.core.types.CBInput attribute)
(reagent.core.types.PolicyGradientInput attribute)
(reagent.gym.types.Transition attribute)
log_prob() (reagent.gym.policies.samplers.continuous_sampler.GaussianSampler method)
(reagent.gym.policies.samplers.discrete_sampler.EpsilonGreedyActionSampler method)
(reagent.gym.policies.samplers.discrete_sampler.GreedyActionSampler method)
(reagent.gym.policies.samplers.discrete_sampler.SoftmaxActionSampler method)
(reagent.gym.policies.samplers.top_k_sampler.TopKSampler method)
(reagent.gym.types.Sampler method)
(reagent.samplers.frechet.FrechetSort method)
(reagent.samplers.FrechetSort method)
log_probs (reagent.core.types.RankingOutput attribute)
log_reward (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
(reagent.ope.estimators.estimator.EstimatorResult attribute)
(reagent.ope.estimators.estimator.EstimatorSampleResult attribute)
(reagent.ope.estimators.slate_estimators.LogSample attribute)
log_scores (reagent.core.types.FrechetSortConfig attribute)
log_slate (reagent.ope.estimators.slate_estimators.LogSample attribute)
log_slate_probability() (reagent.ope.estimators.slate_estimators.LogSample method)
log_slot_item_expectations() (reagent.ope.estimators.slate_estimators.LogSample method)
log_to_tensorboard() (reagent.evaluation.cpe.CpeDetails method)
(reagent.evaluation.cpe.CpeEstimateSet method)
logged_action_uniform_prior (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
logged_metrics (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
logged_metrics_values (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
logged_propensities (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
logged_propensities_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
logged_propensities_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
logged_rewards (reagent.evaluation.doubly_robust_estimator.ImportanceSamplingData attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
logged_rewards_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
logged_rewards_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
logged_values (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
LoggedQuery (class in reagent.ope.test.yandex_web_search)
logger_data (reagent.workflow.types.RLTrainingOutput attribute)
LogisticRegressionTrainer (class in reagent.ope.trainers.linear_trainers)
LogitBasedComboOptimizerBase (class in reagent.lite.optimizer)
logpi (reagent.core.types.MemoryNetworkOutput attribute)
LogSample (class in reagent.ope.estimators.contextual_bandits_estimators)
(class in reagent.ope.estimators.slate_estimators)
loss_callback_fn (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
loss_type (reagent.training.parameters.RewardNetworkTrainerParameters attribute)
(reagent.training.RewardNetworkTrainerParameters attribute)
LossEvaluator (class in reagent.evaluation.world_model_evaluator)
LossFunction (class in reagent.training.reward_network_trainer)
lr (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.Adamax attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
(reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
(reagent.optimizer.uninferrable_optimizers.NAdam attribute)
(reagent.optimizer.uninferrable_optimizers.RAdam attribute)
(reagent.optimizer.uninferrable_optimizers.Rprop attribute)
(reagent.optimizer.uninferrable_optimizers.SGD attribute)
(reagent.optimizer.uninferrable_optimizers.SparseAdam attribute)
lr_lambda (reagent.optimizer.uninferrable_schedulers.LambdaLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiplicativeLR attribute)
lr_schedulers (reagent.optimizer.optimizer.OptimizerConfig attribute)
LRUCache (class in reagent.ope.utils)
lstm_bidirectional (reagent.net_builder.synthetic_reward.sequence_synthetic_reward.SequenceSyntheticReward attribute)
lstm_hidden_size (reagent.net_builder.synthetic_reward.sequence_synthetic_reward.SequenceSyntheticReward attribute)
lstm_num_layers (reagent.net_builder.synthetic_reward.sequence_synthetic_reward.SequenceSyntheticReward attribute)
M
MAB (class in reagent.mab.simulation)
MABAlgo (class in reagent.mab.mab_algorithm)
magic (reagent.evaluation.cpe.CpeEstimateSet attribute)
MAGICEstimator (class in reagent.ope.estimators.sequential_estimators)
make() (reagent.gym.envs.changing_arms.ChangingArms method)
(reagent.gym.envs.ChangingArms method)
(reagent.gym.envs.env_wrapper.EnvWrapper method)
(reagent.gym.envs.Gym method)
(reagent.gym.envs.gym.Gym method)
(reagent.gym.envs.RecSim method)
(reagent.gym.envs.recsim.RecSim method)
(reagent.gym.envs.toy_vm.ToyVM method)
(reagent.gym.envs.ToyVM method)
(reagent.gym.Gym method)
make_agent_from_model() (in module reagent.workflow.gym_batch_rl)
make_config_class() (in module reagent.core.configuration)
make_default_score_fn() (in module reagent.gym.envs.oracle_pvm)
make_existence_bitvector_udf() (in module reagent.data.oss_data_fetcher)
make_from_optimizer() (reagent.optimizer.scheduler.LearningRateSchedulerConfig method)
make_fully_connected() (reagent.models.dueling_q_network.DuelingQNetwork class method)
(reagent.models.dueling_q_network.ParametricDuelingQNetwork class method)
(reagent.models.DuelingQNetwork class method)
(reagent.models.ParametricDuelingQNetwork class method)
make_get_step_udf() (in module reagent.data.oss_data_fetcher)
make_next_udf() (in module reagent.data.oss_data_fetcher)
make_optimizer_scheduler() (reagent.optimizer.optimizer.OptimizerConfig method)
(reagent.optimizer.Optimizer__Union method)
(reagent.optimizer.soft_update.SoftUpdate class method)
(reagent.optimizer.SoftUpdate class method)
(reagent.optimizer.union.Optimizer__Union method)
make_random_policy_for_env() (in module reagent.gym.policies.random_policies)
make_replay_buffer_inserter() (in module reagent.gym.preprocessors)
(in module reagent.gym.preprocessors.replay_buffer_inserters)
make_replay_buffer_trainer_preprocessor() (in module reagent.gym.preprocessors)
(in module reagent.gym.preprocessors.trainer_preprocessor)
make_replay_element() (in module reagent.replay_memory.circular_replay_buffer)
make_slate() (in module reagent.ope.estimators.slate_estimators)
make_slot_item_distributions() (in module reagent.ope.estimators.slate_estimators)
make_sparse2dense() (in module reagent.data.oss_data_fetcher)
make_sparse_preprocessor() (in module reagent.preprocessing.sparse_preprocessor)
make_trainer_preprocessor() (in module reagent.gym.preprocessors.trainer_preprocessor)
make_trainer_preprocessor_online() (in module reagent.gym.preprocessors)
(in module reagent.gym.preprocessors.trainer_preprocessor)
make_union_instance() (reagent.gym.envs.Env__Union method)
(reagent.optimizer.Optimizer__Union method)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union method)
(reagent.optimizer.union.Optimizer__Union method)
(reagent.publishers.union.ModelPublisher__Union method)
(reagent.validators.union.ModelValidator__Union method)
(reagent.workflow.types.ModelFeatureConfigProvider__Union method)
(reagent.workflow.types.PublishingResult__Union method)
(reagent.workflow.types.RLTrainingReport method)
(reagent.workflow.types.ValidationResult__Union method)
make_where_udf() (in module reagent.data.oss_data_fetcher)
manhattan_distance() (in module reagent.gym.envs.pomdp.pocman)
ManualDataModule (class in reagent.data)
(class in reagent.data.manual_data_module)
MapIDList (class in reagent.preprocessing.sparse_preprocessor)
MapIDListFeatures (class in reagent.preprocessing.transforms)
MapIDScoreList (class in reagent.preprocessing.sparse_preprocessor)
mask (reagent.core.types.DocList attribute)
mask_logits_by_idx() (in module reagent.model_utils.seq2slate_utils)
MaskByPresence (class in reagent.preprocessing.transforms)
masked_softmax() (in module reagent.core.torch_utils)
max_episode_steps (reagent.gym.envs.toy_vm.ToyVM attribute)
(reagent.gym.envs.ToyVM attribute)
max_eval (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
max_iter (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
max_len (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
max_lr (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
max_momentum (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
max_nodes (reagent.workflow.types.ResourceOptions attribute)
max_norm (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
max_num_actions (reagent.core.types.ExtraData attribute)
max_seq_len (reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
max_src_seq_len (reagent.core.parameters.RankingParameters attribute)
(reagent.models.seq2slate.Seq2SlateNet attribute)
max_steps (reagent.gym.envs.env_wrapper.EnvWrapper property)
max_tgt_seq_len (reagent.core.parameters.RankingParameters attribute)
(reagent.models.seq2slate.Seq2SlateNet attribute)
max_unique_enum_values (reagent.workflow.types.PreprocessingOptions attribute)
max_value (reagent.core.parameters.NormalizationParameters attribute)
max_weight (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
max_x (reagent.gym.envs.pomdp.pocman.Ghost attribute)
max_y (reagent.gym.envs.pomdp.pocman.Ghost attribute)
maximize (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.Adamax attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
(reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
(reagent.optimizer.uninferrable_optimizers.NAdam attribute)
(reagent.optimizer.uninferrable_optimizers.RAdam attribute)
(reagent.optimizer.uninferrable_optimizers.Rprop attribute)
(reagent.optimizer.uninferrable_optimizers.SGD attribute)
(reagent.optimizer.uninferrable_optimizers.SparseAdam attribute)
maxq_learning (reagent.core.parameters.RLParameters attribute)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
MDN_RNN (reagent.core.parameters.ProblemDomain attribute)
MDNRNN (class in reagent.models.mdn_rnn)
mdnrnn (reagent.core.parameters.CEMTrainerParameters attribute)
MDNRNNMemoryPool (class in reagent.models.mdn_rnn)
MDNRNNMemorySample (class in reagent.models.mdn_rnn)
MDNRNNTrainer (class in reagent.training)
(class in reagent.training.world_model.mdnrnn_trainer)
MDNRNNTrainerParameters (class in reagent.core.parameters)
MDNRNNWithPreprocessor (class in reagent.prediction.predictor_wrapper)
mdp_id (reagent.core.types.ExtraData attribute)
(reagent.core.types.SlateScoreBatch attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
(reagent.gym.types.Transition attribute)
MDP_ID (reagent.preprocessing.types.InputColumn attribute)
mean (reagent.core.parameters.NormalizationParameters attribute)
(reagent.core.running_stats.RunningStats property)
MeanAggregator (class in reagent.core.aggregators)
meanfull (reagent.core.running_stats.RunningStats property)
memory (reagent.workflow.types.ResourceOptions attribute)
memory_size (reagent.models.mdn_rnn.MDNRNNMemoryPool property)
MemoryNetwork (class in reagent.models.world_model)
MemoryNetworkInput (class in reagent.core.types)
MemoryNetworkInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
MemoryNetworkOutput (class in reagent.core.types)
merge() (reagent.ope.test.yandex_web_search.TrainingQuery method)
metadata (reagent.replay_memory.circular_replay_buffer.ReplayElement attribute)
method (reagent.core.parameters.SlateOptParameters attribute)
metric (reagent.ope.estimators.slate_estimators.LogSample attribute)
metric_reward_values (reagent.workflow.types.RewardOptions attribute)
metrics (reagent.core.types.ExtraData attribute)
METRICS (reagent.preprocessing.types.InputColumn attribute)
MetricUCB (class in reagent.mab.ucb)
milestones (reagent.optimizer.uninferrable_schedulers.MultiStepLR attribute)
min_nodes (reagent.workflow.types.ResourceOptions attribute)
min_std (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
min_value (reagent.core.parameters.NormalizationParameters attribute)
minibatch_size (reagent.training.C51TrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
(reagent.workflow.types.ReaderOptions attribute)
minibatches_per_step (reagent.training.C51TrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.ParametricDQNTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.ParametricDQNTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
misc_column_preprocessing() (in module reagent.data.oss_data_fetcher)
MLPScorer (class in reagent.models)
(class in reagent.models.mlp_scorer)
mode (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
Model (class in reagent.ope.estimators.sequential_estimators)
model (reagent.evaluation.feature_importance.feature_importance_base.FeatureImportanceBase attribute)
model_manager (reagent.data.manual_data_module.ManualDataModule property)
(reagent.data.ManualDataModule property)
model_metrics (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_metrics_for_logged_action (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_metrics_values (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_metrics_values_for_logged_action (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_outputs (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
model_propensities (reagent.evaluation.doubly_robust_estimator.ImportanceSamplingData attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_propensities_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
model_propensities_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
model_rewards (reagent.evaluation.doubly_robust_estimator.ImportanceSamplingData attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_rewards_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
model_rewards_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
model_rewards_for_logged_action (reagent.evaluation.doubly_robust_estimator.ImportanceSamplingData attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
model_rewards_for_logged_action_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
model_rewards_for_logged_action_eval (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
model_values (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
ModelBase (class in reagent.models)
(class in reagent.models.base)
ModelFeatureConfig (class in reagent.core.types)
ModelFeatureConfigProvider (class in reagent.models.model_feature_config_provider)
ModelFeatureConfigProvider__Union (class in reagent.workflow.types)
ModelManager (class in reagent.model_managers.model_manager)
ModelManager__Union (class in reagent.model_managers.union)
ModelOutputs (class in reagent.ope.estimators.contextual_bandits_estimators)
ModelPublisher (class in reagent.publishers.model_publisher)
ModelPublisher__Union (class in reagent.publishers.union)
ModelValidator (class in reagent.validators.model_validator)
ModelValidator__Union (class in reagent.validators.union)
ModelWrapper (class in reagent.ope.test.cartpole)
module
reagent
reagent.core
reagent.core.aggregators
reagent.core.base_dataclass
reagent.core.configuration
reagent.core.dataclasses
reagent.core.debug_on_error
reagent.core.fb_checker
reagent.core.multiprocess_utils
reagent.core.observers
reagent.core.parameters
reagent.core.parameters_seq2slate
reagent.core.registry_meta
reagent.core.report_utils
reagent.core.result_registries
reagent.core.result_types
reagent.core.running_stats
reagent.core.tagged_union
reagent.core.tensorboardX
reagent.core.torch_utils
reagent.core.tracker
reagent.core.types
reagent.core.utils
reagent.data
reagent.data.data_fetcher
reagent.data.manual_data_module
reagent.data.oss_data_fetcher
reagent.data.reagent_data_module
reagent.data.spark_utils
reagent.evaluation
reagent.evaluation.cpe
reagent.evaluation.doubly_robust_estimator
reagent.evaluation.evaluation_data_page
reagent.evaluation.evaluator
reagent.evaluation.feature_importance
reagent.evaluation.feature_importance.feature_importance_base
reagent.evaluation.feature_importance.feature_importance_perturbation
reagent.evaluation.ope_adapter
reagent.evaluation.sequential_doubly_robust_estimator
reagent.evaluation.weighted_sequential_doubly_robust_estimator
reagent.evaluation.world_model_evaluator
reagent.gym
reagent.gym.agents
reagent.gym.agents.agent
reagent.gym.agents.post_step
reagent.gym.datasets
reagent.gym.datasets.episodic_dataset
reagent.gym.datasets.replay_buffer_dataset
reagent.gym.envs
reagent.gym.envs.changing_arms
reagent.gym.envs.dynamics
reagent.gym.envs.dynamics.linear_dynamics
reagent.gym.envs.env_wrapper
reagent.gym.envs.functionality
reagent.gym.envs.functionality.possible_actions_mask_tester
reagent.gym.envs.gym
reagent.gym.envs.oracle_pvm
reagent.gym.envs.pomdp
reagent.gym.envs.pomdp.pocman
reagent.gym.envs.pomdp.state_embed_env
reagent.gym.envs.pomdp.string_game
reagent.gym.envs.pomdp.string_game_v1
reagent.gym.envs.recsim
reagent.gym.envs.toy_vm
reagent.gym.envs.utils
reagent.gym.envs.wrappers
reagent.gym.envs.wrappers.recsim
reagent.gym.envs.wrappers.simple_minigrid
reagent.gym.normalizers
reagent.gym.policies
reagent.gym.policies.policy
reagent.gym.policies.predictor_policies
reagent.gym.policies.random_policies
reagent.gym.policies.samplers
reagent.gym.policies.samplers.continuous_sampler
reagent.gym.policies.samplers.discrete_sampler
reagent.gym.policies.samplers.top_k_sampler
reagent.gym.policies.scorers
reagent.gym.policies.scorers.continuous_scorer
reagent.gym.policies.scorers.discrete_scorer
reagent.gym.policies.scorers.slate_q_scorer
reagent.gym.preprocessors
reagent.gym.preprocessors.default_preprocessors
reagent.gym.preprocessors.replay_buffer_inserters
reagent.gym.preprocessors.trainer_preprocessor
reagent.gym.runners
reagent.gym.runners.gymrunner
reagent.gym.tests
reagent.gym.tests.preprocessors
reagent.gym.tests.preprocessors.test_default_preprocessors
reagent.gym.tests.preprocessors.test_replay_buffer_inserters
reagent.gym.tests.test_gym
reagent.gym.tests.test_gym_datasets
reagent.gym.tests.test_gym_offline
reagent.gym.tests.test_gym_replay_buffer
reagent.gym.tests.test_linear_dynamics
reagent.gym.tests.test_pomdp
reagent.gym.tests.test_world_model
reagent.gym.types
reagent.gym.utils
reagent.lite
reagent.lite.optimizer
reagent.mab
reagent.mab.mab_algorithm
reagent.mab.simulation
reagent.mab.thompson_sampling
reagent.mab.ucb
reagent.model_managers
reagent.model_managers.actor_critic
reagent.model_managers.actor_critic.sac
reagent.model_managers.actor_critic.td3
reagent.model_managers.actor_critic_base
reagent.model_managers.discrete
reagent.model_managers.discrete.discrete_c51dqn
reagent.model_managers.discrete.discrete_crr
reagent.model_managers.discrete.discrete_dqn
reagent.model_managers.discrete.discrete_qrdqn
reagent.model_managers.discrete_dqn_base
reagent.model_managers.model_based
reagent.model_managers.model_based.cross_entropy_method
reagent.model_managers.model_based.seq2reward_model
reagent.model_managers.model_based.synthetic_reward
reagent.model_managers.model_based.world_model
reagent.model_managers.model_manager
reagent.model_managers.parametric
reagent.model_managers.parametric.parametric_dqn
reagent.model_managers.parametric_dqn_base
reagent.model_managers.policy_gradient
reagent.model_managers.policy_gradient.ppo
reagent.model_managers.policy_gradient.reinforce
reagent.model_managers.ranking
reagent.model_managers.ranking.slate_q
reagent.model_managers.slate_q_base
reagent.model_managers.union
reagent.model_managers.world_model_base
reagent.model_utils
reagent.model_utils.seq2slate_utils
reagent.models
reagent.models.actor
reagent.models.base
reagent.models.bcq
reagent.models.categorical_dqn
reagent.models.cem_planner
reagent.models.containers
reagent.models.convolutional_network
reagent.models.critic
reagent.models.dqn
reagent.models.dueling_q_network
reagent.models.embedding_bag_concat
reagent.models.fully_connected_network
reagent.models.linear_regression
reagent.models.mdn_rnn
reagent.models.mlp_scorer
reagent.models.model_feature_config_provider
reagent.models.no_soft_update_embedding
reagent.models.seq2reward_model
reagent.models.seq2slate
reagent.models.seq2slate_reward
reagent.models.synthetic_reward
reagent.models.world_model
reagent.net_builder
reagent.net_builder.categorical_dqn
reagent.net_builder.categorical_dqn.categorical
reagent.net_builder.categorical_dqn_net_builder
reagent.net_builder.continuous_actor
reagent.net_builder.continuous_actor.dirichlet_fully_connected
reagent.net_builder.continuous_actor.fully_connected
reagent.net_builder.continuous_actor.gaussian_fully_connected
reagent.net_builder.continuous_actor_net_builder
reagent.net_builder.discrete_actor
reagent.net_builder.discrete_actor.fully_connected
reagent.net_builder.discrete_actor_net_builder
reagent.net_builder.discrete_dqn
reagent.net_builder.discrete_dqn.dueling
reagent.net_builder.discrete_dqn.fully_connected
reagent.net_builder.discrete_dqn.fully_connected_with_embedding
reagent.net_builder.discrete_dqn_net_builder
reagent.net_builder.parametric_dqn
reagent.net_builder.parametric_dqn.fully_connected
reagent.net_builder.parametric_dqn_net_builder
reagent.net_builder.quantile_dqn
reagent.net_builder.quantile_dqn.dueling_quantile
reagent.net_builder.quantile_dqn.quantile
reagent.net_builder.quantile_dqn_net_builder
reagent.net_builder.slate_ranking
reagent.net_builder.slate_ranking.slate_ranking_scorer
reagent.net_builder.slate_ranking.slate_ranking_transformer
reagent.net_builder.slate_ranking_net_builder
reagent.net_builder.slate_reward
reagent.net_builder.slate_reward.slate_reward_gru
reagent.net_builder.slate_reward.slate_reward_transformer
reagent.net_builder.slate_reward_net_builder
reagent.net_builder.synthetic_reward
reagent.net_builder.synthetic_reward.ngram_synthetic_reward
reagent.net_builder.synthetic_reward.sequence_synthetic_reward
reagent.net_builder.synthetic_reward.single_step_synthetic_reward
reagent.net_builder.synthetic_reward.transformer_synthetic_reward
reagent.net_builder.synthetic_reward_net_builder
reagent.net_builder.unions
reagent.net_builder.value
reagent.net_builder.value.fully_connected
reagent.net_builder.value.seq2reward_rnn
reagent.net_builder.value_net_builder
reagent.ope
reagent.ope.datasets
reagent.ope.datasets.logged_dataset
reagent.ope.estimators
reagent.ope.estimators.contextual_bandits_estimators
reagent.ope.estimators.estimator
reagent.ope.estimators.sequential_estimators
reagent.ope.estimators.slate_estimators
reagent.ope.estimators.types
reagent.ope.test
reagent.ope.test.cartpole
reagent.ope.test.envs
reagent.ope.test.gridworld
reagent.ope.test.mslr_slate
reagent.ope.test.multiclass_bandits
reagent.ope.test.unit_tests
reagent.ope.test.unit_tests.test_contextual_bandit_estimators
reagent.ope.test.unit_tests.test_slate_estimators
reagent.ope.test.unit_tests.test_types
reagent.ope.test.unit_tests.test_utils
reagent.ope.test.yandex_web_search
reagent.ope.trainers
reagent.ope.trainers.linear_trainers
reagent.ope.trainers.rl_tabular_trainers
reagent.ope.utils
reagent.optimizer
reagent.optimizer.optimizer
reagent.optimizer.scheduler
reagent.optimizer.scheduler_union
reagent.optimizer.soft_update
reagent.optimizer.uninferrable_optimizers
reagent.optimizer.uninferrable_schedulers
reagent.optimizer.union
reagent.optimizer.utils
reagent.prediction
reagent.prediction.predictor_wrapper
reagent.prediction.ranking
reagent.prediction.ranking.predictor_wrapper
reagent.prediction.synthetic_reward
reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper
reagent.preprocessing
reagent.preprocessing.batch_preprocessor
reagent.preprocessing.identify_types
reagent.preprocessing.normalization
reagent.preprocessing.postprocessor
reagent.preprocessing.preprocessor
reagent.preprocessing.sparse_preprocessor
reagent.preprocessing.sparse_to_dense
reagent.preprocessing.transforms
reagent.preprocessing.types
reagent.publishers
reagent.publishers.file_system_publisher
reagent.publishers.model_publisher
reagent.publishers.no_publishing
reagent.publishers.union
reagent.replay_memory
reagent.replay_memory.circular_replay_buffer
reagent.replay_memory.prioritized_replay_buffer
reagent.replay_memory.sum_tree
reagent.replay_memory.utils
reagent.reporting
reagent.reporting.actor_critic_reporter
reagent.reporting.compound_reporter
reagent.reporting.discrete_crr_reporter
reagent.reporting.discrete_dqn_reporter
reagent.reporting.parametric_dqn_reporter
reagent.reporting.reporter_base
reagent.reporting.reward_network_reporter
reagent.reporting.seq2reward_reporter
reagent.reporting.slate_q_reporter
reagent.reporting.td3_reporter
reagent.reporting.world_model_reporter
reagent.samplers
reagent.samplers.frechet
reagent.scripts
reagent.training
reagent.training.c51_trainer
reagent.training.cb
reagent.training.cb.linucb_trainer
reagent.training.cem_trainer
reagent.training.cfeval
reagent.training.cfeval.bandit_reward_network_trainer
reagent.training.discrete_crr_trainer
reagent.training.dqn_trainer
reagent.training.dqn_trainer_base
reagent.training.gradient_free
reagent.training.gradient_free.ars_util
reagent.training.gradient_free.es_worker
reagent.training.gradient_free.evolution_pool
reagent.training.imitator_training
reagent.training.multi_stage_trainer
reagent.training.parameters
reagent.training.parametric_dqn_trainer
reagent.training.ppo_trainer
reagent.training.qrdqn_trainer
reagent.training.ranking
reagent.training.ranking.helper
reagent.training.ranking.seq2slate_attn_trainer
reagent.training.ranking.seq2slate_sim_trainer
reagent.training.ranking.seq2slate_tf_trainer
reagent.training.ranking.seq2slate_trainer
reagent.training.reagent_lightning_module
reagent.training.reinforce_trainer
reagent.training.reward_network_trainer
reagent.training.rl_trainer_pytorch
reagent.training.sac_trainer
reagent.training.slate_q_trainer
reagent.training.td3_trainer
reagent.training.utils
reagent.training.world_model
reagent.training.world_model.compress_model_trainer
reagent.training.world_model.mdnrnn_trainer
reagent.training.world_model.seq2reward_trainer
reagent.validators
reagent.validators.model_validator
reagent.validators.no_validation
reagent.validators.union
reagent.workflow
reagent.workflow.env
reagent.workflow.gym_batch_rl
reagent.workflow.identify_types_flow
reagent.workflow.training
reagent.workflow.training_reports
reagent.workflow.types
reagent.workflow.utils
modulo (reagent.core.types.IdMappingUnion attribute)
ModuloMapIDList (class in reagent.preprocessing.sparse_preprocessor)
ModuloMapIDScoreList (class in reagent.preprocessing.sparse_preprocessor)
ModuloMapping (class in reagent.core.types)
momentum (reagent.optimizer.uninferrable_optimizers.SGD attribute)
momentum_decay (reagent.optimizer.uninferrable_optimizers.NAdam attribute)
MonteCarloTrainer (class in reagent.ope.trainers.rl_tabular_trainers)
MonteCarloValueFunction (class in reagent.ope.trainers.rl_tabular_trainers)
move() (reagent.gym.envs.pomdp.pocman.Ghost method)
MSE (reagent.training.reward_network_trainer.LossFunction attribute)
mse_loss() (in module reagent.evaluation.weighted_sequential_doubly_robust_estimator)
MSLRDatasets (class in reagent.ope.test.mslr_slate)
MSLRModel (class in reagent.ope.test.mslr_slate)
multi_selection_value_fn() (in module reagent.gym.envs.recsim)
multi_stage_total_epochs (reagent.training.multi_stage_trainer.MultiStageTrainer property)
(reagent.training.MultiStageTrainer property)
multi_steps (reagent.core.parameters.MDNRNNTrainerParameters attribute)
(reagent.core.parameters.RLParameters attribute)
(reagent.core.parameters.Seq2RewardTrainerParameters attribute)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase property)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
MultiClassContext (class in reagent.ope.test.multiclass_bandits)
MultiClassDataRow (class in reagent.ope.test.multiclass_bandits)
MultiClassModel (class in reagent.ope.test.multiclass_bandits)
MultiClassPolicy (class in reagent.ope.test.multiclass_bandits)
MulticlickIEvUserModel (class in reagent.gym.envs.recsim)
MultiDiscreteRandomPolicy (class in reagent.gym.policies.random_policies)
MultiHeadedAttention (class in reagent.models.seq2slate)
multiple_evaluations_bandit_algo() (in module reagent.mab.simulation)
MultiplicativeLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
MultiStageTrainer (class in reagent.training)
(class in reagent.training.multi_stage_trainer)
MultiStepLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
mus (reagent.core.types.MemoryNetworkOutput attribute)
mutation_power (reagent.core.parameters.EvolutionParameters attribute)
N
NAdam (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
name (reagent.core.types.FloatFeatureInfo attribute)
(reagent.core.types.IdListFeatureConfig attribute)
(reagent.core.types.IdScoreListFeatureConfig attribute)
(reagent.ope.estimators.slate_estimators.FrechetDistribution property)
(reagent.ope.estimators.slate_estimators.PassThruDistribution property)
(reagent.ope.estimators.slate_estimators.RankingDistribution property)
(reagent.ope.estimators.slate_estimators.RewardDistribution property)
(reagent.ope.estimators.types.Trainer property)
(reagent.ope.test.mslr_slate.MSLRDatasets property)
(reagent.ope.trainers.linear_trainers.DecisionTreeClassifierTrainer property)
(reagent.ope.trainers.linear_trainers.DecisionTreeTrainer property)
(reagent.ope.trainers.linear_trainers.LassoTrainer property)
(reagent.ope.trainers.linear_trainers.LogisticRegressionTrainer property)
(reagent.ope.trainers.linear_trainers.NNTrainer property)
(reagent.ope.trainers.linear_trainers.SGDClassifierTrainer property)
(reagent.replay_memory.circular_replay_buffer.ReplayElement attribute)
name2config (reagent.core.types.ModelFeatureConfig property)
name2id (reagent.core.types.ModelFeatureConfig property)
NDCGSlateMetric (class in reagent.ope.estimators.slate_estimators)
nesterov (reagent.optimizer.uninferrable_optimizers.SGD attribute)
net_builder (reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN attribute)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN attribute)
(reagent.model_managers.discrete.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.DiscreteDQN attribute)
(reagent.model_managers.discrete.DiscreteQRDQN attribute)
(reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel attribute)
(reagent.model_managers.model_based.Seq2RewardModel attribute)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.parametric.parametric_dqn.ParametricDQN attribute)
(reagent.model_managers.parametric.ParametricDQN attribute)
(reagent.model_managers.ranking.slate_q.SlateQ attribute)
(reagent.model_managers.ranking.SlateQ attribute)
NeuralDualDICE (class in reagent.ope.estimators.sequential_estimators)
NeverGradOptimizer (class in reagent.lite.optimizer)
next_action (reagent.core.types.DiscreteDqnInput attribute)
(reagent.core.types.ParametricDqnInput attribute)
(reagent.core.types.PolicyNetworkInput attribute)
(reagent.core.types.SlateQInput attribute)
NEXT_ACTION (reagent.preprocessing.types.InputColumn attribute)
next_best_continuous_action (reagent.core.types.PlanningPolicyOutput attribute)
next_best_discrete_action_idx (reagent.core.types.PlanningPolicyOutput attribute)
next_best_discrete_action_one_hot (reagent.core.types.PlanningPolicyOutput attribute)
NEXT_CANDIDATE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
NEXT_ITEM_MASK (reagent.preprocessing.types.InputColumn attribute)
NEXT_ITEM_PROBABILITY (reagent.preprocessing.types.InputColumn attribute)
next_pos() (reagent.gym.envs.pomdp.pocman.PocManEnv method)
next_slate_value_norm_method (reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
next_state (reagent.core.types.BaseInput attribute)
(reagent.models.mdn_rnn.MDNRNNMemorySample attribute)
NEXT_STATE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
NEXT_STATE_ID_LIST_FEATURES (reagent.preprocessing.types.InputColumn attribute)
NEXT_STATE_ID_SCORE_LIST_FEATURES (reagent.preprocessing.types.InputColumn attribute)
next_state_loss_weight (reagent.core.parameters.MDNRNNTrainerParameters attribute)
next_state_reward_dist() (reagent.ope.estimators.sequential_estimators.Model method)
(reagent.ope.test.cartpole.ModelWrapper method)
(reagent.ope.test.gridworld.GridWorld method)
(reagent.ope.test.gridworld.NoiseGridWorldModel method)
NEXT_STATE_SEQUENCE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
NextSlateValueNormMethod (class in reagent.training.slate_q_trainer)
ngram() (in module reagent.models.synthetic_reward)
NGramConvNetSyntheticReward (class in reagent.net_builder.synthetic_reward.ngram_synthetic_reward)
(reagent.net_builder.unions.SyntheticRewardNetBuilder__Union attribute)
NGramConvolutionalNetwork (class in reagent.models.synthetic_reward)
NGramFullyConnectedNetwork (class in reagent.models.synthetic_reward)
NGramSyntheticReward (class in reagent.net_builder.synthetic_reward.ngram_synthetic_reward)
(reagent.net_builder.unions.SyntheticRewardNetBuilder__Union attribute)
nhead (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
NNTrainer (class in reagent.ope.trainers.linear_trainers)
no_op_feature() (in module reagent.preprocessing.normalization)
no_publishing_results (reagent.workflow.types.PublishingResult__Union attribute)
no_validation_results (reagent.workflow.types.ValidationResult__Union attribute)
NoDuplicatedWarningLogger (class in reagent.core.types)
noise_clip (reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
noise_variance (reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
NoiseGridWorldModel (class in reagent.ope.test.gridworld)
NOOP (reagent.ope.estimators.sequential_estimators.Transition.Status attribute)
NoPublishing (class in reagent.publishers.no_publishing)
(reagent.publishers.union.ModelPublisher__Union attribute)
NoPublishingResults (class in reagent.core.result_types)
NORM_BY_CURRENT_SLATE_SIZE (reagent.training.slate_q_trainer.NextSlateValueNormMethod attribute)
NORM_BY_NEXT_SLATE_SIZE (reagent.training.slate_q_trainer.NextSlateValueNormMethod attribute)
norm_type (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
NORMAL (reagent.ope.estimators.sequential_estimators.Transition.Status attribute)
NormalGammaThompson (class in reagent.mab.thompson_sampling)
normalization_data (reagent.gym.envs.changing_arms.ChangingArms property)
(reagent.gym.envs.ChangingArms property)
normalization_helper() (in module reagent.workflow.identify_types_flow)
NormalizationData (class in reagent.core.parameters)
NormalizationKey (class in reagent.core.parameters)
NormalizationParameters (class in reagent.core.parameters)
normalize (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
normalize_importance_weights() (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator static method)
normalize_output (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
normalized (reagent.evaluation.cpe.CpeEstimate attribute)
normalized_std_error (reagent.evaluation.cpe.CpeEstimate attribute)
normalizer_helper() (in module reagent.gym.normalizers)
NoSoftUpdateEmbedding (class in reagent.models.no_soft_update_embedding)
not_terminal (reagent.core.types.BaseInput attribute)
(reagent.core.types.MemoryNetworkOutput attribute)
(reagent.models.mdn_rnn.MDNRNNMemorySample attribute)
NOT_TERMINAL (reagent.preprocessing.types.InputColumn attribute)
not_terminal_loss_weight (reagent.core.parameters.MDNRNNTrainerParameters attribute)
notify_observers() (reagent.core.tracker.ObservableMixin method)
(reagent.evaluation.evaluator.Evaluator method)
NoValidation (class in reagent.validators.no_validation)
(reagent.validators.union.ModelValidator__Union attribute)
NoValidationResults (class in reagent.core.result_types)
num_actions (reagent.ope.datasets.logged_dataset.BanditsDataset property)
(reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
NUM_ACTIONS (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators attribute)
num_actions (reagent.training.dqn_trainer_base.DQNTrainerBaseLightning property)
(reagent.training.parameters.LinUCBTrainerParameters attribute)
num_arms (reagent.gym.envs.changing_arms.ChangingArms attribute)
(reagent.gym.envs.ChangingArms attribute)
num_atoms (reagent.training.C51TrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
NUM_BOOTSTRAP_SAMPLES (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator attribute)
num_candidates (reagent.gym.envs.OraclePVM attribute)
(reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
(reagent.model_managers.ranking.slate_q.SlateQ attribute)
(reagent.model_managers.ranking.SlateQ attribute)
num_elites (reagent.core.parameters.CEMTrainerParameters attribute)
num_embeddings (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
num_encoder_layers (reagent.net_builder.synthetic_reward.transformer_synthetic_reward.TransformerSyntheticReward attribute)
num_examples_dict (reagent.evaluation.doubly_robust_estimator.TrainValidEvalData attribute)
num_features (reagent.ope.datasets.logged_dataset.BanditsDataset property)
(reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
num_gaussians (reagent.core.parameters.MDNRNNTrainerParameters attribute)
num_heads (reagent.core.parameters.TransformerParameters attribute)
(reagent.models.seq2slate.Seq2SlateTransformerNet attribute)
num_hidden_layers (reagent.core.parameters.MDNRNNTrainerParameters attribute)
(reagent.net_builder.value.seq2reward_rnn.Seq2RewardNetBuilder attribute)
num_hiddens (reagent.net_builder.value.seq2reward_rnn.Seq2RewardNetBuilder attribute)
NUM_J_STEPS_FOR_MAGIC_ESTIMATOR (reagent.evaluation.evaluator.Evaluator attribute)
num_samples (reagent.workflow.types.PreprocessingOptions attribute)
num_stacked_layers (reagent.core.parameters.BaselineParameters attribute)
(reagent.core.parameters.GRUParameters attribute)
(reagent.core.parameters.TransformerParameters attribute)
(reagent.models.seq2slate.Seq2SlateNet attribute)
NUM_SUBSETS_FOR_CB_ESTIMATES (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator attribute)
num_weights (reagent.gym.envs.oracle_pvm.OraclePVM attribute)
(reagent.gym.envs.OraclePVM attribute)
num_world_models (reagent.core.parameters.CEMTrainerParameters attribute)
O
obj_func_scaler() (in module reagent.lite.optimizer)
Objects (class in reagent.ope.estimators.types)
objects (reagent.ope.estimators.slate_estimators.SlateSlotObjects property)
obs_preprocessor() (reagent.gym.envs.changing_arms.ChangingArms method)
(reagent.gym.envs.ChangingArms method)
(reagent.gym.envs.env_wrapper.EnvWrapper method)
(reagent.gym.envs.Gym method)
(reagent.gym.envs.gym.Gym method)
(reagent.gym.envs.oracle_pvm.OraclePVM method)
(reagent.gym.envs.OraclePVM method)
(reagent.gym.envs.RecSim method)
(reagent.gym.envs.recsim.RecSim method)
(reagent.gym.envs.toy_vm.ToyVM method)
(reagent.gym.envs.ToyVM method)
(reagent.gym.Gym method)
observable() (in module reagent.core.tracker)
ObservableMixin (class in reagent.core.tracker)
observation (reagent.gym.types.Transition attribute)
observation() (reagent.gym.envs.wrappers.recsim.ValueWrapper method)
(reagent.gym.envs.wrappers.simple_minigrid.SimpleObsWrapper method)
observation_space (reagent.gym.envs.changing_arms.ChangingArmsEnv property)
(reagent.gym.envs.wrappers.recsim.ValueWrapper property)
(reagent.ope.test.envs.Environment property)
(reagent.ope.test.gridworld.GridWorld property)
(reagent.ope.test.gridworld.NoiseGridWorldModel property)
Observer (class in reagent.core.tracker)
off_policy (reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
offline_gym_predictor() (in module reagent.workflow.gym_batch_rl)
offline_gym_random() (in module reagent.workflow.gym_batch_rl)
OfflineReplayBufferDataset (class in reagent.gym.datasets.replay_buffer_dataset)
offset_clamp_min (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
on_epoch_end() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
on_fit_end() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
on_fit_start() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
on_policy (reagent.core.parameters.Seq2SlateParameters attribute)
on_pretrain_routine_end() (reagent.training.reagent_lightning_module.StoppingEpochCallback method)
(reagent.training.StoppingEpochCallback method)
on_test_batch_end() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
on_test_end() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
on_test_start() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
on_train_batch_end() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
on_validation_batch_end() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
one_hot (reagent.ope.test.multiclass_bandits.MultiClassDataRow attribute)
one_hot_actions() (in module reagent.gym.preprocessors.trainer_preprocessor)
one_hots (reagent.ope.test.multiclass_bandits.UCIMultiClassDataset property)
one_hots() (reagent.ope.estimators.slate_estimators.Slate method)
OneCycleLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
OneHotActions (class in reagent.preprocessing.transforms)
OneMaxEvolutionPool (class in reagent.training.gradient_free.evolution_pool)
only_continuous_action_normalizer() (in module reagent.gym.normalizers)
only_continuous_normalizer() (in module reagent.gym.normalizers)
only_dense (reagent.core.types.ModelFeatureConfig property)
OPEstimatorAdapter (class in reagent.evaluation.ope_adapter)
OPEvaluator (class in reagent.evaluation.ope_adapter)
opposite_direction() (in module reagent.gym.envs.pomdp.pocman)
optim_tgt_in_idx (reagent.core.types.PreprocessedRankingInput attribute)
optim_tgt_in_seq (reagent.core.types.PreprocessedRankingInput attribute)
optim_tgt_out_idx (reagent.core.types.PreprocessedRankingInput attribute)
optim_tgt_out_seq (reagent.core.types.PreprocessedRankingInput attribute)
optimal_q_values (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
optimize_step() (reagent.lite.optimizer.ComboOptimizerBase method)
optimizer (reagent.training.C51TrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.ParametricDQNTrainerParameters attribute)
(reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.parameters.RewardNetworkTrainerParameters attribute)
(reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.ParametricDQNTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
(reagent.training.RewardNetworkTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
Optimizer__Union (class in reagent.optimizer)
(class in reagent.optimizer.union)
optimizer_step() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
optimizer_value_net (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
OptimizerConfig (class in reagent.optimizer.optimizer)
optimizers() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
OraclePVM (class in reagent.gym.envs)
(class in reagent.gym.envs.oracle_pvm)
(reagent.gym.envs.Env__Union attribute)
orthogonal_init (reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
OssDataFetcher (class in reagent.data.oss_data_fetcher)
OSSPredictorUnwrapper (class in reagent.prediction.predictor_wrapper)
OSSSparsePredictorUnwrapper (class in reagent.prediction.predictor_wrapper)
OuterProduct (class in reagent.preprocessing.transforms)
output_arch (reagent.models.seq2slate.Seq2SlateNet attribute)
(reagent.net_builder.slate_ranking.slate_ranking_transformer.SlateRankingTransformer attribute)
output_dim (reagent.models.embedding_bag_concat.EmbeddingBagConcat property)
(reagent.models.EmbeddingBagConcat property)
output_paths (reagent.workflow.types.RLTrainingOutput attribute)
P
pack() (reagent.ope.test.yandex_web_search.TrainingQuery method)
padding_idx (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
PAIRWISE_ATTENTION (reagent.core.parameters_seq2slate.LearningMethod attribute)
param_hash() (in module reagent.core.configuration)
PARAMETRIC_ACTION (reagent.core.parameters.ProblemDomain attribute)
parametric_action_float_features (reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
parametric_action_preprocessing() (in module reagent.data.oss_data_fetcher)
parametric_dqn_report (reagent.workflow.types.RLTrainingReport attribute)
parametric_dqn_scorer() (in module reagent.gym.policies.scorers.discrete_scorer)
parametric_dqn_serving_scorer() (in module reagent.gym.policies.scorers.discrete_scorer)
ParametricDQN (class in reagent.model_managers.parametric)
(class in reagent.model_managers.parametric.parametric_dqn)
(reagent.model_managers.union.ModelManager__Union attribute)
ParametricDQNBase (class in reagent.model_managers.parametric_dqn_base)
ParametricDqnBatchPreprocessor (class in reagent.preprocessing.batch_preprocessor)
ParametricDqnDataModule (class in reagent.model_managers.parametric_dqn_base)
ParametricDqnInput (class in reagent.core.types)
ParametricDqnInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
ParametricDQNNetBuilder (class in reagent.net_builder.parametric_dqn_net_builder)
ParametricDQNNetBuilder__Union (class in reagent.net_builder.unions)
ParametricDqnPredictorUnwrapper (in module reagent.prediction.predictor_wrapper)
ParametricDqnPredictorWrapper (class in reagent.prediction.predictor_wrapper)
ParametricDQNReporter (class in reagent.reporting.parametric_dqn_reporter)
ParametricDQNTrainer (class in reagent.training)
(class in reagent.training.parametric_dqn_trainer)
ParametricDQNTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
ParametricDQNTrainingReport (class in reagent.workflow.training_reports)
ParametricDqnWithPreprocessor (class in reagent.prediction.predictor_wrapper)
ParametricDuelingQNetwork (class in reagent.models)
(class in reagent.models.dueling_q_network)
params (reagent.ope.estimators.slate_estimators.SlateContext attribute)
(reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
parquet_url (reagent.workflow.types.Dataset attribute)
PassThruDistribution (class in reagent.ope.estimators.slate_estimators)
PBMEstimator (class in reagent.ope.estimators.slate_estimators)
pct_start (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
PER_SEQ_LOG_PROB_MODE (reagent.model_utils.seq2slate_utils.Seq2SlateMode attribute)
per_seq_log_probs (reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
PER_SYMBOL_LOG_PROB_DIST_MODE (reagent.model_utils.seq2slate_utils.Seq2SlateMode attribute)
per_symbol_log_probs (reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
per_symbol_to_per_seq_log_probs() (in module reagent.model_utils.seq2slate_utils)
per_symbol_to_per_seq_probs() (in module reagent.model_utils.seq2slate_utils)
perturb_fn (reagent.evaluation.feature_importance.feature_importance_perturbation.FeatureImportancePerturbation attribute)
petastorm_reader_pool_type (reagent.workflow.types.ReaderOptions attribute)
PetastormLightningDataModule (class in reagent.workflow.utils)
PETransformerEncoderLayer (class in reagent.models.synthetic_reward)
place_values_at_indices() (in module reagent.mab.mab_algorithm)
plan_horizon_length (reagent.core.parameters.CEMTrainerParameters attribute)
PlanningPolicyOutput (class in reagent.core.types)
PocManEnv (class in reagent.gym.envs.pomdp.pocman)
Policy (class in reagent.gym.policies)
(class in reagent.gym.policies.policy)
(class in reagent.ope.estimators.types)
policy_gradient_interval (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
policy_indicators_train (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
policy_indicators_valid (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
policy_net_builder (reagent.model_managers.policy_gradient.PPO attribute)
(reagent.model_managers.policy_gradient.ppo.PPO attribute)
(reagent.model_managers.policy_gradient.Reinforce attribute)
(reagent.model_managers.policy_gradient.reinforce.Reinforce attribute)
policy_optimizer (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
PolicyGradientInput (class in reagent.core.types)
PolicyGradientInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
PolicyGradientOptimizer (class in reagent.lite.optimizer)
PolicyLogGenerator (class in reagent.ope.test.envs)
PolicyNetworkBatchPreprocessor (class in reagent.preprocessing.batch_preprocessor)
PolicyNetworkInput (class in reagent.core.types)
PolicyNetworkInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
polynomial_degree (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
pool_kernel_sizes (reagent.core.parameters.ConvNetParameters attribute)
pool_types (reagent.core.parameters.ConvNetParameters attribute)
pop() (reagent.core.tensorboardX.SummaryWriterContext class method)
populate_children() (reagent.training.gradient_free.evolution_pool.EvolutionPool method)
population_size (reagent.core.parameters.EvolutionParameters attribute)
Position (class in reagent.gym.envs.pomdp.pocman)
position_relevances (reagent.ope.test.yandex_web_search.LoggedQuery property)
(reagent.ope.test.yandex_web_search.TrainingQuery property)
position_reward (reagent.core.types.PreprocessedRankingInput attribute)
POSITION_REWARD (reagent.preprocessing.types.InputColumn attribute)
PositionalEncoding (class in reagent.models.seq2slate)
(class in reagent.models.synthetic_reward)
PositionwiseFeedForward (class in reagent.models.seq2slate)
possible_actions (reagent.core.types.ParametricDqnInput attribute)
POSSIBLE_ACTIONS (reagent.preprocessing.types.InputColumn attribute)
possible_actions_mask (reagent.core.types.DiscreteDqnInput attribute)
(reagent.core.types.ParametricDqnInput attribute)
(reagent.core.types.PolicyGradientInput attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
(reagent.gym.envs.env_wrapper.EnvWrapper property)
(reagent.gym.types.Transition attribute)
POSSIBLE_ACTIONS_MASK (reagent.preprocessing.types.InputColumn attribute)
possible_actions_state_concat (reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
possible_next_actions (reagent.core.types.ParametricDqnInput attribute)
POSSIBLE_NEXT_ACTIONS (reagent.preprocessing.types.InputColumn attribute)
possible_next_actions_mask (reagent.core.types.DiscreteDqnInput attribute)
(reagent.core.types.ParametricDqnInput attribute)
POSSIBLE_NEXT_ACTIONS_MASK (reagent.preprocessing.types.InputColumn attribute)
possible_values (reagent.core.parameters.NormalizationParameters attribute)
PossibleActionsMaskTester (class in reagent.gym.envs.functionality.possible_actions_mask_tester)
post_episode() (reagent.gym.Agent method)
(reagent.gym.agents.agent.Agent method)
post_step() (reagent.gym.Agent method)
(reagent.gym.agents.agent.Agent method)
Postprocessor (class in reagent.preprocessing.postprocessor)
PostStep (in module reagent.gym.types)
POWER (reagent.gym.envs.pomdp.pocman.Element attribute)
PPO (class in reagent.model_managers.policy_gradient)
(class in reagent.model_managers.policy_gradient.ppo)
(reagent.model_managers.union.ModelManager__Union attribute)
ppo_batch_size (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
ppo_epsilon (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
PPOTrainer (class in reagent.training)
(class in reagent.training.ppo_trainer)
PPOTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
precision (reagent.training.BanditRewardNetTrainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.cb.linucb_trainer.LinUCBTrainer attribute)
(reagent.training.CEMTrainer attribute)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer attribute)
(reagent.training.cfeval.BanditRewardNetTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.MDNRNNTrainer attribute)
(reagent.training.MultiStageTrainer attribute)
(reagent.training.PPOTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer attribute)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer attribute)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer attribute)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer attribute)
(reagent.training.ReAgentLightningModule attribute)
(reagent.training.reinforce_trainer.ReinforceTrainer attribute)
(reagent.training.ReinforceTrainer attribute)
(reagent.training.reward_network_trainer.RewardNetTrainer attribute)
(reagent.training.RewardNetTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.TD3Trainer attribute)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer attribute)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer attribute)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer attribute)
pred_fn (reagent.evaluation.feature_importance.feature_importance_perturbation.FeatureImportancePerturbation attribute)
predict() (reagent.ope.estimators.types.Trainer method)
(reagent.ope.trainers.linear_trainers.LinearTrainer method)
(reagent.ope.trainers.linear_trainers.NNTrainer method)
predicted_reward (reagent.core.types.RewardNetworkOutput attribute)
predictions (reagent.ope.estimators.types.PredictResults attribute)
predictor_atol_check (reagent.core.parameters.RLParameters attribute)
predictor_rtol_check (reagent.core.parameters.RLParameters attribute)
PredictResults (class in reagent.ope.estimators.types)
prepare_data() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
prepare_data_per_node (reagent.training.BanditRewardNetTrainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.cb.linucb_trainer.LinUCBTrainer attribute)
(reagent.training.CEMTrainer attribute)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer attribute)
(reagent.training.cfeval.BanditRewardNetTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.MDNRNNTrainer attribute)
(reagent.training.MultiStageTrainer attribute)
(reagent.training.PPOTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer attribute)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer attribute)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer attribute)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer attribute)
(reagent.training.ReAgentLightningModule attribute)
(reagent.training.reinforce_trainer.ReinforceTrainer attribute)
(reagent.training.ReinforceTrainer attribute)
(reagent.training.reward_network_trainer.RewardNetTrainer attribute)
(reagent.training.RewardNetTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.TD3Trainer attribute)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer attribute)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer attribute)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer attribute)
preprocess_id_list() (reagent.preprocessing.sparse_preprocessor.SparsePreprocessor method)
preprocess_id_score_list() (reagent.preprocessing.sparse_preprocessor.SparsePreprocessor method)
PreprocessedRankingInput (class in reagent.core.types)
PreprocessedTrainingBatch (class in reagent.core.types)
preprocessing_options (reagent.model_managers.discrete_dqn_base.DiscreteDQNBase attribute)
(reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel attribute)
(reagent.model_managers.model_based.Seq2RewardModel attribute)
PreprocessingOptions (class in reagent.workflow.types)
Preprocessor (class in reagent.preprocessing.preprocessor)
presence (reagent.core.types.ValuePresence attribute)
print_action() (reagent.gym.envs.pomdp.pocman.PocManEnv static method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv static method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 static method)
print_internal_state() (reagent.gym.envs.pomdp.pocman.PocManEnv method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
print_interval (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
print_mdnrnn_losses() (in module reagent.training.cem_trainer)
print_model_info() (in module reagent.model_utils.seq2slate_utils)
print_ob() (reagent.gym.envs.pomdp.pocman.PocManEnv method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv static method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 static method)
PrioritizedReplayBuffer (class in reagent.replay_memory)
(class in reagent.replay_memory.prioritized_replay_buffer)
prob (reagent.ope.estimators.sequential_estimators.RewardProbability attribute)
probabilities (reagent.ope.estimators.types.PredictResults attribute)
probability() (reagent.ope.estimators.types.Values method)
ProblemDomain (class in reagent.core.parameters)
process() (reagent.preprocessing.sparse_to_dense.PythonSparseToDenseProcessor method)
(reagent.preprocessing.sparse_to_dense.StringKeySparseToDenseProcessor method)
PseudoInverseEstimator (class in reagent.ope.estimators.slate_estimators)
publish() (reagent.publishers.model_publisher.ModelPublisher method)
publishing_result (reagent.workflow.types.RLTrainingOutput attribute)
PublishingResult (class in reagent.core.result_registries)
PublishingResult__Union (class in reagent.workflow.types)
push() (reagent.core.tensorboardX.SummaryWriterContext class method)
PythonSparseToDenseProcessor (class in reagent.preprocessing.sparse_to_dense)
pytorch_decoder_mask() (in module reagent.model_utils.seq2slate_utils)
PyTorchPolicy (class in reagent.ope.test.cartpole)
Q
q_network (reagent.training.discrete_crr_trainer.DiscreteCRRTrainer property)
(reagent.training.DiscreteCRRTrainer property)
q_network_loss (reagent.core.parameters.RLParameters attribute)
q_network_optimizer (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
QLearningOptimizer (class in reagent.lite.optimizer)
qmax (reagent.training.C51TrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
qmin (reagent.training.C51TrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
QRDQNNetBuilder (class in reagent.net_builder.quantile_dqn_net_builder)
QRDQNNetBuilder__Union (class in reagent.net_builder.unions)
QRDQNTrainer (class in reagent.training)
(class in reagent.training.qrdqn_trainer)
QRDQNTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
Quantile (class in reagent.net_builder.quantile_dqn.quantile)
(reagent.net_builder.unions.QRDQNNetBuilder__Union attribute)
quantile_k2_threshold (reagent.workflow.types.PreprocessingOptions attribute)
quantile_size (reagent.workflow.types.PreprocessingOptions attribute)
quantiles (reagent.core.parameters.NormalizationParameters attribute)
queries (reagent.ope.test.mslr_slate.MSLRDatasets property)
query (reagent.ope.estimators.slate_estimators.SlateContext attribute)
query_and_train() (in module reagent.workflow.training)
query_data() (reagent.data.data_fetcher.DataFetcher method)
(reagent.data.DataFetcher method)
(reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.data.oss_data_fetcher.OssDataFetcher method)
(reagent.model_managers.actor_critic_base.ActorCriticDataModule method)
(reagent.model_managers.discrete_dqn_base.DiscreteDqnDataModule method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticRewardDataModule method)
(reagent.model_managers.parametric_dqn_base.ParametricDqnDataModule method)
(reagent.model_managers.world_model_base.WorldModelDataModule method)
query_data_synthetic_reward() (reagent.data.data_fetcher.DataFetcher method)
(reagent.data.DataFetcher method)
query_id (reagent.ope.test.multiclass_bandits.MultiClassContext attribute)
(reagent.ope.test.yandex_web_search.LoggedQuery property)
(reagent.ope.test.yandex_web_search.TrainingQuery property)
query_terms (reagent.ope.test.yandex_web_search.LoggedQuery property)
(reagent.ope.test.yandex_web_search.TrainingQuery property)
R
RAdam (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
rand_string() (in module reagent.data.oss_data_fetcher)
random_action() (reagent.gym.envs.pomdp.pocman.PocManEnv static method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv static method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 static method)
random_document() (in module reagent.gym.envs.toy_vm)
random_grid() (reagent.ope.test.gridworld.GridWorld class method)
RandomActionsAlgo (class in reagent.mab.mab_algorithm)
RandomRLPolicy (class in reagent.ope.estimators.sequential_estimators)
RandomSearchOptimizer (class in reagent.lite.optimizer)
RANK_MODE (reagent.model_utils.seq2slate_utils.Seq2SlateMode attribute)
ranked_per_seq_probs (reagent.core.types.RankingOutput attribute)
(reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
ranked_per_symbol_probs (reagent.core.types.RankingOutput attribute)
(reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
ranked_tgt_out_idx (reagent.core.types.RankingOutput attribute)
(reagent.models.seq2slate.Seq2SlateTransformerOutput attribute)
RankingActorPredictorWrapper (class in reagent.prediction.predictor_wrapper)
RankingActorWithPreprocessor (class in reagent.prediction.predictor_wrapper)
RankingDistribution (class in reagent.ope.estimators.slate_estimators)
RankingOutput (class in reagent.core.types)
RankingParameters (class in reagent.core.parameters)
ratio_different_predictions_tolerance (reagent.core.parameters.RLParameters attribute)
raw (reagent.evaluation.cpe.CpeEstimate attribute)
(reagent.workflow.types.ModelFeatureConfigProvider__Union attribute)
raw_std_error (reagent.evaluation.cpe.CpeEstimate attribute)
RawModelFeatureConfigProvider (class in reagent.models.model_feature_config_provider)
RBF (reagent.prediction.ranking.predictor_wrapper.Kernel attribute)
reader_options (reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
ReaderOptions (class in reagent.workflow.types)
reagent
module
reagent.core
module
reagent.core.aggregators
module
reagent.core.base_dataclass
module
reagent.core.configuration
module
reagent.core.dataclasses
module
reagent.core.debug_on_error
module
reagent.core.fb_checker
module
reagent.core.multiprocess_utils
module
reagent.core.observers
module
reagent.core.parameters
module
reagent.core.parameters_seq2slate
module
reagent.core.registry_meta
module
reagent.core.report_utils
module
reagent.core.result_registries
module
reagent.core.result_types
module
reagent.core.running_stats
module
reagent.core.tagged_union
module
reagent.core.tensorboardX
module
reagent.core.torch_utils
module
reagent.core.tracker
module
reagent.core.types
module
reagent.core.utils
module
reagent.data
module
reagent.data.data_fetcher
module
reagent.data.manual_data_module
module
reagent.data.oss_data_fetcher
module
reagent.data.reagent_data_module
module
reagent.data.spark_utils
module
reagent.evaluation
module
reagent.evaluation.cpe
module
reagent.evaluation.doubly_robust_estimator
module
reagent.evaluation.evaluation_data_page
module
reagent.evaluation.evaluator
module
reagent.evaluation.feature_importance
module
reagent.evaluation.feature_importance.feature_importance_base
module
reagent.evaluation.feature_importance.feature_importance_perturbation
module
reagent.evaluation.ope_adapter
module
reagent.evaluation.sequential_doubly_robust_estimator
module
reagent.evaluation.weighted_sequential_doubly_robust_estimator
module
reagent.evaluation.world_model_evaluator
module
reagent.gym
module
reagent.gym.agents
module
reagent.gym.agents.agent
module
reagent.gym.agents.post_step
module
reagent.gym.datasets
module
reagent.gym.datasets.episodic_dataset
module
reagent.gym.datasets.replay_buffer_dataset
module
reagent.gym.envs
module
reagent.gym.envs.changing_arms
module
reagent.gym.envs.dynamics
module
reagent.gym.envs.dynamics.linear_dynamics
module
reagent.gym.envs.env_wrapper
module
reagent.gym.envs.functionality
module
reagent.gym.envs.functionality.possible_actions_mask_tester
module
reagent.gym.envs.gym
module
reagent.gym.envs.oracle_pvm
module
reagent.gym.envs.pomdp
module
reagent.gym.envs.pomdp.pocman
module
reagent.gym.envs.pomdp.state_embed_env
module
reagent.gym.envs.pomdp.string_game
module
reagent.gym.envs.pomdp.string_game_v1
module
reagent.gym.envs.recsim
module
reagent.gym.envs.toy_vm
module
reagent.gym.envs.utils
module
reagent.gym.envs.wrappers
module
reagent.gym.envs.wrappers.recsim
module
reagent.gym.envs.wrappers.simple_minigrid
module
reagent.gym.normalizers
module
reagent.gym.policies
module
reagent.gym.policies.policy
module
reagent.gym.policies.predictor_policies
module
reagent.gym.policies.random_policies
module
reagent.gym.policies.samplers
module
reagent.gym.policies.samplers.continuous_sampler
module
reagent.gym.policies.samplers.discrete_sampler
module
reagent.gym.policies.samplers.top_k_sampler
module
reagent.gym.policies.scorers
module
reagent.gym.policies.scorers.continuous_scorer
module
reagent.gym.policies.scorers.discrete_scorer
module
reagent.gym.policies.scorers.slate_q_scorer
module
reagent.gym.preprocessors
module
reagent.gym.preprocessors.default_preprocessors
module
reagent.gym.preprocessors.replay_buffer_inserters
module
reagent.gym.preprocessors.trainer_preprocessor
module
reagent.gym.runners
module
reagent.gym.runners.gymrunner
module
reagent.gym.tests
module
reagent.gym.tests.preprocessors
module
reagent.gym.tests.preprocessors.test_default_preprocessors
module
reagent.gym.tests.preprocessors.test_replay_buffer_inserters
module
reagent.gym.tests.test_gym
module
reagent.gym.tests.test_gym_datasets
module
reagent.gym.tests.test_gym_offline
module
reagent.gym.tests.test_gym_replay_buffer
module
reagent.gym.tests.test_linear_dynamics
module
reagent.gym.tests.test_pomdp
module
reagent.gym.tests.test_world_model
module
reagent.gym.types
module
reagent.gym.utils
module
reagent.lite
module
reagent.lite.optimizer
module
reagent.mab
module
reagent.mab.mab_algorithm
module
reagent.mab.simulation
module
reagent.mab.thompson_sampling
module
reagent.mab.ucb
module
reagent.model_managers
module
reagent.model_managers.actor_critic
module
reagent.model_managers.actor_critic.sac
module
reagent.model_managers.actor_critic.td3
module
reagent.model_managers.actor_critic_base
module
reagent.model_managers.discrete
module
reagent.model_managers.discrete.discrete_c51dqn
module
reagent.model_managers.discrete.discrete_crr
module
reagent.model_managers.discrete.discrete_dqn
module
reagent.model_managers.discrete.discrete_qrdqn
module
reagent.model_managers.discrete_dqn_base
module
reagent.model_managers.model_based
module
reagent.model_managers.model_based.cross_entropy_method
module
reagent.model_managers.model_based.seq2reward_model
module
reagent.model_managers.model_based.synthetic_reward
module
reagent.model_managers.model_based.world_model
module
reagent.model_managers.model_manager
module
reagent.model_managers.parametric
module
reagent.model_managers.parametric.parametric_dqn
module
reagent.model_managers.parametric_dqn_base
module
reagent.model_managers.policy_gradient
module
reagent.model_managers.policy_gradient.ppo
module
reagent.model_managers.policy_gradient.reinforce
module
reagent.model_managers.ranking
module
reagent.model_managers.ranking.slate_q
module
reagent.model_managers.slate_q_base
module
reagent.model_managers.union
module
reagent.model_managers.world_model_base
module
reagent.model_utils
module
reagent.model_utils.seq2slate_utils
module
reagent.models
module
reagent.models.actor
module
reagent.models.base
module
reagent.models.bcq
module
reagent.models.categorical_dqn
module
reagent.models.cem_planner
module
reagent.models.containers
module
reagent.models.convolutional_network
module
reagent.models.critic
module
reagent.models.dqn
module
reagent.models.dueling_q_network
module
reagent.models.embedding_bag_concat
module
reagent.models.fully_connected_network
module
reagent.models.linear_regression
module
reagent.models.mdn_rnn
module
reagent.models.mlp_scorer
module
reagent.models.model_feature_config_provider
module
reagent.models.no_soft_update_embedding
module
reagent.models.seq2reward_model
module
reagent.models.seq2slate
module
reagent.models.seq2slate_reward
module
reagent.models.synthetic_reward
module
reagent.models.world_model
module
reagent.net_builder
module
reagent.net_builder.categorical_dqn
module
reagent.net_builder.categorical_dqn.categorical
module
reagent.net_builder.categorical_dqn_net_builder
module
reagent.net_builder.continuous_actor
module
reagent.net_builder.continuous_actor.dirichlet_fully_connected
module
reagent.net_builder.continuous_actor.fully_connected
module
reagent.net_builder.continuous_actor.gaussian_fully_connected
module
reagent.net_builder.continuous_actor_net_builder
module
reagent.net_builder.discrete_actor
module
reagent.net_builder.discrete_actor.fully_connected
module
reagent.net_builder.discrete_actor_net_builder
module
reagent.net_builder.discrete_dqn
module
reagent.net_builder.discrete_dqn.dueling
module
reagent.net_builder.discrete_dqn.fully_connected
module
reagent.net_builder.discrete_dqn.fully_connected_with_embedding
module
reagent.net_builder.discrete_dqn_net_builder
module
reagent.net_builder.parametric_dqn
module
reagent.net_builder.parametric_dqn.fully_connected
module
reagent.net_builder.parametric_dqn_net_builder
module
reagent.net_builder.quantile_dqn
module
reagent.net_builder.quantile_dqn.dueling_quantile
module
reagent.net_builder.quantile_dqn.quantile
module
reagent.net_builder.quantile_dqn_net_builder
module
reagent.net_builder.slate_ranking
module
reagent.net_builder.slate_ranking.slate_ranking_scorer
module
reagent.net_builder.slate_ranking.slate_ranking_transformer
module
reagent.net_builder.slate_ranking_net_builder
module
reagent.net_builder.slate_reward
module
reagent.net_builder.slate_reward.slate_reward_gru
module
reagent.net_builder.slate_reward.slate_reward_transformer
module
reagent.net_builder.slate_reward_net_builder
module
reagent.net_builder.synthetic_reward
module
reagent.net_builder.synthetic_reward.ngram_synthetic_reward
module
reagent.net_builder.synthetic_reward.sequence_synthetic_reward
module
reagent.net_builder.synthetic_reward.single_step_synthetic_reward
module
reagent.net_builder.synthetic_reward.transformer_synthetic_reward
module
reagent.net_builder.synthetic_reward_net_builder
module
reagent.net_builder.unions
module
reagent.net_builder.value
module
reagent.net_builder.value.fully_connected
module
reagent.net_builder.value.seq2reward_rnn
module
reagent.net_builder.value_net_builder
module
reagent.ope
module
reagent.ope.datasets
module
reagent.ope.datasets.logged_dataset
module
reagent.ope.estimators
module
reagent.ope.estimators.contextual_bandits_estimators
module
reagent.ope.estimators.estimator
module
reagent.ope.estimators.sequential_estimators
module
reagent.ope.estimators.slate_estimators
module
reagent.ope.estimators.types
module
reagent.ope.test
module
reagent.ope.test.cartpole
module
reagent.ope.test.envs
module
reagent.ope.test.gridworld
module
reagent.ope.test.mslr_slate
module
reagent.ope.test.multiclass_bandits
module
reagent.ope.test.unit_tests
module
reagent.ope.test.unit_tests.test_contextual_bandit_estimators
module
reagent.ope.test.unit_tests.test_slate_estimators
module
reagent.ope.test.unit_tests.test_types
module
reagent.ope.test.unit_tests.test_utils
module
reagent.ope.test.yandex_web_search
module
reagent.ope.trainers
module
reagent.ope.trainers.linear_trainers
module
reagent.ope.trainers.rl_tabular_trainers
module
reagent.ope.utils
module
reagent.optimizer
module
reagent.optimizer.optimizer
module
reagent.optimizer.scheduler
module
reagent.optimizer.scheduler_union
module
reagent.optimizer.soft_update
module
reagent.optimizer.uninferrable_optimizers
module
reagent.optimizer.uninferrable_schedulers
module
reagent.optimizer.union
module
reagent.optimizer.utils
module
reagent.prediction
module
reagent.prediction.predictor_wrapper
module
reagent.prediction.ranking
module
reagent.prediction.ranking.predictor_wrapper
module
reagent.prediction.synthetic_reward
module
reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper
module
reagent.preprocessing
module
reagent.preprocessing.batch_preprocessor
module
reagent.preprocessing.identify_types
module
reagent.preprocessing.normalization
module
reagent.preprocessing.postprocessor
module
reagent.preprocessing.preprocessor
module
reagent.preprocessing.sparse_preprocessor
module
reagent.preprocessing.sparse_to_dense
module
reagent.preprocessing.transforms
module
reagent.preprocessing.types
module
reagent.publishers
module
reagent.publishers.file_system_publisher
module
reagent.publishers.model_publisher
module
reagent.publishers.no_publishing
module
reagent.publishers.union
module
reagent.replay_memory
module
reagent.replay_memory.circular_replay_buffer
module
reagent.replay_memory.prioritized_replay_buffer
module
reagent.replay_memory.sum_tree
module
reagent.replay_memory.utils
module
reagent.reporting
module
reagent.reporting.actor_critic_reporter
module
reagent.reporting.compound_reporter
module
reagent.reporting.discrete_crr_reporter
module
reagent.reporting.discrete_dqn_reporter
module
reagent.reporting.parametric_dqn_reporter
module
reagent.reporting.reporter_base
module
reagent.reporting.reward_network_reporter
module
reagent.reporting.seq2reward_reporter
module
reagent.reporting.slate_q_reporter
module
reagent.reporting.td3_reporter
module
reagent.reporting.world_model_reporter
module
reagent.samplers
module
reagent.samplers.frechet
module
reagent.scripts
module
reagent.training
module
reagent.training.c51_trainer
module
reagent.training.cb
module
reagent.training.cb.linucb_trainer
module
reagent.training.cem_trainer
module
reagent.training.cfeval
module
reagent.training.cfeval.bandit_reward_network_trainer
module
reagent.training.discrete_crr_trainer
module
reagent.training.dqn_trainer
module
reagent.training.dqn_trainer_base
module
reagent.training.gradient_free
module
reagent.training.gradient_free.ars_util
module
reagent.training.gradient_free.es_worker
module
reagent.training.gradient_free.evolution_pool
module
reagent.training.imitator_training
module
reagent.training.multi_stage_trainer
module
reagent.training.parameters
module
reagent.training.parametric_dqn_trainer
module
reagent.training.ppo_trainer
module
reagent.training.qrdqn_trainer
module
reagent.training.ranking
module
reagent.training.ranking.helper
module
reagent.training.ranking.seq2slate_attn_trainer
module
reagent.training.ranking.seq2slate_sim_trainer
module
reagent.training.ranking.seq2slate_tf_trainer
module
reagent.training.ranking.seq2slate_trainer
module
reagent.training.reagent_lightning_module
module
reagent.training.reinforce_trainer
module
reagent.training.reward_network_trainer
module
reagent.training.rl_trainer_pytorch
module
reagent.training.sac_trainer
module
reagent.training.slate_q_trainer
module
reagent.training.td3_trainer
module
reagent.training.utils
module
reagent.training.world_model
module
reagent.training.world_model.compress_model_trainer
module
reagent.training.world_model.mdnrnn_trainer
module
reagent.training.world_model.seq2reward_trainer
module
reagent.validators
module
reagent.validators.model_validator
module
reagent.validators.no_validation
module
reagent.validators.union
module
reagent.workflow
module
reagent.workflow.env
module
reagent.workflow.gym_batch_rl
module
reagent.workflow.identify_types_flow
module
reagent.workflow.training
module
reagent.workflow.training_reports
module
reagent.workflow.types
module
reagent.workflow.utils
module
ReAgentDataModule (class in reagent.data)
(class in reagent.data.reagent_data_module)
ReAgentLightningModule (class in reagent.training)
(class in reagent.training.reagent_lightning_module)
RecentValuesAggregator (class in reagent.core.aggregators)
RecSim (class in reagent.gym.envs)
(class in reagent.gym.envs.recsim)
(reagent.gym.envs.Env__Union attribute)
RecsimObsPreprocessor (class in reagent.gym.preprocessors.default_preprocessors)
RecSimReplayBufferInserter (class in reagent.gym.preprocessors.replay_buffer_inserters)
register_if_not_exists() (in module reagent.gym.envs.utils)
REGISTRY (reagent.core.result_registries.PublishingResult attribute)
(reagent.core.result_registries.TrainingReport attribute)
(reagent.core.result_registries.ValidationResult attribute)
(reagent.gym.envs.env_wrapper.EnvWrapper attribute)
(reagent.models.model_feature_config_provider.ModelFeatureConfigProvider attribute)
(reagent.optimizer.optimizer.OptimizerConfig attribute)
(reagent.optimizer.scheduler.LearningRateSchedulerConfig attribute)
(reagent.publishers.model_publisher.ModelPublisher attribute)
(reagent.validators.model_validator.ModelValidator attribute)
REGISTRY_FROZEN (reagent.core.result_registries.PublishingResult attribute)
(reagent.core.result_registries.TrainingReport attribute)
(reagent.core.result_registries.ValidationResult attribute)
(reagent.gym.envs.env_wrapper.EnvWrapper attribute)
(reagent.models.model_feature_config_provider.ModelFeatureConfigProvider attribute)
(reagent.optimizer.optimizer.OptimizerConfig attribute)
(reagent.optimizer.scheduler.LearningRateSchedulerConfig attribute)
(reagent.publishers.model_publisher.ModelPublisher attribute)
(reagent.validators.model_validator.ModelValidator attribute)
REGISTRY_NAME (reagent.core.result_registries.PublishingResult attribute)
(reagent.core.result_registries.TrainingReport attribute)
(reagent.core.result_registries.ValidationResult attribute)
(reagent.gym.envs.env_wrapper.EnvWrapper attribute)
(reagent.models.model_feature_config_provider.ModelFeatureConfigProvider attribute)
(reagent.optimizer.optimizer.OptimizerConfig attribute)
(reagent.optimizer.scheduler.LearningRateSchedulerConfig attribute)
(reagent.publishers.model_publisher.ModelPublisher attribute)
(reagent.validators.model_validator.ModelValidator attribute)
RegistryMeta (class in reagent.core.registry_meta)
reindex_multiple_tensors() (in module reagent.mab.mab_algorithm)
Reinforce (class in reagent.model_managers.policy_gradient)
(class in reagent.model_managers.policy_gradient.reinforce)
(reagent.model_managers.union.ModelManager__Union attribute)
reinforce_type() (reagent.gym.datasets.episodic_dataset.EpisodicDataset method)
(reagent.gym.datasets.replay_buffer_dataset.OfflineReplayBufferDataset method)
(reagent.gym.datasets.replay_buffer_dataset.ReplayBufferDataset method)
REINFORCEMENT_LEARNING (reagent.core.parameters_seq2slate.LearningMethod attribute)
ReinforceTrainer (class in reagent.training)
(class in reagent.training.reinforce_trainer)
ReinforceTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
relevances (reagent.ope.test.mslr_slate.MSLRDatasets property)
Rename (class in reagent.preprocessing.transforms)
repeat (reagent.evaluation.feature_importance.feature_importance_perturbation.FeatureImportancePerturbation attribute)
replace() (reagent.ope.estimators.types.Values method)
replay_buffer_to_pre_timeline_df() (in module reagent.replay_memory.utils)
ReplayBuffer (class in reagent.replay_memory)
(class in reagent.replay_memory.circular_replay_buffer)
ReplayBufferDataset (class in reagent.gym.datasets.replay_buffer_dataset)
ReplayElement (class in reagent.replay_memory.circular_replay_buffer)
report() (reagent.ope.estimators.estimator.EstimatorResults method)
report_results() (reagent.ope.estimators.estimator.Evaluator static method)
reporter (reagent.training.reagent_lightning_module.ReAgentLightningModule property)
(reagent.training.ReAgentLightningModule property)
ReporterBase (class in reagent.reporting)
(class in reagent.reporting.reporter_base)
reporting_frequency (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
resample_documents (reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
rescale_actions() (in module reagent.training.utils)
rescale_torch_tensor() (in module reagent.core.torch_utils)
reset() (reagent.core.observers.ValueListObserver method)
(reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter.EDPValueFunc method)
(reagent.gym.envs.changing_arms.ChangingArmsEnv method)
(reagent.gym.envs.dynamics.linear_dynamics.LinDynaEnv method)
(reagent.gym.envs.functionality.possible_actions_mask_tester.PossibleActionsMaskTester method)
(reagent.gym.envs.oracle_pvm.OraclePVM method)
(reagent.gym.envs.OraclePVM method)
(reagent.gym.envs.pomdp.pocman.Ghost method)
(reagent.gym.envs.pomdp.pocman.PocManEnv method)
(reagent.gym.envs.pomdp.state_embed_env.StateEmbedEnvironment method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
(reagent.gym.envs.RecSim method)
(reagent.gym.envs.recsim.RecSim method)
(reagent.gym.envs.toy_vm.ToyVMEnv method)
(reagent.gym.tests.test_gym_replay_buffer.TestEnv method)
(reagent.mab.mab_algorithm.MABAlgo method)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE method)
(reagent.ope.estimators.sequential_estimators.ValueFunction method)
(reagent.ope.estimators.types.Trainer method)
(reagent.ope.test.envs.Environment method)
(reagent.ope.test.gridworld.GridWorld method)
(reagent.ope.test.gridworld.NoiseGridWorldModel method)
(reagent.ope.trainers.rl_tabular_trainers.DPValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.EstimatedStateValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.MonteCarloValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.TabularValueFunction method)
ResidualBlock (class in reagent.models.synthetic_reward)
resolve_defaults() (in module reagent.core.configuration)
ResourceOptions (class in reagent.workflow.types)
ResultDiffs (class in reagent.ope.estimators.estimator)
results (reagent.ope.estimators.estimator.EstimatorResults attribute)
reward (reagent.core.types.BanditRewardModelInput attribute)
(reagent.core.types.BaseInput attribute)
(reagent.core.types.CBInput attribute)
(reagent.core.types.MemoryNetworkOutput attribute)
(reagent.core.types.PolicyGradientInput attribute)
(reagent.gym.types.Transition attribute)
(reagent.models.mdn_rnn.MDNRNNMemorySample attribute)
(reagent.ope.estimators.sequential_estimators.RewardProbability attribute)
(reagent.ope.estimators.sequential_estimators.StateReward attribute)
(reagent.ope.estimators.sequential_estimators.Transition attribute)
REWARD (reagent.preprocessing.types.InputColumn attribute)
reward_boost (reagent.core.parameters.RLParameters attribute)
(reagent.core.parameters.Seq2RewardTrainerParameters attribute)
(reagent.model_managers.world_model_base.WorldModelBase attribute)
reward_clamp (reagent.core.parameters_seq2slate.SimulationParameters attribute)
reward_clip (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
reward_dm (reagent.workflow.training_reports.DQNTrainingReport attribute)
reward_dr (reagent.workflow.training_reports.DQNTrainingReport attribute)
reward_ignore_threshold (reagent.training.parameters.RewardNetworkTrainerParameters attribute)
(reagent.training.RewardNetworkTrainerParameters attribute)
reward_ips (reagent.workflow.training_reports.DQNTrainingReport attribute)
reward_loss_weight (reagent.core.parameters.MDNRNNTrainerParameters attribute)
reward_mask (reagent.core.types.SlateQInput attribute)
REWARD_MASK (reagent.preprocessing.types.InputColumn attribute)
reward_name_path (reagent.core.parameters_seq2slate.SimulationParameters attribute)
reward_name_power (reagent.core.parameters_seq2slate.SimulationParameters attribute)
reward_name_weight (reagent.core.parameters_seq2slate.SimulationParameters attribute)
reward_network (reagent.training.parameters.Seq2SlateTrainerParameters attribute)
(reagent.training.Seq2SlateTrainerParameters attribute)
RewardClamp (class in reagent.core.parameters_seq2slate)
RewardDistribution (class in reagent.ope.estimators.slate_estimators)
RewardNetTrainer (class in reagent.training)
(class in reagent.training.reward_network_trainer)
RewardNetworkOutput (class in reagent.core.types)
RewardNetworkReporter (class in reagent.reporting.reward_network_reporter)
RewardNetworkTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
RewardOptions (class in reagent.workflow.types)
RewardProbability (class in reagent.ope.estimators.sequential_estimators)
rewards (reagent.ope.datasets.logged_dataset.BanditsDataset property)
RIGHT (reagent.gym.envs.pomdp.pocman.Action attribute)
rl (reagent.core.parameters.CEMTrainerParameters attribute)
(reagent.training.C51TrainerParameters attribute)
(reagent.training.CRRTrainerParameters attribute)
(reagent.training.DQNTrainerParameters attribute)
(reagent.training.parameters.C51TrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
(reagent.training.parameters.DQNTrainerParameters attribute)
(reagent.training.parameters.ParametricDQNTrainerParameters attribute)
(reagent.training.parameters.QRDQNTrainerParameters attribute)
(reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.parameters.TD3TrainerParameters attribute)
(reagent.training.ParametricDQNTrainerParameters attribute)
(reagent.training.QRDQNTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
(reagent.training.TD3TrainerParameters attribute)
rl_parameters (reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN property)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR property)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN property)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN property)
(reagent.model_managers.discrete.DiscreteC51DQN property)
(reagent.model_managers.discrete.DiscreteCRR property)
(reagent.model_managers.discrete.DiscreteDQN property)
(reagent.model_managers.discrete.DiscreteQRDQN property)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase property)
(reagent.model_managers.parametric.parametric_dqn.ParametricDQN property)
(reagent.model_managers.parametric.ParametricDQN property)
(reagent.training.c51_trainer.C51Trainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.discrete_crr_trainer.DiscreteCRRTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.dqn_trainer.DQNTrainer attribute)
(reagent.training.dqn_trainer_base.DQNTrainerBaseLightning attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin attribute)
(reagent.training.sac_trainer.SACTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.slate_q_trainer.SlateQTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.td3_trainer.TD3Trainer attribute)
(reagent.training.TD3Trainer attribute)
rl_temperature (reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
RLEstimator (class in reagent.ope.estimators.sequential_estimators)
RLEstimatorInput (class in reagent.ope.estimators.sequential_estimators)
RLParameters (class in reagent.core.parameters)
RLPolicy (class in reagent.ope.estimators.sequential_estimators)
RLTrainerMixin (class in reagent.training.rl_trainer_pytorch)
RLTrainingOutput (class in reagent.workflow.types)
RLTrainingReport (class in reagent.workflow.types)
rmse (reagent.ope.estimators.estimator.ResultDiffs property)
RMSprop (reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
Rprop (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
run_dualdice_test() (in module reagent.ope.test.cartpole)
run_episode() (in module reagent.gym.runners.gymrunner)
run_epoch() (reagent.training.gradient_free.es_worker.EsWorker method)
run_evaluation() (in module reagent.ope.estimators.estimator)
run_feature_identification() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.model_managers.actor_critic_base.ActorCriticDataModule method)
(reagent.model_managers.discrete_dqn_base.DiscreteDqnDataModule method)
(reagent.model_managers.model_based.synthetic_reward.SyntheticRewardDataModule method)
(reagent.model_managers.parametric_dqn_base.ParametricDqnDataModule method)
(reagent.model_managers.world_model_base.WorldModelDataModule method)
run_n_episodes() (reagent.gym.tests.test_linear_dynamics.TestLinearDynamicsEnvironment method)
run_publisher() (in module reagent.workflow.training)
run_test_offline() (in module reagent.gym.tests.test_gym_offline)
run_test_online_episode() (in module reagent.gym.tests.test_gym)
run_test_replay_buffer() (in module reagent.gym.tests.test_gym)
run_validator() (in module reagent.workflow.training)
RunningAverage (class in reagent.ope.utils)
RunningStats (class in reagent.core.running_stats)
S
SAC (class in reagent.model_managers.actor_critic)
(class in reagent.model_managers.actor_critic.sac)
(reagent.model_managers.union.ModelManager__Union attribute)
sac_scorer() (in module reagent.gym.policies.scorers.continuous_scorer)
SACTrainer (class in reagent.training)
(class in reagent.training.sac_trainer)
SACTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
sample() (reagent.lite.optimizer.BayesianOptimizer method)
(reagent.lite.optimizer.ComboOptimizerBase method)
(reagent.lite.optimizer.LogitBasedComboOptimizerBase method)
(reagent.lite.optimizer.NeverGradOptimizer method)
(reagent.lite.optimizer.PolicyGradientOptimizer method)
(reagent.lite.optimizer.QLearningOptimizer method)
(reagent.lite.optimizer.RandomSearchOptimizer method)
(reagent.ope.estimators.types.Values method)
(reagent.replay_memory.sum_tree.SumTree method)
sample_action() (reagent.gym.policies.samplers.continuous_sampler.GaussianSampler method)
(reagent.gym.policies.samplers.discrete_sampler.EpsilonGreedyActionSampler method)
(reagent.gym.policies.samplers.discrete_sampler.GreedyActionSampler method)
(reagent.gym.policies.samplers.discrete_sampler.SoftmaxActionSampler method)
(reagent.gym.policies.samplers.top_k_sampler.TopKSampler method)
(reagent.gym.types.Sampler method)
(reagent.samplers.frechet.FrechetSort method)
(reagent.samplers.FrechetSort method)
sample_all_valid_transitions() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
sample_from_logits() (in module reagent.lite.optimizer)
sample_gumbel() (in module reagent.lite.optimizer)
sample_index_batch() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.prioritized_replay_buffer.PrioritizedReplayBuffer method)
(reagent.replay_memory.PrioritizedReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
sample_internal() (reagent.lite.optimizer.BayesianMLPEnsemblerOptimizer method)
(reagent.lite.optimizer.ComboOptimizerBase method)
(reagent.lite.optimizer.GumbelSoftmaxOptimizer method)
(reagent.lite.optimizer.NeverGradOptimizer method)
(reagent.lite.optimizer.PolicyGradientOptimizer method)
(reagent.lite.optimizer.QLearningOptimizer method)
(reagent.lite.optimizer.RandomSearchOptimizer method)
sample_memories() (reagent.models.mdn_rnn.MDNRNNMemoryPool method)
sample_perturbed_params() (reagent.training.gradient_free.ars_util.ARSOptimizer method)
sample_reward_next_state_terminal() (reagent.models.cem_planner.CEMPlannerNetwork method)
sample_slate() (reagent.ope.estimators.slate_estimators.SlateItemProbabilities method)
(reagent.ope.estimators.slate_estimators.SlateSlotItemProbabilities method)
sample_terminal() (reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
sample_to_output() (reagent.replay_memory.circular_replay_buffer.DenseMetadata method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata method)
sample_transition_batch() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.prioritized_replay_buffer.PrioritizedReplayBuffer method)
(reagent.replay_memory.PrioritizedReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
sample_weights (reagent.ope.test.mslr_slate.MSLRDatasets property)
Sampler (class in reagent.gym.types)
sampler_temperature (reagent.model_managers.policy_gradient.PPO attribute)
(reagent.model_managers.policy_gradient.ppo.PPO attribute)
(reagent.model_managers.policy_gradient.Reinforce attribute)
(reagent.model_managers.policy_gradient.reinforce.Reinforce attribute)
samples (reagent.ope.estimators.contextual_bandits_estimators.BanditsEstimatorInput attribute)
(reagent.ope.estimators.slate_estimators.SlateEstimatorInput attribute)
save() (reagent.ope.test.mslr_slate.MSLRDatasets method)
(reagent.ope.trainers.rl_tabular_trainers.TabularPolicy method)
(reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
save_critic_bool (reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
save_model() (reagent.ope.estimators.types.Trainer method)
scale_fn (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
scale_grad_by_freq (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
scale_log (reagent.gym.types.GaussianSamplerScore attribute)
scale_mode (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
score() (reagent.ope.estimators.types.Trainer method)
(reagent.ope.trainers.linear_trainers.LinearTrainer method)
(reagent.ope.trainers.linear_trainers.NNTrainer method)
score_cap (reagent.net_builder.slate_ranking.slate_ranking_scorer.FinalLayer attribute)
score_cpe() (reagent.evaluation.evaluator.Evaluator method)
(reagent.evaluation.ope_adapter.OPEvaluator method)
score_document() (reagent.gym.envs.recsim.UserState method)
ScoreCap (class in reagent.net_builder.slate_ranking.slate_ranking_scorer)
scores (reagent.core.types.SlateScoreBatch attribute)
(reagent.ope.estimators.types.PredictResults attribute)
SCORES (reagent.preprocessing.types.InputColumn attribute)
seed() (reagent.gym.envs.changing_arms.ChangingArmsEnv method)
(reagent.gym.envs.pomdp.pocman.PocManEnv method)
(reagent.gym.envs.pomdp.state_embed_env.StateEmbedEnvironment method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
(reagent.gym.envs.toy_vm.ToyVMEnv method)
(reagent.gym.tests.test_gym_replay_buffer.TestEnv method)
select_maze() (in module reagent.gym.envs.pomdp.pocman)
select_relevant_columns() (in module reagent.data.oss_data_fetcher)
select_slate() (reagent.core.types.DocList method)
SelectValuePresenceColumns (class in reagent.preprocessing.transforms)
seq2reward_report (reagent.workflow.types.RLTrainingReport attribute)
Seq2RewardCompressReporter (class in reagent.reporting.seq2reward_reporter)
Seq2RewardModel (class in reagent.model_managers.model_based)
(class in reagent.model_managers.model_based.seq2reward_model)
(reagent.model_managers.union.ModelManager__Union attribute)
Seq2RewardNetBuilder (class in reagent.net_builder.value.seq2reward_rnn)
(reagent.net_builder.unions.ValueNetBuilder__Union attribute)
Seq2RewardNetwork (class in reagent.models)
(class in reagent.models.seq2reward_model)
Seq2RewardOutput (class in reagent.core.types)
Seq2RewardPlanShortSeqWithPreprocessor (class in reagent.prediction.predictor_wrapper)
Seq2RewardReporter (class in reagent.reporting.seq2reward_reporter)
Seq2RewardTrainer (class in reagent.training.world_model.seq2reward_trainer)
Seq2RewardTrainerParameters (class in reagent.core.parameters)
Seq2RewardTrainingReport (class in reagent.workflow.training_reports)
Seq2RewardWithPreprocessor (class in reagent.prediction.predictor_wrapper)
Seq2SlateGRURewardNet (class in reagent.models.seq2slate_reward)
Seq2SlateMode (class in reagent.model_utils.seq2slate_utils)
Seq2SlateNet (class in reagent.models.seq2slate)
Seq2SlateOutputArch (class in reagent.model_utils.seq2slate_utils)
Seq2SlatePairwiseAttnTrainer (class in reagent.training.ranking.seq2slate_attn_trainer)
Seq2SlateParameters (class in reagent.core.parameters)
Seq2SlatePredictorWrapper (class in reagent.prediction.predictor_wrapper)
Seq2SlateRewardNetBase (class in reagent.models.seq2slate_reward)
Seq2SlateRewardNetEnsemble (class in reagent.models.seq2slate_reward)
Seq2SlateRewardNetJITWrapper (class in reagent.models.seq2slate_reward)
Seq2SlateRewardWithPreprocessor (class in reagent.prediction.predictor_wrapper)
Seq2SlateSimulationTrainer (class in reagent.training.ranking.seq2slate_sim_trainer)
Seq2SlateTeacherForcingTrainer (class in reagent.training.ranking.seq2slate_tf_trainer)
Seq2SlateTrainer (class in reagent.training.ranking.seq2slate_trainer)
Seq2SlateTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
Seq2SlateTransformerModel (class in reagent.models.seq2slate)
Seq2SlateTransformerNet (class in reagent.models.seq2slate)
Seq2SlateTransformerOutput (class in reagent.models.seq2slate)
Seq2SlateTransformerRewardNet (class in reagent.models.seq2slate_reward)
Seq2SlateWithPreprocessor (class in reagent.prediction.predictor_wrapper)
SEQ_TO_REWARD (reagent.core.parameters.ProblemDomain attribute)
sequence_number (reagent.core.types.ExtraData attribute)
(reagent.core.types.SlateScoreBatch attribute)
(reagent.evaluation.evaluation_data_page.EvaluationDataPage attribute)
(reagent.gym.types.Transition attribute)
SEQUENCE_NUMBER (reagent.preprocessing.types.InputColumn attribute)
SequenceSyntheticReward (class in reagent.net_builder.synthetic_reward.sequence_synthetic_reward)
(reagent.net_builder.unions.SyntheticRewardNetBuilder__Union attribute)
SequenceSyntheticRewardNet (class in reagent.models.synthetic_reward)
Sequential (class in reagent.models)
(class in reagent.models.containers)
sequential_doubly_robust (reagent.evaluation.cpe.CpeEstimateSet attribute)
SequentialDoublyRobustEstimator (class in reagent.evaluation.sequential_doubly_robust_estimator)
SequentialLR (reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
SequentialMultiArguments (class in reagent.models.synthetic_reward)
SequentialOPEstimatorAdapter (class in reagent.evaluation.ope_adapter)
SequentialOPEstimatorAdapter.EDPSeqPolicy (class in reagent.evaluation.ope_adapter)
SequentialOPEstimatorAdapter.EDPValueFunc (class in reagent.evaluation.ope_adapter)
serialize() (in module reagent.preprocessing.normalization)
serialize_one() (in module reagent.preprocessing.normalization)
serve_mean_policy (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
serving_action_extractor() (reagent.gym.envs.env_wrapper.EnvWrapper method)
serving_module_names() (reagent.model_managers.discrete.discrete_crr.DiscreteCRR method)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN method)
(reagent.model_managers.discrete.DiscreteCRR method)
(reagent.model_managers.discrete.DiscreteDQN method)
(reagent.model_managers.model_manager.ModelManager method)
serving_obs_preprocessor() (reagent.gym.envs.changing_arms.ChangingArms method)
(reagent.gym.envs.ChangingArms method)
(reagent.gym.envs.env_wrapper.EnvWrapper method)
(reagent.gym.envs.Gym method)
(reagent.gym.envs.gym.Gym method)
(reagent.gym.envs.oracle_pvm.OraclePVM method)
(reagent.gym.envs.OraclePVM method)
(reagent.gym.envs.RecSim method)
(reagent.gym.envs.recsim.RecSim method)
(reagent.gym.envs.toy_vm.ToyVM method)
(reagent.gym.envs.ToyVM method)
(reagent.gym.Gym method)
serving_to_feature_data() (in module reagent.prediction.predictor_wrapper)
ServingFeatureData (class in reagent.core.types)
set() (reagent.replay_memory.sum_tree.SumTree method)
set_clean_stop() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
set_flush_function() (reagent.reporting.compound_reporter.CompoundReporter method)
(reagent.reporting.CompoundReporter method)
set_index_valid_status() (reagent.replay_memory.circular_replay_buffer.ReplayBuffer method)
(reagent.replay_memory.ReplayBuffer method)
set_max_steps (reagent.gym.envs.Gym attribute)
(reagent.gym.envs.gym.Gym attribute)
(reagent.gym.Gym attribute)
set_metric_as_reward() (reagent.evaluation.evaluation_data_page.EvaluationDataPage method)
set_missing_value_to_zero (reagent.core.parameters.RLParameters attribute)
(reagent.workflow.types.PreprocessingOptions attribute)
set_priority() (reagent.replay_memory.prioritized_replay_buffer.PrioritizedReplayBuffer method)
(reagent.replay_memory.PrioritizedReplayBuffer method)
set_reporter() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
set_reward_col_as_reward() (in module reagent.data.oss_data_fetcher)
set_seed() (in module reagent.gym.utils)
setup() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
setUp() (reagent.gym.tests.test_gym_datasets.TestEpisodicDataset method)
(reagent.gym.tests.test_linear_dynamics.TestLinearDynamicsEnvironment method)
(reagent.gym.tests.test_pomdp.TestPOMDPEnvironment method)
(reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators method)
(reagent.ope.test.unit_tests.test_slate_estimators.TestEstimator method)
(reagent.ope.test.unit_tests.test_types.TestDistribution method)
(reagent.ope.test.unit_tests.test_types.TestTypes method)
(reagent.ope.test.unit_tests.test_types.TestValues method)
SGD (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
SGDClassifierTrainer (class in reagent.ope.trainers.linear_trainers)
shape (reagent.core.types.FrechetSortConfig attribute)
(reagent.replay_memory.circular_replay_buffer.DenseMetadata attribute)
should_generate_eval_dataset (reagent.data.manual_data_module.ManualDataModule property)
(reagent.data.ManualDataModule property)
(reagent.model_managers.actor_critic_base.ActorCriticDataModule property)
(reagent.model_managers.discrete_dqn_base.DiscreteDqnDataModule property)
(reagent.model_managers.model_based.synthetic_reward.SyntheticRewardDataModule property)
(reagent.model_managers.parametric_dqn_base.ParametricDqnDataModule property)
(reagent.model_managers.world_model_base.WorldModelDataModule property)
should_publish (reagent.core.result_registries.ValidationResult attribute)
(reagent.core.result_types.NoValidationResults attribute)
shuffle_exp_replay() (in module reagent.lite.optimizer)
sigmas (reagent.core.types.MemoryNetworkOutput attribute)
sigmoid (reagent.net_builder.slate_ranking.slate_ranking_scorer.FinalLayer attribute)
SimpleObsWrapper (class in reagent.gym.envs.wrappers.simple_minigrid)
simulate_response() (reagent.gym.envs.recsim.MulticlickIEvUserModel method)
simulate_reward() (in module reagent.gym.envs.toy_vm)
simulation (reagent.core.parameters.Seq2SlateParameters attribute)
SIMULATION (reagent.core.parameters_seq2slate.LearningMethod attribute)
SimulationParameters (class in reagent.core.parameters_seq2slate)
single_evaluation_bandit_algo() (in module reagent.mab.simulation)
single_selection (reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
(reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
SingleStepSyntheticReward (class in reagent.net_builder.synthetic_reward.single_step_synthetic_reward)
(reagent.net_builder.unions.SyntheticRewardNetBuilder__Union attribute)
SingleStepSyntheticRewardNet (class in reagent.models.synthetic_reward)
size (reagent.replay_memory.circular_replay_buffer.ReplayBuffer property)
(reagent.replay_memory.ReplayBuffer property)
sizes (reagent.net_builder.categorical_dqn.categorical.Categorical attribute)
(reagent.net_builder.continuous_actor.dirichlet_fully_connected.DirichletFullyConnected attribute)
(reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.dueling.Dueling attribute)
(reagent.net_builder.discrete_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.fully_connected_with_embedding.FullyConnectedWithEmbedding attribute)
(reagent.net_builder.parametric_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.quantile_dqn.dueling_quantile.DuelingQuantile attribute)
(reagent.net_builder.quantile_dqn.quantile.Quantile attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward attribute)
(reagent.net_builder.value.fully_connected.FullyConnected attribute)
skip_box_cox (reagent.workflow.types.PreprocessingOptions attribute)
skip_quantiles (reagent.workflow.types.PreprocessingOptions attribute)
Slate (class in reagent.ope.estimators.slate_estimators)
slate_feature_id (reagent.model_managers.slate_q_base.SlateQBase attribute)
slate_opt_parameters (reagent.training.parameters.SlateQTrainerParameters attribute)
(reagent.training.SlateQTrainerParameters attribute)
slate_probability() (reagent.ope.estimators.slate_estimators.SlateItemProbabilities method)
(reagent.ope.estimators.slate_estimators.SlateSlotItemProbabilities method)
slate_q_report (reagent.workflow.types.RLTrainingReport attribute)
slate_q_scorer() (in module reagent.gym.policies.scorers.slate_q_scorer)
slate_q_serving_scorer() (in module reagent.gym.policies.scorers.slate_q_scorer)
slate_reward (reagent.core.types.PreprocessedRankingInput attribute)
SLATE_REWARD (reagent.preprocessing.types.InputColumn attribute)
slate_score_id (reagent.model_managers.slate_q_base.SlateQBase attribute)
slate_size (reagent.gym.envs.OraclePVM attribute)
(reagent.gym.envs.RecSim attribute)
(reagent.gym.envs.recsim.RecSim attribute)
(reagent.gym.envs.toy_vm.ToyVM attribute)
(reagent.gym.envs.ToyVM attribute)
(reagent.model_managers.ranking.slate_q.SlateQ attribute)
(reagent.model_managers.ranking.SlateQ attribute)
slate_space() (reagent.ope.estimators.slate_estimators.SlateItemProbabilities method)
SlateBatchNorm1d (class in reagent.models.fully_connected_network)
SlateContext (class in reagent.ope.estimators.slate_estimators)
SlateEstimator (class in reagent.ope.estimators.slate_estimators)
SlateEstimatorInput (class in reagent.ope.estimators.slate_estimators)
SlateItemFeatures (class in reagent.ope.estimators.slate_estimators)
SlateItemProbabilities (class in reagent.ope.estimators.slate_estimators)
SlateItems (class in reagent.ope.estimators.slate_estimators)
SlateItemValues (class in reagent.ope.estimators.slate_estimators)
SlateMetric (class in reagent.ope.estimators.slate_estimators)
SlateModel (class in reagent.ope.estimators.slate_estimators)
SlateOptMethod (class in reagent.core.parameters)
SlateOptParameters (class in reagent.core.parameters)
SlatePolicy (class in reagent.ope.estimators.slate_estimators)
SlateQ (class in reagent.model_managers.ranking)
(class in reagent.model_managers.ranking.slate_q)
(reagent.model_managers.union.ModelManager__Union attribute)
SlateQBase (class in reagent.model_managers.slate_q_base)
SlateQInput (class in reagent.core.types)
SlateQInputMaker (class in reagent.gym.preprocessors.trainer_preprocessor)
SlateQReporter (class in reagent.reporting.slate_q_reporter)
SlateQTrainer (class in reagent.training)
(class in reagent.training.slate_q_trainer)
SlateQTrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
SlateQTrainingReport (class in reagent.workflow.training_reports)
SlateRankingNetBuilder (class in reagent.net_builder.slate_ranking_net_builder)
SlateRankingNetBuilder__Union (class in reagent.net_builder.slate_ranking)
SlateRankingPreprocessor (class in reagent.prediction.predictor_wrapper)
SlateRankingScorer (class in reagent.net_builder.slate_ranking.slate_ranking_scorer)
(reagent.net_builder.slate_ranking.SlateRankingNetBuilder__Union attribute)
SlateRankingTransformer (class in reagent.net_builder.slate_ranking.slate_ranking_transformer)
(reagent.net_builder.slate_ranking.SlateRankingNetBuilder__Union attribute)
SlateRewardGRU (class in reagent.net_builder.slate_reward.slate_reward_gru)
(reagent.net_builder.slate_reward.SlateRewardNetBuilder__Union attribute)
SlateRewardNetBuilder (class in reagent.net_builder.slate_reward_net_builder)
SlateRewardNetBuilder__Union (class in reagent.net_builder.slate_reward)
SlateRewardTransformer (class in reagent.net_builder.slate_reward.slate_reward_transformer)
(reagent.net_builder.slate_reward.SlateRewardNetBuilder__Union attribute)
SlateScoreBatch (class in reagent.core.types)
SlateSlotFeatures (class in reagent.ope.estimators.slate_estimators)
SlateSlotItemExpectations (class in reagent.ope.estimators.slate_estimators)
SlateSlotItemProbabilities (class in reagent.ope.estimators.slate_estimators)
SlateSlotItemValues (class in reagent.ope.estimators.slate_estimators)
SlateSlotObjects (class in reagent.ope.estimators.slate_estimators)
SlateSlots (class in reagent.ope.estimators.slate_estimators)
SlateSlotValues (class in reagent.ope.estimators.slate_estimators)
SlateView (class in reagent.preprocessing.transforms)
slot_features() (reagent.ope.estimators.slate_estimators.Slate method)
slot_item_expectations() (reagent.ope.estimators.slate_estimators.SlateItemProbabilities method)
(reagent.ope.estimators.slate_estimators.SlateSlotItemProbabilities method)
slot_probabilities (reagent.ope.estimators.slate_estimators.LogSample attribute)
slot_probabilities() (reagent.ope.estimators.slate_estimators.SlateModel method)
(reagent.ope.test.yandex_web_search.YandexSlateModel method)
slot_relevances() (reagent.ope.test.yandex_web_search.TrainingDataset method)
slot_values() (reagent.ope.estimators.slate_estimators.DCGSlateMetric method)
(reagent.ope.estimators.slate_estimators.ERRSlateMetric method)
(reagent.ope.estimators.slate_estimators.Slate method)
(reagent.ope.estimators.slate_estimators.SlateMetric method)
slot_weights (reagent.ope.estimators.slate_estimators.LogSample attribute)
slot_weights() (reagent.ope.estimators.slate_estimators.DCGSlateMetric method)
(reagent.ope.estimators.slate_estimators.ERRSlateMetric method)
(reagent.ope.estimators.slate_estimators.NDCGSlateMetric method)
(reagent.ope.estimators.slate_estimators.SlateMetric method)
slots (reagent.ope.estimators.slate_estimators.SlateContext attribute)
(reagent.ope.estimators.slate_estimators.SlateSlotObjects property)
SmoothL1Loss (reagent.training.reward_network_trainer.LossFunction attribute)
soft_update_result() (reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
softmax (reagent.core.types.DqnPolicyActionSet attribute)
softmax() (in module reagent.core.torch_utils)
softmax_act_name (reagent.core.types.DqnPolicyActionSet attribute)
softmax_act_prob (reagent.core.types.DqnPolicyActionSet attribute)
softmax_policy (reagent.core.parameters.RLParameters attribute)
SoftmaxActionSampler (class in reagent.gym.policies.samplers.discrete_sampler)
SoftUpdate (class in reagent.optimizer)
(class in reagent.optimizer.soft_update)
sol_to_tensors() (in module reagent.lite.optimizer)
sort() (reagent.evaluation.evaluation_data_page.EvaluationDataPage method)
(reagent.ope.estimators.types.Values method)
sort_features_by_normalization() (in module reagent.preprocessing.normalization)
sorted_feature_ids (reagent.evaluation.feature_importance.feature_importance_base.FeatureImportanceBase attribute)
source_file (reagent.ope.test.mslr_slate.MSLRDatasets property)
space (reagent.ope.estimators.types.ActionSpace property)
SPARK_JAR_FROM_ROOT_DIR (in module reagent.data.spark_utils)
sparse (reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
sparse_input_prototype() (in module reagent.prediction.predictor_wrapper)
SparseAdam (class in reagent.optimizer.uninferrable_optimizers)
(reagent.optimizer.Optimizer__Union attribute)
(reagent.optimizer.union.Optimizer__Union attribute)
SparsePreprocessor (class in reagent.preprocessing.sparse_preprocessor)
SparseToDenseProcessor (class in reagent.preprocessing.sparse_to_dense)
split_features() (in module reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper)
split_state_transform() (reagent.gym.envs.changing_arms.ChangingArms method)
(reagent.gym.envs.ChangingArms method)
squashed_mean (reagent.core.types.ActorOutput attribute)
src_in_idx (reagent.core.types.PreprocessedRankingInput attribute)
src_seq (reagent.core.types.PreprocessedRankingInput attribute)
src_src_mask (reagent.core.types.PreprocessedRankingInput attribute)
stack() (in module reagent.core.torch_utils)
StackDenseFixedSizeArray (class in reagent.preprocessing.transforms)
stacked_float_features (reagent.core.types.FeatureData attribute)
start() (in module reagent.core.debug_on_error)
State (class in reagent.ope.estimators.sequential_estimators)
STATE (reagent.core.parameters.NormalizationKey attribute)
state (reagent.core.types.BanditRewardModelInput attribute)
(reagent.core.types.BaseInput attribute)
(reagent.core.types.PolicyGradientInput attribute)
(reagent.core.types.PreprocessedRankingInput attribute)
(reagent.gym.envs.changing_arms.ChangingArmsEnv property)
(reagent.models.mdn_rnn.MDNRNNMemorySample attribute)
(reagent.ope.estimators.sequential_estimators.StateReward attribute)
(reagent.ope.estimators.sequential_estimators.Transition attribute)
state_action_value() (reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter.EDPValueFunc method)
(reagent.ope.estimators.sequential_estimators.ValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.EstimatedStateValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.TabularValueFunction method)
state_and_metrics_sparse2dense() (in module reagent.data.oss_data_fetcher)
state_dim (reagent.models.seq2slate.Seq2SlateNet attribute)
(reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
state_embed_dim (reagent.core.parameters.TransformerParameters attribute)
(reagent.models.seq2slate.Seq2SlateTransformerNet attribute)
state_feature_config (reagent.model_managers.actor_critic_base.ActorCriticBase property)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase property)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward property)
(reagent.model_managers.model_based.SyntheticReward property)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase property)
(reagent.model_managers.policy_gradient.PPO property)
(reagent.model_managers.policy_gradient.ppo.PPO property)
(reagent.model_managers.policy_gradient.Reinforce property)
(reagent.model_managers.policy_gradient.reinforce.Reinforce property)
(reagent.model_managers.slate_q_base.SlateQBase property)
state_feature_config_provider (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.discrete.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteDQN attribute)
(reagent.model_managers.discrete.DiscreteQRDQN attribute)
(reagent.model_managers.discrete_dqn_base.DiscreteDQNBase attribute)
(reagent.model_managers.policy_gradient.PPO attribute)
(reagent.model_managers.policy_gradient.ppo.PPO attribute)
(reagent.model_managers.policy_gradient.Reinforce attribute)
(reagent.model_managers.policy_gradient.reinforce.Reinforce attribute)
state_feature_hashes_override (reagent.core.parameters.StateFeatureParameters attribute)
state_feature_names_override (reagent.core.parameters.StateFeatureParameters attribute)
STATE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
state_float_features (reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
(reagent.model_managers.slate_q_base.SlateQBase attribute)
STATE_ID_LIST_FEATURES (reagent.preprocessing.types.InputColumn attribute)
STATE_ID_SCORE_LIST_FEATURES (reagent.preprocessing.types.InputColumn attribute)
state_preprocessing_options (reagent.model_managers.actor_critic_base.ActorCriticBase attribute)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.parametric_dqn_base.ParametricDQNBase attribute)
(reagent.model_managers.slate_q_base.SlateQBase attribute)
STATE_SEQUENCE_FEATURES (reagent.preprocessing.types.InputColumn attribute)
state_sorted_features (reagent.prediction.predictor_wrapper.Seq2SlateRewardWithPreprocessor property)
state_value() (reagent.evaluation.ope_adapter.SequentialOPEstimatorAdapter.EDPValueFunc method)
(reagent.ope.estimators.sequential_estimators.ValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.DPValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.EstimatedStateValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.MonteCarloValueFunction method)
(reagent.ope.trainers.rl_tabular_trainers.TabularValueFunction method)
StateEmbedEnvironment (class in reagent.gym.envs.pomdp.state_embed_env)
StateFeatureParameters (class in reagent.core.parameters)
StateReward (class in reagent.ope.estimators.sequential_estimators)
states (reagent.ope.test.envs.Environment property)
(reagent.ope.test.gridworld.GridWorld property)
(reagent.ope.test.gridworld.NoiseGridWorldModel property)
status (reagent.ope.estimators.sequential_estimators.Transition attribute)
std (reagent.core.running_stats.RunningStats property)
stddev (reagent.core.parameters.NormalizationParameters attribute)
step (reagent.core.types.BaseInput attribute)
STEP (reagent.preprocessing.types.InputColumn attribute)
step() (reagent.gym.envs.changing_arms.ChangingArmsEnv method)
(reagent.gym.envs.dynamics.linear_dynamics.LinDynaEnv method)
(reagent.gym.envs.functionality.possible_actions_mask_tester.PossibleActionsMaskTester method)
(reagent.gym.envs.oracle_pvm.OraclePVM method)
(reagent.gym.envs.OraclePVM method)
(reagent.gym.envs.pomdp.pocman.PocManEnv method)
(reagent.gym.envs.pomdp.state_embed_env.StateEmbedEnvironment method)
(reagent.gym.envs.pomdp.string_game.StringGameEnv method)
(reagent.gym.envs.pomdp.string_game_v1.StringGameEnvV1 method)
(reagent.gym.envs.RecSim method)
(reagent.gym.envs.recsim.RecSim method)
(reagent.gym.envs.toy_vm.ToyVMEnv method)
(reagent.gym.tests.test_gym_replay_buffer.TestEnv method)
(reagent.ope.test.envs.Environment method)
(reagent.optimizer.soft_update.SoftUpdate method)
(reagent.optimizer.SoftUpdate method)
step_predict_net_size (reagent.core.parameters.Seq2RewardTrainerParameters attribute)
step_size (reagent.optimizer.uninferrable_schedulers.StepLR attribute)
step_size_down (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
step_size_up (reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
step_sizes (reagent.optimizer.uninferrable_optimizers.Rprop attribute)
StepLR (class in reagent.optimizer.uninferrable_schedulers)
(reagent.optimizer.scheduler_union.LearningRateScheduler__Union attribute)
steps_per_epoch (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
StochasticActor (class in reagent.models.actor)
StoppingEpochCallback (class in reagent.training)
(class in reagent.training.reagent_lightning_module)
stratified_sample() (reagent.replay_memory.sum_tree.SumTree method)
StringGameEnv (class in reagent.gym.envs.pomdp.string_game)
StringGameEnvV1 (class in reagent.gym.envs.pomdp.string_game_v1)
StringKeySparseToDenseProcessor (class in reagent.preprocessing.sparse_to_dense)
SublayerConnection (class in reagent.models.seq2slate)
subsequent_and_padding_mask() (in module reagent.model_utils.seq2slate_utils)
subsequent_mask() (in module reagent.model_utils.seq2slate_utils)
subtract_mean (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.parameters.ReinforceTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
(reagent.training.ReinforceTrainerParameters attribute)
success (reagent.core.result_registries.PublishingResult attribute)
(reagent.core.result_types.NoPublishingResults attribute)
summary_writer (reagent.training.reagent_lightning_module.ReAgentLightningModule property)
(reagent.training.ReAgentLightningModule property)
summary_writer_context() (in module reagent.core.tensorboardX)
SummaryWriterContext (class in reagent.core.tensorboardX)
SummaryWriterContextMeta (class in reagent.core.tensorboardX)
SumTree (class in reagent.replay_memory.sum_tree)
swap_dist() (in module reagent.training.ranking.seq2slate_sim_trainer)
swap_dist_in_slate() (in module reagent.training.ranking.seq2slate_sim_trainer)
swap_dist_out_slate() (in module reagent.training.ranking.seq2slate_sim_trainer)
switch (reagent.evaluation.cpe.CpeEstimateSet attribute)
switch_dr (reagent.evaluation.cpe.CpeEstimateSet attribute)
SwitchDREstimator (class in reagent.ope.estimators.contextual_bandits_estimators)
SwitchEstimator (class in reagent.ope.estimators.contextual_bandits_estimators)
SyntheticReward (class in reagent.model_managers.model_based)
(class in reagent.model_managers.model_based.synthetic_reward)
(reagent.model_managers.union.ModelManager__Union attribute)
SyntheticRewardDataModule (class in reagent.model_managers.model_based.synthetic_reward)
SyntheticRewardNet (class in reagent.models.synthetic_reward)
SyntheticRewardNetBuilder (class in reagent.net_builder.synthetic_reward_net_builder)
SyntheticRewardNetBuilder__Union (class in reagent.net_builder.unions)
SyntheticRewardPredictorWrapper (class in reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper)
T
T_0 (reagent.optimizer.uninferrable_schedulers.CosineAnnealingWarmRestarts attribute)
T_max (reagent.optimizer.uninferrable_schedulers.CosineAnnealingLR attribute)
T_mult (reagent.optimizer.uninferrable_schedulers.CosineAnnealingWarmRestarts attribute)
table_name (reagent.workflow.types.TableSpec attribute)
table_sample (reagent.workflow.types.TableSpec attribute)
table_size (reagent.core.types.ExplicitMapping property)
(reagent.core.types.ModuloMapping attribute)
tablesample (reagent.workflow.types.PreprocessingOptions attribute)
TableSpec (class in reagent.workflow.types)
TabularPolicy (class in reagent.ope.trainers.rl_tabular_trainers)
TabularValueFunction (class in reagent.ope.trainers.rl_tabular_trainers)
TaggedUnion (class in reagent.core.tagged_union)
tanh (reagent.net_builder.slate_ranking.slate_ranking_scorer.FinalLayer attribute)
target_action_distribution (reagent.model_managers.discrete_dqn_base.DiscreteDQNBase attribute)
target_entropy (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
target_policy (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
target_reward (reagent.ope.estimators.estimator.EstimatorSampleResult attribute)
target_update_rate (reagent.core.parameters.RLParameters attribute)
tau (reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
TD3 (class in reagent.model_managers.actor_critic)
(class in reagent.model_managers.actor_critic.td3)
(reagent.model_managers.union.ModelManager__Union attribute)
TD3Reporter (class in reagent.reporting.td3_reporter)
TD3Trainer (class in reagent.training)
(class in reagent.training.td3_trainer)
TD3TrainerParameters (class in reagent.training)
(class in reagent.training.parameters)
td_loss (reagent.workflow.training_reports.DQNTrainingReport attribute)
TEACHER_FORCING (reagent.core.parameters_seq2slate.LearningMethod attribute)
temperature (reagent.core.parameters.RLParameters attribute)
(reagent.models.seq2slate.Seq2SlateNet attribute)
(reagent.net_builder.slate_ranking.slate_ranking_transformer.SlateRankingTransformer attribute)
TensorAggregator (class in reagent.core.aggregators)
tensorboard_logging_freq (reagent.core.parameters.RLParameters attribute)
TensorBoardActionCountAggregator (class in reagent.core.aggregators)
TensorBoardActionHistogramAndMeanAggregator (class in reagent.core.aggregators)
TensorBoardHistogramAndMeanAggregator (class in reagent.core.aggregators)
TensorBoardScalarObserver (class in reagent.core.observers)
TensorDataClass (class in reagent.core.types)
TensorFeatureData (class in reagent.core.types)
terminal (reagent.gym.types.Transition attribute)
TERMINATED (reagent.ope.estimators.sequential_estimators.Transition.Status attribute)
test_box() (reagent.gym.tests.preprocessors.test_default_preprocessors.TestMakeDefaultObsPreprocessor method)
test_box_cuda() (reagent.gym.tests.preprocessors.test_default_preprocessors.TestMakeDefaultObsPreprocessor method)
test_cartpole() (reagent.gym.tests.preprocessors.test_replay_buffer_inserters.TestBasicReplayBufferInserter method)
test_clamper() (reagent.ope.test.unit_tests.test_utils.TestUtils method)
test_conversion() (reagent.ope.test.unit_tests.test_types.TestValues method)
test_copy() (reagent.ope.test.unit_tests.test_types.TestValues method)
test_create_df_from_replay_buffer() (reagent.gym.tests.test_gym_replay_buffer.TestGymReplayBuffer method)
test_dataloader() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.workflow.utils.PetastormLightningDataModule method)
test_episodic_dataset() (reagent.gym.tests.test_gym_datasets.TestEpisodicDataset method)
test_epoch_end() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
test_float_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_gym_offline_cpu (reagent.gym.tests.test_gym_offline.TestGymOffline attribute)
test_gym_offline_cpu_0_CEM_Cartpole() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_gym_offline_cpu_1_CEM_Single_World_Model_Linear_Dynamics() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_gym_offline_cpu_2_CEM_Many_World_Models_Linear_Dynamics() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_gym_offline_gpu (reagent.gym.tests.test_gym_offline.TestGymOffline attribute)
test_gym_offline_gpu_0_CEM_Cartpole() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_gym_offline_gpu_1_CEM_Single_World_Model_Linear_Dynamics() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_gym_offline_gpu_2_CEM_Many_World_Models_Linear_Dynamics() (reagent.gym.tests.test_gym_offline.TestGymOffline method)
test_indexing() (reagent.ope.test.unit_tests.test_types.TestValues method)
test_int_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_mdnrnn() (reagent.gym.tests.test_world_model.TestWorldModel method)
test_metrics() (reagent.ope.test.unit_tests.test_slate_estimators.TestEstimator method)
test_ndarray_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_online_episode_gym_cpu (reagent.gym.tests.test_gym.TestGym attribute)
test_online_episode_gym_cpu_0_REINFORCE_Cartpole_online() (reagent.gym.tests.test_gym.TestGym method)
test_online_episode_gym_cpu_1_PPO_Cartpole_online() (reagent.gym.tests.test_gym.TestGym method)
test_pocman() (reagent.gym.tests.test_pomdp.TestPOMDPEnvironment method)
test_random_vs_lqr() (reagent.gym.tests.test_linear_dynamics.TestLinearDynamicsEnvironment method)
test_recsim_interest_evolution() (reagent.gym.tests.preprocessors.test_default_preprocessors.TestMakeDefaultObsPreprocessor method)
(reagent.gym.tests.preprocessors.test_replay_buffer_inserters.TestRecSimReplayBufferInserter method)
test_recsim_interest_exploration() (reagent.gym.tests.preprocessors.test_default_preprocessors.TestMakeDefaultObsPreprocessor method)
(reagent.gym.tests.preprocessors.test_replay_buffer_inserters.TestRecSimReplayBufferInserter method)
test_replay_buffer_gym_cpu_1 (reagent.gym.tests.test_gym.TestGym attribute)
test_replay_buffer_gym_cpu_1_0_Discrete_CRR_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_1_Discrete_DQN_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_2_Discrete_C51_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_3_Discrete_QR_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_4_Discrete_DQN_Open_Gridworld() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_5_SAC_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_6_Continuous_CRR_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_1_7_TD3_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2 (reagent.gym.tests.test_gym.TestGym attribute)
test_replay_buffer_gym_cpu_2_0_Parametric_DQN_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_1_Parametric_SARSA_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_2_SlateQ_RecSim() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_3_SlateQ_RecSim_with_Discount_Scaled_by_Time_Diff() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_4_SlateQ_RecSim_multi_selection() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_5_SlateQ_RecSim_multi_selection_average_by_current_slate_size() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_cpu_2_6_PossibleActionsMask_DQN() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1 (reagent.gym.tests.test_gym.TestGym attribute)
test_replay_buffer_gym_gpu_1_0_Discrete_CRR_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_1_Discrete_DQN_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_2_Discrete_C51_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_3_Discrete_QR_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_4_Discrete_DQN_Open_Gridworld() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_5_SAC_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_6_Continuous_CRR_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_1_7_TD3_Pendulum() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2 (reagent.gym.tests.test_gym.TestGym attribute)
test_replay_buffer_gym_gpu_2_0_Parametric_DQN_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_1_Parametric_SARSA_Cartpole() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_2_SlateQ_RecSim() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_3_SlateQ_RecSim_with_Discount_Scaled_by_Time_Diff() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_4_SlateQ_RecSim_multi_selection() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_5_SlateQ_RecSim_multi_selection_average_by_current_slate_size() (reagent.gym.tests.test_gym.TestGym method)
test_replay_buffer_gym_gpu_2_6_PossibleActionsMask_DQN() (reagent.gym.tests.test_gym.TestGym method)
test_running_average() (reagent.ope.test.unit_tests.test_utils.TestUtils method)
test_sample() (reagent.ope.test.unit_tests.test_types.TestDistribution method)
test_slate_item_probabilities() (reagent.ope.test.unit_tests.test_slate_estimators.TestEstimator method)
test_slate_slot_item_probabilities() (reagent.ope.test.unit_tests.test_slate_estimators.TestEstimator method)
test_sort() (reagent.ope.test.unit_tests.test_types.TestValues method)
test_step() (reagent.training.MDNRNNTrainer method)
(reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer method)
test_string_game() (reagent.gym.tests.test_pomdp.TestPOMDPEnvironment method)
test_string_game_v1() (reagent.gym.tests.test_pomdp.TestPOMDPEnvironment method)
test_switch_dr_equal_to_dm() (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators method)
test_switch_dr_equal_to_dr() (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators method)
test_switch_equal_to_dm() (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators method)
test_switch_equal_to_ips() (reagent.ope.test.unit_tests.test_contextual_bandit_estimators.TestSwitchEstimators method)
test_table_sample (reagent.workflow.types.TableSpec attribute)
test_tensor_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_tuple_float_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_tuple_int_type() (reagent.ope.test.unit_tests.test_types.TestTypes method)
test_unzip() (reagent.ope.test.unit_tests.test_types.TestValues method)
test_values() (reagent.ope.test.unit_tests.test_types.TestDistribution method)
test_world_model() (reagent.gym.tests.test_world_model.TestWorldModel method)
TestBasicReplayBufferInserter (class in reagent.gym.tests.preprocessors.test_replay_buffer_inserters)
TestClass (reagent.ope.test.unit_tests.test_types.TestTypes attribute)
TestDistribution (class in reagent.ope.test.unit_tests.test_types)
TestDistribution.TestIntKeyDistribution (class in reagent.ope.test.unit_tests.test_types)
TestEnv (class in reagent.gym.tests.test_gym_replay_buffer)
TestEpisodicDataset (class in reagent.gym.tests.test_gym_datasets)
TestEstimator (class in reagent.ope.test.unit_tests.test_slate_estimators)
TestGym (class in reagent.gym.tests.test_gym)
TestGymOffline (class in reagent.gym.tests.test_gym_offline)
TestGymReplayBuffer (class in reagent.gym.tests.test_gym_replay_buffer)
TestIntType (reagent.ope.test.unit_tests.test_types.TestValues attribute)
TestLinearDynamicsEnvironment (class in reagent.gym.tests.test_linear_dynamics)
TestMakeDefaultObsPreprocessor (class in reagent.gym.tests.preprocessors.test_default_preprocessors)
TestPOMDPEnvironment (class in reagent.gym.tests.test_pomdp)
TestRecSimReplayBufferInserter (class in reagent.gym.tests.preprocessors.test_replay_buffer_inserters)
TestSwitchEstimators (class in reagent.ope.test.unit_tests.test_contextual_bandit_estimators)
TestTupleFloatType (reagent.ope.test.unit_tests.test_types.TestValues attribute)
TestType (reagent.ope.test.unit_tests.test_types.TestTypes attribute)
TestTypes (class in reagent.ope.test.unit_tests.test_types)
TestUtils (class in reagent.ope.test.unit_tests.test_utils)
TestValues (class in reagent.ope.test.unit_tests.test_types)
TestValues.TestIntKeyValues (class in reagent.ope.test.unit_tests.test_types)
TestValues.TestTupleFloatKeyValues (class in reagent.ope.test.unit_tests.test_types)
TestWorldModel (class in reagent.gym.tests.test_world_model)
tgt_action (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
tgt_action_probabilities (reagent.ope.estimators.contextual_bandits_estimators.LogSample attribute)
tgt_in_idx (reagent.core.types.PreprocessedRankingInput attribute)
tgt_in_seq (reagent.core.types.PreprocessedRankingInput attribute)
tgt_out_idx (reagent.core.types.PreprocessedRankingInput attribute)
tgt_out_probs (reagent.core.types.PreprocessedRankingInput attribute)
tgt_out_seq (reagent.core.types.PreprocessedRankingInput attribute)
tgt_reward_from_log_action (reagent.ope.estimators.contextual_bandits_estimators.ModelOutputs attribute)
tgt_rewards (reagent.ope.estimators.contextual_bandits_estimators.ModelOutputs attribute)
tgt_slate_probability() (reagent.ope.estimators.slate_estimators.LogSample method)
tgt_slate_space() (reagent.ope.estimators.slate_estimators.LogSample method)
tgt_slot_expectations() (reagent.ope.estimators.slate_estimators.LogSample method)
tgt_tgt_mask (reagent.core.types.PreprocessedRankingInput attribute)
ThomasGridWorld (class in reagent.ope.test.gridworld)
three_phase (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
time_diff (reagent.core.types.BaseInput attribute)
TIME_DIFF (reagent.preprocessing.types.InputColumn attribute)
time_diff_unit_length (reagent.core.parameters.RLParameters attribute)
time_since_first (reagent.core.types.FeatureData attribute)
TIME_SINCE_FIRST (reagent.preprocessing.types.InputColumn attribute)
timeline_operator() (in module reagent.workflow.gym_batch_rl)
to() (reagent.ope.test.cartpole.ModelWrapper method)
to_dict() (reagent.gym.types.Trajectory method)
tolerance_change (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
tolerance_grad (reagent.optimizer.uninferrable_optimizers.LBFGS attribute)
TOP_K (reagent.core.parameters.SlateOptMethod attribute)
topk (reagent.core.types.FrechetSortConfig attribute)
topk() (reagent.lite.optimizer.BestResultsQueue method)
TopKSampler (class in reagent.gym.policies.samplers.top_k_sampler)
total (reagent.ope.utils.RunningAverage property)
total_steps (reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
ToyVM (class in reagent.gym.envs)
(class in reagent.gym.envs.toy_vm)
(reagent.gym.envs.Env__Union attribute)
ToyVMEnv (class in reagent.gym.envs.toy_vm)
train() (in module reagent.ope.test.mslr_slate)
(reagent.model_managers.model_manager.ModelManager method)
(reagent.ope.estimators.types.Trainer method)
(reagent.ope.trainers.linear_trainers.DecisionTreeClassifierTrainer method)
(reagent.ope.trainers.linear_trainers.DecisionTreeTrainer method)
(reagent.ope.trainers.linear_trainers.LassoTrainer method)
(reagent.ope.trainers.linear_trainers.LogisticRegressionTrainer method)
(reagent.ope.trainers.linear_trainers.NNTrainer method)
(reagent.ope.trainers.linear_trainers.SGDClassifierTrainer method)
(reagent.ope.trainers.rl_tabular_trainers.DPTrainer method)
(reagent.ope.trainers.rl_tabular_trainers.MonteCarloTrainer method)
(reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
train_all() (in module reagent.ope.test.mslr_slate)
train_dataloader() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
(reagent.workflow.utils.PetastormLightningDataModule method)
train_eval_lightning() (in module reagent.workflow.utils)
train_mdnrnn() (in module reagent.gym.tests.test_world_model)
train_mdnrnn_and_compute_feature_stats() (in module reagent.gym.tests.test_world_model)
train_mdnrnn_and_train_on_embedded_env() (in module reagent.gym.tests.test_world_model)
train_models() (in module reagent.ope.test.mslr_slate)
train_sample_range (reagent.data.manual_data_module.TrainEvalSampleRanges attribute)
train_step_gen() (reagent.training.BanditRewardNetTrainer method)
(reagent.training.c51_trainer.C51Trainer method)
(reagent.training.C51Trainer method)
(reagent.training.cem_trainer.CEMTrainer method)
(reagent.training.CEMTrainer method)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer method)
(reagent.training.cfeval.BanditRewardNetTrainer method)
(reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
(reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.DQNTrainer method)
(reagent.training.MDNRNNTrainer method)
(reagent.training.parametric_dqn_trainer.ParametricDQNTrainer method)
(reagent.training.ParametricDQNTrainer method)
(reagent.training.qrdqn_trainer.QRDQNTrainer method)
(reagent.training.QRDQNTrainer method)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer method)
(reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
(reagent.training.reinforce_trainer.ReinforceTrainer method)
(reagent.training.ReinforceTrainer method)
(reagent.training.reward_network_trainer.RewardNetTrainer method)
(reagent.training.RewardNetTrainer method)
(reagent.training.sac_trainer.SACTrainer method)
(reagent.training.SACTrainer method)
(reagent.training.slate_q_trainer.SlateQTrainer method)
(reagent.training.SlateQTrainer method)
(reagent.training.td3_trainer.TD3Trainer method)
(reagent.training.TD3Trainer method)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer method)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer method)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
train_val_test_split() (reagent.ope.test.multiclass_bandits.UCIMultiClassDataset method)
train_weight (reagent.ope.estimators.types.TrainingData attribute)
train_workflow() (in module reagent.workflow.training)
train_x (reagent.ope.estimators.types.TrainingData attribute)
train_y (reagent.ope.estimators.types.TrainingData attribute)
Trainer (class in reagent.ope.estimators.types)
trainer_param (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic.td3.TD3 attribute)
(reagent.model_managers.discrete.discrete_c51dqn.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.discrete_crr.DiscreteCRR attribute)
(reagent.model_managers.discrete.discrete_dqn.DiscreteDQN attribute)
(reagent.model_managers.discrete.discrete_qrdqn.DiscreteQRDQN attribute)
(reagent.model_managers.discrete.DiscreteC51DQN attribute)
(reagent.model_managers.discrete.DiscreteCRR attribute)
(reagent.model_managers.discrete.DiscreteDQN attribute)
(reagent.model_managers.discrete.DiscreteQRDQN attribute)
(reagent.model_managers.model_based.cross_entropy_method.CrossEntropyMethod attribute)
(reagent.model_managers.model_based.CrossEntropyMethod attribute)
(reagent.model_managers.model_based.seq2reward_model.Seq2RewardModel attribute)
(reagent.model_managers.model_based.Seq2RewardModel attribute)
(reagent.model_managers.model_based.synthetic_reward.SyntheticReward attribute)
(reagent.model_managers.model_based.SyntheticReward attribute)
(reagent.model_managers.model_based.world_model.WorldModel attribute)
(reagent.model_managers.model_based.WorldModel attribute)
(reagent.model_managers.parametric.parametric_dqn.ParametricDQN attribute)
(reagent.model_managers.parametric.ParametricDQN attribute)
(reagent.model_managers.policy_gradient.PPO attribute)
(reagent.model_managers.policy_gradient.ppo.PPO attribute)
(reagent.model_managers.policy_gradient.Reinforce attribute)
(reagent.model_managers.policy_gradient.reinforce.Reinforce attribute)
(reagent.model_managers.ranking.slate_q.SlateQ attribute)
(reagent.model_managers.ranking.SlateQ attribute)
trainer_preprocessor() (reagent.gym.envs.changing_arms.ChangingArms method)
(reagent.gym.envs.ChangingArms method)
TrainerConf (class in reagent.workflow.types)
TrainerPreprocessor (in module reagent.gym.types)
TrainEvalSampleRanges (class in reagent.data.manual_data_module)
training (reagent.mab.mab_algorithm.GreedyAlgo attribute)
(reagent.mab.mab_algorithm.MABAlgo attribute)
(reagent.mab.mab_algorithm.RandomActionsAlgo attribute)
(reagent.mab.thompson_sampling.BaseThompsonSampling attribute)
(reagent.mab.thompson_sampling.BernoulliBetaThompson attribute)
(reagent.mab.thompson_sampling.NormalGammaThompson attribute)
(reagent.mab.ucb.BaseUCB attribute)
(reagent.mab.ucb.MetricUCB attribute)
(reagent.mab.ucb.UCB1 attribute)
(reagent.model_managers.discrete.discrete_crr.ActorDQN attribute)
(reagent.models.actor.DirichletFullyConnectedActor attribute)
(reagent.models.actor.FullyConnectedActor attribute)
(reagent.models.actor.GaussianFullyConnectedActor attribute)
(reagent.models.actor.StochasticActor attribute)
(reagent.models.base.ModelBase attribute)
(reagent.models.BatchConstrainedDQN attribute)
(reagent.models.bcq.BatchConstrainedDQN attribute)
(reagent.models.categorical_dqn.CategoricalDQN attribute)
(reagent.models.CategoricalDQN attribute)
(reagent.models.cem_planner.CEMPlannerNetwork attribute)
(reagent.models.convolutional_network.ConvolutionalNetwork attribute)
(reagent.models.critic.FullyConnectedCritic attribute)
(reagent.models.DirichletFullyConnectedActor attribute)
(reagent.models.dqn.FullyConnectedDQN attribute)
(reagent.models.dueling_q_network.DuelingQNetwork attribute)
(reagent.models.dueling_q_network.ParametricDuelingQNetwork attribute)
(reagent.models.DuelingQNetwork attribute)
(reagent.models.embedding_bag_concat.EmbeddingBagConcat attribute)
(reagent.models.EmbeddingBagConcat attribute)
(reagent.models.fully_connected_network.FloatFeatureFullyConnected attribute)
(reagent.models.fully_connected_network.FullyConnectedNetwork attribute)
(reagent.models.fully_connected_network.SlateBatchNorm1d attribute)
(reagent.models.FullyConnectedActor attribute)
(reagent.models.FullyConnectedCritic attribute)
(reagent.models.FullyConnectedDQN attribute)
(reagent.models.FullyConnectedNetwork attribute)
(reagent.models.GaussianFullyConnectedActor attribute)
(reagent.models.linear_regression.LinearRegressionUCB attribute)
(reagent.models.mdn_rnn.MDNRNN attribute)
(reagent.models.mlp_scorer.MLPScorer attribute)
(reagent.models.MLPScorer attribute)
(reagent.models.ModelBase attribute)
(reagent.models.ParametricDuelingQNetwork attribute)
(reagent.models.seq2reward_model.Seq2RewardNetwork attribute)
(reagent.models.Seq2RewardNetwork attribute)
(reagent.models.seq2slate.BaselineNet attribute)
(reagent.models.seq2slate.Decoder attribute)
(reagent.models.seq2slate.DecoderLastLayerPytorch attribute)
(reagent.models.seq2slate.DecoderLayer attribute)
(reagent.models.seq2slate.DecoderPyTorch attribute)
(reagent.models.seq2slate.Embedder attribute)
(reagent.models.seq2slate.Encoder attribute)
(reagent.models.seq2slate.EncoderLayer attribute)
(reagent.models.seq2slate.EncoderPyTorch attribute)
(reagent.models.seq2slate.Generator attribute)
(reagent.models.seq2slate.MultiHeadedAttention attribute)
(reagent.models.seq2slate.PositionalEncoding attribute)
(reagent.models.seq2slate.PositionwiseFeedForward attribute)
(reagent.models.seq2slate.Seq2SlateTransformerModel attribute)
(reagent.models.seq2slate.SublayerConnection attribute)
(reagent.models.seq2slate_reward.Seq2SlateGRURewardNet attribute)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetBase attribute)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetEnsemble attribute)
(reagent.models.seq2slate_reward.Seq2SlateRewardNetJITWrapper attribute)
(reagent.models.seq2slate_reward.Seq2SlateTransformerRewardNet attribute)
(reagent.models.synthetic_reward.Concat attribute)
(reagent.models.synthetic_reward.NGramConvolutionalNetwork attribute)
(reagent.models.synthetic_reward.NGramFullyConnectedNetwork attribute)
(reagent.models.synthetic_reward.PETransformerEncoderLayer attribute)
(reagent.models.synthetic_reward.PositionalEncoding attribute)
(reagent.models.synthetic_reward.ResidualBlock attribute)
(reagent.models.synthetic_reward.SequenceSyntheticRewardNet attribute)
(reagent.models.synthetic_reward.SingleStepSyntheticRewardNet attribute)
(reagent.models.synthetic_reward.SyntheticRewardNet attribute)
(reagent.models.synthetic_reward.TransformerSyntheticRewardNet attribute)
(reagent.models.world_model.MemoryNetwork attribute)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.ScoreCap attribute)
(reagent.ope.test.cartpole.EnvironmentModel attribute)
(reagent.ope.trainers.linear_trainers.LinearNet attribute)
(reagent.prediction.predictor_wrapper.ActorPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.ActorWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.BinaryDifferenceScorerPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.BinaryDifferenceScorerWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.CompressModelWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.DiscreteDqnPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.DiscreteDqnWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.LearnVMSlateWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.MDNRNNWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.OSSPredictorUnwrapper attribute)
(reagent.prediction.predictor_wrapper.OSSSparsePredictorUnwrapper attribute)
(reagent.prediction.predictor_wrapper.ParametricDqnPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.ParametricDqnWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.RankingActorPredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.RankingActorWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.Seq2RewardPlanShortSeqWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.Seq2RewardWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.Seq2SlatePredictorWrapper attribute)
(reagent.prediction.predictor_wrapper.Seq2SlateRewardWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.Seq2SlateWithPreprocessor attribute)
(reagent.prediction.predictor_wrapper.SlateRankingPreprocessor attribute)
(reagent.prediction.ranking.predictor_wrapper.DeterminantalPointProcessPredictorWrapper attribute)
(reagent.prediction.synthetic_reward.synthetic_reward_predictor_wrapper.SyntheticRewardPredictorWrapper attribute)
(reagent.preprocessing.batch_preprocessor.BatchPreprocessor attribute)
(reagent.preprocessing.batch_preprocessor.DiscreteDqnBatchPreprocessor attribute)
(reagent.preprocessing.batch_preprocessor.ParametricDqnBatchPreprocessor attribute)
(reagent.preprocessing.batch_preprocessor.PolicyNetworkBatchPreprocessor attribute)
(reagent.preprocessing.postprocessor.Postprocessor attribute)
(reagent.preprocessing.preprocessor.Preprocessor attribute)
(reagent.preprocessing.sparse_preprocessor.ExplicitMapIDList attribute)
(reagent.preprocessing.sparse_preprocessor.ExplicitMapIDScoreList attribute)
(reagent.preprocessing.sparse_preprocessor.MapIDList attribute)
(reagent.preprocessing.sparse_preprocessor.MapIDScoreList attribute)
(reagent.preprocessing.sparse_preprocessor.ModuloMapIDList attribute)
(reagent.preprocessing.sparse_preprocessor.ModuloMapIDScoreList attribute)
(reagent.preprocessing.sparse_preprocessor.SparsePreprocessor attribute)
(reagent.training.BanditRewardNetTrainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.cb.linucb_trainer.LinUCBTrainer attribute)
(reagent.training.cem_trainer.CEMTrainer attribute)
(reagent.training.CEMTrainer attribute)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer attribute)
(reagent.training.cfeval.BanditRewardNetTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.MDNRNNTrainer attribute)
(reagent.training.multi_stage_trainer.MultiStageTrainer attribute)
(reagent.training.MultiStageTrainer attribute)
(reagent.training.ppo_trainer.PPOTrainer attribute)
(reagent.training.PPOTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer attribute)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer attribute)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer attribute)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer attribute)
(reagent.training.reagent_lightning_module.ReAgentLightningModule attribute)
(reagent.training.ReAgentLightningModule attribute)
(reagent.training.reinforce_trainer.ReinforceTrainer attribute)
(reagent.training.ReinforceTrainer attribute)
(reagent.training.reward_network_trainer.RewardNetTrainer attribute)
(reagent.training.RewardNetTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.TD3Trainer attribute)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer attribute)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer attribute)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer attribute)
training_epoch_end() (reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
training_input (reagent.core.types.PreprocessedTrainingBatch attribute)
(reagent.core.types.SlateScoreBatch attribute)
training_queries (reagent.ope.test.yandex_web_search.TrainingDataset property)
training_report (reagent.workflow.types.RLTrainingOutput attribute)
training_samples (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
training_step() (reagent.training.cb.linucb_trainer.LinUCBTrainer method)
(reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.ppo_trainer.PPOTrainer method)
(reagent.training.PPOTrainer method)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer method)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer method)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer method)
(reagent.training.reagent_lightning_module.ReAgentLightningModule method)
(reagent.training.ReAgentLightningModule method)
TRAINING_VALIDATION_SPLIT (reagent.ope.estimators.contextual_bandits_estimators.DMEstimator attribute)
TrainingData (class in reagent.ope.estimators.types)
TrainingDataset (class in reagent.ope.test.yandex_web_search)
TrainingQuery (class in reagent.ope.test.yandex_web_search)
TrainingReport (class in reagent.core.result_registries)
TrainValidEvalData (class in reagent.evaluation.doubly_robust_estimator)
Trajectory (class in reagent.gym.types)
transform_to_equal_length_trajectories() (reagent.evaluation.weighted_sequential_doubly_robust_estimator.WeightedSequentialDoublyRobustEstimator static method)
transformer (reagent.net_builder.slate_ranking.slate_ranking_transformer.SlateRankingTransformer attribute)
(reagent.net_builder.slate_reward.slate_reward_transformer.SlateRewardTransformer attribute)
TransformerParameters (class in reagent.core.parameters)
TransformerSyntheticReward (class in reagent.net_builder.synthetic_reward.transformer_synthetic_reward)
(reagent.net_builder.unions.SyntheticRewardNetBuilder__Union attribute)
TransformerSyntheticRewardNet (class in reagent.models.synthetic_reward)
Transition (class in reagent.gym.types)
(class in reagent.ope.estimators.sequential_estimators)
Transition.Status (class in reagent.ope.estimators.sequential_estimators)
transitions (reagent.gym.types.Trajectory attribute)
transpose() (in module reagent.models.mdn_rnn)
TypeWrapper (class in reagent.ope.estimators.types)
U
UCB1 (class in reagent.mab.ucb)
UCIMultiClassDataset (class in reagent.ope.test.multiclass_bandits)
unchosen_dets() (reagent.prediction.ranking.predictor_wrapper.DeterminantalPointProcessPredictorWrapper method)
UNIVERSAL (reagent.core.parameters_seq2slate.IPSClampMethod attribute)
UnsqueezeRepeat (class in reagent.preprocessing.transforms)
unwrap_function_outputs() (in module reagent.core.multiprocess_utils)
UP (reagent.gym.envs.pomdp.pocman.Action attribute)
update() (reagent.core.observers.CompositeObserver method)
(reagent.core.observers.EpochEndObserver method)
(reagent.core.observers.IntervalAggregatingObserver method)
(reagent.core.observers.TensorBoardScalarObserver method)
(reagent.core.observers.ValueListObserver method)
(reagent.core.running_stats.RunningStats method)
(reagent.core.tracker.Observer method)
(reagent.gym.envs.pomdp.pocman.Ghost method)
(reagent.gym.policies.samplers.discrete_sampler.EpsilonGreedyActionSampler method)
(reagent.gym.policies.samplers.discrete_sampler.SoftmaxActionSampler method)
(reagent.gym.types.Sampler method)
(reagent.ope.trainers.rl_tabular_trainers.TabularPolicy method)
update_ars_params() (reagent.training.gradient_free.ars_util.ARSOptimizer method)
update_best_model() (reagent.reporting.reward_network_reporter.RewardNetworkReporter method)
update_epochs (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
update_freq (reagent.training.parameters.PPOTrainerParameters attribute)
(reagent.training.PPOTrainerParameters attribute)
update_model() (reagent.training.ppo_trainer.PPOTrainer method)
(reagent.training.PPOTrainer method)
update_params() (reagent.lite.optimizer.BayesianMLPEnsemblerOptimizer method)
(reagent.lite.optimizer.ComboOptimizerBase method)
(reagent.lite.optimizer.GumbelSoftmaxOptimizer method)
(reagent.lite.optimizer.NeverGradOptimizer method)
(reagent.lite.optimizer.PolicyGradientOptimizer method)
(reagent.lite.optimizer.QLearningOptimizer method)
(reagent.lite.optimizer.RandomSearchOptimizer method)
(reagent.training.cb.linucb_trainer.LinUCBTrainer method)
update_predictor() (reagent.lite.optimizer.BayesianMLPEnsemblerOptimizer method)
upload_as_parquet() (in module reagent.data.oss_data_fetcher)
url_relevances (reagent.ope.test.yandex_web_search.LoggedQuery property)
(reagent.ope.test.yandex_web_search.TrainingQuery property)
use_2_q_functions (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
(reagent.model_managers.actor_critic.TD3 attribute)
(reagent.model_managers.actor_critic.td3.TD3 attribute)
use_amp (reagent.training.BanditRewardNetTrainer attribute)
(reagent.training.C51Trainer attribute)
(reagent.training.cb.linucb_trainer.LinUCBTrainer attribute)
(reagent.training.CEMTrainer attribute)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer attribute)
(reagent.training.cfeval.BanditRewardNetTrainer attribute)
(reagent.training.DiscreteCRRTrainer attribute)
(reagent.training.DQNTrainer attribute)
(reagent.training.MDNRNNTrainer attribute)
(reagent.training.MultiStageTrainer attribute)
(reagent.training.PPOTrainer attribute)
(reagent.training.qrdqn_trainer.QRDQNTrainer attribute)
(reagent.training.QRDQNTrainer attribute)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer attribute)
(reagent.training.ranking.seq2slate_sim_trainer.Seq2SlateSimulationTrainer attribute)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer attribute)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer attribute)
(reagent.training.ReAgentLightningModule attribute)
(reagent.training.reinforce_trainer.ReinforceTrainer attribute)
(reagent.training.ReinforceTrainer attribute)
(reagent.training.reward_network_trainer.RewardNetTrainer attribute)
(reagent.training.RewardNetTrainer attribute)
(reagent.training.SACTrainer attribute)
(reagent.training.SlateQTrainer attribute)
(reagent.training.TD3Trainer attribute)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer attribute)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer attribute)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer attribute)
use_batch_norm (reagent.net_builder.continuous_actor.dirichlet_fully_connected.DirichletFullyConnected attribute)
(reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.discrete_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.parametric_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward attribute)
use_gpu (reagent.workflow.types.ResourceOptions property)
use_interaction_features (reagent.training.parameters.LinUCBTrainerParameters attribute)
use_l2_normalization (reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
use_layer_norm (reagent.net_builder.continuous_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.continuous_actor.gaussian_fully_connected.GaussianFullyConnected attribute)
(reagent.net_builder.discrete_actor.fully_connected.FullyConnected attribute)
(reagent.net_builder.parametric_dqn.fully_connected.FullyConnected attribute)
(reagent.net_builder.slate_ranking.slate_ranking_scorer.SlateRankingScorer attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramConvNetSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.ngram_synthetic_reward.NGramSyntheticReward attribute)
(reagent.net_builder.synthetic_reward.single_step_synthetic_reward.SingleStepSyntheticReward attribute)
(reagent.net_builder.value.fully_connected.FullyConnected attribute)
use_seq_num_diff_as_time_diff (reagent.core.parameters.RLParameters attribute)
(reagent.training.rl_trainer_pytorch.RLTrainerMixin property)
use_target_actor (reagent.training.CRRTrainerParameters attribute)
(reagent.training.parameters.CRRTrainerParameters attribute)
user_feat_dim (reagent.gym.envs.oracle_pvm.OraclePVM attribute)
(reagent.gym.envs.OraclePVM attribute)
user_id (reagent.ope.test.yandex_web_search.LoggedQuery property)
UserState (class in reagent.gym.envs.recsim)
V
v (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
v_net (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
val_dataloader() (reagent.data.manual_data_module.ManualDataModule method)
(reagent.data.ManualDataModule method)
valid_step (reagent.core.types.MemoryNetworkInput attribute)
VALID_STEP (reagent.preprocessing.types.InputColumn attribute)
validate() (reagent.evaluation.evaluation_data_page.EvaluationDataPage method)
(reagent.ope.estimators.slate_estimators.LogSample method)
(reagent.ope.estimators.slate_estimators.SlateEstimatorInput method)
(reagent.replay_memory.circular_replay_buffer.DenseMetadata method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata method)
(reagent.validators.model_validator.ModelValidator method)
validate_mdp_ids_seq_nums() (in module reagent.gym.utils)
validation_epoch_end() (reagent.training.BanditRewardNetTrainer method)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer method)
(reagent.training.cfeval.BanditRewardNetTrainer method)
(reagent.training.dqn_trainer_base.DQNTrainerBaseLightning method)
(reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer method)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer method)
(reagent.training.reward_network_trainer.RewardNetTrainer method)
(reagent.training.RewardNetTrainer method)
validation_result (reagent.workflow.types.RLTrainingOutput attribute)
validation_step() (reagent.training.BanditRewardNetTrainer method)
(reagent.training.cfeval.bandit_reward_network_trainer.BanditRewardNetTrainer method)
(reagent.training.cfeval.BanditRewardNetTrainer method)
(reagent.training.discrete_crr_trainer.DiscreteCRRTrainer method)
(reagent.training.DiscreteCRRTrainer method)
(reagent.training.dqn_trainer.DQNTrainer method)
(reagent.training.dqn_trainer_base.DQNTrainerBaseLightning method)
(reagent.training.DQNTrainer method)
(reagent.training.MDNRNNTrainer method)
(reagent.training.multi_stage_trainer.MultiStageTrainer method)
(reagent.training.MultiStageTrainer method)
(reagent.training.ranking.seq2slate_attn_trainer.Seq2SlatePairwiseAttnTrainer method)
(reagent.training.ranking.seq2slate_tf_trainer.Seq2SlateTeacherForcingTrainer method)
(reagent.training.ranking.seq2slate_trainer.Seq2SlateTrainer method)
(reagent.training.reward_network_trainer.RewardNetTrainer method)
(reagent.training.RewardNetTrainer method)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer method)
(reagent.training.world_model.mdnrnn_trainer.MDNRNNTrainer method)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
validation_weight (reagent.ope.estimators.types.TrainingData attribute)
validation_x (reagent.ope.estimators.types.TrainingData attribute)
validation_y (reagent.ope.estimators.types.TrainingData attribute)
ValidationResult (class in reagent.core.result_registries)
ValidationResult__Union (class in reagent.workflow.types)
value (reagent.core.tagged_union.TaggedUnion property)
(reagent.core.types.DocList attribute)
(reagent.core.types.ValuePresence attribute)
(reagent.ope.estimators.types.TypeWrapper attribute)
value_function (reagent.ope.estimators.sequential_estimators.RLEstimatorInput attribute)
value_list_observers (reagent.reporting.actor_critic_reporter.ActorCriticReporter property)
(reagent.reporting.reward_network_reporter.RewardNetworkReporter property)
(reagent.reporting.seq2reward_reporter.Seq2RewardReporter property)
(reagent.reporting.slate_q_reporter.SlateQReporter property)
(reagent.reporting.world_model_reporter.WorldModelReporter property)
value_lr (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
value_magic_dr (reagent.workflow.training_reports.DQNTrainingReport attribute)
value_net_builder (reagent.model_managers.actor_critic.SAC attribute)
(reagent.model_managers.actor_critic.sac.SAC attribute)
(reagent.model_managers.policy_gradient.PPO attribute)
(reagent.model_managers.policy_gradient.ppo.PPO attribute)
(reagent.model_managers.policy_gradient.Reinforce attribute)
(reagent.model_managers.policy_gradient.reinforce.Reinforce attribute)
value_network_optimizer (reagent.training.parameters.SACTrainerParameters attribute)
(reagent.training.SACTrainerParameters attribute)
value_sequential_dr (reagent.workflow.training_reports.DQNTrainingReport attribute)
value_weighted_dr (reagent.workflow.training_reports.DQNTrainingReport attribute)
ValueFunction (class in reagent.ope.estimators.sequential_estimators)
ValueListObserver (class in reagent.core.observers)
ValueNetBuilder (class in reagent.net_builder.value_net_builder)
ValueNetBuilder__Union (class in reagent.net_builder.unions)
ValuePresence (class in reagent.core.types)
(class in reagent.preprocessing.transforms)
Values (class in reagent.ope.estimators.types)
values (reagent.ope.estimators.types.Objects attribute)
(reagent.ope.estimators.types.Objects property)
(reagent.ope.estimators.types.Values attribute)
values_tensor() (reagent.ope.estimators.slate_estimators.SlateSlotItemValues method)
ValueWrapper (class in reagent.gym.envs.wrappers.recsim)
var (reagent.mab.ucb.BaseUCB property)
variance (reagent.ope.estimators.estimator.ResultDiffs property)
verbose (reagent.optimizer.uninferrable_schedulers.CosineAnnealingLR attribute)
(reagent.optimizer.uninferrable_schedulers.CosineAnnealingWarmRestarts attribute)
(reagent.optimizer.uninferrable_schedulers.CyclicLR attribute)
(reagent.optimizer.uninferrable_schedulers.ExponentialLR attribute)
(reagent.optimizer.uninferrable_schedulers.LambdaLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiplicativeLR attribute)
(reagent.optimizer.uninferrable_schedulers.MultiStepLR attribute)
(reagent.optimizer.uninferrable_schedulers.OneCycleLR attribute)
(reagent.optimizer.uninferrable_schedulers.StepLR attribute)
verify_result() (reagent.gym.tests.test_world_model.TestWorldModel static method)
view_q_value (reagent.core.parameters.Seq2RewardTrainerParameters attribute)
W
WALL (reagent.gym.envs.pomdp.pocman.Element attribute)
warm_start_components() (reagent.training.reward_network_trainer.RewardNetTrainer method)
(reagent.training.RewardNetTrainer method)
(reagent.training.world_model.compress_model_trainer.CompressModelTrainer method)
(reagent.training.world_model.seq2reward_trainer.Seq2RewardTrainer method)
warmup_num_batches (reagent.core.parameters.BaselineParameters attribute)
warning() (reagent.core.types.NoDuplicatedWarningLogger method)
weight (reagent.core.types.CBInput attribute)
(reagent.models.no_soft_update_embedding.NoSoftUpdateEmbedding attribute)
(reagent.ope.estimators.estimator.EstimatorSampleResult attribute)
WEIGHT (reagent.preprocessing.types.InputColumn attribute)
weight_decay (reagent.optimizer.uninferrable_optimizers.Adam attribute)
(reagent.optimizer.uninferrable_optimizers.Adamax attribute)
(reagent.optimizer.uninferrable_optimizers.AdamW attribute)
(reagent.optimizer.uninferrable_optimizers.NAdam attribute)
(reagent.optimizer.uninferrable_optimizers.RAdam attribute)
(reagent.optimizer.uninferrable_optimizers.SGD attribute)
weighted_by_inverse_propensity (reagent.training.parameters.RewardNetworkTrainerParameters attribute)
(reagent.training.RewardNetworkTrainerParameters attribute)
weighted_doubly_robust (reagent.evaluation.cpe.CpeEstimateSet attribute)
WeightedSequentialDoublyRobustEstimator (class in reagent.evaluation.weighted_sequential_doubly_robust_estimator)
weights_train (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
weights_valid (reagent.evaluation.doubly_robust_estimator.EstimationData attribute)
whiten() (in module reagent.training.utils)
world_model_report (reagent.workflow.types.RLTrainingReport attribute)
WorldModel (class in reagent.model_managers.model_based)
(class in reagent.model_managers.model_based.world_model)
(reagent.model_managers.union.ModelManager__Union attribute)
WorldModelBase (class in reagent.model_managers.world_model_base)
WorldModelDataModule (class in reagent.model_managers.world_model_base)
WorldModelReporter (class in reagent.reporting.world_model_reporter)
WorldModelTrainingReport (class in reagent.workflow.training_reports)
wrap_function_arguments() (in module reagent.core.multiprocess_utils)
wrap_oss_with_dataclass() (in module reagent.core.registry_meta)
X
x (reagent.gym.envs.pomdp.pocman.Position attribute)
xgb_params (reagent.evaluation.doubly_robust_estimator.DoublyRobustHP attribute)
Y
y (reagent.gym.envs.pomdp.pocman.Position attribute)
YandexSlateModel (class in reagent.ope.test.yandex_web_search)
Z
zero_augment() (in module reagent.gym.envs.toy_vm)
zero_example() (reagent.replay_memory.circular_replay_buffer.DenseMetadata method)
(reagent.replay_memory.circular_replay_buffer.ElementMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDListMetadata method)
(reagent.replay_memory.circular_replay_buffer.IDScoreListMetadata method)
zeta (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
zeta_lr (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
zeta_net (reagent.ope.estimators.sequential_estimators.NeuralDualDICE attribute)
zeta_nu_loss_callback() (in module reagent.ope.test.cartpole)