diff --git a/pyrobolearn/rewards/__init__.py b/pyrobolearn/rewards/__init__.py index bd6f0c1..1b3f2ed 100644 --- a/pyrobolearn/rewards/__init__.py +++ b/pyrobolearn/rewards/__init__.py @@ -11,3 +11,5 @@ from .gym_reward import GymReward # import costs from .cost import * +# import processors +from .processors import * diff --git a/pyrobolearn/rewards/processors/__init__.py b/pyrobolearn/rewards/processors/__init__.py new file mode 100644 index 0000000..fa1a8eb --- /dev/null +++ b/pyrobolearn/rewards/processors/__init__.py @@ -0,0 +1,3 @@ + +# import reward processors +from .reward_processor import * diff --git a/pyrobolearn/rewards/reward_processor.py b/pyrobolearn/rewards/processors/reward_processor.py similarity index 99% rename from pyrobolearn/rewards/reward_processor.py rename to pyrobolearn/rewards/processors/reward_processor.py index 54b709a..f1daae4 100644 --- a/pyrobolearn/rewards/reward_processor.py +++ b/pyrobolearn/rewards/processors/reward_processor.py @@ -5,7 +5,8 @@ It processes the rewards before returning them; this can be useful to standardiz """ import numpy as np -from reward import Reward + +from pyrobolearn.rewards.reward import Reward __author__ = "Brian Delhaisse" __copyright__ = "Copyright 2018, PyRoboLearn" @@ -277,7 +278,6 @@ class ScaleRewardProcessor(RewardProcessor): self.y2 = y2 self.ratio = (self.y2 - self.y1) / (self.x2 - self.x1) - @convert_numpy def compute(self): reward = self.reward() self.value = self.y1 + (reward - self.x1) * self.ratio