-
Notifications
You must be signed in to change notification settings - Fork 1
Expand file tree
/
Copy pathworker.py
More file actions
executable file
·167 lines (131 loc) · 4.84 KB
/
Copy pathworker.py
File metadata and controls
executable file
·167 lines (131 loc) · 4.84 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
#! /usr/bin/env python
from __future__ import absolute_import
from __future__ import division
from __future__ import print_function
from six.moves import xrange
import numpy as np
import agents
import configs
import environments
import policies
import runners
import memories
import models
import net_fns
import transforms
def make_dist_params (FLAGS):
return dict (
cluster = configs.distributed.get_cluster_local(FLAGS),
task_index = FLAGS.task_index,
is_chief = FLAGS.task_index == 0,
config = configs.tf.session_configs['single_cpu']
)
def make_local_params (FLAGS):
return dict (
cluster = None,
task_index = 0,
is_chief = True,
config = None
)
def main (FLAGS):
# Net fn parameters
hidden_units = [16]
dropout_rate = 0.0
# Model parameters
model_dir = '/tmp/cartpole/model'
learning_rate = 1e-3
batch_size = 32
# Distributed model parameters
params_fn = make_local_params if FLAGS.task_index is None else make_dist_params
dist_params = params_fn(FLAGS)
# Policy parameters
total_steps = 50*200
epsilon_start = 1.0
epsilon_stop = 0.00
epsilon_steps = total_steps*0.95
# Agent parameters
gamma = 0.99
environment = environments.GymEnvironment('Pong-v0')
environment = transforms.image.StateImageResizeTransform(environment, (84, 84, 3))
environment = transforms.image.StateLuminanceTransform(environment)
environment = transforms.image.StateImageStackTransform(environment, num_stacked_frames=4)
environment = environments.BatchEnvironment(environment, batch_size=batch_size)
net_params = [
# First conv layer
dict (
type='conv2d', filters=16, kernel_size=(9, 9), strides=(4, 4), activation='relu',
name='hidden_0/conv_16_9x9_4x4_relu'
),
# Second conv layer
dict (
type='conv2d', filters=32, kernel_size=(7, 7), strides=(2, 2), activation='relu',
name='hidden_1/conv_32_7x7_2x2_relu'
),
# Third conv layer
dict (
type='conv2d', filters=64, kernel_size=(5, 5), strides=(2, 2), activation='relu',
name='hidden_2/conv_64_5x5_2x2_relu'
),
# Fully connected layer
dict(type='flatten', name='hidden_3/flattened'),
dict(type='dense', units=128, activation='relu', name='hidden_3/dense_256_relu')
]
model = models.Q.Model (
# DataConfigs
input_config=configs.DataConfig(dtype=np.float32, shape=environment.state_shape),
output_config=configs.DataConfig(dtype=np.float32, shape=environment.action_shape),
action_config=configs.DataConfig(dtype=np.int32, shape=()),
target_config=configs.DataConfig(dtype=np.float32, shape=()),
# Q.Model inputs
net_fn=net_fns.make_net_fn(net_params=net_params),
loss_type='mean_squared_error',
# TF model inputs
params=dict (
# Tensorflow Model
model_dir=model_dir,
# Tensorflow Optimizer
optimizer='Adam',
learning_rate=learning_rate,
# Tensorflow Distributed
cluster=dist_params['cluster'],
task_index=dist_params['task_index'],
is_chief=dist_params['is_chief'],
config=dist_params['config']
)
)
policy = policies.EpsilonGreedyPolicy(epsilon=epsilon_start)
memory = memories.OneStepMemory()
agent = agents.Q.SarsaAgent(model=model, policy=policy, memory=memory, gamma=gamma)
runner = runners.Runner(agent=agent, environment=environment)
with model:
start_step = model.step()
step = start_step
episodes = 0
while step - start_step < total_steps:
if model.session.should_stop():
break
special_episode = dist_params['is_chief'] and ((1+episodes) % 10 == 0)
a = (epsilon_stop - epsilon_start)/epsilon_steps
b = epsilon_start
agent.policy.epsilon = a*step + b
if agent.policy.epsilon < epsilon_stop:
agent.policy.epsilon = epsilon_stop
sub_episodes, rewards = runner.run_episode(render=special_episode, render_delay=None)
rewards = rewards.mean(axis=-1)
reward = rewards.sum()
print('eps={:.2f} reward={:.2f} sub_episodes={} id={}'.format (
agent.policy.epsilon, reward, sub_episodes, agent.model.server.target
))
step = model.step()
episodes += 1
return 0
if __name__ == '__main__':
import argparse
parser = argparse.ArgumentParser()
parser = configs.distributed.add_argparse_args(parser)
parser.add_argument (
'--task_index', type=int, default=None,
help='Index of worker in cluster.'
)
FLAGS = parser.parse_args()
exit(main(FLAGS))