-
Notifications
You must be signed in to change notification settings - Fork 0
58 lines (50 loc) · 1.82 KB
/
Copy pathscrape.yml
File metadata and controls
58 lines (50 loc) · 1.82 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
name: Scheduled Job Scraper
on:
schedule:
# Every 6h; scraper self-throttles with minHoursBetweenScrapes (18h in scraper/config.js)
- cron: '0 */6 * * *'
workflow_dispatch: # Manual trigger button in GitHub UI
jobs:
scrape:
runs-on: ubuntu-latest
timeout-minutes: 30
steps:
- name: Checkout code
uses: actions/checkout@v4
- name: Setup Node.js
uses: actions/setup-node@v4
with:
node-version: '20'
- name: Install server dependencies
working-directory: ./server
run: npm ci
- name: Install Playwright Chromium
working-directory: ./server
run: npx playwright install chromium --with-deps
# Playwright reads session JSON from disk; secrets hold base64(file).
- name: Materialize scraper sessions from secrets
working-directory: ./server
env:
LINKEDIN_SESSION_B64: ${{ secrets.LINKEDIN_SESSION }}
NAUKRI_SESSION_B64: ${{ secrets.NAUKRI_SESSION }}
run: |
set -euo pipefail
if [ -n "$LINKEDIN_SESSION_B64" ]; then
echo "$LINKEDIN_SESSION_B64" | base64 -d > scraper/linkedin-session.json
echo "LinkedIn session file written."
else
echo "LINKEDIN_SESSION secret empty — LinkedIn scrape may be limited."
fi
if [ -n "$NAUKRI_SESSION_B64" ]; then
echo "$NAUKRI_SESSION_B64" | base64 -d > scraper/naukri-session.json
echo "Naukri session file written."
else
echo "NAUKRI_SESSION secret empty — Naukri uses anonymous context if allowed."
fi
- name: Run scraper
working-directory: ./server
env:
MONGODB_URI: ${{ secrets.MONGODB_URI }}
CI: 'true'
NODE_ENV: production
run: node scraper/index.js