In this Article
เมื่อ 5 ปีก่อน web scraping ยังเป็นเรื่องปวดหัวของทีม IT เพียงอย่างเดียว ผู้บริหารระดับ C-level แทบไม่ต้องเกี่ยวข้องด้วย แต่ทุกวันนี้สถานการณ์เปลี่ยนไปอย่างสิ้นเชิง ข้อมูลจากเว็บกลายเป็นรายการหนึ่งในงบกำไรขาดทุน (Profit & Loss) ธนาคารและกองทุนการลงทุนสร้างกลยุทธ์จากสัญญาณด้านราคา ตลาดแรงงาน และความคิดเห็นของลูกค้าที่รวบรวมจากแหล่งข้อมูลสาธารณะ บริษัทยาติดตามราคาของคู่แข่ง ทะเบียนสิทธิบัตร และการประมูลแบบเรียลไทม์ ผลที่ตามมาคือ CFO ต้องเข้าร่วมโต๊ะเจรจากับที่ปรึกษากฎหมายในทุกการตัดสินใจที่เกี่ยวกับการเก็บรวบรวมข้อมูล เพราะราคาที่ต้องจ่ายเมื่อทำผิดพลาดทางกฎหมายนั้นสูงมาก และไม่ได้จ่ายด้วยเงินเพียงอย่างเดียว แต่ยังรวมถึงชื่อเสียงด้วย DataImpulse เป็นผู้ให้บริการ proxy ที่ยึดหลักจริยธรรม และเรารู้ดีจากประสบการณ์ตรงว่าความเสี่ยงจากการทำ scraping และเครื่องมือที่ไม่โปร่งใสนั้นเป็นอย่างไร
บทความนี้ไม่ได้พูดถึงวิธีการเก็บรวบรวมข้อมูล แต่พูดถึงวิธีป้องกันค่าปรับ การถูกฟ้องร้อง หรือความเสียหายต่อชื่อเสียง
ข้อเท็จจริงสำคัญ:
- Proxy ไม่ใช่แค่ค่าใช้จ่ายทางเทคนิคเท่านั้น proxy ที่ไม่ยึดหลักจริยธรรมอย่างน้อยที่สุดก็นำไปสู่การเก็บข้อมูลที่ผิดพลาดและการตัดสินใจที่ผิดพลาด หรือร้ายแรงกว่านั้น อาจนำไปสู่ความเสี่ยงทางกฎหมายจากการใช้เครื่องมือที่ผิดกฎหมายและความเสียหายต่อชื่อเสียง proxy ที่น่าเชื่อถือคือการลงทุนเพื่อความปลอดภัยทางกฎหมายและภาพลักษณ์ของคุณ
- แม้ว่าคุณจะทำการ scrape ข้อมูลที่เปิดเผยต่อสาธารณะ ข้อมูลเหล่านั้นก็ยังต้องถูกเก็บรวบรวมภายใต้ขอบเขตทางกฎหมาย
- มาตรการที่รุนแรงเกินไปเพื่อหลบเลี่ยงระบบตรวจจับสามารถสร้างความเสี่ยงเพิ่มเติมได้ คุณจำเป็นต้อง scrape อย่างมีจริยธรรม นั่นคือยึดตามกฎหมายอย่าง GDPR และ ToS ของแพลตฟอร์มต่าง ๆ ไม่ใช่แค่พยายามหลบเลี่ยงการตรวจจับเพียงอย่างเดียว นี่คือความแตกต่างระหว่าง scraping ทั่วไปกับ ethical scraping
- ก่อนตัดสินใจเลือกผู้ให้บริการ proxy ให้ตรวจสอบแหล่งที่มาของ IP การปฏิบัติตามกฎหมาย และการรับรองมาตรฐาน ISO
เหตุใดจึงไม่ควรมองว่า proxy เป็นเพียงค่าใช้จ่ายทางเทคนิค
CFO มักมองบิลค่า proxy เป็นเพียงต้นทุนดำเนินงาน แต่กลับมองข้ามค่าใช้จ่ายที่ไม่ชัดเจนดังนี้
- ค่าใช้จ่ายจากการ retry – proxy ราคาถูกที่มีชื่อเสียงไม่ดีมักถูกบล็อกภายในไม่กี่นาทีแรก ทีมงานจะไม่ได้รับข้อความแจ้งข้อผิดพลาด แต่กลับได้รับข้อมูลที่ผิดพลาดหรือไม่สมบูรณ์ซึ่งดูเหมือนจะปกติดี จากนั้นการตัดสินใจต่าง ๆ ก็ถูกสร้างขึ้นบนพื้นฐานของข้อมูลนั้น ราคาที่แท้จริงของการตัดสินใจเช่นนี้ไม่ใช่แค่ 500 ดอลลาร์ค่า proxy แต่อาจสูงถึงหลายร้อยหรือหลายล้านดอลลาร์ อันเป็นผลจากการประเมินตลาดที่ผิดพลาดและการคาดการณ์การเปิดตัวผลิตภัณฑ์ที่คลาดเคลื่อน
- ค่าใช้จ่ายทางกฎหมาย – คดีความอย่าง hiQ Labs vs LinkedIn หรือ Ryanair vs Aviation ไม่ใช่สมมติฐาน แต่เป็นตัวอย่างจริงที่แสดงให้เห็นว่า แม้จะเป็นการเก็บข้อมูลสาธารณะก็ตาม วิธีการได้มาซึ่งข้อมูลนั้นก็ยังคงสำคัญ โครงสร้างพื้นฐานที่ใช้ ข้อจำกัดทางเทคนิคที่ยึดถือ และความโปร่งใสเกี่ยวกับแหล่งที่มาของทราฟฟิก ทั้งหมดนี้อาจกลายเป็นประเด็นในการพิจารณาคดีได้
อุตสาหกรรมที่มีการกำกับดูแลเข้มงวดอย่างเภสัชกรรมต้องเผชิญแรงกดดันมากกว่า – GDPR และกฎระเบียบหรือข้อกำหนดอื่น ๆ เกี่ยวกับข้อมูล อุตสาหกรรมการเงินยิ่งเผชิญความยากลำบากมากกว่านั้นด้วยกฎเกณฑ์เกี่ยวกับการใช้ข้อมูลในตลาดโดยมิชอบและข้อมูลภายใน ในกรณีที่การ scraping ไปแตะข้อมูลที่ไม่เปิดเผยต่อสาธารณะโดยไม่ตั้งใจ - ค่าใช้จ่ายด้านชื่อเสียงและสัญญา – ลูกค้าองค์กรขนาดใหญ่เรียกร้องมากขึ้นเรื่อย ๆ ที่จะทราบว่าคุณได้ข้อมูลสำหรับการวิเคราะห์มาอย่างไร คำตอบที่ไม่ชัดเจนหรือการไม่มีคำตอบเลยอาจกลายเป็นเหตุผลให้ลูกค้าที่ใส่ใจเรื่องการปฏิบัติตามกฎระเบียบยกเลิกสัญญาได้
การมองโครงสร้างพื้นฐานของ proxy เพียงในแง่ของค่าใช้จ่ายด้าน IT เป็นการประเมินคุณค่าของมันในฐานะเครื่องมือบริหารความเสี่ยงต่ำเกินไป
เหตุใด proxy ราคาถูกจึงไม่ใช่ทางออกที่ดีที่สุด
การเลือกซื้อ proxy pool ที่ถูกที่สุดอาจดูเป็นทางเลือกที่ชาญฉลาดในระยะสั้นเท่านั้น ในความเป็นจริง proxy pool เหล่านี้มักถูกสร้างขึ้นด้วยวิธีการที่หลีกเลี่ยงการขอความยินยอมโดยตรงจากผู้ใช้ปลายทาง กล่าวอีกนัยหนึ่งคือ ทราฟฟิกถูกส่งผ่านอุปกรณ์ของผู้คนที่ไม่เข้าใจอย่างถ่องแท้ หรือแม้แต่ไม่รู้เลยว่ามีบุคคลที่สามกำลังใช้ที่อยู่ IP ของตน สำหรับทีม compliance ขององค์กรที่ดำเนินธุรกิจในอุตสาหกรรมที่มีการกำกับดูแล นี่ไม่ใช่เพียงคำถามเชิงจริยธรรม แต่เป็นประเด็นของห่วงโซ่อุปทานข้อมูล ซึ่งแท้จริงแล้วก็คือคำถามเดียวกันกับแหล่งที่มาของข้อมูลส่วนบุคคลนั่นเอง
หากหน่วยงานกำกับดูแลหรือผู้ตรวจสอบบัญชีถามว่า “ที่อยู่ IP ที่บริษัทใช้เก็บรวบรวมราคาของคู่แข่งนั้นมาจากไหน” คำตอบ “เราไม่ทราบ” ฟังดูแย่ยิ่งกว่าการไม่มีคำตอบเลยเสียอีก
นี่คือเหตุผลที่คำถามเกี่ยวกับแหล่งที่มาและความแท้จริงของ proxy pool ได้เปลี่ยนจากรายละเอียดทางเทคนิคไปสู่ประเด็นที่ต้องตรวจสอบอย่างรอบคอบ
CFO ต้องเข้าใจแง่มุมทางกฎหมายใดบ้าง
มีหลายประเด็นที่ควรคำนึงถึงเมื่อวางกลยุทธ์ด้านข้อมูล ซึ่งเป็นสิ่งที่แม้แต่ผู้ที่ไม่มีพื้นฐานด้านกฎหมายก็สามารถและควรจดจำไว้
- ข้อมูลที่เปิดเผยต่อสาธารณะไม่ได้หมายความว่าปราศจากข้อจำกัด
ศาล (ตัวอย่างเช่น ในคดี hiQ vs. LinkedIn) ยอมรับสิทธิในการ scrape ข้อมูลที่เปิดเผยต่อสาธารณะโดยไม่ต้องขออนุญาต แต่ในขณะเดียวกัน ToS และสัญญาของแพลตฟอร์มก็สร้างความรับผิดชอบทางกฎหมายอีกชั้นหนึ่งซึ่งไม่ได้ขึ้นอยู่กับความ “เปิดเผยต่อสาธารณะ” ทางเทคนิคของข้อมูลแต่อย่างใด
- มาตรการที่รุนแรงเกินไปเพื่อหลบเลี่ยงระบบป้องกันเพิ่มความเสี่ยงทางกฎหมาย
การหลบเลี่ยง CAPTCHA การเพิกเฉยต่อไฟล์ robot.txt และการปลอม user-agent string ล้วนเป็นข้อโต้แย้งที่โจทก์ใช้เพื่อพิสูจน์เจตนาไม่สุจริต ซึ่งบั่นทอนภาพลักษณ์ของบริษัทที่ทำการ scrape ข้อมูลอย่างรุนแรง
- ยังคงต้องปฏิบัติตาม GDPR และกฎหมายอื่น ๆ
GDPR และกฎระเบียบอื่น ๆ ยังคงมีผลบังคับใช้ แม้กระทั่งกับข้อมูลสาธารณะ โปรไฟล์ LinkedIn รีวิวที่ระบุชื่อ ข้อมูลติดต่อ ตามหลัก GDPR สิ่งเหล่านี้ถือเป็นข้อมูลส่วนบุคคล ไม่ว่าจะมาจากแหล่งใดก็ตาม
- กฎระเบียบเพิ่มเติมสำหรับอุตสาหกรรมการเงิน
MNPI (ข้อมูลสำคัญที่ไม่เปิดเผยต่อสาธารณะ) กฎเกณฑ์เกี่ยวกับการปั่นตลาด และข้อกำหนดของ MiFID II/SEC เกี่ยวกับคุณภาพข้อมูลสำหรับการตัดสินใจลงทุน หมายความว่าข้อมูลทางเลือกจะต้องมีห่วงโซ่อุปทานที่มีเอกสารบันทึกและผ่านการตรวจสอบ
- อุตสาหกรรมยาต้องเผชิญประเด็นความโปร่งใสด้านราคาและข้อกังวลเรื่องการแข่งขันที่ไม่เป็นธรรม
การติดตามราคาของคู่แข่งเป็นแนวปฏิบัติที่ชอบธรรม อย่างไรก็ตาม หากวิธีการได้มาซึ่งข้อมูลนั้นก่อให้เกิดข้อสงสัยและดูไม่โปร่งใส ก็อาจถูกใช้เป็นหลักฐานในการสอบสวนเรื่องการแข่งขันที่ไม่เป็นธรรมได้ อันที่จริงแล้ว อุตสาหกรรมยาสมควรได้รับความสนใจเป็นพิเศษ จึงมีบทความเจาะลึกเรื่อง เหตุใดองค์กรด้านเภสัชกรรมและสาธารณสุขจึงต้องการ IP ที่ปลอดภัย
ข้อสรุปนั้นเรียบง่าย ความเสี่ยงทางกฎหมายไม่ได้อยู่ที่ ข้อมูลอะไร ที่คุณได้มาเท่านั้น แต่ยังอยู่ที่ วิธีการ ที่คุณใช้ได้มาซึ่งข้อมูลนั้น และคุณสามารถพิสูจน์ได้หรือไม่ว่าการกระทำของคุณถูกต้องตามกฎหมาย Proxy ที่ได้มาอย่างมีจริยธรรมสำหรับ web scraping จึงเป็นสิ่งที่ขาดไม่ได้ในกรณีนี้
ทีมกฎหมายและ compliance ควรใช้เกณฑ์ใดในการประเมินผู้ให้บริการ proxy
เมื่อต้องตัดสินใจว่าจะไว้วางใจผู้ให้บริการรายใดรายหนึ่งหรือไม่ สิ่งแรกที่ควรตรวจสอบไม่ใช่ราคาต่อ GB แต่เป็นประเด็นต่อไปนี้
- ความโปร่งใสของแหล่งที่มาของ IP ผู้ให้บริการต้องยืนยันได้ว่า residential IP ได้มาอย่างมีจริยธรรม นั่นคือหลังจากได้รับความยินยอมโดยตรงจากผู้ใช้ปลายทาง ซึ่งพวกเขาเลือกเข้าร่วม (opted in) เพื่ออนุญาตให้ใช้ IP ของตน จะต้องไม่มีการฝัง SDK ที่ซ่อนอยู่ในแอปพลิเคชันฟรีเข้ามาเกี่ยวข้อง นี่คือความแตกต่างระหว่างการใช้เครื่องมือที่ถูกต้องตามกฎหมายกับการกลายเป็นผู้สมรู้ร่วมคิดในคดีการบุกรุกโดยไม่รู้ตัว
- การรับรองมาตรฐานและการตรวจสอบ การรับรอง ISO และบันทึกการตรวจสอบในช่วงเวลาที่กำหนด คือสิ่งที่ทีมกฎหมายของคุณอาจต้องใช้ในอีก 18 เดือนข้างหน้า เมื่อหน่วยงานกำกับดูแลขอให้แสดงว่าคุณได้ข้อมูลนั้นมาอย่างไรในเดือนมีนาคมของปีก่อน
- การปฏิบัติตามกฎหมายคุ้มครองข้อมูล สำหรับบริษัทด้านการเงินและเภสัชกรรมที่ดำเนินธุรกิจในสหภาพยุโรป สิ่งสำคัญคือผู้ให้บริการต้องปฏิบัติตาม GDPR และรับประกันการส่งผ่านและประมวลผลทราฟฟิกตามข้อกำหนดที่กำหนดไว้
เหตุใด proxy ราคาแพงกว่าจึงกลับกลายเป็นตัวเลือกที่ประหยัดกว่า
เมื่อมองเผิน ๆ การเปรียบเทียบระหว่าง proxy pool ราคาถูกกับผู้ให้บริการระดับองค์กรอาจดูเหมือนว่าฝ่ายหลังไม่ได้เปรียบเลย แต่ลองคำนึงถึงมูลค่าเวลาของนักพัฒนาที่สูญเสียไปกับการ retry เมื่อ proxy ราคาถูกถูกบล็อก ซึ่งเป็นเรื่องปกติเมื่อทำงานกับผู้ให้บริการคุณภาพต่ำ เพิ่มด้วยค่าใช้จ่ายในการปรึกษากฎหมายเพื่อประเมินความเสี่ยงและค่าความคุ้มครองประกันภัย รวมถึงคำนวณมูลค่าความเสียหายจากความล่าช้าในการเปิดตัวผลิตภัณฑ์
ท้ายที่สุดแล้ว โซลูชันระดับองค์กรที่มีแหล่งที่มาของ IP ชัดเจนและมีการรับรองมาตรฐานมักจะคุ้มค่ากว่าในระยะยาวเมื่อเทียบกับผู้ให้บริการราคาถูก แม้ว่าราคาเริ่มต้นจะสูงกว่าก็ตาม
CFO และฝ่าย Compliance ควรตรวจสอบอะไรบ้างก่อนตัดสินใจเลือกผู้ให้บริการ
- ตรวจสอบนโยบายด้านความยินยอม ทีม compliance ของคุณต้องประเมินสิ่งนี้ก่อนเริ่มทำงานกับผู้ให้บริการ ไม่ใช่หลังจากนั้น
- ตรวจสอบให้ชัดเจนว่าผู้ให้บริการมีข้อมูล log สำหรับการตรวจสอบภายในหรือไม่
- คำนวณค่าใช้จ่ายโดยประมาณ โดยคำนึงถึงค่าใช้จ่ายต่อการ retry และความคุ้มครองประกันภัย ไม่ใช่แค่ปริมาณทราฟฟิกเพียงอย่างเดียว
- เพิ่มผู้ให้บริการ proxy เข้าไปในรายชื่อผู้ให้บริการบุคคลที่สามที่มีความเสี่ยง เช่นเดียวกับผู้ให้บริการ cloud hosting หรือผู้ให้บริการชำระเงิน
สรุป
ข้อมูลคือความได้เปรียบทางการแข่งขันที่ไม่อาจมองข้ามได้ แต่สำหรับ CFO และที่ปรึกษากฎหมายในอุตสาหกรรมที่มีการกำกับดูแล คำถามไม่ได้อยู่ที่ว่าควรใช้ข้อมูลนั้นหรือไม่ แต่อยู่ที่ว่าจะพิสูจน์ได้อย่างไรว่าธุรกิจได้มาและใช้ข้อมูลนั้นอย่างถูกต้องตามกฎหมาย เมื่อแหล่งที่มาของข้อมูลและเครื่องมือที่ใช้สนับสนุนมีความโปร่งใสและเปิดเผย เมื่อมีนโยบายที่ชัดเจนซึ่งรับประกันการปฏิบัติตามกฎระเบียบด้านข้อมูล การ scraping ก็จะเปลี่ยนจากแหล่งความเสี่ยงไปเป็นกระบวนการที่จัดการได้ คาดการณ์ได้ และมีต้นทุนต่ำ
คำถามที่พบบ่อย
การทำ web scraping ถูกกฎหมายหรือไม่
ใช่ โดยทั่วไปแล้ว web scraping เป็นแนวปฏิบัติที่ถูกกฎหมาย แต่ทั้งนี้ขึ้นอยู่กับหลายปัจจัย เช่น อุตสาหกรรมที่คุณดำเนินธุรกิจอยู่ เครื่องมือที่ใช้ ข้อมูลที่ scrape และวิธีการจัดเก็บข้อมูลนั้น เพื่อให้อยู่ในขอบเขตของกฎหมาย ควรพิจารณากฎระเบียบด้านข้อมูลที่บังคับใช้ในพื้นที่ของคุณและ ToS ของแพลตฟอร์ม ใช้เครื่องมือที่มีนโยบายโปร่งใส และคำนึงถึงข้อจำกัดเฉพาะของอุตสาหกรรมของคุณ
หากข้อมูลเปิดเผยต่อสาธารณะ ข้อจำกัดจะยังมีผลบังคับใช้ได้อย่างไร
ข้อมูลอาจเปิดเผยต่อสาธารณะแต่ก็ยังถือเป็นข้อมูลส่วนบุคคลได้ เช่น โปรไฟล์ LinkedIn รีวิวที่ระบุชื่อ ข้อมูลติดต่อ ทั้งหมดนี้อาจถูกจัดว่าเป็นข้อมูลส่วนบุคคลตามหลัก GDPR นอกจากนี้ การที่ข้อมูลมองเห็นได้ไม่ได้หมายความว่าไม่จำเป็นต้องประมวลผล จัดเก็บ และแบ่งปันข้อมูลตามกฎระเบียบที่กำหนด นี่คือเหตุผลที่แม้แต่ข้อมูลสาธารณะก็ยังคงมีข้อจำกัดอยู่ และจำเป็นต้องใช้ความระมัดระวัง
ธุรกิจอาจต้องรับผิดชอบหรือไม่ หาก IP ของผู้ให้บริการ proxy ไม่ได้มาอย่างมีจริยธรรมหรือก่อให้เกิดข้อกังวลอื่น ๆ
มีความเป็นไปได้ โดยเฉพาะอย่างยิ่งหากบริษัททราบถึงปัญหาทางกฎหมายล่วงหน้าแล้วยังคงใช้ proxy เหล่านั้นโดยรู้เท่าทัน นี่คือเหตุผลที่ต้องมั่นใจว่า IP ได้มาด้วยความยินยอมของผู้ใช้ เพื่อหลีกเลี่ยงปัญหา ควรเลือกผู้ให้บริการที่ถูกต้องตามกฎหมายอย่าง DataImpulse ซึ่งไม่ขายต่อ proxy และได้ IP มาด้วยความยินยอมของผู้ใช้เท่านั้น
DataImpulse คืออะไร
DataImpulse (dataimpulse.com) เป็นผู้ให้บริการ proxy ที่ยึดหลักจริยธรรม ซึ่งมี residential IP มากกว่า 90M+, mobile IP มากกว่า 16M+ และ datacenter IP มากกว่า 20M+ จาก 195 ประเทศ ผู้ให้บริการนี้ใช้ระบบราคาแบบจ่ายตาม GB (pay-per-GB) และจำหน่ายทราฟฟิกที่ไม่มีวันหมดอายุ โดย residential proxy มีราคา $1/GB proxy ของ DataImpulse สอดคล้องกับ GDPR จึงเหมาะสำหรับ web scraping ที่ถูกกฎหมาย, ad verification, SERP monitoring, price tracking และกรณีการใช้งานอื่น ๆ
DataImpulse ไม่เหมาะกับกรณีใดบ้าง
DataImpulse ไม่สามารถช่วยในการเข้าถึงแหล่งข้อมูลของภาครัฐหรือธนาคารได้ และไม่มี scraping API ให้บริการเช่นกัน นอกจากนี้ยังควรทราบว่าผู้ให้บริการนี้ไม่มี address จากอิหร่าน คิวบา เบลารุส สหพันธรัฐรัสเซีย เกาหลีเหนือ ซีเรีย และพื้นที่ของยูเครนที่ถูกยึดครองชั่วคราว
การใช้ผู้ให้บริการ proxy ที่ถูกกฎหมายช่วยขจัดความเสี่ยงทางกฎหมายทั้งหมดได้หรือไม่
ไม่ทั้งหมด การใช้ผู้ให้บริการที่ถูกต้องตามกฎหมายช่วยลดความเสี่ยงได้อย่างมีนัยสำคัญ แต่ความเสี่ยงทางกฎหมายยังขึ้นอยู่กับปัจจัยอื่น ๆ อีกมาก เช่น กฎของแพลตฟอร์มเป้าหมาย ประเภทของข้อมูลที่เก็บรวบรวม และวิธีการจัดเก็บและประมวลผลข้อมูลเหล่านั้น ผู้ให้บริการ proxy ไม่ได้มีอิทธิพลต่อปัจจัยเหล่านี้โดยตรง แต่จะช่วยจัดการความเสี่ยงในระดับโครงสร้างพื้นฐานเท่านั้น กล่าวอีกนัยหนึ่งคือ ผู้ให้บริการ proxy ที่น่าเชื่อถือเป็นสิ่งจำเป็น แต่ก็ไม่ใช่ทั้งหมด
