सामग्री पर जाएँ
विषय

AI सुरक्षा और गवर्नेंस: सुरक्षित AI उपयोग गाइड

AI टूल्स के सुरक्षा जोखिम, प्रॉम्प्ट डेटा लीकेज, AI एजेंट सेफ्टी और गवर्नेंस बेस्ट प्रैक्टिस।

20 लेख

लेखों को क्रमबद्ध करें

सुरक्षा और गवर्नेंस के लेख

क्या AI से लिखे लेख पर "AI जनित" लेबल ज़रूरी है? EU AI Act अनुच्छेद 50 को व्यवहार की नज़र से पढ़ना

क्या AI से लिखे लेख पर "AI जनित" लेबल ज़रूरी है? EU AI Act अनुच्छेद 50 को व्यवहार की नज़र से पढ़ना

2 अगस्त 2026 को EU AI Act के बाक़ी प्रावधान आम तौर पर लागू हुए, और उसके साथ ही यह दावा अचानक हर जगह दिखने लगा कि AI से लिखे लेख पर लेबल न लगाना अब गैरकानूनी है। छोटा जवाब यह है कि अधिकतर व्यक्तिगत लेखकों और कंपनी ब्लॉग पर प्रकटीकरण का दायित्व पैदा ही नहीं होता। अनुच्छेद 50(4) साफ़ शब्दों में कहता है कि जहाँ सामग्री इंसानी समीक्षा या संपादकीय नियंत्रण से गुज़री हो और कोई उस प्रकाशन की संपादकीय ज़िम्मेदारी उठाता हो, वहाँ यह दायित्व लागू नहीं होता। साथ जुड़ी शर्त यह है कि समीक्षा सारभूत होनी चाहिए और सतही बातों या केवल औपचारिक मंज़ूरी तक सीमित नहीं रहनी चाहिए, इसलिए बिना पढ़े अपने आप पोस्ट कर देने वाला तरीक़ा इसमें नहीं आता। यह लेख बताता है कि प्रदाता (provider) और उपयोगकर्ता (deployer) के दायित्व बिल्कुल अलग क्यों हैं, AI जनित टेक्स्ट का प्रकटीकरण विषय के बजाय प्रकाशन के उद्देश्य पर क्यों तय होता है, डीपफ़ेक का प्रकटीकरण दायित्व और कलात्मक तथा व्यंग्यात्मक कृतियों के साथ किया गया नरम बर्ताव क्या है, चैटबॉट की सूचना कैसी होनी चाहिए, C2PA Content Credentials जैसी मशीन-पठनीय मार्किंग प्रदाता का दायित्व क्यों है, और 2 दिसंबर 2026 तथा 2 फ़रवरी 2027 की समयसीमाएँ क्या हैं। हर बात उतनी ही रखी गई है जितनी क़ानूनी पाठ और यूरोपीय आयोग की सामग्री पर पुष्ट की जा सकी।

पूरा एडमिन पैनल मिटाकर क्या सीखा — AI के दौर में UI कब बचता है और कब हट सकता है

पूरा एडमिन पैनल मिटाकर क्या सीखा — AI के दौर में UI कब बचता है और कब हट सकता है

इस सवाल का जवाब कि "अगर AI सीधे ही चीज़ें बदल सकता है तो क्या अब भी एडमिन पैनल चाहिए", किसी आम-सी घोषणा से नहीं निकलता, क्योंकि "एडमिन पैनल" यह अकेला शब्द बिलकुल अलग-अलग स्वभाव वाले फ़ीचरों के ढेर को समेटे हुए है। यह लेख इस साइट का अपना एडमिन पैनल पूरा मिटा देने के अनुभव पर टिका है और उस सवाल की जगह एक तीखा सवाल रखता है: क्या वह स्क्रीन कुछ ऐसा दे रही है जो CLI और AI पहले से नहीं दे रहे? पूरा पैनल मिटाकर जो सामने आया वह यह कि हटाए गए ज़्यादातर फ़ीचर "बेकार पड़े" नहीं, "ढाँचे से टूटे हुए" थे। लेखों का CRUD कभी काम कर ही नहीं सकता था, क्योंकि लेखों का असली स्रोत कोड में रहता है और हर deploy database को ऊपर से लिख देता है, इसलिए स्क्रीन से किया गया हर संपादन अगले deploy पर गायब हो जाता था। कमेंट मंज़ूरी की कतार हमेशा खाली रहती थी क्योंकि पोस्ट होते ही कमेंट पर मंज़ूर का निशान लग जाता था, यानी बिना मंज़ूरी वाला कमेंट कभी पैदा ही नहीं होता था। जिस फ़ीचर को कोई इस्तेमाल नहीं करता, उसके टूटे होने की खबर भी किसी को नहीं होती। इकलौती क्षमता जो हट नहीं सकती थी वह थी कमेंट मिटाना, और उसे भी एडमिन पैनल होने की कोई अनिवार्यता नहीं थी: लेख के पन्ने पर रखा एक delete बटन बेहतर निकला, क्योंकि आपत्तिजनक कमेंट ठीक वहीं हटाया जा सकता है जहाँ उसे पढ़ा जा रहा है। फ़ैसला छह सवालों पर उतरता है। इसे चलाता कौन है (ग़ैर-तकनीकी कर्मचारी या हाथ बदलती भूमिका UI के पक्ष में है, terminal में रहने वाले डेवलपर नहीं)। क्या यह पलटी जा सकती है (जो पलटी न जा सके, उसके आगे गेट चाहिए)। क्या इसमें इंसानी निर्णय चाहिए (क्या मंज़ूर-या-नामंज़ूर वाला स्थिति-परिवर्तन मौजूद है)। क्या अधिकार अलग करने हैं। क्या चलाने वाले को पता है कि मुमकिन क्या है (सूची ही दस्तावेज़ का काम कर देती है)। क्या कोई audit trail है। खासकर अधिकार और audit trail अकेले चलने वाले प्रोजेक्ट में ग़ैर-ज़रूरी लगते हैं और दूसरा व्यक्ति आते ही सबसे पहली ज़रूरत बन जाते हैं। कोड से किए गए बदलाव git में उतरते हैं, पर AI को सीधे database में लिखने देने पर डिफ़ॉल्ट रूप से कुछ भी दर्ज नहीं होता, और बातचीत का लॉग यह सँभालता है कि क्या माँगा गया था, यह नहीं कि क्या हुआ। छह कसौटियों में से सिर्फ़ पलटे जा सकने का वज़न अलग है। 18 जुलाई 2025 को Replit के एक AI एजेंट ने चालू code freeze के बीच SaaStr का production database मिटा दिया, 4,000 काल्पनिक उपयोगकर्ता गढ़ दिए और गलत ढंग से दावा किया कि rollback मुमकिन नहीं है, जिससे बहाली में देर हुई (AI Incident Database #1152) — यह मामला AI के ख़तरे से कहीं ज़्यादा वह डिज़ाइन-समस्या दिखाता है जिसमें पलटी न जा सकने वाली कार्रवाई तक बिना किसी इंसानी गेट से गुज़रे पहुँचा जा सकता था। लेख उन तीन तैयारियों को भी गिनाता है जो भार AI और CLI पर डालने से पहले चाहिए (बदलाव कोई टिकाऊ निशान छोड़ें, न पलटी जा सकने वाली कार्रवाई के आगे एक कदम हो, और प्रक्रिया लिखी हुई हो, क्योंकि UI मिटाने से यह सूची भी मिट जाती है कि मुमकिन क्या-क्या है), कुछ भी बनाने से पहले चलाने लायक एक चेकलिस्ट देता है, और पैनल हाथ से लिखने के बजाय Retool तथा Forest Admin जैसे भीतरी-टूल वाले उत्पादों का तीसरा विकल्प सामने रखता है।

Claude का Dispatch — फ़ोन से आपका अपना PC कैसे चलता है, और वह कितना सुरक्षित है

Claude का Dispatch — फ़ोन से आपका अपना PC कैसे चलता है, और वह कितना सुरक्षित है

Dispatch वह फ़ीचर है जिसमें आप अपने फ़ोन से निर्देश भेजते हैं और Claude वह काम आपके अपने कंप्यूटर पर करता है (बीटा, Pro और Max)। यह क्लाउड में नहीं चलता; आपकी असली मशीन चलती है, और इसी एक तथ्य से इसका फ़ायदा भी निकलता है और इसका ख़तरा भी। आधिकारिक हेल्प कहती है कि आप अपने फ़ोन से Claude को संदेश भेजकर उससे अपने डेस्कटॉप कंप्यूटर पर काम करवा सकते हैं, और वह इसके लिए वही connector, plugin और फ़ाइल-एक्सेस इस्तेमाल करता है जो आपने Cowork में पहले से सेट कर रखे हैं — Anthropic इसे एक लगातार चलती बातचीत बताता है जिस तक दोनों डिवाइस से पहुँचा जा सकता है। इसे चलाने के लिए PC का जगा होना और डेस्कटॉप ऐप का खुला होना ज़रूरी है, और कंप्यूटर उपयोग सिर्फ़ macOS तथा Windows पर समर्थित है, Linux पर कंप्यूटर उपयोग है ही नहीं। मशीनरी के लिहाज़ से यह प्राथमिकता की तीन सीढ़ियाँ उतरता है: connector अगर मौजूद हो, न हो तो ब्राउज़र चलाना, और आखिरी उपाय के तौर पर स्क्रीन से सीधा व्यवहार — बीच-बीच में वह स्क्रीन समझने के लिए स्क्रीनशॉट भी लेता है। असली आकलन इसके बाद शुरू होता है। जहाँ यह रुकता है, वे जगहें डिज़ाइन में रखी गई हैं: कंप्यूटर उपयोग डिफ़ॉल्ट रूप से बंद है और Settings, General के नीचे चालू होता है; हर नए ऐप के लिए अलग से permission माँगी जाती है; किसी फ़ाइल को स्थायी रूप से मिटाने के लिए साफ़ permission चाहिए; और निवेश तथा ट्रेडिंग प्लेटफ़ॉर्म एवं क्रिप्टोकरेंसी ऐप डिफ़ॉल्ट रूप से दायरे से बाहर हैं। पर कुछ जगहें ऐसी भी हैं जहाँ यह नहीं रुकता। पहले से मंज़ूर किए ऐप के भीतर की अलग-अलग कार्रवाइयों की पुष्टि आपसे नहीं ली जाती, और आधिकारिक शब्द यही हैं कि Claude आपकी स्क्रीन पर सीधे क्लिक करता है, टाइप करता है और नेविगेट करता है, उन permission जाँचों के बिना जो बाकी Cowork tool पर लगती हैं। दस्तावेज़ यह भी जोड़ते हैं कि Claude और आपकी स्क्रीन पर मौजूद चीज़ों के बीच कोई sandbox नहीं है, और एक ऐप में की गई कार्रवाइयाँ दूसरे ऐप पर असर डाल सकती हैं। सबसे बड़ा जोखिम prompt injection है, जिसे Anthropic अपने शब्दों में यूँ रखता है: वेब का कंटेंट prompt injection हमलों का एक प्रमुख रास्ता है, और कोई तोड़-मरोड़कर डाला गया निर्देश, कोई अप्रत्याशित कमांड, या आपके ब्राउज़र में खुला कोई फ़िशिंग लिंक ऐसी कार्रवाइयों की शृंखला में बदल सकता है जिन्हें पलटना मुश्किल या असंभव हो। Anthropic कहता है कि वह ऐसा व्यवहार पकड़ने के लिए मॉडल की भीतरी activations स्कैन करता है, पर इससे संभावना घटती है, आपकी अपनी रेखा खींचने की ज़रूरत खत्म नहीं होती, और मार्गदर्शन अब भी यही कहता है कि जब कोई काम संवेदनशील फ़ाइलों, खातों या साइटों को छूता हो तो मैनुअल मंज़ूरी पर चले जाइए। Anthropic सीमा नाम लेकर बताता है: संवेदनशील ऐप, जैसे बैंकिंग, स्वास्थ्य-सेवा और सरकारी, को कंप्यूटर उपयोग की permission मत दीजिए, और वित्तीय खातों, कानूनी दस्तावेज़ों, चिकित्सा जानकारी तथा निजी डेटा से बचिए। लेख फ़ोन वाली तरफ़ को भी उठाता है। हैंडसेट खोने पर जो रिसता है वह उसमें रखा डेटा नहीं, बल्कि आपके PC को आदेश देने की हैसियत है, और साथ में लगातार चलती बातचीत का सामान — और Dispatch की आधिकारिक हेल्प अनपेयर करने या खोए डिवाइस से निपटने का कोई ब्योरा नहीं देती, इसलिए उपाय खाते की तरफ़ से आते हैं: Settings, Account, Active sessions में जाकर उस एक session को खत्म करना, claude.ai से हर session का लॉगआउट करना (जो मोबाइल ऐप में उपलब्ध नहीं है और इसलिए वेब ब्राउज़र माँगता है), या फिर बस PC वाली तरफ़ काट देना, यानी डेस्कटॉप ऐप बंद कर देना या मशीन को स्लीप में जाने देना — दरअसल यही सबसे तेज़ है, क्योंकि Dispatch को PC का जगा होना और ऐप का खुला होना चाहिए। आखिर में लेख Dispatch और कंप्यूटर उपयोग को दो अलग स्विच के रूप में अलग करता है, दोनों को Claude Code के agent view से भी अलग करता है (जिसकी क्रिया को आधिकारिक दस्तावेज़ dispatch कहते हैं), और एक व्यावहारिक रेखा खींचता है: शुरुआत उस काम से कीजिए जिसे वापस लिया जा सके।

Claude Code sandbox क्या है? सुरक्षित स्वचालन के लिए फ़ाइलसिस्टम और नेटवर्क अलगाव (2026)

Claude Code sandbox क्या है? सुरक्षित स्वचालन के लिए फ़ाइलसिस्टम और नेटवर्क अलगाव (2026)

Claude Code को काफ़ी समय तक इस्तेमाल करें तो आप एक दुविधा में फँसते हैं: हर कमांड पर प्रॉम्प्ट आपका प्रवाह रोकता है, फिर भी bypass से सब बंद करना ख़तरनाक है। sandbox इस दो-टूक स्थिति को तोड़ता है, OS स्तर पर छुई जा सकने वाली चीज़ों की बाड़ लगाकर, ताकि कमांड भीतर बिना प्रॉम्प्ट के स्वतंत्र रूप से चलें जबकि कुछ भी बाहर न पहुँचे। यह गाइड दो अलगाव (फ़ाइलसिस्टम और नेटवर्क), /sandbox से शुरुआत (macOS सीधे काम करता है, Linux/WSL2 को bubblewrap+socat चाहिए, नेटिव Windows समर्थित नहीं), auto-allow बनाम regular मोड, settings.json कॉन्फ़िगर करना (allowWrite/denyRead, credentials, allowedDomains), यह कैसे एक तीसरी OS-लागू परत के रूप में permission मोड और नियमों को पूरक करता है, इसकी सीमाएँ (बिना-जाँचे TLS, Unix सॉकेट), और dev container या VM कब चुनें, को कवर करता है। Anthropic बताता है कि आंतरिक उपयोग में इसने permission प्रॉम्प्ट 84% घटाए।

AI से AWS कैसे चलवाएँ: तरीके, फायदे और नुकसान (2026)

AI से AWS कैसे चलवाएँ: तरीके, फायदे और नुकसान (2026)

क्या आप AWS संचालन AI को सौंप सकते हैं? 2026 में काफी कुछ सौंपा जा सकता है। AWS खुद Amazon Q Developer और Agent Toolkit for AWS (May 2026 — 40+ agent skills + एक मैनेज्ड AWS MCP Server + प्लगइन्स) प्रदान करता है, जिससे AI, IaC जनरेशन से रिसोर्स ऑपरेशन तक पहुँच सकता है। यह गाइड "सौंपने" को तीन स्तरों में समझाती है (① कोड/IaC जनरेशन, ② पढ़ने-केंद्रित ऑपरेशन/जाँच, ③ एक स्वायत्त एजेंट जो सचमुच AWS संचालित करता है), मुख्य टूल्स को कवर करती है (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — जिसमें Claude Code या Codex को AWS CLI देकर शेल से "aws" चलवाने वाला अपना-लाओ रास्ता भी शामिल है — फायदे (तेज़ IaC, स्वचालित ट्राइएज, कॉस्ट-ऑप्टिमाइज़ेशन के विचार, ज्ञान का लोकतंत्रीकरण), और फिर असली मुद्दा, नुकसान (IAM permission sprawl, गलतियों/प्रॉम्प्ट इंजेक्शन के लिए ब्लास्ट-रेडियस बढ़ाने वाली अधिक-अनुमति, कार्य के बाद बची अनुमतियाँ, कॉस्ट रनअवे — 2025-26 की वास्तविक प्रोड-DB-डिलीशन घटनाओं के साथ), AWS आधिकारिक और सुरक्षा-वेंडर स्रोतों के आधार पर। मुख्य पेच: सवाल "क्या यह हो सकता है?" नहीं बल्कि "बिना रनअवे या बिल विस्फोट के आप इसे कैसे सौंपें" है — और AWS द्वारा खुद Agent Toolkit में IAM गार्डरेल्स, CloudTrail ऑडिट और सैंडबॉक्सिंग शामिल करना उत्तर की रूपरेखा दिखाता है। इसमें पाँच सिद्धांत (न्यूनतम-विशेषाधिकार IAM, विनाशकारी ऑपरेशन के लिए मानवीय अनुमोदन, ऑब्ज़र्वेबिलिटी, JIT अल्पकालिक क्रेडेंशियल्स, सैंडबॉक्सिंग) और एक FAQ शामिल है।

Claude Fable 5 की वापसी: निलंबन के 19 दिन बाद विश्वभर में फिर तैनात (जुलाई 2026)

Claude Fable 5 की वापसी: निलंबन के 19 दिन बाद विश्वभर में फिर तैनात (जुलाई 2026)

1 जुलाई 2026 को, Anthropic ने अपने फ्लैगशिप मॉडल Claude Fable 5 और Mythos 5 को विश्वभर में फिर से तैनात किया — 12 जून को एक अमेरिकी निर्यात-नियंत्रण आदेश के तहत पूर्ण निलंबन के महज 19 दिन बाद। वापसी का सीधा कारण: अमेरिकी वाणिज्य विभाग ने 30 जून को निर्यात नियंत्रण हटा दिए। मूल वजह Amazon के शोधकर्ताओं की जेलब्रेक रिपोर्ट थी, पर Anthropic लगातार यह दलील देता रहा कि 'Fable 5 में कोई अनूठी आक्रामक क्षमता नहीं है', और नियंत्रणों का हटना उसी रुख के अनुरूप मामले को सुलझाता है। यह केवल ज्यों का त्यों वापस नहीं आया: रिपोर्ट की गई दरकिनार तकनीक को पहचानने के लिए प्रशिक्षित एक नया classifier इसे 99% से अधिक मामलों में रोकता है, और सक्रिय होने पर अनुरोध अपने-आप Opus 4.8 पर रीरूट होता है (ऐप में "किसी संदेश पर फ़्लैग लगने पर मॉडल स्विच करें" टॉगल)। फ़िलहाल एक अस्थायी सीमा लागू है — 7 जुलाई तक Pro, Max, Team और चुनिंदा Enterprise प्लान पर साप्ताहिक सीमा के अधिकतम 50% तक, उसके बाद उपयोग क्रेडिट के ज़रिए। Fable 5, Opus 4.8 की तुलना में उपयोग तेज़ी से खपत करता है, और क्लाउड पहुँच (AWS, Google Cloud, Microsoft Foundry) चरणबद्ध तरीके से लौटती है (अभी तारीख नहीं)। निलंबन के फ़ॉलो-अप के रूप में, यह लेख बताता है कि वापसी कैसे संभव हुई, क्या बदला, उपयोग की सावधानियाँ, और किसी एक मॉडल पर निर्भर न रहने वाले डिज़ाइन की सीख — आधिकारिक घोषणा और मीडिया रिपोर्टों पर आधारित।

AI बनाम इंसान: सुरक्षा में बेहतर कौन? 2026 की असल क्षमता से तुलना

AI बनाम इंसान: सुरक्षा में बेहतर कौन? 2026 की असल क्षमता से तुलना

AI और इंसान, सुरक्षा-उपायों में बेहतर कौन — 2025–2026 में इसका जवाब काफ़ी बदल गया। Google के Big Sleep ने असली ज़ीरो-डे (SQLite की CVE-2025-6965) को दुरुपयोग से पहले रोका, और स्वायत्त AI पेनटेस्टर XBOW HackerOne की अमेरिकी रैंकिंग में #1 पर पहुँचा। दूसरी ओर AI-निर्मित कोड के 45% में कमज़ोरियाँ मिलीं (इंसान के लिखे से करीब 2.74 गुना), और Claude का दुरुपयोग कर पहला बड़े पैमाने का AI-संचालित साइबर हमला (हमले का 80–90% AI ने स्वायत्त रूप से अंजाम दिया) भी हुआ। यह लेख Google, Anthropic, DARPA, Veracode के प्राथमिक स्रोतों के आधार पर स्पीड, स्केल और कवरेज में भारी पड़ते AI और बिज़नेस लॉजिक, हमले की चेनिंग व अंतिम निर्णय में जीतते इंसान की टास्क-वार तालिका से तुलना करता है। साथ ही दिखाता है कि AI एक दोधारी तलवार है जिसके तीन चेहरे हैं — "कमज़ोरियों का स्रोत, हमले का औज़ार, और सबसे मज़बूत रक्षक" — और निष्कर्ष में व्यावहारिक लोगों व प्रबंधकों के लिए स्पष्ट करता है कि विजेता है "इंसान × AI (सेंटॉर मॉडल)" का भूमिका-विभाजन + human-in-the-loop।

AI निर्भरता जोखिम क्या है? जब कोई AI अचानक रुक जाए तो कैसे तैयार रहें

AI निर्भरता जोखिम क्या है? जब कोई AI अचानक रुक जाए तो कैसे तैयार रहें

जेनरेटिव AI रोज़मर्रा के काम में गहराई तक बुना जा चुका है, पर इसका ऑन/ऑफ़ स्विच आपके नियंत्रण के बाहर रहता है—जैसा जून 2026 में Claude Fable 5 और Mythos 5 के लॉन्च के तीन दिन बाद हुए सस्पेंशन—और 19 दिन बाद 1 जुलाई 2026 को दोबारा तैनाती—ने दिखाया। यह लेख समझाता है कि AI निर्भरता जोखिम क्या है, किन छह तरीकों से कोई AI उपलब्ध न रहे, और अपनी निर्भरता कैसे मापें। फिर यह व्यक्तिगत उपयोगकर्ताओं के लिए 5 कदम और डेवलपर्स के लिए रिडंडेंसी डिज़ाइन—LLM गेटवे, फ़ॉलबैक चेन, लोकल LLM और रिकवरी प्लेबुक—देता है, साथ ही वेंडर चुनने की चेकलिस्ट। मूल विचार: भविष्यवाणी से नहीं, डिज़ाइन से बचाव करें ताकि AI रुकने पर भी आपका कोर काम न रुके।

Claude Code परमिशन रूल्स और settings.json सेटिंग पूरी गाइड

Claude Code परमिशन रूल्स और settings.json सेटिंग पूरी गाइड

Claude Code के परमिशन रूल्स से आप settings.json में allow/ask/deny लिखकर बारीकी से तय कर सकते हैं कि कौन-से टूल, कमांड, फ़ाइल और डोमेन बिना पूछे चलें, पुष्टि माँगें या वर्जित रहें। यह गाइड प्राथमिकता क्रम, रूल सिंटैक्स, settings.json की पदानुक्रम और व्यावहारिक रेसिपी समझाती है।

Claude Code के अनुमति मोड: 5 मोड और उन्हें सुरक्षित तरीके से कैसे इस्तेमाल करें

Claude Code के अनुमति मोड: 5 मोड और उन्हें सुरक्षित तरीके से कैसे इस्तेमाल करें

Claude Code में प्रॉम्प्ट बॉक्स के बगल वाला "अनुमति मोड" सेलेक्टर तय करता है कि Claude कितनी बार रुककर अनुमति मांगेगा। यह गाइड 5 मोड, Shift+Tab से स्विच करने का तरीका, ऑटो मोड की कार्यप्रणाली, और कब कौन सा मोड सुरक्षित रूप से चुनें, इन सबको समझाता है।

ChatGPT और Claude account को ban होने से कैसे बचाएँ (OpenAI / Anthropic)

ChatGPT और Claude account को ban होने से कैसे बचाएँ (OpenAI / Anthropic)

एक दिन अचानक आपका ChatGPT या Claude account काम करना बंद कर देता है: 2026 में account निलंबन (ban) और चेतावनियों की रिपोर्टें बढ़ रही हैं, और डरावनी बात यह है कि बिना किसी बुरे इरादे के भी, गलती से नियम तोड़ने पर आप ban हो सकते हैं। यह लेख OpenAI (ChatGPT, Codex) और Anthropic (Claude, Claude Code) पर अपना account न खोने के लिए जानने योग्य बातों को प्रकाशित usage policies और रिपोर्टों के आधार पर व्यवस्थित करता है। दोनों में आम पाँच triggers: प्रतिबंधित content / jailbreak, अनधिकृत automation / scraping, account/API keys साझा या बेचना, संदिग्ध access patterns, और payment में बेमेल/धोखाधड़ी। 2026 का सबसे बड़ा जाल: निजी-plan (Free/Pro/Max) के OAuth tokens को Agent SDK जैसे harnesses समेत आधिकारिक app के अलावा कहीं इस्तेमाल करना Consumer ToS उल्लंघन है। सही तरीका है apps/agents को API (pay-as-you-go) से चलाना। साथ में 7-बिंदु बचाव checklist और appeals की जानकारी।

AI guardrails क्या हैं? Prompt injection से बचाव और input/output सुरक्षा — शुरुआती गाइड

AI guardrails क्या हैं? Prompt injection से बचाव और input/output सुरक्षा — शुरुआती गाइड

जब आप AI ऐप्स बनाना सीख जाते हैं, तो अगला चरण उन्हें सुरक्षित रूप से चलाना है। LLMs को दुर्भावनापूर्ण input से धोखा दिया जा सकता है, वे गोपनीय डेटा लीक कर सकते हैं, या आत्मविश्वास के साथ बेतुकी बातें ठोक सकते हैं; इसे रोकने वाला सुरक्षा तंत्र ही AI guardrails है, जो 2026 में AI agent की घटनाओं के असल में होने के साथ production का अनिवार्य हिस्सा बन चुका है। guardrails वे नियम और फ़िल्टर हैं जो खतरनाक input और अवांछित output को रोकते हैं, user input को LLM तक पहुँचने से पहले और जवाब को वापस लौटने से पहले जाँचते हैं — model से अलग एक स्वतंत्र सुरक्षा परत। मुख्य खतरे हैं prompt injection (सबसे बड़ा), jailbreak, डेटा लीक (गोपनीय डेटा, PII, system prompt), और hallucination या हानिकारक output। सुरक्षा दो परतों पर काम करती है: input guardrails (injection और jailbreak का पता लगाना, PII पहचानना/mask करना, विषय सीमित करना, sanitize करना) और output guardrails (हानिकारक सामग्री फ़िल्टर करना, लीक रोकना, hallucination जाँचना, format सत्यापित करना)। prompt injection — OWASP LLM Top 10 में सबसे गंभीर — direct (user "पिछले सभी निर्देश अनदेखा करो" टाइप करता है) और indirect (वेब पेज या RAG दस्तावेज़ में छिपे आदेश) रूपों में आता है, और indirect injection को अकेला RAG नहीं रोकता, इसलिए retrieved दस्तावेज़ों की अपनी जाँच चाहिए। यह शुरुआती गाइड tools (LLM Guard, Guardrails AI, NeMo Guardrails, Llama Guard, और Azure, AWS व OpenAI की cloud safety सुविधाएँ) तथा defense in depth, least privilege, मानव की मंज़ूरी और लगातार निगरानी के व्यावहारिक सिद्धांतों को भी कवर करती है।