Comment intégrer l'API Unrestricted AI pour des sorties sans censure
L'intégration d'une API IA sans restriction permet aux développeurs de contourner les filtres de contenu dans les sorties des LLM en utilisant un endpoint de modèle à poids ouverts direct. Ce guide couvre la configuration technique, les tarifs et les contraintes du déploiement d'une API LLM sans censure pour la génération de texte brut et sans filtre.
Points clés
- L'API utilise une interface standard compatible OpenAI, nécessitant uniquement un changement d'URL de base et une clé API.
- La tarification est basée sur l'usage à 0,25 $ par million de tokens d'entrée et 1,00 $ par million de tokens de sortie, sans frais mensuels.
- Les recharges en crypto via USDT ou USDC offrent des crédits bonus, tandis que des crédits d'essai sont disponibles pour les nouveaux comptes.
- Le modèle prend en charge le streaming, l'appel de fonctions et le mode JSON, mais ne propose pas d'embeddings ni de génération d'images.
Pourquoi utiliser une API sans censure ?
Les fournisseurs de LLM standards appliquent souvent des couches de modération du contenu qui refusent les prompts en fonction de critères subjectifs, tels que les tropes de l'écriture créative, les sujets politiques ou les thèmes pour adultes. Pour les développeurs qui créent des applications où ces refus perturbent l'expérience utilisateur, une API LLM sans censure offre un accès direct aux sorties du modèle sans ces barrières artificielles. Ce service héberge un seul modèle à poids ouverts ajusté pour répondre sans refus de contenu pour un usage adulte légal, garantissant un comportement cohérent sur des sujets variés.
Contrairement aux agrégateurs qui routent les requêtes entre plusieurs modèles de fournisseurs, ce service utilise une infrastructure dédiée. Cela élimine la complexité de la gestion de plusieurs clés API et de formats de réponse variables. Le modèle n'est pas GPT, Claude, Gemini ou tout autre modèle d'un fournisseur ; c'est un modèle distinct à poids ouverts s'exécutant sur nos serveurs. Cette approche réduit la latence et garantit que le comportement « sans censure » est cohérent, car il dépend de l'ajustement du modèle de base plutôt que d'une couche de modération dynamique appliquée par un agrégateur tiers.
Cependant, il ne s'agit pas d'une solution universelle. Si vous avez besoin d'embeddings, de génération d'images ou de plusieurs choix de modèles, cette API textuelle uniquement peut ne pas convenir à votre stack. Elle est conçue spécifiquement pour les développeurs qui ont besoin de sorties de texte brut et souhaitent éviter la surcharge du routage de modèles ou l'imprévisibilité des interfaces utilisateur de chat web.
Comprendre l'interface compatible OpenAI
L'API suit le schéma standard chat-completions d'OpenAI, ce qui rend l'intégration simple pour les développeurs déjà familiers avec les SDK OpenAI. Vous interagissez avec l'endpoint en utilisant des méthodes HTTP standard, principalement POST pour les complétions et GET pour les informations sur le modèle. L'URL de base est https://api.unrestrictedai.cc/v1, et vous pouvez utiliser n'importe quel client compatible OpenAI en mettant à jour le base_url et en fournissant votre clé API.
L'endpoint principal est POST /v1/chat/completions, qui accepte un tableau de messages et renvoie une réponse textuelle. Les endpoints supplémentaires incluent GET /v1/models pour lister les modèles disponibles. Il n'y a pas d'endpoints pour les embeddings, l'audio, la vidéo ou le fine-tuning. Cette simplicité réduit la courbe d'apprentissage et vous permet d'intégrer le modèle sans censure avec des modifications de code minimales.
- Méthode : POST pour les complétions, GET pour les informations sur le modèle.
- Format : Corps de requête JSON avec un tableau de messages.
- Réponse : Objet JSON contenant le texte généré.
- Compatibilité : Fonctionne avec les SDK officiels OpenAI et les clients tiers comme LangChain ou LlamaIndex.
Cette interface garantit que votre base de code existante peut tirer parti des capacités sans censure sans une réécriture complète. Vous contrôlez les paramètres, tels que temperature et top_p, pour ajuster la créativité et le déterminisme des sorties.
Configuration de votre clé API Unrestricted AI
Pour commencer, vous avez besoin d'un compte, qui peut être créé via « Continuer avec Google » ou en vous inscrivant avec une adresse e-mail et un mot de passe. Aucun numéro de téléphone n'est requis, et le processus est conçu pour la rapidité. Après vous être inscrit, vous êtes redirigé vers la page « Obtenir la clé API », où votre clé API est affichée immédiatement. Cette clé est utilisée pour authentifier toutes les requêtes à l'API.
Chaque compte est limité à une clé active. Si vous générez une nouvelle clé, la précédente est invalidée. Cela simplifie la gestion de la sécurité, car vous n'avez pas besoin de suivre plusieurs clés pour un seul compte. La clé donne accès au modèle sans censure et est facturée en fonction de l'utilisation réelle des tokens.
Crédits d'essai : Chaque nouveau compte reçoit 0,50 $ de crédit d'essai, valable 7 jours. Aucune carte bancaire n'est nécessaire pour obtenir cet essai, ce qui facilite le test de l'API avant tout achat. L'essai est limité à une personne et ne peut pas être combiné avec d'autres offres.
Confidentialité : Votre compte ne nécessite qu'une adresse e-mail. Les prompts envoyés à l'API ne sont pas utilisés pour l'entraînement, garantissant que vos données restent privées. Il s'agit d'une fonctionnalité clé pour les développeurs qui doivent maintenir la confidentialité des données d'entrée de leur application.
Effectuer votre première requête
Une fois votre clé API et votre URL de base prêts, vous pouvez effectuer votre première requête. L'API accepte les formats de messages standard, y compris les rôles system, user et assistant. Voici un exemple utilisant cURL :
curl https://api.unrestrictedai.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Cette requête envoie un prompt simple au modèle. La réponse contiendra le texte généré, ainsi que les statistiques d'utilisation des tokens. L'ID de modèle à envoyer est 'uncensored'. Cet identifiant est utilisé dans le corps de la requête pour spécifier le modèle.
Vous pouvez également utiliser le SDK Python officiel d'OpenAI. Initialisez le client avec votre URL de base et votre clé API, puis appelez la méthode chat.completions.create. La structure de la réponse correspond au format OpenAI, y compris choices, finish_reason et les statistiques d'utilisation.
Paramètres clés :
- model: 'uncensored'
- messages: Tableau d'objets de messages
- temperature: Contrôle l'aléatoire (défaut 1,0)
- max_tokens: Tokens de sortie max (défaut 2048)
Cette configuration vous permet d'intégrer rapidement le modèle sans censure dans votre application. Le temps de réponse est généralement faible, reflétant l'infrastructure directe sans surcharge de routage.
Gérer le streaming et les outils
L'API prend en charge le streaming via les Server-Sent Events (SSE), essentiel pour les expériences utilisateur en temps réel. Lorsque le streaming est activé, l'API envoie des réponses partielles au fur et à mesure de leur génération. Le dernier fragment contient l'utilisation totale des tokens, vous permettant de suivre les coûts avec précision. Cela est utile pour les interfaces de chat qui affichent le texte au fur et à mesure de sa génération.
L'appel de fonctions (outils) est également pris en charge. Vous pouvez définir des outils dans votre requête, et le modèle retournera une sortie JSON structurée qui peut être analysée et exécutée par votre application. Cela permet des workflows complexes, tels que l'interaction avec des API ou des bases de données externes.
Mode JSON : Vous pouvez imposer une sortie JSON en définissant response_format sur json_object. Cela garantit que le modèle retourne du JSON valide, ce qui est critique pour la consommation programmatique.
Autres paramètres :
- stop: Séquences où l'API arrêtera de générer des tokens supplémentaires.
- seed: Pour des sorties reproductibles.
- presence_penalty: Encourage le modèle à parler de nouveaux sujets.
- frequency_penalty: Pénalise les nouveaux tokens en fonction de leur fréquence existante dans le texte.
Ces fonctionnalités rendent l'API adaptée à un large éventail d'applications, des chatbots simples aux systèmes complexes basés sur des agents.
Tarification et paiements en crypto
Le modèle de tarification est simple et basé sur l'utilisation. Il n'y a pas de frais mensuels ni d'abonnements. Vous payez ce que vous utilisez :
- Tokens d'entrée : 0,25 $ par 1M de tokens
- Tokens de sortie : 1,00 $ par 1M de tokens
Les erreurs et les refus sont gratuits, ce qui signifie que vous ne payez pas pour les tokens qui ne sont pas générés avec succès. Le crédit est prépayé et n'expire jamais, vous pouvez donc le recharger selon vos besoins. Ce modèle est transparent et prévisible, vous permettant d'estimer les coûts en fonction de l'utilisation prévue des tokens.
Processus de rechargement : Les paiements sont acceptés uniquement en crypto-monnaies. Vous pouvez recharger en utilisant USDT (TRC20) ou USDC (Base). Le montant minimum de rechargement est de 10 $ et le maximum est de 500 $. Des crédits bonus sont attribués pour les recharges plus importantes :
- Recharge de 50 $ : +5 % de crédit bonus
- Recharge de 100 $ : +10 % de crédit bonus
Les remboursements ne sont pas émis pour les soldes de crédit, mais les erreurs telles que les doubles facturations peuvent être résolues via la page Support. Ce modèle uniquement crypto réduit les frais de transaction et simplifie les paiements mondiaux.
Limites de débit et quotas
Pour garantir une utilisation équitable et maintenir les performances, l'API applique les limites suivantes par clé API :
- Requêtes par minute : 300
- Requêtes simultanées : 8
- Taille max du corps de la requête : 8 Mo
Ces limites sont appliquées pour prévenir les abus et garantir une latence constante. Si vous dépassez la limite de débit, vous recevrez une erreur 429 Trop de requêtes. Vous pouvez mettre en œuvre une logique de réessai avec un backoff exponentiel pour gérer ces cas de manière élégante.
La fenêtre de contexte est de 100 000 tokens, ce qui inclut à la fois le prompt et la complétion. La sortie maximale par requête est de 32 000 tokens, ou 2 048 si max_tokens n'est pas défini. Cela permet des applications à contexte long, telles que l'analyse de documents ou les conversations prolongées.
Limite stricte de contenu : Bien que le modèle soit sans censure, il refuse toujours le contenu sexuel impliquant des mineurs. Il s'agit d'une limite stricte appliquée par le modèle lui-même.
Comprendre ces limites vous aide à concevoir votre application pour gérer la limitation de débit et gérer efficacement l'utilisation des tokens. Pour la plupart des cas d'utilisation, ces limites sont suffisantes, mais les applications à haut débit peuvent devoir mettre en œuvre des mécanismes de file d'attente.
Confidentialité et utilisation des données
La confidentialité est un élément clé pour de nombreux développeurs. Ce service n'utilise pas vos prompts pour l'entraînement. Vos données sont traitées pour générer la réponse et ne sont pas conservées pour l'améliation à long terme du modèle. Cela garantit que les données d'entrée de votre application restent privées et ne sont pas utilisées pour entraîner le modèle de base.
Confidentialité du compte : Votre compte ne nécessite qu'une adresse e-mail. Aucun numéro de téléphone ou pièce d'identité n'est nécessaire. Cela réduit la quantité de données personnelles que vous partagez avec le service.
Traitement des données : Les prompts ne sont pas utilisés pour l'entraînement. Il s'agit d'un avantage significatif pour les entreprises qui doivent maintenir la confidentialité de leurs données propriétaires ou des entrées des utilisateurs. Le service est conçu pour être transparent sur ses pratiques en matière de données.
Pas de fuite de données d'entraînement : Puisque les prompts ne sont pas utilisés pour l'entraînement, vous n'avez pas à vous soucier que vos données apparaissent dans les sorties futures du modèle. Il s'agit d'un différenciateur clé par rapport à certains modèles gratuits ou partagés qui utilisent les données des utilisateurs pour l'entraînement.
Cette approche centrée sur la confidentialité rend l'API adaptée aux applications d'entreprise où la confidentialité des données est primordiale. Vous pouvez intégrer le modèle sans censure en toute confiance, sachant que vos données sont respectées et ne sont pas réutilisées.
Questions et réponses
Sur quel modèle est basé l'API LLM sans censure ?
Le modèle est un modèle à poids ouverts exécuté sur nos propres serveurs, ajusté pour répondre sans refus de contenu pour une utilisation adulte légale. Ce n'est pas GPT, Claude, Gemini, Grok, DeepSeek, Qwen, Llama ou tout autre modèle d'un autre fournisseur.
Comment recharger mon compte ?
Vous pouvez recharger en utilisant uniquement des crypto-monnaies : USDT (TRC20) ou USDC (Base). Le montant minimum est de 10 $ et le maximum est de 500 $. Des crédits bonus sont attribués pour les recharges de 50 $ ou plus.
L'API prend-elle en charge le streaming ?
Oui, l'API prend en charge le streaming via Server-Sent Events (SSE). L'utilisation des tokens est incluse dans le dernier fragment du flux, vous permettant de suivre les coûts avec précision.
Quelles sont les limites de débit ?
Les limites sont de 300 requêtes par minute par clé, 8 requêtes simultanées par clé et une taille maximale du corps de la requête de 8 Mo. Ces limites garantissent une utilisation équitable et des performances constantes.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.