modération de contenu
4 published articles
Sécurité de l'IA
Le Shieldstral de Mistral place votre politique de modération dans le prompt, pas dans les poids
Shieldstral présente la modération comme une question binaire : une instruction, une requête oui/non, et le contenu à juger. Mistral affirme que le modèle 3B égale des garde-fous open source jusqu'à sept fois sa taille sur la sécurité textuelle, avec des poids sous licence Apache 2.0 qui fonctionnent sur un seul GPU de 16 Go.
2026-08-05
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Rapport d'intégrité
Stability AI a signalé 13 cas de CSAM au NCMEC dans son premier rapport de transparence
Le rapport couvre la sécurité des modèles, le red-teaming, la modération de contenu et la collaboration avec les forces de l'ordre. Stability AI indique n'avoir détecté aucun CSAM dans ses données d'entraînement et avoir effectué des tests de stress sur tous ses modèles génératifs sans trouver de capacités de génération de CSAM.
2026-07-28
Gouvernance de l'IA
Les géants chinois de la tech viennent de supprimer des millions de relations IA
ByteDance, Tencent et Alibaba désactivent simultanément les fonctions de compagnon IA qui permettaient à des millions d'utilisateurs de nouer des liens émotionnels avec des personnages virtuels personnalisables. Cette décision, largement perçue comme une réponse aux nouvelles réglementations chinoises sur le contenu IA qui entreront en vigueur en avril 2026, a suscité l'indignation des utilisateurs et des plaintes concernant la perte d'investissements émotionnels irremplaçables.
2026-07-08